一种更省显存、计算更快的注意力方法。
它像外卖站分拣:不把包裹来回搬仓库,边扫边装车,少折腾就更快。
它用于长上下文训练和推理,省显存,也常见于大模型加速。
Attention
注意力是这步计算,Flash 把它做得更快、更省显存。
Transformer
Transformer 核心就是注意力,所以常靠它提速。
VRAM
Flash Attention 会减少中间过程的显存占用,缓解 VRAM 压力。
Llm-inference-engine
很多推理引擎会集成 Flash Attention,用来提升大模型运行表现。