让序列中每个位置彼此关注的信息机制。
一句话进来后,它会让每个词都四处打量,像饭桌上默默观察全场的人,谁重要就多记谁。
它帮助模型抓上下文关系,是 Transformer 理解句子的关键部件。
Attention
它是注意力机制的一种,让序列内部自己彼此关联。
Transformer
Transformer 把它作为核心部件来建模上下文关系。
KV cache
生成时会缓存它用到的键和值,减少重复计算。
Flash Attention
Flash Attention 主要是在工程上加速它的计算过程。