AI Rookies

Self-Attention — Self-Attention|自注意力

事实

让序列中每个位置彼此关注的信息机制。

人话

一句话进来后,它会让每个词都四处打量,像饭桌上默默观察全场的人,谁重要就多记谁。

它帮助模型抓上下文关系,是 Transformer 理解句子的关键部件。

相关概念

Attention
它是注意力机制的一种,让序列内部自己彼此关联。

Transformer
Transformer 把它作为核心部件来建模上下文关系。

KV cache
生成时会缓存它用到的键和值,减少重复计算。

Flash Attention
Flash Attention 主要是在工程上加速它的计算过程。