一种为序列元素加入位置信息的编码方式。
没有位置编码,句子就像早高峰地铁:词全挤上车,乱成一锅粥,没人知道谁先谁后。
它补上顺序感,让模型读语序、长文本和代码不串行。
Transformer位置编码让 Transformer 知道词在序列中的位置。
Self-Attention自注意力看全局关系,但本身不带先后顺序。
Embedding它常与词向量相加,一起送进模型。