一种在生成时动态对齐输入位置的注意力机制。
它像开卷考试答题,写到哪题就翻哪页,不用整本硬背,现用现找最对口那段。
常见于翻译等序列生成,让输出时动态对齐输入重点。
Attention它是经典注意力机制的早期代表形式。
Seq2Seq它为 Seq2Seq 补上输入输出的动态对齐能力。
Self-AttentionSelf-Attention 把这种选重点思路扩展到序列内部。
TransformerTransformer 延续并放大了注意力这条路线。