按前文条件,逐步预测下一个 token 的生成模型。
像接龙讲鬼故事,前一句刚吓完,后一句只能顺着往下编;开头挖了坑,后面都得接着填。
它按前文一步步生成,常用于对话、写作和代码补全。
Token
它按顺序逐个预测 token,拼出完整文本。
Language Modeling
语言建模的经典目标,就是让它学会续写下一个 token。
Transformer
现代自回归模型通常用 Transformer 来提升长序列建模能力。
Masked-language-modeling
它强调顺着往后生成,MLM 更像先挖空再填空。