一种按顺序预测下一个 token 的 Transformer 架构。
仅解码器像开车只看后视镜和眼前路:走过的都能回头望,但前面转弯处是什么,得等到了才知道。
常用来做聊天、写作和代码生成,是大模型主力骨架。
Transformer
它是 Transformer 在生成任务上的一条核心分支。
Autoregressive Model
它按顺序预测下一个 token,天然适合连续生成。
GPT
GPT 系列把这种结构做成了大语言模型主流路线。
BERT
BERT 双向读上下文更像做理解题,不是连续写下去。