一种依靠注意力机制处理序列信息的深度学习架构。
Transformer 像开会时特别会抓重点的人,满屋子发言它能听出谁和谁有关。
今天很多 LLM 都靠它理解上下文、生成文本,是 AI 爆发的关键底座。
Attention
Attention 是 Transformer 捕捉上下文关系的核心机制。
LLM
Transformer 架构推动了现代 LLM 的能力跃迁。
Neural-network
Transformer 是 Neural-network 中适合序列建模的结构。
Foundation-model
许多 Foundation-model 以 Transformer 作为通用架构。