一种基于 Transformer 编码器的双向预训练语言模型。
轮到它做题,不会急着往下猜,而是先把前后文都翻一遍,活像阅读理解考场里的稳健选手。
擅长吃透文本意思,常用于分类、检索和信息抽取。
Transformer它建立在 Transformer 编码器结构之上。
Masked-language-modeling它通过遮住部分词再预测来完成预训练。
Embedding它能为句子或词生成可用于比较的语义表示。
Gpt它更偏文本理解,和主打生成的路线不同。