AI Rookies

N-gram LM — n 元语言模型

事实

用前 n-1 个词预测下一个词的统计语言模型。

人话

n-gram像输入法顺嘴接话:只瞄前几个词,就敢猜你下一句是“收到”。

早年撑起手机联想和语音识别,长上下文容易迷糊。

相关概念

Language Modeling
它是语言建模早期最经典的统计方法。

Autoregressive Model
它按从左到右的顺序预测下一个词元。

Token
词元是它统计 n 连串和预测的基本单位。

Perplexity
困惑度常用来评估它猜下个词准不准。