AI Rookies

MTP — 多 token 预测

事实

让模型一次预测多个 token 的生成方式。

人话

以前是一颗一颗往外蹦字,现在干脆一把吐几颗,像输入法提前读懂你,直接整段往前冲。

它主要用于推理提速,常见于大模型生成优化。

相关概念

Token
原本逐个 token 往外蹦,MTP 改成一次预测好几个。

Inference
multi-token prediction 主要发生在推理阶段,目标是让生成更快。

Llm-inference-engine
multi-token prediction 往往需要推理引擎配合,才能稳定落地。

Continuous batching
连续批处理管调度,MTP 管一次吐几个,二者常一起提速。