AI Rookies

Speculative Decoding — 推测解码(Speculative decoding)

事实

用小模型预猜、多数结果由大模型快速验收的解码加速方法。

人话

像烧烤摊先让小工把串排好,老板只负责扫一眼点头;多数时候不用每串都亲手重来。

主要给大模型推理提速,常见于在线服务,提升出字速度,不直接增智。

相关概念

Inference
它发生在推理阶段,核心目标是加快生成速度。

Small-language-model
常先由小模型预猜 token,再交给大模型验证。

LLM
它给大模型减轻逐 token 生成负担。

Tokens-per-second
推测解码常直接体现在 TPS 提升上。