用小模型预猜、多数结果由大模型快速验收的解码加速方法。
像烧烤摊先让小工把串排好,老板只负责扫一眼点头;多数时候不用每串都亲手重来。
主要给大模型推理提速,常见于在线服务,提升出字速度,不直接增智。
Inference它发生在推理阶段,核心目标是加快生成速度。
Small-language-model常先由小模型预猜 token,再交给大模型验证。
LLM它给大模型减轻逐 token 生成负担。
Tokens-per-second推测解码常直接体现在 TPS 提升上。