AI Rookies

KV cache — Key-Value 缓存

事实

保存已生成 token 的注意力中间结果的缓存。

人话

它最像聊天时有个机灵秘书,前面说过的话先记在小本上,后面续聊就不用每次从头翻旧账。

它能加快长文本生成,常用于聊天机器人和本地大模型推理。

相关概念

Attention
KV cache 保存 Attention 的历史键和值,避免重复重算。

Inference
KV cache 主要用于推理生成阶段,加快逐 token 输出。

VRAM
KV cache 会占用显存,长上下文时开销尤其明显。

Continuous batching
在线推理常把 KV cache 与动态批处理一起使用。