保存已生成 token 的注意力中间结果的缓存。
它最像聊天时有个机灵秘书,前面说过的话先记在小本上,后面续聊就不用每次从头翻旧账。
它能加快长文本生成,常用于聊天机器人和本地大模型推理。
Attention
KV cache 保存 Attention 的历史键和值,避免重复重算。
Inference
KV cache 主要用于推理生成阶段,加快逐 token 输出。
VRAM
KV cache 会占用显存,长上下文时开销尤其明显。
Continuous batching
在线推理常把 KV cache 与动态批处理一起使用。