复用已处理的提示词前缀,降低重复请求的延迟和成本。
提示词缓存像录好的开场白:同一段开头不用每次重讲,直接接着说正题。
重复长上下文会更快更省,适合客服和知识库问答。
KV Cache提示词缓存通常复用 KV Cache,跳过重复前缀的计算。
Prefill它省去重复前缀的 Prefill,尤其适合长提示词。
Inference Engine推理引擎负责识别可复用前缀并管理缓存。