AI Rookies

Prompt Caching — 提示词缓存

事实

复用已处理的提示词前缀,降低重复请求的延迟和成本。

人话

提示词缓存像录好的开场白:同一段开头不用每次重讲,直接接着说正题。

重复长上下文会更快更省,适合客服和知识库问答。

相关概念

KV Cache
提示词缓存通常复用 KV Cache,跳过重复前缀的计算。

Prefill
它省去重复前缀的 Prefill,尤其适合长提示词。

Inference Engine
推理引擎负责识别可复用前缀并管理缓存。