在尽量保留关键信息下缩短输入上下文的方法。
像朋友排队时一句话复述三小时电影:打斗高潮留给你,地毯啥颜色这种细节直接略过。
常用于长文档问答、Agent 记忆和超长对话,帮模型省上下文。
Context-window它用更短文本装下更多信息,缓解窗口限制。
RAGRAG 找资料后,常靠它把重点压短再喂给模型。
Memory它能把冗长历史记忆整理成更紧凑的可用信息。
Token压缩上下文,本质上是在减少输入 token 消耗。