上下文压缩(Context Compression)指在把内容输入大模型之前,先对超长上下文进行压缩处理——提炼摘要、删除无关信息、抽取关键片段——从而节省 token 开销、降低延迟,让有限的上下文窗口装下更有价值的信息。
为什么要压缩
- token 即成本:上下文越长,费用越高、响应越慢
- 上下文窗口有限:动辄几十万 token 的资料无法完整塞入
- 信息冗余:真实资料里大量内容与任务无关
- 摘要式:把长文档概括为要点
- 抽取式:只保留与问题相关的段落或句子
- 语义压缩:用模型把信息“浓缩”成更精炼的表达
- 分层压缩:先粗后细,按需取用细节
- 长文档问答:先压缩再回答,省成本、提速度
- 智能体记忆:把历史对话压缩成要点,延长“记忆”
- 批量处理:把多封邮件、多份报告压缩后再统一分析
- KV 缓存:解决“重复计算”问题
- 上下文压缩:解决“内容太多放不下”问题,两者常配合使用