🗜️

上下文压缩(Context Compression)

Context Compression
技术原理
上下文优化

上下文压缩(Context Compression)指在把内容输入大模型之前,先对超长上下文进行压缩处理——提炼摘要、删除无关信息、抽取关键片段——从而节省 token 开销、降低延迟,让有限的上下文窗口装下更有价值的信息。

为什么要压缩

  • token 即成本:上下文越长,费用越高、响应越慢
  • 上下文窗口有限:动辄几十万 token 的资料无法完整塞入
  • 信息冗余:真实资料里大量内容与任务无关
常见压缩方式
  • 摘要式:把长文档概括为要点
  • 抽取式:只保留与问题相关的段落或句子
  • 语义压缩:用模型把信息“浓缩”成更精炼的表达
  • 分层压缩:先粗后细,按需取用细节
典型应用
  • 长文档问答:先压缩再回答,省成本、提速度
  • 智能体记忆:把历史对话压缩成要点,延长“记忆”
  • 批量处理:把多封邮件、多份报告压缩后再统一分析
与 KV 缓存的关系
  • KV 缓存:解决“重复计算”问题
  • 上下文压缩:解决“内容太多放不下”问题,两者常配合使用
趋势 2026 年,压缩技术从“事后压缩”走向“在注意力计算中同步压缩”(如注意力稀疏化),进一步降低长上下文成本。

🔗 探索更多 AI 工具板块

除了本板块,AI工具宝箱还有这些独家内容板块,帮你从不同角度发现好工具。

0