💾

提示词缓存(Prompt Caching)

Prompt Caching
使用技巧
成本优化性能

提示词缓存(Prompt Caching)是2024年起各大模型厂商推出的成本优化技术:当用户在同一会话中反复发送相同的前缀内容(如系统提示词、长文档、历史对话)时,服务商缓存这部分内容,后续请求只对新增部分计费。

为什么有效

LLM 的计费按 token 计算,而实际应用中每次请求都会重复携带大量固定上下文——系统提示词、工具定义、RAG资料、历史记录。对长上下文场景,重复部分可占总输入 80%以上。

主要收益

  • 成本:缓存命中的 token 价格约为原来的 10%-25%
  • 速度:命中缓存的请求首字延迟大幅降低(TTFT减少)
  • 稳定:减少重复计算,服务端负载下降

支持情况

OpenAI、Anthropic、DeepSeek、Gemini 等主流模型 API 均已支持,且多数为自动开启,无需额外配置。

适用场景

多轮对话、Agent 长期任务、批量处理、RAG 应用中固定知识库前缀、代码补全等。

🔗 探索更多 AI 工具板块

除了本板块,AI工具宝箱还有这些独家内容板块,帮你从不同角度发现好工具。

0