提示词缓存(Prompt Caching)是2024年起各大模型厂商推出的成本优化技术:当用户在同一会话中反复发送相同的前缀内容(如系统提示词、长文档、历史对话)时,服务商缓存这部分内容,后续请求只对新增部分计费。
为什么有效
LLM 的计费按 token 计算,而实际应用中每次请求都会重复携带大量固定上下文——系统提示词、工具定义、RAG资料、历史记录。对长上下文场景,重复部分可占总输入 80%以上。
主要收益
- 成本:缓存命中的 token 价格约为原来的 10%-25%
- 速度:命中缓存的请求首字延迟大幅降低(TTFT减少)
- 稳定:减少重复计算,服务端负载下降
支持情况
OpenAI、Anthropic、DeepSeek、Gemini 等主流模型 API 均已支持,且多数为自动开启,无需额外配置。
适用场景
多轮对话、Agent 长期任务、批量处理、RAG 应用中固定知识库前缀、代码补全等。