DeepSeek 预告 API「大幅涨价」:单日 8 万亿 Token 压垮价格屠夫——大模型「白菜价」时代结束,降本战场转移到调用层(2026年8月)
2026年8月6日,DeepSeek 在开发者平台发布公告:计划近期整体上调 API 服务定价,预计涨幅较大。距离 V4-Flash 正式版上线仅六天,距离引入峰谷定价仅五周。导火索是需求海啸——OpenCode 披露 8 月 1 日单日处理 8 万亿 Token(其中 5 万亿来自免费额度),8 月 4 日 API 因访问量过大出现容量不足。本文完整梳理 DeepSeek 从 ¥1/¥2 行业地板价到主动涨价的调价曲线,拆解 Agent 时代 Token 消耗量级改写、中美厂商一涨一降背后的三重差异,横评三档主流 API 价格,并给出五个可立即执行的调用层降本手段。
2026年8月6日,DeepSeek 在开发者平台挂出一条公告,全文不到五十个字:
计划近期整体上调 DeepSeek API 服务的定价,预计涨幅较大,请合理安排您的使用。具体方案以正式通知为准。
没有幅度,没有时间表,没有分模型细则。但"整体上调"和"涨幅较大"这八个字,在开发者社区里炸出来的动静,比很多新模型发布还大。
原因很简单:过去两年,DeepSeek 是全球大模型价格体系的地板。它把输入 ¥1、输出 ¥2 每百万 Token 的价格钉在那里,所有人都得围着这条线定价。现在这块地板自己要往上抬了。
距离 7 月 31 日 DeepSeek-V4-Flash 正式版公测上线,只过去了六天。距离 6 月底引入"高峰时段翻倍"的峰谷定价,只过去了五周。
这不是一次常规调价。这是一家用低价打穿全球市场的公司,在自己声量最高的时刻主动踩刹车。
二、一条陡峭的曲线:从行业地板价到主动涨价
把 DeepSeek 的定价史铺开,方向感会非常清楚。
| 时间 | 动作 | 价格状态 |
|---|---|---|
| 2024年4月 | 率先降至输入 ¥1 / 输出 ¥2 每百万 Token | 行业地板价,价格战开幕 |
| 2025年9月 | 再度一次性降价 50% 以上 | 以亏损换份额的战略姿态 |
| 2026年4月 | V4 预览版发布,推出 Pro / Flash 双线,限时 2.5 折 | 折扣打法 |
| 2026年5月 | V4-Pro 限时折扣转为永久价(输入 ¥3 / 输出 ¥6) | 价格战白热化标志 |
| 2026年6月30日 | 引入峰谷定价:工作日 9:00-12:00、14:00-18:00 价格翻倍 | 首次事实性涨价,但包装成"精细化调度" |
| 2026年7月31日 | V4-Flash 正式版 API 公测上线 | 调用量起飞 |
| 2026年8月6日 | 公告:整体上调,预计涨幅较大 | 定价中枢整体上移 |
关键转折发生在 6 月底。当时市场还能把峰谷机制解读为"错峰更便宜"而不是"涨价"——毕竟平峰价格没动。但 8 月 6 日这条公告把这层窗户纸捅破了:这次不是时段性调节,是整体重新锚定。
作为参照,现行价目表(每百万 Token,涨价前)是这样的:
| 模型 | 缓存命中输入 | 缓存未命中输入 | 输出 | 高峰时段(翻倍后) |
|---|---|---|---|---|
| DeepSeek V4-Flash | ¥0.02 | ¥1 | ¥2 | 输入 ¥2 / 输出 ¥4 |
| DeepSeek V4-Pro | ¥0.025 | ¥3 | ¥6 | 输入 ¥6 / 输出 ¥12 |
也就是说,如果"涨幅较大"意味着平峰价格再翻一倍,那么 V4-Pro 高峰输出会摸到 ¥24/百万 Token。对重度 Agent 用户,这是量级上的差别。
三、压垮骆驼的不是竞争对手,是它自己的成功
一个反常识的点:DeepSeek 这次涨价,几乎和竞争压力无关。
导火索是需求端的海啸。
海外开源 Agent 工具平台 OpenCode 在 8 月 3 日披露了一组数据:8 月 1 日单日,DeepSeek V4-Flash 在该平台处理的 Token 总量达到 8 万亿——其中 5 万亿来自免费试用额度,3 万亿来自付费调用。
请注意这个结构:免费额度消耗了六成以上的算力。这是典型的"叫好不叫座"账单——名声、口碑、榜单全拿到了,成本也全担下来了。
紧接着,8 月 4 日 OpenCode 发文称 V4-Flash 因"前所未有的访问量"出现容量不足,开发者调用频繁报错。有开发者形容:"上午官方 API 几乎不可用,和 Kimi K3 刚发布时情况差不多。"DeepSeek 官方随后回应问题已解决、服务已恢复。
而供给端的天花板是硬的。据业内信息,DeepSeek 目前持有约两万张 H 系等效芯片,且训练与推理共用。这意味着每多分一份算力给推理,就少一份算力给下一代模型的训练。当调用量指数级上涨时,涨价其实是最直接的算力再分配手段——用价格把低价值调用挤出去,把算力留给愿意付费的高价值场景,同时保住训练侧的资源。
工信部信息通信经济专家委员会委员盘和林对此次涨价的判断是:主要源于成本上升;是否会持续上涨,还要看后续 AI 算力成本的走势。
顺带一提,同期还有一条相关消息:DeepSeek 重启融资,投前估值约 5000 亿元人民币。融资与涨价同时发生,指向同一个事实——这个阶段最缺的不是钱,是卡。
四、真正的变量:Agent 把 Token 消耗改写了一个量级
如果只看"模型变强了、价格该涨",会漏掉这次涨价背后最重要的结构性变化。
Token 消耗的形态变了。
在聊天时代,一次典型交互是:用户问 200 字,模型答 800 字。一整天高强度使用,个人开发者可能消耗几十万 Token,按 ¥2/百万的输出价,一天不到一块钱。
在 Agent 时代,一次典型任务是:模型读代码库、规划、调工具、跑测试、看报错、改代码、再跑——一个中等复杂度的任务动辄几十轮工具调用,上下文反复膨胀。Cursor、Claude Code、Cline、Trae 这类 Agent 型工具跑一个下午,消耗几千万 Token 是常态。
差距有多大?粗算一笔账:
| 使用形态 | 单日典型 Token 量 | 按 V4-Flash 平峰计(¥1/¥2) | 若涨价一倍 |
|---|---|---|---|
| 聊天问答(个人) | 约 50 万 | 约 ¥1 | 约 ¥2 |
| 编程助手(个人开发者) | 约 2000 万 | 约 ¥30 | 约 ¥60 |
| Agent 连轴跑(小团队) | 约 5 亿 | 约 ¥750 | 约 ¥1500 |
| Agent 产品化(To C 应用) | 数十亿起 | 数千元起 | 翻倍 |
注:上表为按公开价目表做的量级估算,实际消耗与缓存命中率、上下文长度、工具调用次数强相关,仅用于说明数量级差异,不作为报价依据。
宏观数据也在印证这件事。国家数据局今年 3 月披露,我国日均 Token 调用量已突破 140 万亿(2024 年初约 1000 亿,两年多增长超千倍);中国信通院人工智能研究所所长魏凯给出的 6 月初数字是接近 175 万亿/天。
当一个行业的单位价格降到地板、而用量在两年内涨了一千倍时,"低价换规模"这个模式就自动走到头了。 DeepSeek 只是第一个把这句话说出口的。
事实上今年以来,智谱、月之暗面、MiniMax 都已经做过不同程度的价格上调。DeepSeek 的特殊性只在于:它此前一直站在价格最低点,所以它的转向具有标志性。
五、一个反直觉的对照:OpenAI 反而在降价 80%
同一时间窗口里,海外的方向是反的。
- OpenAI:近日宣布 GPT-5.6 Luna 价格下调 80%,Terra 下调 20%;8 月 6 日进一步宣布免费用户与 ChatGPT 的文字互动不再受限,免费版默认模型升级为 GPT-5.6 Luna,并开放"思考"按钮。
- Google:持续强化以效率见长的 Gemini Flash 产品线。
- Anthropic:对高端 Claude 系列维持较高定价,用能力、安全性和稳定性支撑溢价——Claude Fable 5 甚至直接取消了订阅制、转为按量计费。
一边涨一边降,看似矛盾,其实指向三个不同的处境:
第一,算力自有度不同。 OpenAI、Google 手里握着自建集群甚至自研芯片(Anthropic 8 月初也确认组建了内部芯片团队),边际推理成本的下降空间大得多。DeepSeek 是两万张卡训推共用,弹性有限。
第二,商业模型不同。 OpenAI 的收入大头在 ChatGPT 订阅与企业合同,API 降价是获客手段,可以用订阅利润补贴。DeepSeek 目前几乎是纯 API 变现,API 就是损益表本身。
第三,降价的位置不同。 OpenAI 降的是轻量档(Luna 降 80%、Terra 降 20%),旗舰档一分没降;Anthropic 更是把最强的 Fable 5 定在 $10/$50。海外厂商在做的是价格分层:入门免费、旗舰昂贵。 而 DeepSeek 长期在用接近旗舰的性能卖入门的价格——这条路本身就不稳定。
一个能说明问题的数字:Artificial Analysis 的实测显示,V4-Flash 最新版智能指数只比 GPT-5.6 Luna(最高 51 分)低 1 分,但跑完一次基准测试任务的成本只要 $0.03,而 Claude Fable 5 要 $3.15——便宜超过 100 倍。
这个差距不是技术效率能解释的全部,它里面必然含有相当比例的补贴。"便宜"从来不只是模型的属性,也是补贴的属性。补贴退坡的那天迟早会来,8 月 6 日只是把日期写实了。
六、这次涨价,对谁最痛?
不同用户受到的冲击差异极大,值得分开看。
| 用户类型 | 典型场景 | 冲击程度 | 建议动作 |
|---|---|---|---|
| 个人聊天用户 | 网页版/App 问答 | 几乎无感 | 不用管,API 涨价不影响 App |
| 个人开发者 | 编程助手、小脚本 | 轻微 | 提高缓存命中率即可覆盖 |
| Agent 应用团队 | 自动化流水线、多轮工具调用 | 最痛 | 立即做成本压测与多供应商预案 |
| To C 产品方 | 按用户量线性放大 Token | 最痛 | 重算单用户成本模型,考虑分档服务 |
| 企业私有化 | 本地部署开源权重 | 无影响 | 反而是相对优势变大 |
要害在于:痛的正是这一年增长最快的那批用户。 Agent 应用的毛利模型本来就建立在"底层 Token 便宜"这个假设上。假设一旦松动,一批靠差价活着的套壳产品会直接失去存在理由。
这也解释了为什么公告只有两行,却引发了远超其字数的讨论——它动的不是价格表,是很多人的商业模式。
七、2026年8月主流大模型 API 价格横评
把三个价格档位放在一起看,会更清楚 DeepSeek 这次涨价的空间在哪里。
| 维度 | DeepSeek V4-Flash | Qwen3.8-Max | Claude Fable 5 |
|---|---|---|---|
| 定位 | 国产平价高频档 | 国产旗舰长程档 | 海外顶级难题档 |
| 平峰输入 / 百万 Token | ¥1(约 $0.14) | ¥12(国际 $2) | $10 |
| 平峰输出 / 百万 Token | ¥2(约 $0.28) | ¥36(国际 $6) | $50 |
| 缓存命中输入 | ¥0.02 | ¥1.5 | 按厂商政策 |
| 计费机制 | 峰谷定价,高峰翻倍 | 常规计费 | 取消订阅制,纯按量 |
| 单次基准任务成本 | 约 $0.03 | 未披露 | 约 $3.15 |
| 开源权重 | ✅ MIT | ✅ 首次开源超大杯 | ❌ 闭源 |
| 近期价格方向 | ⬆️ 预告大幅上调 | ➡️ 维持 | ⬇️ Opus 5 已打对折 |
三点值得注意:
其一,即使涨价一倍,DeepSeek 仍然是全球最便宜的一档。 ¥2 涨到 ¥4,折合约 $0.56/百万输出 Token,和 Fable 5 的 $50 仍有近百倍差距。恐慌性迁移没有必要。
其二,Qwen3.8-Max 这类"中间档"的位置变得更好了。 它比 DeepSeek 贵一个数量级,但比海外旗舰便宜一个数量级,且旗舰级首次开源权重。当最便宜的那档开始涨价,中间档的性价比曲线自动上移。
其三,价格战的终点不是某家赢了,而是所有人都开始算账。 这和站内此前分析过的7月价格战总决战形成了一个完整闭环:上半年比谁更便宜,下半年比谁更算得清。
八、降本的第二战场:不在模型层,在调用层
这是我认为这轮涨价最有价值的启示。
过去两年,开发者降本的方式基本只有一个:换一个更便宜的模型。这个办法之所以有效,是因为总有厂商在补贴。现在这条路的收益在快速衰减,降本必须往上走一层——从"选哪个模型"变成"怎么调模型"。
五个实际有效的手段,按投入产出比排序:
1. 把缓存命中率做上去(性价比最高,很多人没做) DeepSeek 缓存命中输入是 ¥0.02,未命中是 ¥1——相差 50 倍。把 System Prompt、工具定义、长文档这些固定前缀稳定下来、放在上下文最前面、不要每次改动,命中率能从个位数拉到 60% 以上。这一项做好,涨价一倍基本能被抵消掉。
2. 用峰谷调度错峰跑批 只要 DeepSeek 保留峰谷结构,把非实时任务(批量总结、数据清洗、离线评测、夜间构建)挪到 18:00 之后跑,直接省一半。很多团队的 Agent 任务其实并不要求实时。
3. 模型路由:让便宜模型干便宜的活 不是所有步骤都需要旗舰模型。规划和最终审校用强模型,中间的信息抽取、格式转换、意图分类用小模型甚至端侧模型。Coze、Dify、OpenClaw 这类编排平台都支持在同一条链路里混用不同模型。
4. 融合推理:调用层也能提升智能 一个刚出现的思路值得关注:8 月 6 日 PPIO 发布了名为 Fusion 的融合模型网关,把一次调用分发给多个各有所长的模型并行作答,再交叉验证融合出最终答案。其公布的数据是:三个开源模型融合后在 DRACO 深度研究基准上的评分超过了 Claude Fable 5,成本只有后者的十分之一。
这个方向的意义在于——智能的提升不再只发生在参数层,也可以发生在调用层。当模型层的性价比红利见顶,工程层的空间才刚打开。(该数据为厂商自评,尚无第三方复现,建议自行小规模验证。)
5. 自部署开源权重:把可变成本变成固定成本 V4-Flash 是 MIT 开源的,Kimi K3、GLM 系列、Qwen 系列同样开放权重。如果你的调用量已经稳定在很高的水位,用 Ollama、vLLM 等方案自建推理,或直接把 量化版模型跑在自有显卡上,算总账可能比调 API 更划算。API 涨价最大的受益者,其实是开源自部署路线。
九、三条诚实边界
写这类分析,最容易犯的错是把"预告"当成"已发生"。有三点必须讲清楚:
第一,涨幅和生效时间都还没公布。 官方原话是"具体方案以正式通知为准"。目前所有关于"翻倍""三倍"的推算都是外部估计,包括本文表格里的假设。在正式通知出来之前,不建议做不可逆的架构迁移。
第二,峰谷结构是否保留、各档模型是否同幅上调,都是未知数。 完全可能出现的情况是:V4-Pro 涨幅大、V4-Flash 涨幅小;或者取消峰谷、统一定价。不同方案对不同用户的影响截然不同。
第三,涨价不等于失去竞争力。 前面算过,即使翻倍,DeepSeek 与海外旗舰仍有近百倍价差。真正需要担心的不是 DeepSeek 变贵,而是你的产品毛利是否建立在"底层永远白菜价"这个假设上。如果是,那么无论这次涨多少,这个假设都该被重写了。
十、结语:Token 经济进入「算账时代」
把 8 月的几件事连起来看,画面其实很完整:
一边是供给繁荣——MiniMax H3 开源登顶 Hugging Face、Qwen3.8-Max 旗舰首次开源、Kimi K3 以 2.8 万亿参数成为全球最大开源模型、中国研发的开源模型下载量已占全球总量的 41%。
另一边是成本见底——日均 Token 调用量两年涨千倍、单日 8 万亿 Token 打爆 API 容量、价格屠夫主动宣布涨价、年内已有多家国产厂商跟进调价。
这两件事不矛盾,它们是同一枚硬币:模型越好用,用得越狠;用得越狠,越藏不住成本。
过去两年,行业的关键词是"更便宜"。从 2026 年 8 月开始,关键词会换成"更值"——同样一块钱,谁能把更多有效工作交付出来。这对开发者的要求也变了:不再是盯着价目表挑最低价,而是要会算缓存命中率、会做模型路由、会判断哪一步该用贵模型。
对国产大模型来说,这未必是坏事。靠补贴堆出来的市场份额不牢固,靠工程效率赚出来的利润才能支撑下一代训练。 涨价这件事本身不体面,但它至少说明,这个行业开始正视自己的损益表了。
真正该焦虑的不是"DeepSeek 要涨价了",而是——如果底层不再免费,你的东西还值钱吗?
常见问题(FAQ)
Q1:DeepSeek 具体涨多少?什么时候生效? 截至 2026 年 8 月 7 日,官方只发布了涨价预告,未公布幅度与生效时间,原文明确"具体方案以正式通知为准"。外界流传的倍数均为推测。建议关注 DeepSeek 开放平台公告。
Q2:涨价会影响 App 和网页版用户吗? 不会。本次公告针对的是 API 服务定价,面向开发者调用。普通用户使用 DeepSeek App 或网页版对话不受此次调整影响。
Q3:涨价后 DeepSeek 还便宜吗? 仍然很便宜。涨价前 V4-Flash 输出为 ¥2/百万 Token,即使翻倍到 ¥4,折合约 $0.56,与 Claude Fable 5 的 $50/百万 Token 相比仍有近百倍价差。Artificial Analysis 实测的单次基准任务成本对比是 $0.03 vs $3.15。
Q4:为什么 OpenAI 在降价,DeepSeek 却在涨价? 三个原因:一是算力自有度不同(海外巨头自建集群甚至自研芯片,边际成本下降空间更大);二是商业模型不同(OpenAI 有订阅收入可以补贴 API,DeepSeek 几乎纯 API 变现);三是降价位置不同(OpenAI 降的是 Luna 等轻量档,旗舰档没降,本质是价格分层)。
Q5:现在要不要赶紧换模型? 不建议恐慌迁移。更务实的顺序是:先做缓存命中率优化(命中价与未命中价相差 50 倍)→ 再做峰谷错峰调度 → 再做模型路由(便宜模型干简单活)→ 调用量极大时才考虑自部署开源权重。把这四步做完,多数团队能吃下相当幅度的涨价。
Q6:这轮涨价会不会引发全行业跟涨? 部分已经在发生。今年以来智谱、月之暗面、MiniMax 均有过不同程度的价格上调,DeepSeek 因长期处于价格最低点而具有标志意义。但海外方向相反(OpenAI 轻量档降价 80%),所以更准确的判断是"价格分层"而非"全行业跟涨":入门档继续卷向免费,旗舰档维持溢价,中间档竞争最激烈。
数据来源
- DeepSeek 开放平台 2026-08-06 涨价公告(原文:"计划近期整体上调 DeepSeek API 服务的定价,预计涨幅较大")
- 上海证券报/中国证券网《DeepSeek 预告全面上调 API 价格且涨幅较大》,2026-08-07
- 《金融时报》报道及工信部信息通信经济专家委员会委员盘和林分析,2026-08-06
- 北京日报、南方都市报、海报新闻相关报道,2026-08-06
- OpenCode 平台披露的 Token 用量数据(2026-08-01 单日 8 万亿)及 2026-08-04 容量不足公告
- Artificial Analysis 智能指数与单次任务成本实测数据
- 国家数据局(2026年3月,日均 Token 调用量突破 140 万亿)、中国信通院人工智能研究所(2026年6月初,近 175 万亿/天)
- PPIO 2026-08-06 Fusion 融合模型发布内容(厂商自评数据)
本文价格数据截至 2026 年 8 月 7 日,均为公开价目表数值。大模型定价变动频繁,实际计费请以各厂商官方最新公告为准。文中成本估算仅用于说明量级,不构成采购建议。