DeepSeek V4 Pro 正式版转正:1M 上下文 + 384K 输出,Agent 能力暴涨对打 Claude Fable 5——与 Grok 4.6、GPT-5.6 Sol 旗舰横评(2026年8月)

· AI资讯 · · 📖 阅读时长 11 分钟
⚡ TL;DR
8月13日 DeepSeek V4 Pro 从预览版正式转正(版本 0813):1M 上下文 + 384K 输出,Agent 能力暴涨,DeepSWE 从 12.8 飙至 62.7,部分基准超越 Claude Fable 5。同一天 Grok 4.6 发布。本文做三强横评。

8 月 13 日凌晨,DeepSeek 官方把 V4 Pro 从预览版正式「转正」了。

定价页上的版本号已经悄悄变成 DeepSeek-V4-Pro-0813,调用方式不变,用 deepseek-v4-pro 就能调到最新正式版。这意味着,从 4 月底预览、到 7 月底 Flash 先转正,再到今天 Pro 落地,DeepSeek 的 V4 双旗舰终于全部进入生产可用状态。

而就在同一天,Grok 4.6 也刚刚发布——两件事撞在一起,把「AI 旗舰模型的 Agent 决赛圈」彻底推向白热化。

一、先把时间线捋清楚:V4 Pro 这次「转正」意味着什么

DeepSeek 的 V4 系列走了很长的预览期:

时间事件
4 月 24 日V4 系列预览,Pro / Flash 双双开放权重(MIT 协议)+ API
7 月 15 日V4 系列正式版全量商用(峰谷分时计费首发)
7 月 31 日V4-Flash 率先转正为正式版 API
8 月 12–13 日V4-Pro 正式版转正(版本 0813)

「转正」的意义不止是改个版本号:它代表官方对稳定性、可用性的背书,接口行为从「可能变」进入「可依赖」。对已经把 DeepSeek 写进生产流程的团队,这是一个可以放心扩大规模的信号。

二、V4 Pro 正式版的核心参数

正式版的核心规格相当能打:

  • 上下文 1M token,最大输出 384K token——国产模型里的头部水平,长文档、长代码库、连续多步 Agent 任务都更从容;
  • thinking / 非 thinking 双模式,默认开启 thinking;
  • 架构:混合专家(MoE),总参 1.6 万亿、每 token 激活 490 亿(Hugging Face 模型卡数据);
  • 能力:JSON 结构化输出、工具调用、Responses API、兼容 Anthropic API 格式,另支持 Beta 阶段的对话前缀续写与 FIM 补全(FIM 仅限非思考模式);
  • 并发限制 500(Flash 为 2500,Pro 作为高端档限流更严)。

三、最值得说的一点:Agent 能力暴涨

这次转正真正的看点,是 Agent 能力的跃升。智东西的报道点得很准:V4 Pro 正式版部分性能逼近甚至超越 Claude Fable 5

几个关键数字(均为 DeepSeek 官方口径):

  • 在 AI 安全智能体基准 Cybergym、工作流智能体 AutomationBench 中,V4 Pro 正式版的表现超越 Fable 5
  • 针对长周期、高复杂度真实软件工程的编程智能体测试 DeepSWE,得分从预览版的 12.8 飙升至 62.7
  • 最大推理档位 V4-Pro-Max 的官方跑分:SWE-bench Verified 80.6%、LiveCodeBench 93.5%、GPQA Diamond 90.1%、MMLU-Pro 87.5%、Terminal Bench 2.0 67.9%。

一句话总结:V4 Pro 从「会写代码」明显跨向「能独立跑长周期软件工程任务」,这正是 Agent 时代最值钱的能力。

四、价格:便宜到离谱,但涨价已在上路

V4 Pro 的价格体系如下(美元/百万 token,另附人民币价):

模型输入(未命中)缓存命中输出
DeepSeek V4 Pro$0.435$0.003625$0.87
DeepSeek V4 Flash$0.14$0.0028$0.28
Grok 4.6$2.00未公布$6.00
GPT-5.6 Sol$5.00$0.50$30.00
Claude Fable 5$10.00$1.00$50.00

算一笔账:V4 Pro 的输出价是 GPT-5.6 Sol 的 1/34,是 Fable 5 的 1/57;缓存命中输入更是便宜到 Fable 5 的 1/276。人民币口径下,V4 Pro 是缓存命中输入 ¥0.025、未命中 ¥3、输出 ¥6(约为 Flash 的 3 倍)。

但必须提醒:8 月 6 日 DeepSeek 已预告「近期整体上调 API 定价、涨幅较大」。这张价格表是涨价前最后的窗口,对成本敏感的业务要有心理准备。

五、三强横评:V4 Pro vs Grok 4.6 vs Claude Fable 5

8 月 13 日同一天,Grok 4.6 也发布了(SpaceXAI,前身 xAI)。把这两款新旗舰和 Claude Fable 5 放一起,就是当前 Agent 时代的三大路线对决:

维度DeepSeek V4 ProGrok 4.6Claude Fable 5
核心定位高性价比国产旗舰 Agent长程 Agent + 视觉单模型最强自主推理/编码旗舰
上下文1M500K1M
最大输出384K无上限128K
输入/输出($/百万)$0.435 / $0.87$2 / $6$10 / $50
架构/开源MoE 1.6T,MIT 开源1.5T V9,闭源闭源
AA 智能指数6162(Max)

(信息图见文末)

关于 Grok 4.6,多说几句(用户点名要对比)

Grok 4.6 是 1.5 万亿参数 V9 底座的纯后训练升级——底座和 Grok 4.5 一样,没加参数,全在 SFT + 强化学习上发力,专攻「长程 Agent 连贯性」:多步研究、跨代码库、把一个宽泛想法做成可用应用。

  • 价格:$2 / $6(输入/输出),比 Fable 5 便宜 80% 左右,比 Claude Opus 4.8 的 $5/$25 也便宜一截;
  • 基准:官方称 AA 智能指数 61,与 GPT-5.6 Sol 持平,落后 Fable 5 Max 的 62;DeepSWE v1.1 达 65.9%(比 Grok 4.5 的 54% 大涨);GDPVal-AA v2 拿到 1753 领先;
  • 短板:文档未公布缓存命中价(而 Agent 场景恰恰是缓存主导),且 4.5 代曾被开发者诟病幻觉率偏高,独立评测尚未跟上。

三条路线怎么选

  • 要极致性价比 + 可控(可自部署) → 选 DeepSeek V4 Pro。开源权重 + 1/57 的价格,是国产团队的默认答案;
  • 要长程 Agent + 视觉 + 便宜 → 选 Grok 4.6,$2/$6 在海外旗舰里最便宜,四档 reasoning 可调;
  • 要天花板 + 不在乎钱 → 选 Claude Fable 5,最难的自主编码和推理它仍是标杆。

六、四个诚实边界(别被通稿带节奏)

  • 所有跑分都是厂商自报。V4 Pro 的 DeepSWE 62.7、Grok 4.6 的 AA 61,独立评测都还没复现,正式版 0813 更是「零独立样本」;
  • 口径不完全可比。DeepSWE v1.1 和 DeepSWE 不同版本、不同 harness 的分数不能直接对打,横向对比时要看版本号;
  • 涨价悬而未决。8/6 预告的「大幅涨价」尚未落地,现在看到的 V4 Pro 价格可能随时调整;
  • API 与网页版 CoT 有差异。有开发者在 X 上反馈,V4 Pro 的 API 输出话术比网页端生硬、语序别扭,接入前建议用自己的任务跑一遍。

七、结论:Agent 决赛圈,性价比成了新变量

DeepSeek V4 Pro 转正 + Grok 4.6 发布,同一天落子,传递的信号高度一致:

旗舰模型的竞争,已经从「谁更强」转向「谁在长周期 Agent 上又强又便宜」。

对普通开发者和内容团队,这是好消息——Kimi千问智谱清言 等国产模型也在同一条性价比赛道上,AI 的「能力通货膨胀」还在继续。

常见问题(FAQ)

Q1:DeepSeek V4 Pro 正式版怎么调用? 直接沿用 deepseek-v4-pro 端点即可,官方已把底层版本切到 DeepSeek-V4-Pro-0813,无需改代码。

Q2:V4 Pro 和 V4 Flash 正式版怎么选? 要便宜跑量选 Flash($0.14/$0.28,并发 2500);要高质量长文档、复杂 Agent 选 Pro(1M 上下文 + 384K 输出),但 Pro 贵 3 倍、并发仅 500。

Q3:V4 Pro 正式版比预览版强在哪? 主要是 Agent 能力,DeepSWE 从 12.8 涨到 62.7,Cybergym、AutomationBench 超越 Fable 5,属于后训练层面的质变。

Q4:涨价什么时候落地? DeepSeek 8 月 6 日只说了「近期」和「涨幅较大」,未给具体时间表,建议关注官方定价页。

Q5:Grok 4.6 值得从 4.5 迁移吗? 值得。底座不变、价格不变($2/$6),纯后训练增益且无吞吐损失,一行改模型名即可迁移;但追求极限 Agent 跑分的团队,Kimi K3 在部分基准上仍领先。

DeepSeek V4 Pro 正式版转正:1M 上下文 + 384K 输出,Agent 能力暴涨对打 Claude Fable 5——与 Grok 4.6、GPT-5.6 Sol 旗舰横评(2026年8月) - 数据对比信息图
DeepSeek V4 Pro 正式版转正:1M 上下文 + 384K 输出,Agent 能力暴涨对打 Claude Fable 5——与 Grok 4.6、GPT-5.6 Sol 旗舰横评(2026年8月) · 核心数据一览

关于作者:本文由 AI工具宝箱编辑组 撰写,团队 5+ 年 AI 工具付费实测经验,月均订阅支出 $200+,所有评测基于真实付费长期使用。

数据声明:本文所有数据均标注来源,可溯源核查。发现错误欢迎通过 联系页面 反馈,48 小时内核查修正。