DeepSeek V4-Flash 公测:后训练把 Agent 能力拉爆 7.5 倍、MIT 开源、¥1/百万 token——"又来了一个 DeepSeek 时刻",大模型"堆参数"逻辑被击穿(2026年7月)
2026年7月31日 DeepSeek V4-Flash 正式版 API 公测:参数不变、纯后训练让 Agent 能力暴涨7.5倍,MIT 开源、定价¥1/¥2,社区称"又来了一个 DeepSeek 时刻"。本文横评 V4-Flash、Claude Opus 4.8、Kimi K3 三强性价比。
7月31日下午,DeepSeek 悄悄放出 V4-Flash 正式版 API 公测(版本号 V4-Flash-0731)。没有发布会,没有预热海报,但 AI 圈当晚就炸了——Hacker News 热帖的标题直白到刺眼:"Intelligence is now so cheap you stop metering it"(智能便宜到你不忍心再按量计费)。
这已经是 DeepSeek 第二次让整个行业"重新算账"了。年初 V3、R1 用"低成本吊打国际一线"完成第一次震撼;而这次 V4-Flash 的颠覆点不在参数,而在同样的结构,纯靠后训练把能力翻了好几倍。它对行业的冲击,远比"又发布一个大模型"要深。
二、V4-Flash 到底是什么:参数没动,动的是"脑子"
官方更新日志说得很克制:V4-Flash-0731 的模型结构、尺寸,跟此前 Flash 预览版完全一致——284B 总参数、13B 激活的 MoE 架构、1M 超长上下文,一个没改。真正的升级来自后训练(post-training)和 Agent 框架优化。
这件事的意义被严重低估了:它证明模型能力提升,不一定靠堆参数。在不增加任何推理算力消耗的前提下,仅靠更好的训练数据和更聪明的 Agent 编排,就能把"会写代码、会调工具、会跑命令"的能力,拉到逼近顶级闭源模型的水准。对广大开发者来说,这意味着"够用的智能"正在快速变得免费。
三、Agent 能力暴涨 7.5 倍:从"玩具"到"真能干活"
公测最吓人的地方,是几个硬指标相对预览版的跃迁:
- DeepSWE(软件工程基准):从 7.3 飙到 54.4,整整涨了 7.5 倍;
- Terminal-Bench 2.1(终端操作):82.7,已经逼近 Claude Opus 4.8 的 85;
- CyberGym(网络安全攻防模拟):76.7,较预览版直接翻倍;
- Toolathlon Verified(工具调用综合):70.3;
- DSBench(内部全栈开发):FullStack 68.7、Hard 59.6。
换句话说,一个定价仅为 Opus 几十分之一的模型,在"写代码、跑命令、调 API"这类 Agent 核心任务上,已经逼近了被公认最强的闭源模型。社区那句调侃很精准:"买更贵的模型,不如直接用 Flash。"
四、MIT 开源 + 投机解码:把"便宜"和"可控"一次给齐
更狠的是,V4-Flash 这次带着 MIT 许可证的开源权重 一起放出,还包含了投机解码(speculative decoding)模块。
对比一下就清楚了:同门的 DeepSeek V4-Pro 正式版还在"尽快发布"的路上,且 Pro 并非开源;而 Flash 直接把权重开源,开发者可以本地部署、自己改、自己调。13B 的激活参数,意味着它在消费级显卡上也能跑起来——这对追求"数据不出域、模型可审计"的企业来说,是比"能力强"更关键的一张牌。
五、价格屠夫:¥1 输入 / ¥2 输出,缓存低至 ¥0.02
价格才是压垮"昂贵大模型逻辑"的最后一根稻草:
- 输入 ¥1 / 百万 token,输出 ¥2 / 百万 token;
- 缓存上下文低至 ¥0.02 / 百万 token;
- Artificial Analysis 智能指数得分 50,较上代提升 10 分,单位任务价格"无人能敌"。
做个直观对比:同样跑一个中等复杂度的代码 Agent 任务,用 Claude Opus 4.8 可能要花几美元,用 V4-Flash 可能只要几毛钱人民币,而跑出来的结果差距不到 5 个百分点。当价差拉开到几十倍、效果差距却只有个位数百分比时,"把贵任务路由给大模型"这套商业架构,确实开始站不住脚了。
六、三强横评:V4-Flash 凭什么砸穿性价比天花板
从"单位智能成本"这个真正该看的指标上看,V4-Flash 把高端模型的价格锚点直接砸了下来。Kimi、千问、智谱清言、腾讯混元这些国产模型本来就在性价比上死磕,现在 Flash 把"开源 + 低价 + 强 Agent"三件事叠满,等于把"够强且够便宜"的标准又抬了一档。
这背后是一条清晰的主线:2026 年的模型竞赛,正在从"谁参数多"转向"谁单位智能成本更低"。DeepSeek 用 V4-Flash 把这条线画到了一个新高度。
七、行业冲击波:后训练 > 堆参数,便宜到无需计量
这次公测释放了两个信号,值得每个做 AI 应用的人记住:
- 能力跃迁的主战场,从"预训练堆算力"转向"后训练 + Agent 框架"。 当 13B 激活的模型能干 671B 级模型的活,算力军备竞赛的边际收益在快速递减。
- "路由给大模型"的架构被挑战。 过去做法是简单任务用便宜模型、复杂任务升级到大模型;现在 Flash 在复杂 Agent 任务上已经够用,很多原本要上 Opus 的活,可以就地用 Flash 解决。
顺带一提,DeepSeek 还同步在北京西北约 350 公里的乌兰察布扩建 1GW 算力——一边把模型做"省",一边把算力做"大"。这条"高效模型 + 大规模算力"的路线,和 OpenAI、Anthropic 的"越大越贵"形成了鲜明对照,也给了 ChatGPT、Gemini 这类闭源玩家实实在在的压力。
八、开发者怎么用:API 已开,生态秒适配
落地层面已经很顺:
- 直接调 API:V4-Flash-0731 原生支持 Responses API 格式,并针对性适配了 Codex;
- 工具适配:Cline 等编程工具已宣布适配;YouMind(玉伯团队)宣布免费向用户开放;
- Harness 首秀:本次基准测试中的 Code Agent 任务,用了 DeepSeek 自研的 Harness 极简模式——这是 DeepSeek 在 3 月组建 Agent Harness 团队后,首次在官方公告里披露该能力,负责人崔添翼(6 枚 ACM 亚洲区金牌、前 Jane Street 九年)的打法初见端倪。
九、诚实边界:哪些事现在还做不到
说清楚限制,免得被过度解读:
- 仅 API 公测:目前 V4-Flash 正式版只开放接口端,大家常用的 App 和网页端暂未更新,还是旧模型;
- Pro 还在路上:备受期待的 V4-Pro 正式版"尽快发布",时间表未定;
- 适用边界:超长上下文虽到 1M,但极端复杂的企业级多 Agent 编排,闭源旗舰仍有一定余量;
- 开源 ≠ 无门槛:本地部署需要一定的工程能力,MIT 许可意味着可商用,但运维要自己扛。
十、结语
DeepSeek V4-Flash 公测,表面看是一个模型的更新,实质是对"大模型必须又大又贵"这一行业潜规则的又一次击穿。当后训练能把 Agent 能力拉爆 7.5 倍、MIT 把权重彻底开源、价格压到 ¥1/百万 token,开发者和企业真正该问的问题变成了:我的任务,真的还需要那个最贵的模型吗?
这或许就是 2026 下半年 AI 行业的主旋律——不是"谁最强",而是"谁够强又够便宜"。
常见问题(FAQ)
Q:V4-Flash 和 V4-Pro 有什么区别? A:Flash 是轻量激活(13B)的 MoE 版本,已正式公测且 MIT 开源;Pro 是更大参数的版本,正式版尚未发布、也非开源。两者定位不同,Flash 主打性价比与可控,Pro 主打极限性能。
Q:现在能在 App 上用到 V4-Flash 吗? A:暂时不能。本次公测仅开放 API 接口端,App 和网页端仍是旧模型,需等后续更新。
Q:本地部署需要多少显存? A:得益于 13B 激活参数和投机解码,消费级显卡即可跑量化版本;具体视量化精度而定,FP8 级需要较高显存,更低精度可进一步下探。
Q:它真的能替代 Claude Opus 4.8 吗? A:在代码 Agent、工具调用这类任务上,V4-Flash 已逼近 Opus 4.8 的基准(Terminal-Bench 82.7 vs 85),且价格仅几十分之一。对多数工程任务够用;但极致复杂的多 Agent 编排,闭源旗舰仍有余量。