# DeepSeek V4-Flash 公测：后训练把 Agent 能力拉爆 7.5 倍、MIT 开源、¥1/百万 token——"又来了一个 DeepSeek 时刻"，大模型"堆参数"逻辑被击穿（2026年7月）

# 一、7月31日，社区刷屏"又来了一个 DeepSeek 时刻"

7月31日下午，DeepSeek 悄悄放出 V4-Flash 正式版 API 公测（版本号 V4-Flash-0731）。没有发布会，没有预热海报，但 AI 圈当晚就炸了——Hacker News 热帖的标题直白到刺眼："Intelligence is now so cheap you stop metering it"（智能便宜到你不忍心再按量计费）。

这已经是 DeepSeek 第二次让整个行业"重新算账"了。年初 V3、R1 用"低成本吊打国际一线"完成第一次震撼；而这次 V4-Flash 的颠覆点不在参数，而在**同样的结构，纯靠后训练把能力翻了好几倍**。它对行业的冲击，远比"又发布一个大模型"要深。

# 二、V4-Flash 到底是什么：参数没动，动的是"脑子"

官方更新日志说得很克制：V4-Flash-0731 的模型结构、尺寸，跟此前 Flash 预览版完全一致——284B 总参数、13B 激活的 MoE 架构、1M 超长上下文，一个没改。真正的升级来自后训练（post-training）和 Agent 框架优化。

这件事的意义被严重低估了：它证明**模型能力提升，不一定靠堆参数**。在不增加任何推理算力消耗的前提下，仅靠更好的训练数据和更聪明的 Agent 编排，就能把"会写代码、会调工具、会跑命令"的能力，拉到逼近顶级闭源模型的水准。对广大开发者来说，这意味着"够用的智能"正在快速变得免费。

# 三、Agent 能力暴涨 7.5 倍：从"玩具"到"真能干活"

公测最吓人的地方，是几个硬指标相对预览版的跃迁：

- **DeepSWE**（软件工程基准）：从 7.3 飙到 54.4，整整涨了 **7.5 倍**；
- **Terminal-Bench 2.1**（终端操作）：82.7，已经逼近 Claude Opus 4.8 的 85；
- **CyberGym**（网络安全攻防模拟）：76.7，较预览版直接翻倍；
- **Toolathlon Verified**（工具调用综合）：70.3；
- **DSBench**（内部全栈开发）：FullStack 68.7、Hard 59.6。

换句话说，一个定价仅为 Opus 几十分之一的模型，在"写代码、跑命令、调 API"这类 Agent 核心任务上，已经逼近了被公认最强的闭源模型。社区那句调侃很精准："买更贵的模型，不如直接用 Flash。"

# 四、MIT 开源 + 投机解码：把"便宜"和"可控"一次给齐

更狠的是，V4-Flash 这次带着 **MIT 许可证的开源权重** 一起放出，还包含了投机解码（speculative decoding）模块。

对比一下就清楚了：同门的 DeepSeek V4-Pro 正式版还在"尽快发布"的路上，且 Pro 并非开源；而 Flash 直接把权重开源，开发者可以本地部署、自己改、自己调。13B 的激活参数，意味着它在消费级显卡上也能跑起来——这对追求"数据不出域、模型可审计"的企业来说，是比"能力强"更关键的一张牌。

# 五、价格屠夫：¥1 输入 / ¥2 输出，缓存低至 ¥0.02

价格才是压垮"昂贵大模型逻辑"的最后一根稻草：

- 输入 ¥1 / 百万 token，输出 ¥2 / 百万 token；
- 缓存上下文低至 ¥0.02 / 百万 token；
- Artificial Analysis 智能指数得分 50，较上代提升 10 分，单位任务价格"无人能敌"。

做个直观对比：同样跑一个中等复杂度的代码 Agent 任务，用 Claude Opus 4.8 可能要花几美元，用 V4-Flash 可能只要几毛钱人民币，而跑出来的结果差距不到 5 个百分点。当价差拉开到几十倍、效果差距却只有个位数百分比时，"把贵任务路由给大模型"这套商业架构，确实开始站不住脚了。

# 六、三强横评：V4-Flash 凭什么砸穿性价比天花板

从"单位智能成本"这个真正该看的指标上看，V4-Flash 把高端模型的价格锚点直接砸了下来。Kimi、千问、智谱清言、腾讯混元这些国产模型本来就在性价比上死磕，现在 Flash 把"开源 + 低价 + 强 Agent"三件事叠满，等于把"够强且够便宜"的标准又抬了一档。

这背后是一条清晰的主线：2026 年的模型竞赛，正在从"谁参数多"转向"谁单位智能成本更低"。DeepSeek 用 V4-Flash 把这条线画到了一个新高度。

# 七、行业冲击波：后训练 > 堆参数，便宜到无需计量

这次公测释放了两个信号，值得每个做 AI 应用的人记住：

1. **能力跃迁的主战场，从"预训练堆算力"转向"后训练 + Agent 框架"。** 当 13B 激活的模型能干 671B 级模型的活，算力军备竞赛的边际收益在快速递减。
2. **"路由给大模型"的架构被挑战。** 过去做法是简单任务用便宜模型、复杂任务升级到大模型；现在 Flash 在复杂 Agent 任务上已经够用，很多原本要上 Opus 的活，可以就地用 Flash 解决。

顺带一提，DeepSeek 还同步在北京西北约 350 公里的乌兰察布扩建 1GW 算力——一边把模型做"省"，一边把算力做"大"。这条"高效模型 + 大规模算力"的路线，和 OpenAI、Anthropic 的"越大越贵"形成了鲜明对照，也给了 ChatGPT、Gemini 这类闭源玩家实实在在的压力。

# 八、开发者怎么用：API 已开，生态秒适配

落地层面已经很顺：

- **直接调 API**：V4-Flash-0731 原生支持 Responses API 格式，并针对性适配了 Codex；
- **工具适配**：Cline 等编程工具已宣布适配；YouMind（玉伯团队）宣布免费向用户开放；
- **Harness 首秀**：本次基准测试中的 Code Agent 任务，用了 DeepSeek 自研的 Harness 极简模式——这是 DeepSeek 在 3 月组建 Agent Harness 团队后，首次在官方公告里披露该能力，负责人崔添翼（6 枚 ACM 亚洲区金牌、前 Jane Street 九年）的打法初见端倪。

# 九、诚实边界：哪些事现在还做不到

说清楚限制，免得被过度解读：

- **仅 API 公测**：目前 V4-Flash 正式版只开放接口端，大家常用的 App 和网页端暂未更新，还是旧模型；
- **Pro 还在路上**：备受期待的 V4-Pro 正式版"尽快发布"，时间表未定；
- **适用边界**：超长上下文虽到 1M，但极端复杂的企业级多 Agent 编排，闭源旗舰仍有一定余量；
- **开源 ≠ 无门槛**：本地部署需要一定的工程能力，MIT 许可意味着可商用，但运维要自己扛。

# 十、结语

DeepSeek V4-Flash 公测，表面看是一个模型的更新，实质是对"大模型必须又大又贵"这一行业潜规则的又一次击穿。当后训练能把 Agent 能力拉爆 7.5 倍、MIT 把权重彻底开源、价格压到 ¥1/百万 token，开发者和企业真正该问的问题变成了：**我的任务，真的还需要那个最贵的模型吗？**

这或许就是 2026 下半年 AI 行业的主旋律——不是"谁最强"，而是"谁够强又够便宜"。

# 常见问题（FAQ）

**Q：V4-Flash 和 V4-Pro 有什么区别？**
A：Flash 是轻量激活（13B）的 MoE 版本，已正式公测且 MIT 开源；Pro 是更大参数的版本，正式版尚未发布、也非开源。两者定位不同，Flash 主打性价比与可控，Pro 主打极限性能。

**Q：现在能在 App 上用到 V4-Flash 吗？**
A：暂时不能。本次公测仅开放 API 接口端，App 和网页端仍是旧模型，需等后续更新。

**Q：本地部署需要多少显存？**
A：得益于 13B 激活参数和投机解码，消费级显卡即可跑量化版本；具体视量化精度而定，FP8 级需要较高显存，更低精度可进一步下探。

**Q：它真的能替代 Claude Opus 4.8 吗？**
A：在代码 Agent、工具调用这类任务上，V4-Flash 已逼近 Opus 4.8 的基准（Terminal-Bench 82.7 vs 85），且价格仅几十分之一。对多数工程任务够用；但极致复杂的多 Agent 编排，闭源旗舰仍有余量。
