Gemini 3.7 Flash发布:编程基准暴涨、价格砍半,Google把「打工人模型」的速度与性价比一起拉满(2026年8月)
8月13日 Google DeepMind 发布 Gemini 3.7 Flash:距 3.6 Flash 仅三周,编程基准全线跳涨(DeepSWE 49%→65.3%、AutomationBench 近乎翻倍),价格却直接砍半至 $0.75/$3.75 并锁价到年底。本文拆解它强在哪、便宜在哪,并与 DeepSeek V4-Flash、Qwen3.8-Max 做三强横评。
8月13日,Google DeepMind 悄然放出 Gemini 3.7 Flash——距 3.6 Flash 仅三周。 官方叫它「有史以来最聪明的编码与智能体工作马模型」(most intelligent workhorse model yet for coding and agents)。这不是又一场「参数更大、榜单更高」的军备竞赛,而是一次明确的策略转向:把高频、长程、跑量的 Agent 任务成本直接腰斩,同时把编程基准往上抬一大截。
在 DeepSeek V4 Pro 正式版转正 与 Qwen3.8-Max 开源 把「国产性价比」顶到新高度的同一周,Google 用一记「又快又便宜」的组合拳回敬。本文将拆解它到底强在哪、便宜在哪,以及它和 DeepSeek V4-Flash、千问 Qwen3.8-Max 到底怎么选。
一、为什么是「Flash」,又为什么是「工作马」
大模型圈过去一年都在比「谁最强」——Claude Fable 5、GPT-5.6 Sol、DeepSeek V4 Pro 轮流坐庄。但真实生产环境里,跑量最大的是另一类任务:代码补全、自动化测试、长程 Agent 循环里成千上万次的小调用。这种活儿不要求每次都惊艳,但要求又快、又稳、又便宜——这就是「工作马(workhorse)」模型的定义。
Gemini 3.7 Flash 的定位正是如此:它不是 Google 的旗舰 reasoning 模型,却是承载绝大多数日常 AI 流量的那匹马。官方把它称为编码与 Agent 场景的「most intelligent workhorse」,等于直接承认——胜负手已经从「峰值智能」转移到「单位智能成本」。这一点,和 7月那场模型价格战 的总决战逻辑完全一致。
二、硬数据:6 项基准全线跳涨
光喊口号没用,看数字。Gemini 3.7 Flash 相对 3.6 Flash 的官方基准变化:
| 基准 | 3.6 Flash | 3.7 Flash | 提升 |
|---|---|---|---|
| FrontierCode 1.1 Main | 34.4% | 43.6% | +9.2pt |
| DeepSWE v1.1(编程) | 49.0% | 65.3% | +16.3pt |
| Terminal-bench 2.1 | 78.0% | 85.8% | +7.8pt |
| AutomationBench | 17.0% | 30.4% | +13.4pt |
| GDP.pdf | 22.0% | 34.0% | +12.0pt |
| WebDev Arena Elo | 1538 | 1588 | +50 |
注意两个信号:编程类(DeepSWE +16.3pt、AutomationBench 近乎翻倍)涨得最猛,说明这次更新的重心就是写代码和跑 Agent;而 WebDev Arena Elo 涨 50 分,意味着前端生成质量也明显上台阶。这和 智谱 GLM-5.3 靠后训练把编程拉爆 50% 是同一股潮流——不换基座、靠后训练/工程化把专项能力顶上去。
三、价格才是真正的大招:直接砍半,且锁价到年底
基准涨了,价格却降了。Gemini 3.7 Flash introductory 定价为 每百万输入 token 0.75 美元、输出 3.75 美元,正好是 3.6 Flash 原价的一半。更狠的是——这个价格锁到 2026 年 12 月 31 日,2027 年 1 月 1 日起才回到 1.50 / 7.50 美元。
对比一下同周的行情:8月17日起 DeepSeek 执行峰谷涨价,高峰时段 V4 Pro 输出涨到 27 元/百万 token;而 Google 反手把工作马模型价格砍半。一涨一跌之间,「模型之外还能靠什么挣钱」的命题被 Google 用另一种方式回答:用更低的单位成本,把高频调用量锁死在自己生态里。
四、不只是便宜:1M 上下文、三级思考、撑起 Gemini Spark
价格之外,3.7 Flash 的工程规格同样针对 Agent 场景打磨:
- 1M token 上下文 + 64K 最大输出,足够把长代码库、长文档一次性塞进上下文;
- 三级思考(low / medium / high),让开发者按任务贵重度调节推理投入,简单补全用 low、复杂重构用 high;
- 它成为 Gemini Spark 的底座——那个覆盖 160+ 国家的 24/7 个人 Agent;
- 已上线 Gemini API、AI Studio、Android Studio、Antigravity、企业 Agent 平台与 Spark。但标准 Gemini 聊天免费 UI 暂时不提供,说明 Google 这次先把企业/Agent 场景喂饱,再谈消费端。
这种「三周一次 Flash 迭代」的节奏本身也是武器。3.6 到 3.7 仅隔三周,放在 2026 年也算快得反常,等于逼着每一个做 Agent 的模型团队:要么跟上这个发布节奏,要么在「最新基准差」之外找别的差异化。
五、三强横评:Gemini 3.7 Flash vs DeepSeek V4-Flash vs Qwen3.8-Max
把三位「编码/ Agent 工作马」放在一张桌上比一比:
| 维度 | Gemini 3.7 Flash | DeepSeek V4-Flash | Qwen3.8-Max |
|---|---|---|---|
| 核心定位 | 编码/Agent 高频工作马 | 开源极致性价比 | 开源超大杯长程 Agent |
| 编程基准 | DeepSWE 65.3% | DeepSWE 54.4%(后训练+7.5倍) | PaperBench 93.0(开源第一) |
| 上下文 | 1M | 1M | 1M |
| 价格 | $0.75 入 / $3.75 出(锁价到年底) | ¥1 入 / ¥2 出(缓存¥0.02) | ¥12 入 / ¥36 出 |
| 开源 | 闭源(API) | MIT 开源 | Max 级首开源权重 |
| 最适人群 | 高频 Agent 循环、成本敏感团队 | 要便宜且能自托管 | 长程交付 / 组织级 Skill |
六、对开发者意味着什么
第一,高频 Agent 循环的成本直接腰斩。 很多 Agent 流水线里,每一步弱调用都会触发一次 re-roll,token 消耗是乘出来的。把单位价格砍半,等于把整条流水线的边际成本砍半——这比任何「榜单第一」都更能改变 build-vs-buy 的算式。
第二,迭代节奏成了新护城河。 当 Google 用三周一次 Flash 更新逼同行提速,落后的一方要么烧钱追基准,要么转去做「长程自主交付」「私有化部署」这类 Google 暂时吃不到的差异化市场——正好对应 DeepSeek Harness 开源 和 Meta Muse Glimmer 本地 Agent 的路线。
第三,选型建议很清晰: 成本敏感、跑量 Agent → Gemini 3.7 Flash 或 DeepSeek V4-Flash;要开源可自托管 → DeepSeek / Qwen3.8;要能力天花板、不在乎钱 → Claude Fable 5。
七、诚实边界
- 以上基准均为厂商自报数据。3.6→3.7 在长程工程上的增益足够大,但建议等独立复测再围绕它重建生产 prompt;
- 免费版 Gemini 聊天 UI 暂未提供 3.7 Flash,目前主要面向 API、AI Studio、企业平台与 Spark 用户;
- 0.75/3.75 是 introductory 价,锁到 2026-12-31,2027 年起会回到 1.50/7.50,别把「永远半价」写进年度预算。
结语
Gemini 3.7 Flash 的意义,不在它比谁多了几个点,而在于它把「又快又便宜」做成了默认姿态。当 Google、DeepSeek、阿里在同一周分别用「砍半价」「开源」「后训练拉爆」三种姿势回应同一个命题——模型的竞争,正在从「谁最聪明」彻底转向「谁最划算、迭代最快」。对每天被 token 账单追着跑的开发者来说,这或许是 2026 年最实在的好消息。
常见问题(FAQ)
Q1:Gemini 3.7 Flash 和 3.6 Flash 有什么区别? 核心在编码与 Agent 基准的跳涨(DeepSWE +16.3pt、AutomationBench 近乎翻倍)和价格腰斩,上下文仍是 1M,输出 64K。
Q2:免费用户能用上 3.7 Flash 吗? 暂不能。标准 Gemini 聊天免费 UI 未提供,需通过 Gemini API、AI Studio、Android Studio、Antigravity、企业 Agent 平台或 Spark 使用。
Q3:它和 DeepSeek V4-Flash 谁更便宜? DeepSeek V4-Flash 约 ¥1/¥2(约 $0.14/$0.28)明显低于 Gemini 3.7 Flash 的 $0.75/$3.75,但 Gemini 胜在生态整合、三级思考与 Spark 个人 Agent 底座。
Q4:三家工作马模型怎么选? 跑量成本敏感选 Gemini 3.7 Flash 或 DeepSeek V4-Flash;要开源自托管选 DeepSeek / Qwen3.8;要能力天花板选 Claude Fable 5。
Q5:这个半价会一直持续吗? 不会。0.75/3.75 是 introductory 价,锁到 2026-12-31,2027-01-01 起回到 1.50/7.50 美元。
数据来源:Google DeepMind 官方博客、Google 官方博客及多家科技媒体 2026-08-13 至 2026-08-17 报道。基准为厂商自报,请以独立复测为准。