Gemini 3.7 Flash发布:编程基准暴涨、价格砍半,Google把「打工人模型」的速度与性价比一起拉满(2026年8月)

· AI资讯 · · 📖 阅读时长 12 分钟
⚡ TL;DR
8月13日 Google DeepMind 发布 Gemini 3.7 Flash:距 3.6 Flash 仅三周,编程基准全线跳涨(DeepSWE 49%→65.3%、AutomationBench 近乎翻倍),价格却直接砍半至 $0.75/$3.75 并锁价到年底。本文拆解它强在哪、便宜在哪,并与 DeepSeek V4-Flash、Qwen3.8-Max 做三强横评。

🔧 本文提到的工具

8月13日,Google DeepMind 悄然放出 Gemini 3.7 Flash——距 3.6 Flash 仅三周。 官方叫它「有史以来最聪明的编码与智能体工作马模型」(most intelligent workhorse model yet for coding and agents)。这不是又一场「参数更大、榜单更高」的军备竞赛,而是一次明确的策略转向:把高频、长程、跑量的 Agent 任务成本直接腰斩,同时把编程基准往上抬一大截。

DeepSeek V4 Pro 正式版转正Qwen3.8-Max 开源 把「国产性价比」顶到新高度的同一周,Google 用一记「又快又便宜」的组合拳回敬。本文将拆解它到底强在哪、便宜在哪,以及它和 DeepSeek V4-Flash千问 Qwen3.8-Max 到底怎么选。

一、为什么是「Flash」,又为什么是「工作马」

大模型圈过去一年都在比「谁最强」——Claude Fable 5、GPT-5.6 Sol、DeepSeek V4 Pro 轮流坐庄。但真实生产环境里,跑量最大的是另一类任务:代码补全、自动化测试、长程 Agent 循环里成千上万次的小调用。这种活儿不要求每次都惊艳,但要求又快、又稳、又便宜——这就是「工作马(workhorse)」模型的定义。

Gemini 3.7 Flash 的定位正是如此:它不是 Google 的旗舰 reasoning 模型,却是承载绝大多数日常 AI 流量的那匹马。官方把它称为编码与 Agent 场景的「most intelligent workhorse」,等于直接承认——胜负手已经从「峰值智能」转移到「单位智能成本」。这一点,和 7月那场模型价格战 的总决战逻辑完全一致。

二、硬数据:6 项基准全线跳涨

光喊口号没用,看数字。Gemini 3.7 Flash 相对 3.6 Flash 的官方基准变化:

基准3.6 Flash3.7 Flash提升
FrontierCode 1.1 Main34.4%43.6%+9.2pt
DeepSWE v1.1(编程)49.0%65.3%+16.3pt
Terminal-bench 2.178.0%85.8%+7.8pt
AutomationBench17.0%30.4%+13.4pt
GDP.pdf22.0%34.0%+12.0pt
WebDev Arena Elo15381588+50

注意两个信号:编程类(DeepSWE +16.3pt、AutomationBench 近乎翻倍)涨得最猛,说明这次更新的重心就是写代码和跑 Agent;而 WebDev Arena Elo 涨 50 分,意味着前端生成质量也明显上台阶。这和 智谱 GLM-5.3 靠后训练把编程拉爆 50% 是同一股潮流——不换基座、靠后训练/工程化把专项能力顶上去

三、价格才是真正的大招:直接砍半,且锁价到年底

基准涨了,价格却降了。Gemini 3.7 Flash introductory 定价为 每百万输入 token 0.75 美元、输出 3.75 美元,正好是 3.6 Flash 原价的一半。更狠的是——这个价格锁到 2026 年 12 月 31 日,2027 年 1 月 1 日起才回到 1.50 / 7.50 美元。

对比一下同周的行情:8月17日起 DeepSeek 执行峰谷涨价,高峰时段 V4 Pro 输出涨到 27 元/百万 token;而 Google 反手把工作马模型价格砍半。一涨一跌之间,「模型之外还能靠什么挣钱」的命题被 Google 用另一种方式回答:用更低的单位成本,把高频调用量锁死在自己生态里

四、不只是便宜:1M 上下文、三级思考、撑起 Gemini Spark

价格之外,3.7 Flash 的工程规格同样针对 Agent 场景打磨:

  • 1M token 上下文 + 64K 最大输出,足够把长代码库、长文档一次性塞进上下文;
  • 三级思考(low / medium / high),让开发者按任务贵重度调节推理投入,简单补全用 low、复杂重构用 high;
  • 它成为 Gemini Spark 的底座——那个覆盖 160+ 国家的 24/7 个人 Agent;
  • 已上线 Gemini API、AI Studio、Android Studio、Antigravity、企业 Agent 平台与 Spark。但标准 Gemini 聊天免费 UI 暂时不提供,说明 Google 这次先把企业/Agent 场景喂饱,再谈消费端。

这种「三周一次 Flash 迭代」的节奏本身也是武器。3.6 到 3.7 仅隔三周,放在 2026 年也算快得反常,等于逼着每一个做 Agent 的模型团队:要么跟上这个发布节奏,要么在「最新基准差」之外找别的差异化

把三位「编码/ Agent 工作马」放在一张桌上比一比:

维度Gemini 3.7 FlashDeepSeek V4-FlashQwen3.8-Max
核心定位编码/Agent 高频工作马开源极致性价比开源超大杯长程 Agent
编程基准DeepSWE 65.3%DeepSWE 54.4%(后训练+7.5倍)PaperBench 93.0(开源第一)
上下文1M1M1M
价格$0.75 入 / $3.75 出(锁价到年底)¥1 入 / ¥2 出(缓存¥0.02)¥12 入 / ¥36 出
开源闭源(API)MIT 开源Max 级首开源权重
最适人群高频 Agent 循环、成本敏感团队要便宜且能自托管长程交付 / 组织级 Skill

六、对开发者意味着什么

第一,高频 Agent 循环的成本直接腰斩。 很多 Agent 流水线里,每一步弱调用都会触发一次 re-roll,token 消耗是乘出来的。把单位价格砍半,等于把整条流水线的边际成本砍半——这比任何「榜单第一」都更能改变 build-vs-buy 的算式。

第二,迭代节奏成了新护城河。 当 Google 用三周一次 Flash 更新逼同行提速,落后的一方要么烧钱追基准,要么转去做「长程自主交付」「私有化部署」这类 Google 暂时吃不到的差异化市场——正好对应 DeepSeek Harness 开源Meta Muse Glimmer 本地 Agent 的路线。

第三,选型建议很清晰: 成本敏感、跑量 Agent → Gemini 3.7 Flash 或 DeepSeek V4-Flash;要开源可自托管 → DeepSeek / Qwen3.8;要能力天花板、不在乎钱 → Claude Fable 5

七、诚实边界

  • 以上基准均为厂商自报数据。3.6→3.7 在长程工程上的增益足够大,但建议等独立复测再围绕它重建生产 prompt;
  • 免费版 Gemini 聊天 UI 暂未提供 3.7 Flash,目前主要面向 API、AI Studio、企业平台与 Spark 用户;
  • 0.75/3.75 是 introductory 价,锁到 2026-12-31,2027 年起会回到 1.50/7.50,别把「永远半价」写进年度预算。

结语

Gemini 3.7 Flash 的意义,不在它比谁多了几个点,而在于它把「又快又便宜」做成了默认姿态。当 Google、DeepSeek、阿里在同一周分别用「砍半价」「开源」「后训练拉爆」三种姿势回应同一个命题——模型的竞争,正在从「谁最聪明」彻底转向「谁最划算、迭代最快」。对每天被 token 账单追着跑的开发者来说,这或许是 2026 年最实在的好消息。

常见问题(FAQ)

Q1:Gemini 3.7 Flash 和 3.6 Flash 有什么区别? 核心在编码与 Agent 基准的跳涨(DeepSWE +16.3pt、AutomationBench 近乎翻倍)和价格腰斩,上下文仍是 1M,输出 64K。

Q2:免费用户能用上 3.7 Flash 吗? 暂不能。标准 Gemini 聊天免费 UI 未提供,需通过 Gemini API、AI Studio、Android Studio、Antigravity、企业 Agent 平台或 Spark 使用。

Q3:它和 DeepSeek V4-Flash 谁更便宜? DeepSeek V4-Flash 约 ¥1/¥2(约 $0.14/$0.28)明显低于 Gemini 3.7 Flash 的 $0.75/$3.75,但 Gemini 胜在生态整合、三级思考与 Spark 个人 Agent 底座。

Q4:三家工作马模型怎么选? 跑量成本敏感选 Gemini 3.7 Flash 或 DeepSeek V4-Flash;要开源自托管选 DeepSeek / Qwen3.8;要能力天花板选 Claude Fable 5。

Q5:这个半价会一直持续吗? 不会。0.75/3.75 是 introductory 价,锁到 2026-12-31,2027-01-01 起回到 1.50/7.50 美元。

数据来源:Google DeepMind 官方博客、Google 官方博客及多家科技媒体 2026-08-13 至 2026-08-17 报道。基准为厂商自报,请以独立复测为准。
Gemini 3.7 Flash发布:编程基准暴涨、价格砍半,Google把「打工人模型」的速度与性价比一起拉满(2026年8月) - 数据对比信息图
Gemini 3.7 Flash发布:编程基准暴涨、价格砍半,Google把「打工人模型」的速度与性价比一起拉满(2026年8月) · 核心数据一览

关于作者:本文由 AI工具宝箱编辑组 撰写,团队 5+ 年 AI 工具付费实测经验,月均订阅支出 $200+,所有评测基于真实付费长期使用。

数据声明:本文所有数据均标注来源,可溯源核查。发现错误欢迎通过 联系页面 反馈,48 小时内核查修正。