# 谷歌 Gemini 4 Argon 发布：单次输出 100 万 token，$2/$10 半价硬刚 Opus 5.5

9 月 30 日，Google DeepMind 发布 Gemini 4 世代首款旗舰模型 Gemini 4 Argon。三个数字先记住：单次输出上限从 64K 拉到 100 万 token；输入 2 美元、输出 10 美元每百万 token，只有 Claude Opus 5.5 的一半、GPT-6 Astra 的五分之一；知识工作基准 Vals Index 68.9%，四款对比模型里最高。但你现在用不到它：首发只开放给 Fairwind Program 的网络安全防御者，付费 API 客户排第二批，官方没给日期。

## 知识工作第一次压过 Opus 5.5：法律基准超过对手总和

这份由首席 AI 架构师 Koray Kavukcuoglu 签发的[官方成绩单](https://deepmind.google/models/evals-methodology/gemini-4-argon)里，最能说明定位的是知识工作三项：Vals Index 68.9%（Opus 5.5 为 67.0%、GPT-6 Astra 63.1%）、AutomationBench 51.3%（三家为 42.5%/41.4%/31.4%）、Harvey 法律 Agent 基准 19.6%——同表里 Astra 5.4%、Claude Fable 5.1 为 6.7%、Opus 5.5 仅 3.8%，Argon 一项超过三家总和。长上下文同样领先：GraphWalks 256K-1M 档 F1 84.2%。Google 给它的定位很直白：真实世界的软件工程、法律与金融知识工作、网络安全防御。

![Gemini 4 Argon 官方 benchmark 全表](https://www.aitoollab.cn/images/articles/gemini-4-argon-release-2026/deepmind-gemini4-argon-official.png)

## 编程不是全能冠军：两项基准仍输给对手

编程侧 Argon 拿下 DeepSWE v1.1 77.9% 第一，但 FrontierSWE v2 只有 55.0%（Astra 65.5%）、Terminal-bench 4.0 为 57.4%（Opus 5.5 达 66.4%）。100 万 token 输出的意义在这里：代码迁移、全库重构这类一次要吐几万行结果的长任务，不再被 64K 输出截断。预算敏感的团队也可以对照 [DeepSeek](/tools/deepseek/) 与 [Kimi](/tools/kimi/) 的开源路线自行权衡。

## 2 美元/10 美元：把旗舰价格打到五分之一

定价：Argon 输入 2 美元、输出 10 美元，缓存输入 0.10 美元（95% 折扣）；Opus 5.5 为 4/20 美元；GPT-6 Astra 为 10/50 美元。算一笔账：100 万输入加 20 万输出的任务，Argon 花 4 美元、Opus 5.5 花 8 美元、Astra 花 20 美元。注意 Google 自己称这是「介绍价」，后续会调。这套打法延续了 9 月以来 [Claude](/tools/claude/) 与 [GPT](/tools/chatgpt/) 的降价节奏——旗舰能力、中档价格。

![Argon 定价与发布顺序](https://www.aitoollab.cn/images/articles/gemini-4-argon-release-2026/argon-pricing-vs-opus-astra.png)

## 为什么先发给网络安全防御者

这次发布节奏罕见：第一批用户是 Fairwind Program 里的可信安全防御团队，部分版本甚至关闭安全护栏用于攻防演练，Google 同时参与美国政府的自愿预发布流程。安全特性上，官方称 Argon 是对抗间接提示注入最有韧性的模型，并部署了思维链监控、沙箱加固与对齐缓解措施；CWE-bench v1 网络安全基准 68.0%，与 Astra 并列第一。付费 API 客户与 Google AI Ultra 订阅者是第二批，企业与个人消费者「尽快」，均无日期。想先用上最新 Google 模型的，当下仍只有 [Gemini 3.8 Flash](/tools/gemini/)。

> 三款旗舰模型关键维度对比信息图

## 给开发者的三个动作

一、提前建好付费 Gemini API 项目，第二批开放当天即可接入；二、长输出场景（迁移、批量重构、长文档生成）把 Argon 列入选型观察项；三、本文跑分全部取自 Google 官方 methodology 页，第三方复测尚未出现，选型判断以官方数据与自行实测为准。