
10 月 1 日凌晨 4 点,谷歌发布新一代旗舰模型 Gemini 4 Argon。最惊人的一点是:它一次最多能输出 100 万 token,上一代只有 6.4 万。谷歌公布的 19 项测试里,它赢了 13 项。但现在还用不上,第一批只开放给谷歌挑选的网络安全防御者和可信测试者。
这篇文章由 Google DeepMind 高级副总裁、谷歌首席 AI 架构师 Koray Kavukcuoglu 署名。谷歌 CEO 皮查伊、DeepMind 和 Google AI 的官方账号同时发帖。DeepMind 的发布帖是这样说的:

Google DeepMind 发布帖,10 月 1 日 04:03,中文为 X 自动翻译
Argon 是什么
谷歌把 Argon 定位为「前沿模型」,专门处理又长又复杂的工作流程,主攻 3 个方向:
• 真实的软件工程:日常调 bug、大规模代码迁移、算法设计
• 企业知识工作:法律、金融、税务这类专业工作
• 网络安全防御:自己找漏洞、验证漏洞、打补丁
几项基本信息:
• 输出上限:100 万 token,上一代是 6.4 万
• 上下文窗口:100 万 token(据 Artificial Analysis)
• 输入:文字、图片、视频、语音;输出:文字(据 Artificial Analysis)
• 谷歌内部已有数千名员工在用
100 万 token 输出能干什么
以前的模型一次回答写到几万 token 就得停。Argon 能在一次任务里连续思考、写出几十万 token,适合一口气解决多步骤的难题,比如长时间写代码、改代码、做研究。Artificial Analysis 提到,Gemini API 新增了「长解码续写」功能,长回答可以暂停、在后续请求里接着写,避免超时。
谷歌举了几个内部用例:
• 量子计算:优化量子算法的资源消耗,几分钟内比已发表的基准好 40%
• 数据中心:一组 Argon 智能体分析全公司的内存使用数据,自动做优化,已释放 300 TiB 以上内存,预计总共能省 500 TiB 到 1 PiB
• 代码迁移:把 C/C++ 代码改写成更安全的 Rust,规模从几万行一直到 Fuchsia 系统 Zircon 内核的 80 多万行,上线前都要经过自动和人工审核
• 视频解码库 libgav1:替换了 3.2 万行底层加速代码,新的 Rust 版本比原来的 Rust 版快 2.7 倍,输出完全一致
跑分:19 项赢 13 项
谷歌的对照表拿 Argon 和 GPT-6 Astra、Claude Fable 5.1、Claude Opus 5.5 比较。Argon 领先 13 项,网络安全并列第一,落后 5 项:

Gemini 4 Argon 跑分对照表,来自谷歌博客
领先幅度最大的几项:
• Harvey 法律智能体测试:19.6%,GPT-6 Astra 只有 5.4%
• Vals 金融智能体测试:65.4%,GPT-6 Astra 为 53.5%
• Zapier 的 AutomationBench:51.3%,排第 1
• DeepSWE v1.1(长时间软件工程):77.9%,Opus 5.5 为 74.2%
• 长上下文 GraphWalks(25.6 万到 100 万 token):84.2%,GPT-6 Astra 为 71.8%
• 长视频理解 LVBench:91.7%
落后的也要说清:FrontierSWE v2、Terminal-Bench Science 和 OSWorld-2.0 电脑操作上,GPT-6 Astra 更高;Terminal-bench 4.0 和 PostTrainBench 上,Claude Opus 5.5 更高。
和 GPT、Claude 比到底怎样
谷歌的对照表里没有 OpenAI 的 GPT-6.1 Sol。好在第三方评测机构 Artificial Analysis 当天就测了,给出了可比的数字:
• 综合智能指数:Argon 53 分,与 GPT-6 Astra 持平,比 GPT-6.1 Sol 高 1 分
• 幻觉率:15%,GPT-6 Astra 是 51%,GPT-6.1 Sol 是 54%。也就是说,Argon 不懂时更愿意承认,而不是瞎编
• 但答题准确率 50%,比 GPT-6 Astra 低 13 个百分点
• 每完成一个测试任务的成本:折扣价下 1.99 美元,是 GPT-6 Astra 的 60%,但是 GPT-6.1 Sol 的 2.7 倍

Artificial Analysis @ArtificialAnlys,中文为 X 自动翻译
注意,它便宜主要是因为单价低,不是因为省 token:Argon 每个任务平均输出 6.2 万 token,GPT-6 Astra 只要 2.7 万。
网络安全:给防御者一个「不设护栏」的版本
这是本次发布最特别的地方。谷歌专门训练了 Argon 的网络安全防御能力,它能自主发现、验证、修补严重漏洞。对可信的防御者和谷歌内部团队,谷歌会提供没有网络安全护栏的版本,让他们用上全部能力。
• CWE-bench v1(修漏洞):68%,和 GPT-6 Astra、Grok 4.7 并列第一
• 真实代码漏洞发现(20 种编程语言):85.8%,上一代网络安全专用的 Gemini 3.8 Flash Cyber 是 71.0%
• Wiz 渗透测试(不看源码攻击网站):70.9%,Gemini 3.8 Flash Cyber 是 58.2%

漏洞发现测试,来自谷歌博客
安全公司 Wiz 已经用它做公益扫描,发现了一个全球医院在用的医疗软件漏洞,会泄露敏感个人信息,之前的前沿模型都没发现。
安全措施:先管住再放开
谷歌说,能力到了这个级别,只能分阶段放出。它正参与美国政府的模型发布前自愿审查,并在 4 个方面加固:
• 防滥用:拒绝帮助网络攻击和化学、生物、放射、核武器相关请求,同时监控模型内部激活来发现滥用
• 防提示注入:也就是防止网页或文件里藏的恶意指令劫持模型
• 防「越界」:监控模型的思考过程和行动,发现它想用超出用户本意的方式完成任务就叫停
• 加固沙箱:高风险训练和测试前,把运行环境隔离封死
在 Gray Swan 的间接提示注入测试里,攻击 15 次的成功率只有 0.7%,是图中最低的,Claude Opus 5.5 为 1.0%,GPT-6 Astra 为 8.5%:

Gray Swan 提示注入测试,越低越好,来自谷歌博客
谷歌还特别呼吁同行保留模型思考过程的透明度,好让人们能看出模型有没有「跑偏」。
谁能用、什么时候、多少钱
今天起,只有 Fairwind 计划里的可信测试者能用,包括一批网络安全防御者。之后会开放给开发者、企业和普通用户,先从付费 API 客户和 Google AI Ultra 订阅用户开始,但谷歌没有给具体日期。
价格已经公布,按每百万 token 计:
• 首发优惠价:输入 2 美元,输出 10 美元
• 缓存输入打 5% 的价格,即优惠期每百万 0.1 美元
• 优惠期结束后:输入 4 美元,输出 20 美元
• 优惠期多长,谷歌没说
Gemini API 负责人 Logan Kilpatrick 第一时间报了价:

Logan Kilpatrick @OfficialLoganK,中文为 X 自动翻译
各方怎么看
皮查伊发帖说:
Lots of discussion out there about our next model(!), so I wanted to give an early look as soon as possible.
外面对我们下一个模型讨论很多,所以我想尽快让大家先看一眼。
Importantly Argon has frontier safeguards and we are rolling it out responsibly - it's with the US gov't and going to a set of trusted cyber defenders through our Fairwind Program today.
重要的是,Argon 有前沿级的安全防护,我们会负责任地推出:它已交给美国政府,今天通过 Fairwind 计划交给一批可信的网络防御者。
文章署名人 Koray Kavukcuoglu 也说会在测试中逐步扩大开放:

Koray Kavukcuoglu @koraykv,中文为 X 自动翻译
大模型竞技场 Arena 的榜单显示,Argon 在文字对战榜以 1525 分排第 1,比第 2 名 Claude Opus 4.6 高 20 分,中文单项也是第 1;但在网页开发榜只排第 8:

Arena.ai @arena,中文为 X 自动翻译
投资类媒体 Milk Road AI 的评价比较平衡:谷歌的优势集中在企业愿意付钱的领域,但并非全面领先:
Google does not win everything.
谷歌并没有赢下所有项目。

Milk Road AI @MilkRoadAI,中文为 X 自动翻译
也有人对「发布了却用不上」表示不满。AI 资讯账号 Seville AI 写道:
frontier model announced, frontier access withheld. the rollout is the product now.
前沿模型发布了,前沿的使用权却扣着不给。现在,放量节奏本身就成了产品。
需要注意什么
• 对照表是谷歌自己选的模型和测试,数字也是谷歌自测;GPT-6.1 Sol 的对比只来自 Artificial Analysis
• 绝大多数人现在用不上,开放时间没有日期
• 2 美元和 10 美元是限时优惠价,恢复原价后贵一倍
• 输出 token 多,单个任务的实际花费不一定低
• 给防御者的无护栏版本能力很强,谁算「可信防御者」由谷歌决定
谷歌博客
https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon/
评测方法说明
deepmind.google/models/evals-methodology/gemini-4-argon