Gemini 4 Argon 发版:一次能输出 100 万 token,先给网络安全防御者用

机智流 2026-10-01 07:38
Gemini 4 Argon 发版:一次能输出 100 万 token,先给网络安全防御者用图1

10 月 1 日凌晨 4 点,谷歌发布新一代旗舰模型 Gemini 4 Argon。最惊人的一点是:它一次最多能输出 100 万 token,上一代只有 6.4 万。谷歌公布的 19 项测试里,它赢了 13 项。但现在还用不上,第一批只开放给谷歌挑选的网络安全防御者和可信测试者。

这篇文章由 Google DeepMind 高级副总裁、谷歌首席 AI 架构师 Koray Kavukcuoglu 署名。谷歌 CEO 皮查伊、DeepMind 和 Google AI 的官方账号同时发帖。DeepMind 的发布帖是这样说的:

Gemini 4 Argon 发版:一次能输出 100 万 token,先给网络安全防御者用图2

Google DeepMind 发布帖,10 月 1 日 04:03,中文为 X 自动翻译

Argon 是什么

谷歌把 Argon 定位为「前沿模型」,专门处理又长又复杂的工作流程,主攻 3 个方向:

• 真实的软件工程:日常调 bug、大规模代码迁移、算法设计

• 企业知识工作:法律、金融、税务这类专业工作

• 网络安全防御:自己找漏洞、验证漏洞、打补丁

几项基本信息:

• 输出上限:100 万 token,上一代是 6.4 万

• 上下文窗口:100 万 token(据 Artificial Analysis)

• 输入:文字、图片、视频、语音;输出:文字(据 Artificial Analysis)

• 谷歌内部已有数千名员工在用

100 万 token 输出能干什么

以前的模型一次回答写到几万 token 就得停。Argon 能在一次任务里连续思考、写出几十万 token,适合一口气解决多步骤的难题,比如长时间写代码、改代码、做研究。Artificial Analysis 提到,Gemini API 新增了「长解码续写」功能,长回答可以暂停、在后续请求里接着写,避免超时。

谷歌举了几个内部用例:

• 量子计算:优化量子算法的资源消耗,几分钟内比已发表的基准好 40%

• 数据中心:一组 Argon 智能体分析全公司的内存使用数据,自动做优化,已释放 300 TiB 以上内存,预计总共能省 500 TiB 到 1 PiB

• 代码迁移:把 C/C++ 代码改写成更安全的 Rust,规模从几万行一直到 Fuchsia 系统 Zircon 内核的 80 多万行,上线前都要经过自动和人工审核

• 视频解码库 libgav1:替换了 3.2 万行底层加速代码,新的 Rust 版本比原来的 Rust 版快 2.7 倍,输出完全一致

跑分:19 项赢 13 项

谷歌的对照表拿 Argon 和 GPT-6 Astra、Claude Fable 5.1、Claude Opus 5.5 比较。Argon 领先 13 项,网络安全并列第一,落后 5 项:

Gemini 4 Argon 发版:一次能输出 100 万 token,先给网络安全防御者用图3

Gemini 4 Argon 跑分对照表,来自谷歌博客

领先幅度最大的几项:

• Harvey 法律智能体测试:19.6%,GPT-6 Astra 只有 5.4%

• Vals 金融智能体测试:65.4%,GPT-6 Astra 为 53.5%

• Zapier 的 AutomationBench:51.3%,排第 1

• DeepSWE v1.1(长时间软件工程):77.9%,Opus 5.5 为 74.2%

• 长上下文 GraphWalks(25.6 万到 100 万 token):84.2%,GPT-6 Astra 为 71.8%

• 长视频理解 LVBench:91.7%

落后的也要说清:FrontierSWE v2、Terminal-Bench Science 和 OSWorld-2.0 电脑操作上,GPT-6 Astra 更高;Terminal-bench 4.0 和 PostTrainBench 上,Claude Opus 5.5 更高。

和 GPT、Claude 比到底怎样

谷歌的对照表里没有 OpenAI 的 GPT-6.1 Sol。好在第三方评测机构 Artificial Analysis 当天就测了,给出了可比的数字:

• 综合智能指数:Argon 53 分,与 GPT-6 Astra 持平,比 GPT-6.1 Sol 高 1 分

• 幻觉率:15%,GPT-6 Astra 是 51%,GPT-6.1 Sol 是 54%。也就是说,Argon 不懂时更愿意承认,而不是瞎编

• 但答题准确率 50%,比 GPT-6 Astra 低 13 个百分点

• 每完成一个测试任务的成本:折扣价下 1.99 美元,是 GPT-6 Astra 的 60%,但是 GPT-6.1 Sol 的 2.7 倍

Gemini 4 Argon 发版:一次能输出 100 万 token,先给网络安全防御者用图4

Artificial Analysis @ArtificialAnlys,中文为 X 自动翻译

注意,它便宜主要是因为单价低,不是因为省 token:Argon 每个任务平均输出 6.2 万 token,GPT-6 Astra 只要 2.7 万。

网络安全:给防御者一个「不设护栏」的版本

这是本次发布最特别的地方。谷歌专门训练了 Argon 的网络安全防御能力,它能自主发现、验证、修补严重漏洞。对可信的防御者和谷歌内部团队,谷歌会提供没有网络安全护栏的版本,让他们用上全部能力。

• CWE-bench v1(修漏洞):68%,和 GPT-6 Astra、Grok 4.7 并列第一

• 真实代码漏洞发现(20 种编程语言):85.8%,上一代网络安全专用的 Gemini 3.8 Flash Cyber 是 71.0%

• Wiz 渗透测试(不看源码攻击网站):70.9%,Gemini 3.8 Flash Cyber 是 58.2%

Gemini 4 Argon 发版:一次能输出 100 万 token,先给网络安全防御者用图5

漏洞发现测试,来自谷歌博客

安全公司 Wiz 已经用它做公益扫描,发现了一个全球医院在用的医疗软件漏洞,会泄露敏感个人信息,之前的前沿模型都没发现。

安全措施:先管住再放开

谷歌说,能力到了这个级别,只能分阶段放出。它正参与美国政府的模型发布前自愿审查,并在 4 个方面加固:

• 防滥用:拒绝帮助网络攻击和化学、生物、放射、核武器相关请求,同时监控模型内部激活来发现滥用

• 防提示注入:也就是防止网页或文件里藏的恶意指令劫持模型

• 防「越界」:监控模型的思考过程和行动,发现它想用超出用户本意的方式完成任务就叫停

• 加固沙箱:高风险训练和测试前,把运行环境隔离封死

在 Gray Swan 的间接提示注入测试里,攻击 15 次的成功率只有 0.7%,是图中最低的,Claude Opus 5.5 为 1.0%,GPT-6 Astra 为 8.5%:

Gemini 4 Argon 发版:一次能输出 100 万 token,先给网络安全防御者用图6

Gray Swan 提示注入测试,越低越好,来自谷歌博客

谷歌还特别呼吁同行保留模型思考过程的透明度,好让人们能看出模型有没有「跑偏」。

谁能用、什么时候、多少钱

今天起,只有 Fairwind 计划里的可信测试者能用,包括一批网络安全防御者。之后会开放给开发者、企业和普通用户,先从付费 API 客户和 Google AI Ultra 订阅用户开始,但谷歌没有给具体日期。

价格已经公布,按每百万 token 计:

• 首发优惠价:输入 2 美元,输出 10 美元

• 缓存输入打 5% 的价格,即优惠期每百万 0.1 美元

• 优惠期结束后:输入 4 美元,输出 20 美元

• 优惠期多长,谷歌没说

Gemini API 负责人 Logan Kilpatrick 第一时间报了价:

Gemini 4 Argon 发版:一次能输出 100 万 token,先给网络安全防御者用图7

Logan Kilpatrick @OfficialLoganK,中文为 X 自动翻译

各方怎么看

皮查伊发帖说:

Lots of discussion out there about our next model(!), so I wanted to give an early look as soon as possible.

外面对我们下一个模型讨论很多,所以我想尽快让大家先看一眼。

Importantly Argon has frontier safeguards and we are rolling it out responsibly - it's with the US gov't and going to a set of trusted cyber defenders through our Fairwind Program today.

重要的是,Argon 有前沿级的安全防护,我们会负责任地推出:它已交给美国政府,今天通过 Fairwind 计划交给一批可信的网络防御者。

文章署名人 Koray Kavukcuoglu 也说会在测试中逐步扩大开放:

Gemini 4 Argon 发版:一次能输出 100 万 token,先给网络安全防御者用图8

Koray Kavukcuoglu @koraykv,中文为 X 自动翻译

大模型竞技场 Arena 的榜单显示,Argon 在文字对战榜以 1525 分排第 1,比第 2 名 Claude Opus 4.6 高 20 分,中文单项也是第 1;但在网页开发榜只排第 8:

Gemini 4 Argon 发版:一次能输出 100 万 token,先给网络安全防御者用图9

Arena.ai @arena,中文为 X 自动翻译

投资类媒体 Milk Road AI 的评价比较平衡:谷歌的优势集中在企业愿意付钱的领域,但并非全面领先:

Google does not win everything.

谷歌并没有赢下所有项目。

Gemini 4 Argon 发版:一次能输出 100 万 token,先给网络安全防御者用图10

Milk Road AI @MilkRoadAI,中文为 X 自动翻译

也有人对「发布了却用不上」表示不满。AI 资讯账号 Seville AI 写道:

frontier model announced, frontier access withheld. the rollout is the product now.

前沿模型发布了,前沿的使用权却扣着不给。现在,放量节奏本身就成了产品。

需要注意什么

• 对照表是谷歌自己选的模型和测试,数字也是谷歌自测;GPT-6.1 Sol 的对比只来自 Artificial Analysis

• 绝大多数人现在用不上,开放时间没有日期

• 2 美元和 10 美元是限时优惠价,恢复原价后贵一倍

• 输出 token 多,单个任务的实际花费不一定低

• 给防御者的无护栏版本能力很强,谁算「可信防御者」由谷歌决定

谷歌博客

https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon/

评测方法说明

deepmind.google/models/evals-methodology/gemini-4-argon

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
AR EMI 网络安全
more
Meta旗舰模型翻身!比DeepSeek还便宜,华裔掌门人骑脸Gemini
Gemini Spark接管相册:Google的AI“微创新”能否破解消费端落地困局?
Gemini 3.8 Live:边聊边干活的实时语音
谷歌DeepMind研究员宣称Gemini 4已实现RSI!
谷歌在印度试水AI直接购物:Gemini内嵌Flipkart“一键下单”,意在重塑电商交易闭环
刚刚,Gemini 4 Pro偷跑上线!碾压Astra和Fable
Gemini 4震撼发布,已实现RSI?谷歌80万行内核已被重写
谷歌反击!Gemini 4 Argon性能比肩Astra,成本仅60%
刚刚,谷歌Gemini 4 Argon杀回前三!追平GPT-6 Astra,Token价只要1/5
Gemini 4 Pro疑似“幽灵”现身,RSI加速AI研发竞赛
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号