刚刚,谷歌Gemini 3.8登场!姚顺宇:RSI巨大飞跃

机器之心 2026-09-03 06:33
刚刚,谷歌Gemini 3.8登场!姚顺宇:RSI巨大飞跃图1
机器之心编辑部


深夜,谷歌正式推出 Gemini 3.8。这是谷歌在短短六周内推出的第三款 Flash 系列模型。


据介绍,Gemini 3.8 Flash 在保持与 Gemini 3.7 Flash 相同速度和成本优势的基础上,进一步提升了推理与代码能力,重点强化软件工程、Agent 任务以及复杂多步骤推理场景。


刚刚,谷歌Gemini 3.8登场!姚顺宇:RSI巨大飞跃图2


Gemini 3.8 包含两个版本:


Gemini 3.8 Flash:高智能通用工作模型(workhorse model)。相比 Gemini 3.7 Flash,它在软件工程、Agent 任务以及专业领域中的关键多步推理能力方面实现了显著提升。


该模型采用与 Gemini 3.7 Flash 相同的首发价格:输入 Token:每百万 Token 0.75 美元;输出 Token:每百万 Token 3.75 美元。


与此同时,Google 还推出了面向网络安全领域的专用模型 Gemini 3.8 Flash Cyber


该模型被定位为 Google 目前能力最强的网络安全模型之一,重点提升漏洞发现和自动化补丁修复能力,并将通过 Google 推出的 Fairwind Program 向经过认证的安全防御人员开放。


Google 表示,两个版本虽然面向不同部署环境,但均基于同一套底层模型能力,并通过长期运行的 Agent 循环机制进一步增强模型表现。


谷歌 DeepMind 核心成员姚顺宇表示:对模型而言,这只是迈出了一小步;但对于 RSI(递归自我改进,Recursive Self-Improvement)来说,却是一次巨大的飞跃。


刚刚,谷歌Gemini 3.8登场!姚顺宇:RSI巨大飞跃图3


Aigora.ai CEO John Ennis 将 Gemini 3.8 Flash 与 Anthropic 的模型进行了比较,称其具备:Opus 5 级别的代码质量,但成本只需一小部分,而且速度非常快。


刚刚,谷歌Gemini 3.8登场!姚顺宇:RSI巨大飞跃图4


Gemini 3.8 Flash:为长周期代码任务和自主 Agent 打造


Gemini 3.8 Flash 相比 Gemini 3.7 Flash 实现了显著提升,在许多任务中,其性能已经接近成本更高的前沿旗舰模型。


刚刚,谷歌Gemini 3.8登场!姚顺宇:RSI巨大飞跃图5


在 DeepSWE v1.1(长周期软件工程任务)测试中,Gemini 3.8 Flash 能够自主完成复杂工程问题的端到端解决,在性能上超过了大多数参数规模更大的前沿模型,同时成本仅为后者的一小部分。


刚刚,谷歌Gemini 3.8登场!姚顺宇:RSI巨大飞跃图6


此外,Gemini 3.8 Flash 在专业知识领域中也展现出了支撑关键企业级自主任务所需的可靠性。


在需要高级分析和报告能力的定量分析、专业领域任务中,Gemini 3.8 Flash 在 Vals Finance Agent V2 和 Harvey 法律 Agent Benchmark 等测试中均超过了 Gemini 3.7 Flash 以及其他前沿模型。


同时,Gemini 3.8 Flash 在 HLE-Verified 测试中取得了 54.9% 的成绩,展现出其处理跨越 STEM(科学、技术、工程、数学)、人文学科以及专业领域的多步骤复杂推理任务的能力。


刚刚,谷歌Gemini 3.8登场!姚顺宇:RSI巨大飞跃图7


刚刚,谷歌Gemini 3.8登场!姚顺宇:RSI巨大飞跃图8


这些性能提升源于一个核心设计选择:Gemini 3.8 Flash 会投入更多计算量来完成任务。


在处理复杂任务时,该模型展现出更高的执行深度 —— 它会执行更多推理步骤,并反复调用工具完成任务。有时,为了最大化性能,尤其是在更高推理强度(higher effort levels)设置下,模型可能会消耗更多 Token。


对于计算效率是首要限制因素的应用场景,开发者可以选择较低的推理强度级别,以减少 Token 消耗;或者继续使用 Gemini 3.7 Flash。后者仍将持续获得支持,适用于更强调效率优先的工作负载。


刚刚,谷歌Gemini 3.8登场!姚顺宇:RSI巨大飞跃图9


Gemini 3.8 Flash Cyber:专家级网络安全能力


通过 Fairwind Program 向一批可信安全防御人员开放的 Gemini 3.8 Flash Cyber,针对当前日益复杂的网络安全环境提供了关键优势,同时保持 Flash 系列模型的速度和成本优势,使安全团队能够快速迭代。


自主漏洞发现:在用于漏洞发现的行业标准基准测试 CyberGym 中,Gemini 3.8 Flash Cyber 展现出了前沿水平的自主漏洞发现能力。


该模型不仅超过了 Gemini 3.5 Flash Cyber,同时也击败了参数规模明显更大的前沿模型。


刚刚,谷歌Gemini 3.8登场!姚顺宇:RSI巨大飞跃图10


为了更贴近现实世界中的安全防御需求 —— 现实场景并不局限于 CyberGym 中的 C/C++ 代码库,谷歌还使用一个更全面的内部基准测试对 Gemini 3.8 Flash Cyber 进行了评估。


在该测试中,模型需要在覆盖 20 种编程语言、包含复杂代码库的环境中,发现各种类型的漏洞。


测试结果显示,Gemini 3.8 Flash Cyber 相比此前模型实现了显著跃升,漏洞发现成功率超过 70%。


刚刚,谷歌Gemini 3.8登场!姚顺宇:RSI巨大飞跃图11


自动化补丁修复:在 Gemini 3.8 Flash Cyber 的研发过程中,谷歌重点关注如何赋予安全防御人员专家级能力,使他们能够在与攻击者的对抗中获得优势。


因此,从一开始,团队就投入资源用于漏洞修复能力建设,并优先提升修复能力,而非漏洞利用等攻击性能力。


由 Collinear 运行的 CWE-Bench 是一个用于评估补丁修复能力的高难度外部基准测试。


在该测试中,Gemini 3.8 Flash Cyber 位于性能与成本权衡的 Pareto 前沿:其 Pass@1 成功率达到 47.2%,与领先的前沿模型 47.8% 的成绩接近,但成本显著更低。


刚刚,谷歌Gemini 3.8登场!姚顺宇:RSI巨大飞跃图12


真实世界影响:保护 Google 代码安全


Google 已经开始使用 Gemini 3.8 Flash Cyber 来保护公司内部代码安全。例如:



目前,Gemini 3.8 Flash 已面向开发者、企业和消费者开放。开发者可以通过 Google AI Studio、Android Studio 等平台调用模型,企业用户可通过 Gemini Enterprise 使用相关能力;而 Gemini AI Pro 和 Ultra 用户则可以在 Gemini App、Google 搜索 AI Mode 以及 Google Sheets 中体验该模型。


对于网络安全领域,Google 通过 Fairwind Program 向可信政府机构、关键基础设施运营商和软件维护人员提供 Gemini 3.8 Flash Cyber 的优先访问权限。


参考链接:

https://blog.google/innovation-and-ai/models-and-research/gemini-models/3-8-flash-and-3-8-flash-cyber/



刚刚,谷歌Gemini 3.8登场!姚顺宇:RSI巨大飞跃图13


© THE END 

转载请联系本公众号获得授权

投稿或寻求报道:liyazhou@jiqizhixin.com


关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
EMI
more
Gemini 发了 3 款新模型,表现拉了……
莲花EMIRA Scura限量版跑车上市,国内限量9台
谷歌AI之脑不管事了,Gemini这次真要支棱起来?
【有奖直播】onsemi 深度传感产品介绍
台积电效仿英特尔EMIB架构,新封装方案意在破解CoWoS产能死结
资讯速递|Hemispheric以色列神经科技公司 60亿参数“脑基础模型”发布,能否推动脑健康评估走向常规化?
谷歌Gemini的“品牌迷宫”:当AI交互变得比任务本身更复杂
英特尔重金催工俄亥俄厂,EMIB-T封装良率逼近九成但基板仍卡脖子
皮查伊坦承Gemini短板,押注Gemini 4年底突围
狐讯 | 梁文锋投资人会议实录引热议;Gemini 月活达 9.5 亿
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号