谷歌邪修Gemini 3.8 Flash!险胜DeepSeek,姚顺宇:RSI一大步

量子位 2026-09-03 08:16
Jay 发自 凹非寺
量子位 | 公众号 QbitAI

刚刚,Gemini 3.8 Flash,正式发布

Coding能力大幅提升,LMArena上,Gemini 3.8 Flash空降Agent榜单第14名,以微弱优势险胜DeepSeek-V4-Pro。

对一款走量定位的Flash模型来说,无疑是超常发挥了,值得表扬。

毕竟价格一分没涨。

是的,3.8 Flash在定价上,仍然与3.7 Flash保持一致。

谷歌邪修Gemini 3.8 Flash!险胜DeepSeek,姚顺宇:RSI一大步图1

Benchmark啥的就不细说了,大家看看就行。

相比而言,背后的方法论可能更有意思一点——

从谷歌披露的这些数据看来,Gemini好像「邪修」上了啊。。。

OpenAI和Anthropic都在努力让模型表现更强,同时用更少的步骤完成任务。

谷歌这边,完成任务需要走的步骤却越来越多,主打靠Loop大力出奇迹。

估计也是为了弥补模型智能本身的不足吧。

谷歌邪修Gemini 3.8 Flash!险胜DeepSeek,姚顺宇:RSI一大步图2

这可能也是Gemini如此注重「速度」的原因。

目前看来,3.8 Flash是市面上输出最快的模型,断崖碾压的那种,比第二名Meta高了几乎一倍。。。

但就是不知道实际用起来到底咋样。

如果智能水平跟不上,输出的全是劣质Token啊。

谷歌邪修Gemini 3.8 Flash!险胜DeepSeek,姚顺宇:RSI一大步图3

这方面,有网友发现了端倪。

说这玩意儿完全就是刷分刷出来的,像Terminal-bench 4.0这种8月底刚出的bench,新版Gemini表现纯纯一坨。

谷歌邪修Gemini 3.8 Flash!险胜DeepSeek,姚顺宇:RSI一大步图4

但不管怎么样,谷歌这次,终于是睡醒了吧。

过去一个半月,谷歌经历了一窝人事变动,甚至连二进制能力拥有者Jeff Dean都离职了——

谷歌,却连出了三款Flash。

关于这点,DeepMind成员姚顺宇的新帖子,或许能给出一点解释。

对模型来说,那只是一小步;但对RSI来说,则是一次巨大的飞跃呢

谷歌邪修Gemini 3.8 Flash!险胜DeepSeek,姚顺宇:RSI一大步图5

六周三款Flash,搞不好只是开胃菜。

Gemini 3.8 Flash:笨,但很努力

3.8 Flash无疑是一款性价比模型,相比3.7 Flash性能大涨,多数场景已经逼近更高成本的旗舰模型。

谷歌邪修Gemini 3.8 Flash!险胜DeepSeek,姚顺宇:RSI一大步图6

DeepSWE v1.1上,它能端到端自主解复杂工程问题,得分超过大多数体型大得多的前沿模型,成本只要零头。

谷歌邪修Gemini 3.8 Flash!险胜DeepSeek,姚顺宇:RSI一大步图7

金融和法律这类企业级agent场景,它也压过3.7 Flash和其他前沿模型。

HLE-Verified,人类最后的考试上拿到 54.9%,跨STEM、人文、专业领域的多步推理,和旗舰的差距肉眼可见地缩小了。

但智能方面,似乎并没有本质的提升。

3.8 Flash能考出这个分数,单纯是靠卷出来的。。。

是的,面对复杂任务,它会多走几步推理,反复迭代调用工具,所以在高effort档位下,它可能比前辈们烧更多Token。

这么一看,好像也没性价比到哪去啊。

谷歌如果想重回第一梯队,光靠这种Trick估计是不太行的。

还是坐等一手Pro吧。

只守不攻的Cyber模型

对了,还有一款模型——

3.8 Flash Cyber。

谷歌史上最强的网络安全模型。专攻自主发现漏洞、自动生成补丁。

基准上,CyberGym 漏洞发现测试里,3.8 Flash Cyber 超过 3.5 Flash Cyber,也超过大得多的前沿模型。在覆盖 20 种编程语言的内部代码库测试里,挖洞成功率超过 70%。

谷歌邪修Gemini 3.8 Flash!险胜DeepSeek,姚顺宇:RSI一大步图8

修洞方面,CWE-Bench上它pass@1达到47.2%,目前领跑的前沿模型是47.8%,几乎打平,成本却低出一大截。

谷歌邪修Gemini 3.8 Flash!险胜DeepSeek,姚顺宇:RSI一大步图9

更硬核的是实战报告,它已经在谷歌内部上岗了。

Chrome安全团队拿它修洞,产出的正确补丁数量,是最强商业模型的 2.6倍

Wiz用它跑内部渗透测试,召回率提升7.5到9.7个百分点,同样成绩的花费,只有其他前沿模型的2.3到5.2分之一。

最夸张的是Google Cloud漏洞研究团队,用它不到两小时,就挖出了一个以往需要研究数月的关键基础漏洞。

不过吧,这又是一个不公开发布的模型。。。

是的,谷歌表示能力太强,只通过Fairwind计划向受信防御者开放。

One More Thing

就在谷歌发模型的当口,Meta也端出了新货,Muse Spark 1.3。

又是一款对标Opus 5的模型,Agent和Coding能力同样大幅提升。

谷歌邪修Gemini 3.8 Flash!险胜DeepSeek,姚顺宇:RSI一大步图10

还顺手嘲讽了Gemini一波——

我真不想这么说,但是……

Gemni,谁啊?

谷歌邪修Gemini 3.8 Flash!险胜DeepSeek,姚顺宇:RSI一大步图11

不是,bro,你跟Gemini比个啥啊???

参考链接:
[1]https://blog.google/innovation-and-ai/models-and-research/gemini-models/3-8-flash-and-3-8-flash-cyber/

一键三连「点赞」「转发」「小心心」

欢迎在评论区留下你的想法!

—  —

🌟 点亮星标 🌟

科技前沿进展每日见

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
EMI
more
Einride豪掷千金购入500辆特斯拉Semi,具身智能物流的“规模战”正式打响
Tower Semiconductor 2026年全球技术研讨会火热报名中
Meta旗舰模型翻身!比DeepSeek还便宜,华裔掌门人骑脸Gemini
SEMI:Q2全球半导体设备市场同比大增23%
广立微SemiAgent获强芯生态贡献奖,AI赋能半导体产业!
突发|谷歌AI一夜巨震,Gemini换帅,首席科学家带三个大牛出走创业
谷歌Gemini的“品牌迷宫”:当AI交互变得比任务本身更复杂
Gemini Robotics 2 背后,仿真是机器人持续学习的基础设施
EMIB热度之下,先进封装进入内卷期
重磅!力压Gemini,中国开源全新交互AI模型
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号