刚刚,Gemini 3.8 Flash 来了,结果惨遭对手嘲讽

APPSO 2026-09-03 06:23
刚刚,Gemini 3.8 Flash 来了,结果惨遭对手嘲讽图1
好好好,谷歌也开始按月更大模型了。
就在刚刚,距离 Gemini 3.7 Flash 发布仅仅过去三周,Google Gemini 3.8 Flash 和专攻网络安全的 Gemini 3.8 Flash Cyber 同时登场。
刚刚,Gemini 3.8 Flash 来了,结果惨遭对手嘲讽图2
算下来,短短 6 个星期,Gemini Flash 产品线已经完成了 3 次大版本迭代,平均每三周就有一个新模型出现。
放在过去的大模型行业里,这种更新速度几乎难以想象。
刚刚,Gemini 3.8 Flash 来了,结果惨遭对手嘲讽图3
更值得关注的是,谷歌内部一套新的模型开发方式也逐渐显露出来:越来越多 Agent、强化学习和工具调用方面的新能力,开始优先出现在体量更小、修改成本更低的 Flash 上。
而且最近突然加速的还不止谷歌。
就在 Gemini 3.8 发布前后,Meta 刚刚也更新了 Muse Spark 1.3,把 Agent 长任务、编码能力和推理效率列为这一代模型的主要升级方向。
刚刚,Gemini 3.8 Flash 来了,结果惨遭对手嘲讽图4
更有意思的是,Meta AI 负责人 Alexandr Wang 发布新模型之后,也再次阴阳怪气地调侃道:「我真不想这么说,但是……Gemini 是谁?」
刚刚,Gemini 3.8 Flash 来了,结果惨遭对手嘲讽图5
Pro 难产,Flash 被推上了主桌
先看主角 Gemini 3.8 Flash。
谷歌给它的定位相当高,称其为目前谷歌最智能的推理与编程模型之一,重点瞄准端到端自主 Agent 工作流,以及需要持续运行较长时间的软件工程任务。
从官方公布的 Benchmark 来看,谷歌显然希望推动 Flash 摆脱「便宜、快速模型」的固有定位,进一步承担复杂任务的执行。
刚刚,Gemini 3.8 Flash 来了,结果惨遭对手嘲讽图6
在 DeepSWE v1.1 长周期软件工程测试中,Gemini 3.8 Flash 可以自主处理复杂的端到端工程问题,成绩超过了不少体量更大的前沿模型。
刚刚,Gemini 3.8 Flash 来了,结果惨遭对手嘲讽图7
面对金融和法律等专业场景,它同样提升明显。
刚刚,Gemini 3.8 Flash 来了,结果惨遭对手嘲讽图8
在 Vals Finance Agent V2、Harvey's Legal Agent Benchmark 等测试中,3.8 Flash 都显著领先上一代 3.7 Flash;涵盖 STEM、人文与专业知识的 HLE-Verified 测试里,它拿到了 54.9% 的成绩。
刚刚,Gemini 3.8 Flash 来了,结果惨遭对手嘲讽图9
至于这款模型是怎么做到的,就不得不提谷歌这次重点强化的 Agentic loops,也就是模型在完成复杂任务时持续推理、调用工具、检查结果并修正方案的能力。
过去很多 Coding 模型更像一次性给答案,生成一段代码以后,后续能不能运行、哪里需要修改,往往还得依赖用户继续介入。
现在的 3.8 Flash,则越来越像一个愿意把活干完的「打工圣体」。
面对复杂任务,它可以主动增加推理步骤,连续调用不同工具,根据执行结果重新评估方案,并在发现问题以后继续修改。
因此,当用户把 effort level 调高以后,模型会投入更多推理和 Token 预算,以换取更高的复杂任务完成率;面对普通任务,也可以降低 effort level,把响应速度和使用成本控制下来。
官方 Demo 更能说明这种变化。
在 Google Antigravity 中,只需要给出一个相对简单的循环任务指令,Gemini 3.8 Flash 就可以持续调用工具,完成一个可玩的 3D 巫师闯关游戏,其中包括谜题、环境叙事以及由 Nano Banana 生成的纹理资源。
刚刚,Gemini 3.8 Flash 来了,结果惨遭对手嘲讽图10
它甚至还能做出一个完全可玩的 DOS 版 Google Maps,其中包括街景和导航功能。
不过根据网友的真实测试,3.8 Flash 的优缺点也变得更加鲜明。
目前比较一致的感受,是它真的非常快,而且便宜得惊人,但「做得快」和「最终成品最好」之间,暂时还不能完全画上等号。
AI/ML API 用完全相同的提示词,让 Gemini 3.8 Flash 和 Claude Opus 5 分别制作四个独立的 Three.js 物理场景,包括针刺气球、水球坠落、蘑菇云以及动态原子模型。
刚刚,Gemini 3.8 Flash 来了,结果惨遭对手嘲讽图11
Gemini 3.8 Flash 总成本只有 0.12 美元,Claude Opus 5 则花了 1.86 美元,价格相差超过 15 倍;与此同时,Flash 完成每个场景都不到 70 秒,Opus 5 最慢则接近 5 分钟。
另一位,开发者 Tim Jayas 的结果更加夸张。他把同一个提示词分别交给 Gemini 3.8 Flash 和 Opus 5,Opus 5 花了整整 24 分钟,3.8 Flash 只用了 37 秒。
刚刚,Gemini 3.8 Flash 来了,结果惨遭对手嘲讽图12
不过另一批测试,也暴露了 Flash 很典型的另一面。
开发者 Aditya 用 Gemini 3.8 Flash 和 Kimi K3 制作同一个 Sticky Ball 游戏时就发现,Flash 生成速度极快,消耗的 Token 也明显更少,但最终游戏体验明显落后于 K3,在运动机制、移动表现和整体游戏设计上都有差距。
刚刚,Gemini 3.8 Flash 来了,结果惨遭对手嘲讽图13
类似情况也出现在一个高复杂度的纽约城市场景测试里。
博主 AI Pulse Daily 使用完全相同的提示词测试 Gemini 3.8 Flash、3.7 Flash 和 Opus 5,要求模型生成一个细节密集的 Three.js 纽约城市场景。
结果 3.8 Flash 整座城市只放了 6 棵树,甚至比三周前 3.7 Flash 的 10 棵还少,而 Opus 5 塞进了 1840 棵。
刚刚,Gemini 3.8 Flash 来了,结果惨遭对手嘲讽图14
提示词明确要求的人行横道条纹、水下焦散和色差效果,3.8 Flash 也全部略过;与此同时,它却主动加入了 5 个摄像机预设、3 个后处理开关、标题卡和实时时钟,其中不少功能根本没有出现在用户要求里。
另外,在价格方面,Gemini 3.8 Flash 的输入价格仍然为每百万 Token 0.75 美元,输出为每百万 Token 3.75 美元,与三周前降价后的 Gemini 3.7 Flash 保持一致,目前的优惠价格将持续到 2026 年底。
对于谷歌来说,Flash 的角色已经越来越明确:它既负责成本和速度,也一定程度上承担过去更多由旗舰模型负责的复杂任务。
Gemini 的新能力,为什么总在 Flash 首发?
与 Gemini 3.8 Flash 一起发布的,还有专门针对网络安全任务训练的 Gemini 3.8 Flash Cyber。
后者通过新的 Fairwind 计划向经过审核的防御者开放,能力重点集中在漏洞发现、渗透测试以及自动生成安全补丁等场景。
Gemini 3.8 Flash Cyber 在标准 CyberGym 漏洞发现 Benchmark 中明显超过上一代 Gemini 3.5 Flash Cyber,同时也超过了多款体量更大的前沿模型。
刚刚,Gemini 3.8 Flash 来了,结果惨遭对手嘲讽图15
在谷歌内部覆盖 20 种编程语言的真实代码测试中,它发现漏洞的成功率超过 70%。
自动修复漏洞方面,Gemini 3.8 Flash Cyber 在 CWE-Bench 上取得了 47.2% 的 Pass@1,与表现最好的前沿模型 47.8% 已经非常接近,而模型运行成本明显更低。
刚刚,Gemini 3.8 Flash 来了,结果惨遭对手嘲讽图16
Chrome 安全团队给出的内部结果显示,Gemini 3.8 Flash Cyber 生成的正确漏洞补丁数量,可以达到部分大型商业模型的 2.6 倍。
安全公司 Wiz 的测试同样显示,使用该模型进行渗透测试以后,漏洞召回率提高了约 7.5% 至 9.7%,与此同时,成本下降约 2.3 至 5.2 倍。
谷歌云漏洞研究团队还披露过一个更加极端的案例,他们利用 Gemini 3.8 Flash Cyber,在不到两个小时的时间里发现了一处严重基础漏洞,而按照传统研究流程,类似问题通常可能需要数月时间才能被定位。
值得一提的是,在 Gemini 3.8 Flash 系列模型发布前,《华尔街日报》就曾披露 Gemini 3.8 Flash 在谷歌内部的代号为 Skimaki。
员工曾经在内部代码工具 Jetski 中,让它与 Anthropic 的 Claude Opus 进行对比测试,结果不少谷歌工程师反而更加偏好自家的新模型。
代码能力重新成为谷歌重点竞争的战场,而 Flash 目前显然承担了相当重要的角色。
对比之下,谷歌过去一年在旗舰模型上的进展经历了不少波折。
Gemini 3.0 在去年 11 月发布以后曾经短暂取得领先,随后 OpenAI 和 Anthropic 的新模型继续向前推进,谷歌的优势没有维持太久。
刚刚,Gemini 3.8 Flash 来了,结果惨遭对手嘲讽图17
Noam Shazeer、Jeff Dean 等重要技术人物也在今年夏天陆续离开。
原本计划继续推进的 Gemini Pro 新版本同样遭遇调整。
皮查伊曾在今年 5 月透露新版 Pro 可能在随后一个月到来,但谷歌内部准备的 Gemini 3.5 Pro 方案最终被取消,其中一个重要原因,就是相对于 Flash 系列的能力提升不够明显。
更远一些的 Gemini 4 虽然已经完成部分预训练工作,目前仍然处在后训练阶段,距离正式发布还有一段距离。
谷歌随后也调整了 DeepMind 的管理层,Koray Kavukcuoglu 接手更多管理职责,新管理层给团队提出的一项明确要求,就是进一步加快模型研发与发布速度。
刚刚,Gemini 3.8 Flash 来了,结果惨遭对手嘲讽图18
大哥难产,只能靠小老弟 Flash 出来扛大旗了。
不过 Flash 最近近乎疯狂的更新频率,背后其实对应着大模型研发方式正在发生的一次变化。
单纯依靠扩大模型规模获得能力增长,边际收益已经没有前几年那么明显;强化学习、Agent training、工具调用和其他后训练技术的重要性,则持续上升。
《华尔街日报》提到一个很关键的细节:Flash 规模相对较小,因此修改和重新训练模型所需要消耗的算力更低,谷歌内部可以让多个团队同时尝试不同方案。
换成规模庞大的 Pro 系列以后,每一次模型调整都会涉及更多 GPU、训练时间以及跨团队资源协调,同样一种后训练实验,试错成本自然高得多。
刚刚,Gemini 3.8 Flash 来了,结果惨遭对手嘲讽图19
与此同时,谷歌今年明显增加了对强化学习和后训练的投入,还从 OpenAI 招募了后训练负责人 Barret Zoph 担任研究副总裁。
资源投入方式变化以后,一个结果逐渐显现出来:新的 Agent 训练方法、RL 策略以及工具调用机制,更容易先在 Flash 上进行实验,并在验证有效以后迅速进入正式版本。
从产品开发方式来看,现在的 Flash 多少有点 Gemini「高速开发分支」的意思。
模型更小,修改成本更低,所以谷歌可以让多个团队同时尝试不同的 Agent training、RL 和工具调用方案,三周左右就完成一次新版本迭代。
刚刚,Gemini 3.8 Flash 来了,结果惨遭对手嘲讽图20
Pro 系列承担的任务则越来越接近真正意义上的旗舰版本,只有能力提升达到足够大的幅度以后,投入巨量算力和内部资源更新一次才更划算。
说到底,谷歌未必一开始就计划让 Flash 扛起这面大旗。但阴差阳错的是,这种局面恰好撞上了大模型研发重心的变化。
伴随着强化学习、Agent training 和工具调用越来越重要,模型体量更小、实验成本更低的 Flash,反而在短时间内比 Pro 更适合快速后训练。
因此在旗舰模型难产的情况下,谷歌反倒提前摸到了 Flash 模型下半场更重要的能力:也就是更快训练、更快验证,以及更快把新的后训练成果交到用户手里。
当然,这一切的前提是,Gemini 4 最终能争点气,不再让人失望。
我们正在招募伙伴
📮 简历投递邮箱hr@ifanr.com
✉️ 邮件标题「姓名+岗位名称」(请随简历附上项目/作品或相关链接)
刚刚,Gemini 3.8 Flash 来了,结果惨遭对手嘲讽图21

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
EMI
more
Einride豪掷千金购入500辆特斯拉Semi,具身智能物流的“规模战”正式打响
稼动率从 77% 爬到 83%,onsemi 把汽车芯片需求排到 AI 后面
芯片厂商,居然也开始做EMI了?
Pixel Watch 5发布:Gemini AI重塑交互,血压与胰岛素监测成健康新标杆
【有奖直播】onsemi 深度传感产品介绍
Gemini 3.8,明日登场!
SEMI:Q2全球半导体设备市场同比大增23%
长鑫存储拒绝苹果压价,反手涨价/Gemini换帅,诺奖得主退居二线/曝DeepSeek重启第二轮融资
谷歌邪修Gemini 3.8 Flash!险胜DeepSeek,姚顺宇:RSI一大步
英特尔加速俄亥俄晶圆厂建设,EMIB-T量产仍受基板良率制约
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号