能让谷歌逆风翻盘的AI,可能不是 Gemini

APPSO 2026-09-03 12:04
能让谷歌逆风翻盘的AI,可能不是 Gemini图1

能让谷歌逆风翻盘的AI,可能不是 Gemini图2

在 AI 狂飙突进的这两年里,Google 似乎总是扮演着那个「起大跑慢」的角色。

能让谷歌逆风翻盘的AI,可能不是 Gemini图3

老实说,看到 Gemini 在编程和推理上迟迟拿不出让人眼前一亮的成绩时,没人不会觉得 OpenAI 和 Anthropic 已经把身位拉开了。

不过,代码、文本处理,甚至图像生成这些领域的强大模型都会变得非常出色。这只是时间问题而已。

难的是让 AI 理解这个世界本身:包括视频、音频、运动、三维空间、时间和空间关系,以及事物如何相互变化和相互作用。

Google 在 9 月 1 日发布了「主动视频理解」功能,让 AI 判断该盯住哪一段画面,什么时候倒回去重新看一遍,用什么样的方式去看,从而得到更精准的理解。

能让谷歌逆风翻盘的AI,可能不是 Gemini图4

官方的演示是让模型数掌声的次数,这是过去 AI 很难做好的任务,因为传统方式按固定的每秒 1 帧读取画面,瞬间发生的动作很容易被漏掉或者和别的声音混在一起。而在主动理解模式下,模型能根据需要自动调整处理速度,准确识别并数出每一次鼓掌。

能让谷歌逆风翻盘的AI,可能不是 Gemini图5

加上 Google 手里握着 YouTube、Maps 和 Search 这类现实世界的数据入口,它对物理世界的触达方式其实相当特别。

告别逐帧试探,让 AI 主动看懂流动的世界

AI 理解视频的方式没那么高端。简单来说,它们是在「看图说话」。

当我们把一段视频喂给传统的 AI 模型时,系统会在后台悄悄把视频切碎,比如按照每秒 1 帧的频率提取静态画面。这种做法在一定程度上解决了计算量过大的问题,但其缺陷也显而易见。

如果视频里出现了一个极其短暂的动作,或者一个在 0.5 秒内闪过的画面,这种粗暴的采样方式就会将其完美错过。

能让谷歌逆风翻盘的AI,可能不是 Gemini图6

更不用说,当视频长度延伸到几个小时,庞大的帧数会瞬间撑爆模型的上下文窗口,让 AI 陷入记忆错乱的尴尬境地。

Google 给 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 三款模型接入「主动视频理解」,思路和此前发布的「主动视觉」有些相似,都是把模型的推理能力和一套原生工具绑在一起,让模型自己去调用。

模型会先形成一个循环式的判断过程,决定接下来要看哪一段、用多快的速度看、依赖画面还是音频还是字幕,然后调用内部工具把对应片段取出来精读。开发者原本也能手动拼出类似的处理逻辑,但需要写不少胶水代码,如今这被模型自己接管了。

能让谷歌逆风翻盘的AI,可能不是 Gemini图7

根据 Google 官方公布的基准测试,启用主动视频理解之后,token 消耗最多能降低 88%,分析成本最多降低 66%,同时准确率还能提升最多 7%

能让谷歌逆风翻盘的AI,可能不是 Gemini图8

Google 在 LongVideoBench 这类长视频理解基准上做了对比,结果显示 Gemini 3.7 Flash 在开启主动理解后,处于准确率与成本的帕累托前沿,是目前测试模型里性价比最好的一个。

有开发者用 Gemini 3.7 Flash 的主动视频理解功能配合 Agora 的对话式 AI 技术,搭建了一套小型演示系统。他们录制了一段视频,对着系统提出问题,模型分析视频片段,数清了手指排列的顺序,并提取出带时间戳的关键时刻,整个过程支持实时语音对话。

能让谷歌逆风翻盘的AI,可能不是 Gemini图9

像字幕组般贴心 像弹幕般陪伴

「我敢打赌,你或多或少追过字幕组制作过的剧。那时,白字蓝边、悬浮在片子底部的中英字幕,是我们探索另外一个世界的通道。」

字幕组很擅长为国内观众提供文化背景解释。

比如在《生活大爆炸》第四季第二集中,剧中角色提及了斯蒂夫·沃兹尼亚克,他在美国或许是个家喻户晓的人物,但对国内观众来说却较为陌生,于是中文字幕里用括号标注出了此人为苹果公司创始人之一。

能让谷歌逆风翻盘的AI,可能不是 Gemini图10

@ConcordeSky 在翻译《伟大的旅程》的一集特辑中,把镜头里所有出现的飞机全部考证清楚型号,在字幕里做出注释。

现在,AI 也可以像字幕组般贴心地在你观看过程中弹出有趣的事实。

能让谷歌逆风翻盘的AI,可能不是 Gemini图11

可以想象你正在观看一场节奏极快的 NBA 季后赛或是欧洲杯足球赛。

对于普通观众而言,赛场上的战术配合往往是一眨眼就错过的模糊画面,我们只能跟随着解说员的惊呼去感受比赛的激情。

但是,当启用了 Gemini 主动视频理解功能的播放器介入时,观赛体验将会发生颠覆性的改变。

能让谷歌逆风翻盘的AI,可能不是 Gemini图12

在直播或录播的过程中,AI 会在后台以极高的灵敏度实时分析着场上的局势、攻防两端的战术阵型以及每一个球员的跑位。

当赛场上突然出现一次精妙绝伦的反跑空切,或者是针对防守漏洞的战术犯规时,屏幕边缘会自然、克制地弹出战术拆解画面。

动态的战术路线图会自动在球员脚下延伸,同时拉出该球员在类似位置的历史投篮热力图和数据对比。如果遇到争议判罚,AI 甚至会结合当下最新的规则条款给出即时的视觉解释。

在这项技术的加持下,屏幕前不再只是一个被动接受画面的观众,每个人的身边都仿佛坐着一位不知疲倦、数据详实的专业场边战术分析师。

如今许多家庭都会安装智能摄像头来照看家中的幼儿或宠物,然而现有的摄像头报警功能常常闹笑话。一阵风吹动了窗帘,或者是光影发生了微小的变化,手机就会频繁收到「检测到画面异动」的无用推送。

能让谷歌逆风翻盘的AI,可能不是 Gemini图13

连接了 Gemini 的家庭监控系统将完全不同。得益于其对复杂动态场景的理解能力,AI 能够轻易过滤掉那些由风吹草动、光影变幻产生的无效运动噪点。它的注意力始终聚焦在具有语义价值的实体上。

当一个牙牙学语的幼儿试图攀爬客厅里高处的置物架,或者当家里的猫咪在角落里呈现出反常的、长期的蜷缩状态时,它会向监护人的手机推送一条带有精准场景语义的预警:「宝宝正在尝试攀爬书柜,请注意安全」或者是「猫咪已持续萎靡不振超过两小时,建议观察健康状况」。

当 YouTube 拥有了眼睛,视频消费的下半场

这项能力目前已经能通过 Google  AI Studio 和 Gemini Enterprise Agent Platform 里的 Gemini API 调用,支持上传视频和 YouTube 视频两种输入,定价沿用标准的 token 计费,没有额外收费。

能让谷歌逆风翻盘的AI,可能不是 Gemini图14

Google 表示,这项能力很快会推送给 Gemini App 里使用 Flash 和 Flash-Lite 系列模型的所有用户,未来几个月还会为 YouTube 的「Ask YouTube」功能提供支持。

顺带一提,拥有 5 亿订阅者的 YouTuber MrBeast 在即将发布的视频中,将会介绍 Gemini、Google Health 以及 Fitbit Air 等产品。这是他与 Google 多年合作计划的一部分,他会在穿越丛林、沙漠和北极地区时借助 Gemini 辅助工具来识别危险、应对恶劣的天气条件。

能让谷歌逆风翻盘的AI,可能不是 Gemini图15

在以往,我们与视频的交互是单向且线性的。你点开一个两小时的数码评测视频,想要寻找关于某款手机屏幕亮度的真实表现,你只能在进度条上反复拖拽,或者依赖其他热心网友在评论区留下的时间戳或课代表式总结。

当「Ask YouTube」成为标配,用户与视频之间的墙被彻底推倒。

你可以在播放页面随时敲下你的疑问:「主讲人在哪个时间段对比了这款手机在阳光下的显示效果?他们的结论是什么?」或者在一段长达数个多小时的烹饪教学视频里直接提问:「配料表里提到的迷迭香是在第几步放进去的?需要腌制多久?」

AI 会在瞬间检索整部视频,精准地将进度条定位到那一帧,同时在侧边栏用简洁流畅的语言为你总结出答案。

互联网上海量的视频资源,将在这一刻转化为可以直接被调用的结构化知识库。

眼下看,Google 在短时间内是很难回到旗舰模型第一梯队了,但如果真正决定胜负的是谁能造出理解世界、并且能和世界互动的 AI,那么这场比赛可能才刚刚开始重新洗牌。

未来的 AI 不仅仅会听、会说、会画,更能够用一双真正懂温度、懂逻辑的眼睛,和我们一起凝视这个瞬息万变的世界。

相关参考🖊️:

https://mp.weixin.qq.com/s/eIWgS38EFHS-YF48GFf98Q

https://mp.weixin.qq.com/s/fILhstpTYGYsNqFapbiHWg

https://x.com/Red1OneX/status/2094862171348021528


我们正在招募伙伴
📮 简历投递邮箱hr@ifanr.com
✉️ 邮件标题「姓名+岗位名称」(请随简历附上项目/作品或相关链接)
能让谷歌逆风翻盘的AI,可能不是 Gemini图16

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
AI EMI
more
国产AI芯片,不够卖了
AI加速向设备端迁移,“研华AMD嵌入式平台解决方案线上研讨会”成功举办
具身智能的测试时扩展新范式:清华团队提出ParallelWorld,让AI像人一样预演未来再行动
亚马逊祭出AI“照妖镜”:Alexa变身防诈助手,直击36万用户痛点
腾讯研究院AI速递 20260903
AI赋能光电新变革,第二十七届中国国际光电博览会聚力全链创新!
活动邀约 | RISC-V AI技术沙龙@上海站(倒计时两周)
制造业龙头,给工业AI补上了哪一块短板?
新品直击|视障人士的“第三只眼”!环视智能触晓AI导盲设备亮相福祉博览会
为什么说AI更知道你想买什么?
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号