刚和豆包视频完的我,已经开始重新认识AI了。

差评X.PIN 2026-08-06 00:00
刚和豆包视频完的我,已经开始重新认识AI了。图1


刚和豆包视频完的我,已经开始重新认识AI了。图2 不知道大家有没有这种感觉,每次想和 AI 好好说句话,总觉得哪哪儿都拧巴

刚和豆包视频完的我,已经开始重新认识AI了。图3


特别是,和 AI 们直接语音沟通时,你能很明显的感觉出来 AI 和人的差别。


因为说到底,现在的 AI 语音更像在玩回合制游戏,你说话它闭嘴,它说话你挨听。


你不能自然地停顿、插话,它也分不清你是在跟它说话,还是在跟旁边的人说话。


这种交互上的硬伤,直接把 AI 死死钉在了答题机和代码工具的生态位上。

刚和豆包视频完的我,已经开始重新认识AI了。图4


上个月,OpenAI 就推出了 GPT-Live,可以做到在说话的同时持续听取用户输入,获得了外界不少好评。


刚和豆包视频完的我,已经开始重新认识AI了。图5 但不少人表示,这有啥,都是玩剩下的了,因为早在今年 4 月,豆包的语音通话模式中,就已经升级了这一功能。


前两天,豆包更是反手直接升级了自家的视频通话能力,接入了原生音视频多模态全双工大模型 SeedRealtime,说是能支持更好的音视频理解,抗干扰和打断判停能力。

刚和豆包视频完的我,已经开始重新认识AI了。图6


这个所谓的全模态全双工交互模型,核心就是一件事,针对咱们前面说的几个拧巴的地方,回合制对话的模式,进行大版本调整。


听起来有点意思了,于是咱们也马上找几个真实场景试了试。


毕竟技术再好再高大上,咱们更关心的,其实还是这些新能力到底实不实用,用起来能不能更顺、更省心,真遇到事儿时能不能帮上忙。


先来个基础的,看看新版本的豆包视频电话,到底还是不是回合制游戏。


你还真别说,现在这个版本的豆包更聪明了,之前视频的时候,它就像一个单线程生物,耳朵和嘴巴只能有 1 个在工作,它如果开口说话,就很难听见你的新指令;当它在听你说话的时候,那它就没法思考。


刚和豆包视频完的我,已经开始重新认识AI了。图7 如今的豆包就好很多,哪怕在叭叭叭的说话,但只要听到你的声音,它立马住嘴,还会根据你的新提问修改。


而且,你们也能从这个测试视频里看出来,它对人类的提问、断句判断更好了。


以前,你可能只是卡壳了一下,整句话并没有说完,它却 get 不到,自顾自地就开始回答你,但现在,它基本上都能分辨得出你到底说没说完,对话过程更像和一个小姐姐在面对面聊天。


刚和豆包视频完的我,已经开始重新认识AI了。图8 不仅如此,现在的豆姐确实有了更强的抗干扰能力


搁以前,它像长了个顺风耳一样,身边有点其它动静,很容易误判是你的新指令,转头去回应那些杂音了,但现在,它像是有了声纹解锁一样,基本做到和你 1 对 1 私聊。


而且,我们还发现,如今的豆包视频的识别速度杠杠的。


比如下面这个视频,我们在玩一个小游戏的时候,让它帮我们进行武将选择,就咱这滑动的速度,结果豆包的识别又快又准。


在测试中,我们还发现,哪怕面对在编辑部玩游戏,一个人在前面打,后面坐着几个狗头军师的情况。


刚和豆包视频完的我,已经开始重新认识AI了。图9 豆包也完全能 hold 住这样多人对话的复杂场景,它能随时随地在线听大家伙说话,清楚地分辨出说话对象、内容


就连沉浸操作的同事小声嘀咕了一句 “ 怎么冲刺 ”,都被豆包精准抓包,然后打上了一个不怎么会玩的标签。


接下来,我们给豆包上了点强度,刚好编辑部在装测试平台,我们让豆包当个装机高手,指导下该怎么操作。


结果豆包只是简单扫了眼,就知道这台测试平台进度如何。


紧接着,我们发现,豆包除了能在装机过程中指导怎么做,还能在误操作时,主动提醒。


刚和豆包视频完的我,已经开始重新认识AI了。图10 豆包甚至还超有眼力见,实时盯着我的手部动作,在装内存条的时候,主动提前提醒注意正反面,而且别用蛮力硬怼


而且我们发现,豆包完全可以全流程跟踪装机这种大型任务,因为就在我们根据豆包的指导装完显卡,觉得大功告成准备收工时。


这哥们儿居然查漏补缺了:你丫的显卡的供电线还没接呢!


甚至连角落里最容易被忽略的主板 CPU 供电线,都被豆包发现了,主打一个你随便折腾,哥们兜底。


而且在这个过程中,我们还发现了豆包强大的记忆功能。


因为全程开着视频,等我们装完测试平台,准备离开影棚的时候,想起来有台测试机不知道放哪儿了。


于是,我突然想到,有没有可能豆包知道,结果它还真记着了。


要知道,这可不仅是听懂话,而简直就是 AI 磕了哆啦 A 梦的记忆面包。


我就问,平时和真正的人类打电话,谁会帮你记自己随手放的东西?但豆包偏偏就帮你盯在眼里了。

刚和豆包视频完的我,已经开始重新认识AI了。图11


如果说装机只是在影棚里的极客游戏,那在人声鼎沸、流程复杂的真实医院里,豆包还顶得住吗?


刚和豆包视频完的我,已经开始重新认识AI了。图12 于是,我们把豆包带到了医院,想试试,更新完的视频能力能不能辅助一些老人等特殊人群,在大医院里独自看病。


到医院门口后,咱主打一个两眼一抹黑,问豆包先去哪儿取号。


豆包表示,面前的这个人工挂号窗口,或者边上的自主取号机取号就行。


而且,豆包还贴心地给了建议,告诉我们如果提前预约好了,人工窗口排队人多,那还是选自助取号比较方便。


按照引导取好预约号之后,常见的问题就是不知道该怎么上楼找到自己的诊室,特别是一些大医院,很容易把病人给绕晕了,但现在,你只要给豆包看一看,它会告诉你怎么走。


同样的,到了诊室门口,现在很多医院都得先签到才会进入排队队列,但不同医院、科室的签到、报到规则、机器都不大一样,不少人都会傻眼,豆包就能一眼告诉你怎么操作。


我们整一个测试下来,从医院大门开始,豆包一步步带我们去自助机取号、然后找到电梯到达指定楼层、签到。。。除了路过的护士小姐姐和路人,会用奇怪的眼光观察世超,几乎挑不出任何毛病。


所以,在取号、找楼层、识别签到设备这些流程性任务上,豆包已经能提供全程陪同的帮助。


所以,总得看下来,豆包的视频能力确实有了不小的提升,但在我们看来,最有意思的进步并不是豆包能多认几个东西、或者说能更快地进行反应,而是它真的在尝试理解你的语气、声音等等,真学会了像人一样和人沟通。


刚和豆包视频完的我,已经开始重新认识AI了。图13 咱们也去研究了一下,为啥现在豆包的视频能力进步得这么快,发现真正的功臣就是它底层的 SeedRealtime


以前 AI 里所谓的视频通话,本质上都是流水线:


AI 先听到声音,然后转成文字,看一眼屏幕截图,综合起来处理思考,最后生成语音回答。


这种串联思路,每个步骤的反应处理再快,连起来就显得慢半拍。


但 SeedRealtime 最狠的一点,是将声音、画面、时序与表达,全都融进了一个端到端模型。


这么一来,看听说在同一套系统里进行,不分步骤不分前后,AI 就能通过手势和现场画面,秒懂你说的 “ 这个,内个儿 “ 指的是啥,也才能精准地过滤掉旁人的杂音。


同样的,能持续理解视频里的场景变化,AI 也就能分得清啥时候该闭嘴,啥时候能主动开口提醒了。


最后,给人的表现就是懂得察言观色,像个真正的人了。


刚和豆包视频完的我,已经开始重新认识AI了。图14 在搞明白了这些底层逻辑后,你就会发现,豆包这次展现出来的能力,也是目前整个 AI 行业死磕的方向之一


隔壁的海外大厂们也在提实时语音、多模态交互和思考模型,除了咱们前面提到的 GPT‑Live,OpenAI 也还拿出 Thinking Machines 露脸,但它的功能还在演示阶段、没法让公众随手敞开了用。

刚和豆包视频完的我,已经开始重新认识AI了。图15


所以豆包的这个音视频全双工能力,才是真正开始往我们期待的贾维斯方向进化了。


当然了,这离贾维斯还有不少距离,现在你还得到处举个手机,视频通话也受网络、续航等等条件。


但至少从这次体验看,AI 助手正在从 “ 你问一句、它答一句 ”,变成一个能边看、边听、边协助的角色。


再多说两句,咱们突然觉得手机这个形态,有点制约未来 AI 的能力了,如果这个视频能力未来可以跳出到手机以外,像是智能眼镜、手环、AI 小硬件 ( 当然,得搞定续航、散热、网络、算力等等问题 ),或许真是一个完全崭新的原生 AI 世界了。


所以,不久的将来,如果看到谁在大街上嘀嘀咕咕,别以为人家是魔怔了,或许他正在和豆包打电话呢。




撰文:八戒
编辑:江江 & 面线
美编:焕妍

图片、资料来源
豆包



刚和豆包视频完的我,已经开始重新认识AI了。图16

刚和豆包视频完的我,已经开始重新认识AI了。图17

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
AI
more
技嘉AORUS P1600W电源发布:GaN技术加持,专为AI算力集群打造
狐讯 | 普华永道报告被检出 AI 生成;马斯克 AI 百科长期停滞更新
字节跳动定调AI战略:拒走捷径,押注长期AGI自研
OpenAI反击苹果商业秘密诉讼:指责对方安保疏漏,实为掩盖人才流失焦虑
离谱到家!X平台AI随意合成色情图,把马斯克孩子妈给坑了
清华信誉机制破解电商大忽悠,让AI代理真正推你所需
这颗RISC-V+数据流架构的AI芯片,想把视频生成成本打下来
华强北AI硬件出口激增,供应链“一公里”效应凸显全球竞争力
2026科学智能大会平行会议之一|AI4S 基础理论:AI能否自己发现自然规律?
思尔芯RCF RTL自动分割工具,助力大规模AI/HPC芯片原型验证
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号