刚刚,AI 击穿了「视频图灵测试」,1700 万网友在线围观

APPSO 2026-10-03 07:56
x'qx'qx'q刚刚,AI 击穿了「视频图灵测试」,1700 万网友在线围观图1
过去,视频通话常被当成确认身份的一道保险。文字可以代写,声音可以合成,但让对方打开摄像头,聊几句、看表情,似乎总能多一分把握。
如今,连这份眼见为实的笃定也开始受到挑战。
最近,AI 研究团队 Tavus 发布实时视频交互模型 Griffin,并公布了一项实验结果。在与其研究预览版 Griffin-Lite 进行一分钟视频通话后,54 名参与者中有 26 人认为,屏幕另一端坐着一个真人,占比约为 48%。
刚刚,AI 击穿了「视频图灵测试」,1700 万网友在线围观图2
▲ 截至发稿前,近 1736 万网友围观
作为对照,Tavus 上一代系统在相同实验流程下,只有 41 人中的 1 人被当成真人,比例为 2.4%。
Tavus 据此宣称,Griffin 是首个通过实时「视频图灵测试」的模型,并将其归入一个新类别 Human Interaction Model,简称 HIM,即人类交互模型。
不过,「首次通过」目前仍是 Tavus 对实验结果的定义,同时由于尚未全面开放预览,不排除存在画饼 Demo 的嫌疑,而要具体理解这次发布,需要同时看清三个问题,参与者如何被说服,模型如何完成互动,以及一分钟的表现究竟能证明多少。

让人相信的细节,藏在说话之外

与 AI 聊天时,最容易让人出戏的瞬间,未必是答案有多离谱,有时只是它太不会接话。
你停下来组织语言,它立刻抢着回答;你讲了一件难过的事,屏幕上的脸却还挂着笑;你打断它,它仍沿着原来的节奏继续说。答案可能没有错,交流却始终有些别扭。
Griffin 尝试处理的,就是这些发生在语言之外的细节。按照 Tavus 的介绍,它能够同时看、听、说,并根据对方的表情、视线、语气和停顿,持续决定接下来该做什么。
在官方演示中,模型展示了随对话改变情绪、语调和动作的能力,还参与了模仿指令游戏、魔方互动,以及观察用户焊接电路板等场景。Tavus 希望借此说明,模型能够结合画面和时间信息参与交流。
比如,同样是一段沉默,有人正在思考,有人已经说完,有人则可能希望对方继续解释。系统需要结合上下文与非语言信号判断,避免把每次声音停止都当成发言结束。
视觉生成的范围也扩大了。Tavus 称,Griffin 能从一张参考图像出发,实时生成整个画面,包括人物的脸、手臂、手指,以及椅子的移动、阴影和背景变化。
因此,屏幕上的角色在听人说话时,也可以点头、调整视线或改变表情,不必等到自己的台词开始,才突然有了动作。

AI 想学会聊天,得摆脱轮流答题的节奏

上述能力背后,是交互方式的变化。
常见的级联系统会依次完成语音识别、语言模型回答、语音合成和数字人驱动,多个环节前后衔接。用户说完一句,系统处理一句,再把结果交给下一环节。
Griffin 采用全双工视频交互方案。所谓全双工,就是系统在输出语音和视频的同时,仍持续接收并处理用户的声音与画面。
刚刚,AI 击穿了「视频图灵测试」,1700 万网友在线围观图3
▲ 左为原图,右由 AI 辅助翻译,仅供参考
它由两个主要部分构成。
持续对话建模引擎负责感知现场、决定说什么以及何时回应,同时输出情绪、表情和动作等控制信号;音视频生成引擎则将这些信号转化为连续的声音与画面。
刚刚,AI 击穿了「视频图灵测试」,1700 万网友在线围观图4
对话引擎以小于一秒的间隔重新评估交流状态,所以模型在一句话说到一半时,也能根据用户反应决定暂停、继续或让出发言机会。
实现这种配合,还需要生成速度跟得上。
Griffin-Lite 的语音模块采用流式生成,能够随着控制信号到来逐步输出声音,并支持利用约 10 秒参考音频克隆声音。
刚刚,AI 击穿了「视频图灵测试」,1700 万网友在线围观图5
视频模块则以每段 320 毫秒的方式,实时生成 720p、25 帧每秒的视频。团队通过模型蒸馏和自回归训练,将原本多步生成的过程压缩为少步生成,同时改善长时间输出时的画面稳定性。
刚刚,AI 击穿了「视频图灵测试」,1700 万网友在线围观图6
在 Tavus 公布的 H100 测试中,音频到达后,其效果出现在画面上的平均延迟为 0.43 秒,约为比较对象中下一快方法的一半。该数字衡量的是音频到视频的生成延迟,不能直接当成用户提问到收到完整回答的时间。‘
刚刚,AI 击穿了「视频图灵测试」,1700 万网友在线围观图7
画面质量方面,Griffin-Lite 在与四种已发表流式扩散模型的比较中,取得了 DOVER、FID 和 THEval 三项指标的最佳成绩;唇形同步指标 LSE-C 得分为 7.27,位列第二。
刚刚,AI 击穿了「视频图灵测试」,1700 万网友在线围观图8

榜单接近人类,一分钟实验仍有边界

除了内部测试,Griffin-Lite 也出现在英伟达的 VideoFDB 公开榜单上。该基准分别评估模型能否理解交流中的非语言信号,以及能否生成符合情境的声音、表情和动作。
生成赛道中,Griffin-Lite 的总分为 3.83,人类参考分为 3.92,排名下一位的 Gemini 2.5 与 Anam 组合为 2.80。感知赛道中,Griffin-Lite 得分 3.73,人类参考分为 4.20,最高的其他公开基线成绩为 3.44。
刚刚,AI 击穿了「视频图灵测试」,1700 万网友在线围观图9
两项成绩均领先榜单中的其他 AI 系统,但它们属于特定基准下的评分。尤其需要注意,部分比较对象只接收音频,部分接收音视频,输入条件存在差异,排名不能直接推广为所有能力的比较结论。
至于最受关注的 48%,来自另一项由 Tavus 组织、通过独立研究平台招募参与者的实验。
参与者事先被告知,将与另一名参与者视频通话一分钟,讨论今年最期待的事情。实际出现在屏幕上的,是由 Griffin-Lite 实时生成脸、声音和回应的 AI 角色。
刚刚,AI 击穿了「视频图灵测试」,1700 万网友在线围观图10
通话结束后,参与者先评价对方的自然程度、可信度和交流体验,直到问卷最后才被问及,是否怀疑过对方并非真人。研究结束时,所有人都被告知了 AI 身份。
最终,26 人判断对方是真人,这组参与者对判断的平均信心为 79%;认为对方是 AI 的参与者,平均信心则为 81%。产生怀疑的人,通常在通话开始后的 20 秒内就有所察觉。
模型也尚未消除所有交流障碍。在七分制评价中,自然程度为 5.4,可信度为 5.6,再次交流意愿为 5.8,而对话流畅程度为 4.9,是五项评价中最低的一项。
实验说明,实时合成的面孔已经能够在特定条件下让部分人信以为真。但样本只有 54 人,通话仅持续一分钟,参与者又被提前告知对方是另一个人,结果仍需要更大规模、更长时间和更多场景的验证。

越像真人,越需要说明自己是谁

在 Tavus 对 Griffin 的愿景中,你永远不会去思考交流的「机制」。你不会去想「我要用什么词汇才能让他听懂」,你只是自然地表达,让对话如水般流淌。
想象一下,未来的在线辅导,不再是冷冰冰的 PPT 录播。AI 老师能从你紧锁的眉头看出你没听懂,然后主动换一种更通俗的比喻;
未来的客服,不需要你费尽心机描述零件的型号,你只需要把它举到摄像头前,AI 就能和你一起研究怎么修理它。
机器终于俯下身来,走进了人类的语境里。
这也是为什么,Tavus 在发布 Griffin-Lite 预览版的同时,宣布只向部分可信测试者开放研究预览,尚未供普通客户使用。
团队表示,正在开发 AI 身份披露功能,并开展进一步的安全与对齐评估,更广泛的发布将取决于相关问题的处理进展。
过去,数字人的挑战是怎样让人愿意与它交流;随着实时生成越来越自然,产品还必须回答怎样让人知道自己正在与谁交流。让 AI 学会看眼色,可能会降低使用门槛,让用户看清它的身份,则将决定这份便利能否建立在信任之上。
刚刚,AI 击穿了「视频图灵测试」,1700 万网友在线围观图11
我们正在招募伙伴
📮 简历投递邮箱hr@ifanr.com
✉️ 邮件标题「姓名+岗位名称」(请随简历附上项目/作品或相关链接)
刚刚,AI 击穿了「视频图灵测试」,1700 万网友在线围观图12

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
AI 测试
more
狐讯 | 中美 AI 区别对待男女;Open AI 融资 200 亿
从电网到核心,英飞凌完善AI数据中心供电全链路布局
AI宗师和OA两家集体疾呼:RSI带来智能爆炸,导致AI彻底失控!
狐讯 | 华为 AI 智驾里程破 160 亿;特朗普改名带火 si 域名
当AI成为“心理杀手”:Circuit Breaker Labs如何用“数字替身”填补安全真空
GTM工程师崛起:AI如何重塑科技公司的增长引擎
黑石N1掌门人贾斯·凯拉将亮相TechCrunch Disrupt 2026,拆解AI巨头“长寿”基因
Karpathy的新玩法!40年前的航空规范,救了爱说废话的AI
教皇利奥十四世发声:算法缺乏“人性火花”,AI艺术面临本体论拷问
硅片市场迎爆发期,AI与消费电子双轮驱动2030年规模破217亿美元
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号