Tavus发布Griffin模型:AI数字人从“像”到“懂”的跨越与隐忧

科技区角 2026-10-06 19:01

【区角快讯】镜头前,一名男子正专注地拧动魔方,屏幕另一端的女孩静静注视,适时点头示意下一步操作。当男子陷入沉思暂停动作时,女孩并未机械插话,而是保持沉默等待。若非事先知晓,这极易被误认为是一场寻常的视频通话。然而,屏幕中的女孩并不存在——她的面容、声线乃至每一次细微的停顿,均由人工智能实时生成。

10月1日,美国AI视频初创公司Tavus正式推出名为Griffin的新模型,并将其定义为全球首个“人类交互模型”(Human Interaction Model,简称HIM)。据Tavus披露的数据,在一项为期一分钟的视频通话测试中,54名参与者里有26人事后坚信自己是在与真人交流,比例高达48%。作为对比,Tavus上一代系统在同等测试条件下,41人中仅有1人被“骗过”,通过率仅为2.4%。从2.4%跃升至48%,这绝非一次常规的版本迭代所能解释。

Tavus自身便是该领域的头部玩家。其上一代方案由三个独立模型拼接而成:Phoenix-4.5负责渲染人脸,Sparrow-2判断发言时机,Raven-1感知用户情绪。这套组合虽已被15万开发者和企业采用,但在真人盲测中表现平平。而Griffin的发布视频本身即是一次AI视频通话演示。画面中,Tavus联合创始人兼CEO Hassaan Raza深夜在办公室与一位名叫Vanessa的年轻女孩对话。两人如老同事般打趣,Hassaan让Vanessa比大拇指,她即刻照做;他夸赞她是最佳同事,她笑着回应“脸红了”;他甚至炫耀二手衣物,Vanessa则调侃他“活在边缘”,并开玩笑说会控制呼吸以免耗尽电脑CPU。当另一位同事入镜,Vanessa也能自然融入三人对话。整段视频最引人注目的特质,恰恰在于其毫无“出戏”感——笑点衔接流畅,停顿自然,彻底摒弃了传统数字人那种“等你说完、愣一秒、再开口”的机械迟滞。

当然,宣传片经过精心剪辑。更具说服力的是Tavus技术博客中展示的几段开放式对话测试片段。在第一段魔方教学中,模型持续观察用户手中的魔方并给予确认,当用户思考时它选择静默等待。第二段测试中,工程师Sagar焊接主板,Griffin在一旁指导,它能记录任务进度并在适当时机主动提示,而非一见沉默便强行插话。这对AI而言极具挑战,因为它需理解“沉默”本身也是一种信息。第三段则是经典的“西蒙说”游戏,只有听到特定指令时模型才模仿动作,否则当场拆穿。值得注意的是,画面中的所有动作、身体姿态及背景均为现场实时生成。此外,还有片段展示了模型的“抢话”能力:当用户提及升职喜讯时,Griffin在对方话音未落时便做出反应,双方短暂重叠说话却未乱线索;另一段故事中,用户与模型互相打断编故事,模型完美接住每一个转折。这些案例共同指向一个事实:过去的数字人是“会动的播音员”,而Griffin开始像一个“会接话的人”。

要理解Griffin的突破,需先审视传统数字人的工作逻辑。市面上绝大多数实时AI数字人采用“级联”架构,如同接力赛:语音识别转文字,大语言模型生成回复,语音合成朗读,最后形象驱动让脸动起来。这种流程每多一次交棒就增加延迟并丢失信息,语气、表情等非文本细节在转写阶段即被丢弃,且必须等用户说完才能处理,导致标志性的尴尬停顿。Tavus旧版系统正是如此。

Griffin的思路是将接力赛变为单一大脑同步处理所有事务。Tavus将其描述为“全双工、视频到视频”模型。所谓全双工,即能同时听和说,而非对讲机式的轮流发言。该模型由两大部分构成。第一部分是“连续对话建模”,它不再按轮次等待,而是每隔不到一秒重新评估对话状态,综合语义、语调、表情及环境因素,决定此刻是该说话、点头、发出“嗯”声还是继续倾听。其输出不仅包含文本,还涵盖情绪、姿态、表情和手势的控制信号。正因基于语义而非声音停止来判断,它能区分用户是说完还是在思考。第二部分是音视频生成引擎,负责将控制信号转化为视听内容。语音侧,Tavus自研Tavec音频编解码器,将48kHz音频压缩为每秒100帧、每帧仅40个数值的连续表示,通过自回归扩散模型以10毫秒为单位实时生成语音,甚至可用约10秒录音克隆声音。视频侧最为艰难,高质量视频扩散模型通常需数十步迭代且无法实时。Tavus通过“蒸馏”技术,分三步将庞大模型压缩:先用分布匹配蒸馏减少步骤,再改造为逐帧生成的自回归结构,最后用Self-Forcing方法训练以避免画面漂移。加上视频编码器在时间维度上的8倍压缩,Griffin能以320毫秒为块实时生成720p视频,从听到声音到面部反应的平均延迟仅0.43秒,Tavus称此为次快方案的一半。此外,Griffin抛弃了依赖大量3D人脸先验的做法,仅需一张参考照片即可实时生成包括椅子晃动、墙上影子、手指动作及背景在内的所有像素。

第三方评测亦提供佐证。在NVIDIA推出的全双工音视频对话基准VideoFDB上,Griffin-Lite在“生成”赛道获3.83分(满分5分),比排名第二的Gemini 2.5加Anam组合高出1分多,距人类参考值3.92仅差0.09。在考察“看懂对方”的感知赛道,它以3.73分排名第一,领先MiniCPM-o 4.5、Gemini 2.5 Flash及OpenAI的gpt-realtime。若拉长视野,此路并不陌生。2024年GPT-4o发布时,OpenAI便以端到端语音模型取代三段式流程,赋予AI语音插话、语气和停顿的能力。Griffin则将这场端到端革命从声音推进至画面。

Griffin的真正冲击或许不在于逼真度,而在于重新定义数字人行业的竞争核心。过去几年,HeyGen、Synthesia等公司主打预先生成的口播视频,解决的是“播”的问题,国内直播带货、政务客服数字人也遵循此逻辑,只要形象逼真、口型对齐即算及格。一旦进入实时对话,级联架构的天花板便暴露无遗,精细的脸庞也无法掩盖那一两秒的迟滞和不合时宜的微笑。Griffin将核心指标从“像不像”转向“懂不懂”,卖点不再是单帧画质,而是何时点头、插话或闭嘴。这是一个“对话建模”问题,而非单纯的“图形渲染”问题。若端到端全双工模型被证实可行,那些依靠堆砌“语音识别、大模型、语音合成、形象驱动”四件套的产品护城河将迅速变浅,正如GPT-4o之后纯语音合成公司面临的困境。

然而,在为“图灵测试被攻破”欢呼前,需对48%的通过率泼些冷水。Griffin通过的并非严格意义上的图灵测试。经典测试中裁判明知对面可能是机器,需在人与机器间抉择;而Tavus实验中,参与者被告知将与另一参与者视频通话,直至问卷末尾才被问及是否怀疑对方非真人。在这种心理暗示下,仍有52%的人判断出对面是AI,这一数字耐人寻味。此外,样本量极小,54人的数据统计误差范围约为正负13个百分点,真实比例可能低至三成多。测试仅一分钟,话题限于轻松寒暄,未涉及深度理解场景。以此得出“首个通过视频图灵测试”结论难免以偏概全,X平台社区笔记也标注该结果未经独立验证且未遵循标准协议。数据显示,超半数参与者压根没想过对方是AI,而起疑心者大多在前20秒内察觉。Griffin能骗过无防备者,但在警觉者面前露馅很快。即便在NVIDIA基准上,Griffin-Lite在“感知”上与人类参考值仍差0.47分,“看懂对方”远比“演得像”难。目前普通用户尚无法体验,Decrypt记者尝试后发现Griffin-Lite仅向少数受信任测试者开放。

尽管存在疑虑,但从2.4%到48%,同一家公司在同一测试方法下实现20倍提升,证明端到端架构带来质变。数字人或AI真人交互模型确实迈过了此前无人逾越的门槛。至于安全,Tavus承认Griffin的强大特性可能被用于误导他人以为对面非AI,这也是其迟迟不公开发布的原因。公司正开发“主动披露身份”功能并与AI安全组织合作。考虑到年初朝鲜黑客利用深度伪造视频在Zoom冒充熟人实施攻击,这份谨慎并非多余。回到发布视频结尾,Hassaan感慨人机对话界限日益模糊。当那条线薄至肉眼不可见时,我们需重新学习的或许不是如何分辨AI,而是在一个难以分辨的世界里,决定该信任谁。

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
AI
more
Pinterest推出“美容指南”:AI将灵感图片转化为沙龙实操方案
AI几年内或超越所有人类!Claude核心研究员预测
告别“通用计算”?Ghost推出专为AI代理打造的无屏主机Core,获a16z领投1100万美元
知名大厂后训练负责人被边缘化,或将离职;北京电商大厂千万年薪招AI Infra一号位;传某AI视频模型利用代理商「曲线」入北美丨AI情报局
AI原生影视破局:Utopai Studios如何重构好莱坞生产逻辑?
英伟达RTX Spark平台AI笔记本面板供应链揭秘:三星LG双寡头垄断,OLED成标配
数学要「毕业」了!xAI联创宣判:两千年英雄史彻底落幕
OpenAI在欧盟启用“隐形水印”应对AI法案,技术局限与合规博弈并存
TechCrunch Disrupt 2026前瞻:当AI从“云端”落地“实体”,创业者的下一场硬仗在哪里?
长江存储预判NAND紧缺或持续至2029年,AI浪潮重塑供需格局
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号