【科技纵览】当AI不再只是被动等待指令的问答机器,而是能像人类一样“边看、边听、边说”时,交互体验的边界便被彻底重构。8月5日,字节跳动正式对外披露了原生音视频全双工大模型SeedRealtime,并宣布该模型已在豆包App实现全量上线。用户只需将应用更新至最新版本,通过“打电话”功能进入视频通话界面,即可亲身体验这种实时音视频AI交互的新形态。
SeedRealtime的核心突破在于其统一端到端架构。它原生融合了音频、视频与文本数据,支持模型在连续的多模态信息流中,同步完成感知、理解、决策及表达全过程。这与传统依赖ASR、视觉模型、TTS等多个模块串联的级联系统截然不同。新架构不仅削减了多模块堆叠带来的延迟与信息损耗,更摆脱了对外部VAD进行轮次判断的依赖。
据字节方面介绍,该模型具备三项关键能力:音视频联合理解、主动交互以及更自然的对话节奏。它能结合画面、声音及时序信息精准捕捉用户意图,例如利用视觉线索消除同音词歧义,识别手势或指代对象,并持续追踪画面变化以提供主动提醒。在官方演示案例中,无论是多人聚会中区分不同发言者身份,还是协助外国游客实时解读中文菜单,亦或是博物馆内识别特定文物后主动提示,模型均表现优异。甚至在辅助操作咖啡机或阅读论文翻页时,它也能根据画面细微变化实时纠错或自动提示章节出现。
面对复杂环境,SeedRealtime展现出极强的抗干扰能力。在机场等嘈杂场景下,它能有效区分用户对话与旁人闲聊,避免背景噪声误触发;在儿童学习场景中,亦能持续跟随互动,不受背景电话声干扰。端到端人工评测数据显示,相比传统级联系统,SeedRealtime将抢话、回应延迟及噪声误触发等节奏问题减少了约50%,单次对话流畅完成的概率显著提升。未来,字节计划进一步优化端到端时延、主动感知决策及多人复杂场景理解能力,推动AI从单纯问答向真实场景下的持续环境理解与任务协助演进。这一技术路径的转变,或许标志着具身智能与人机交互正迈向更深层次的融合阶段。
字节发布SeedRealtime大模型,原生音视频全双工交互上线豆包
科技区角
2026-08-05 13:31
关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。