蚂蚁集团安全实验室 投稿
量子位 | 公众号QbitAI
在与用户的实时对话中,AI能否及时感知情绪?模型给出的“高置信度”结论,又是否经得起推敲?
围绕这些问题,来自蚂蚁集团与浙江大学的研究团队提出了面向流式视频情绪理解的框架TRACE。该框架通过持续跟踪模型情绪判断的变化过程,让情绪理解兼顾识别效果与响应效率。
团队同时构建了面向流式评测的数据集StreamMER,并在StreamMER、MELD和MER2024上验证了方法的有效性。
在StreamMER上,TRACE将仅使用在线音频判断的准确率从59.87%提升至69.47%,显著减少了多模态推理调用。
论文已被EMNLP 2026 Main Conference接收。
研究背景
随着多模态大模型的发展,AI已经能够结合表情、声音和语言内容识别情绪。然而,现有研究大多采用离线设置:模型先获得完整视频、音频或对话文本,再输出情绪标签。
真实的人机交互提出了不同要求。在实时视频对话、具身交互和远程会议等场景中,信息不断到来,系统需要在观察尚不完整时形成判断,并随着新证据及时调整。
这带来了三个关键挑战:
信息尚未完整,判断却需要及时。语调、停顿和语速可能在一句话结束前就传递情绪线索,等待全部内容会增加交互延迟。 模型有信心,不代表判断可靠。随着音频逐步到来,模型可能反复改变预测类别,某一时刻的高置信度未必意味着证据已经充分。 多模态推理有效,但调用存在成本。表情、文本和对话背景能够帮助消除歧义,但对所有样本都进行完整推理,会带来额外计算和等待。
因此,流式情绪理解需要回答的不只是“这是什么情绪”,还包括:现在的判断是否可靠,是否值得继续等待,以及是否需要更多证据?
StreamMER数据集支持连续对话中的情绪评测
为研究不完整观察下的情绪理解,团队基于《老友记》前两季构建了StreamMER数据集。
StreamMER保留了局部对话背景、说话人互动和场景信息,支持研究模型如何随着输入逐步到来形成情绪判断。
数据集具有以下特点:
8926条话语样本。包含8111条训练样本和815条测试样本,标注话语的视频总时长约10.33小时。 保留连续交互背景。以约1.5分钟的连贯场景组织数据,保留理解当前情绪所需的前文线索。 覆盖多种情绪表达。包括喜悦、愤怒、中性、焦虑、惊讶、悲伤和尴尬等主要类别。 模型辅助标注与人工核验结合。使用Gemini-3.1-Pro生成初始标注,再由三名标注人员独立检查与投票,并对分歧样本进行讨论。约30%的初始情绪标签在人工核验中得到修改。 支持流式评测。在线模块仅观察已经到来的音频前缀,按需调用上下文重判,并将额外延迟和推理成本纳入评估。
StreamMER使研究者能够同时考察模型“识别得准不准”“何时作出判断”以及“为判断付出了多少计算成本”。
通过预测轨迹评估判断的可靠性
TRACE的核心洞察是:判断是否可靠,不仅取决于模型此刻有多自信,也取决于这个判断是如何形成的。
例如,模型连续多次判断为“悲伤”,与模型先后在“喜悦”“惊讶”“悲伤”之间切换,即使最终置信度相同,其可靠性也可能不同。
论文中的验证子集分析显示:
当预测类别没有发生切换时,在线判断准确率为72.6%。 当预测类别发生一次切换时,准确率降至38.3%。 当预测类别发生三次切换时,准确率为24.1%。
这些结果说明,预测轨迹中的波动能够提供单次置信度之外的信息。同时,轨迹不稳定的样本往往更能从上下文重判中获益:在发生一次类别切换的样本中,上下文重判带来74次有效纠正,而将原本正确的判断改错的情况为19次。
基于这一发现,TRACE综合分析置信度、预测分布的不确定性、类别切换和分布稳定性等信息,同时估计两个问题:
当前判断出错的风险有多大? 引入上下文后,有多大可能纠正当前错误?
这使系统能够更有针对性地分配推理资源,将复杂的多模态分析用于更需要补充证据的样本。
TRACE框架实现按需多模态推理
TRACE由三个相互衔接的模块构成。
在线情绪判断
在线模块以Qwen2.5-Omni-3B为基础,持续处理音频前缀,利用语调、停顿、节奏和能量变化等线索,形成随时间更新的情绪概率分布。
训练时,团队对不同长度的音频前缀进行监督,并根据观察进度分配权重,让模型学习在证据尚不完整时形成初步判断。
轨迹可靠性评估
系统根据情绪判断轨迹、错误风险和预期纠正收益,在三种动作中动态选择:
直接输出:当前证据已经足够可靠。 继续等待:需要更多音频信息帮助判断。 请求重判:当前判断存在歧义,需要引入多模态上下文。
上下文重判
当系统请求重判时,基于Qwen2.5-Omni-7B的模块结合当前话语的多模态信息、前文背景、历史摘要和已有预测轨迹重新分析。
该模块不仅输出情绪标签,还生成判断依据,并更新对话摘要,为后续话语提供背景信息。在线设置仅使用已到达的信息,后续话语只用于离线对比分析。
通过上述设计,TRACE让稳定样本沿低延迟路径完成判断,让存在歧义的样本获得更充分的分析。

△TRACE整体框架。系统持续跟踪音频前缀的情绪预测轨迹,评估错误风险与重判收益,并按需引入多模态上下文。
实验结果与推理效率
团队在StreamMER上开展流式评测,并在MELD和MER2024的离线多模态情绪理解设置下进行补充验证。

△不同方法在三个数据集上的情绪识别结果(单位:%)。Acc.为准确率,F1为加权F1,UAR为各类别召回率的平均值。
在StreamMER上,TRACE相较仅在线判断提升了9.60个百分点,同时避免了44.42%的上下文重判调用。在MELD和MER2024上,TRACE也分别减少了45.37%和41.79%的重判调用,体现了按需推理的价值。
效率方面,论文报告TRACE的实时因子(推理耗时与输入时长之比)为0.091,低于全量上下文重判的0.127,降幅约为28.3%。在流式决策策略实验中,TRACE的平均决策时间为3.10秒,全量重判策略为4.05秒。
这些结果表明,系统可以通过判断“哪些样本需要进一步分析”,在识别效果与计算成本之间取得更好的平衡。

△不同方法的单样本推理延迟与实时因子(RTF)。横轴采用对数刻度;RTF越低,表示处理相同时长输入所需的推理时间越短。

△不同重判调用比例下的识别准确率。横轴RR为上下文重判比例,纵轴ACC为准确率;基于预测轨迹的策略在多数调用比例下表现更优。
典型案例
论文展示了一个具有代表性的案例:随着音频逐步输入,模型的预测从“喜悦”转向“惊讶”,判断轨迹并不稳定。
当TRACE触发上下文重判后,模型结合带有指责意味的语气、直视的目光以及对质式对话内容,将情绪修正为“愤怒”。
另一个案例中,在线预测在“惊讶”“焦虑”和“愤怒”之间波动。引入语言内容与对话背景后,模型最终将情绪判断为“惊讶”。
这些案例体现了TRACE的作用:通过预测变化发现歧义,再用相关证据帮助模型修正判断。

△上下文重判案例。两个样本的在线预测均出现类别切换,系统结合语气、表情和对话内容,分别将结果修正为“愤怒”和“惊讶”。
研究启示
这项研究为流式多模态系统设计提供了以下启示。
第一,单次高置信度不足以证明判断可靠。跟踪预测是否稳定、是否反复切换,能够为系统提供更丰富的可靠性信号。
第二,根据预期收益按需调用复杂推理。通过同时估计出错风险与纠正收益,系统能够将更多计算资源用于难以判断的样本。
第三,上下文的相关性比数量更重要。论文的上下文范围实验显示,加入前文能够改善情绪识别;继续加入后文并未带来进一步提升。这提示系统应选择与当前情绪相关的证据,并遵守在线场景的信息可用范围。
总结与展望
TRACE将流式视频情绪理解建模为一个持续形成、评估和修正判断的过程。通过StreamMER数据集、预测轨迹可靠性建模和选择性上下文重判,团队验证了在不完整观察下兼顾识别效果与推理效率的可行路径。
未来,这一方向仍可进一步探索更精准的调用策略、更丰富的真实交互数据,以及对复杂、细微情绪表达的理解能力,为实时多模态交互提供更及时、更可靠的情绪感知支持。
论文名称:Emotion Understanding in Streaming Video with Trajectory-Aware Reliability
论文链接:https://arxiv.org/abs/2608.26786
一键三连「点赞」「转发」「小心心」
欢迎在评论区留下你的想法!
— 完 —
【学术投稿】请在工作日发送邮件至:ai@qbitai.com,标题注明【投稿】,并告诉我们:你是谁,从哪来,投稿内容附上项目/主页链接,以及联系方式。
🌟 点亮星标 🌟