蚂蚁×浙大新研究:让AI在流式对话中“读懂”情绪 | EMNLP'26

量子位 2026-10-08 21:02
蚂蚁集团安全实验室 投稿
量子位 | 公众号QbitAI

在与用户的实时对话中,AI能否及时感知情绪?模型给出的“高置信度”结论,又是否经得起推敲?

围绕这些问题,来自蚂蚁集团与浙江大学的研究团队提出了面向流式视频情绪理解的框架TRACE。该框架通过持续跟踪模型情绪判断的变化过程,让情绪理解兼顾识别效果与响应效率。

团队同时构建了面向流式评测的数据集StreamMER,并在StreamMER、MELD和MER2024上验证了方法的有效性。

在StreamMER上,TRACE将仅使用在线音频判断的准确率从59.87%提升至69.47%,显著减少了多模态推理调用。

论文已被EMNLP 2026 Main Conference接收。

研究背景

随着多模态大模型的发展,AI已经能够结合表情、声音和语言内容识别情绪。然而,现有研究大多采用离线设置:模型先获得完整视频、音频或对话文本,再输出情绪标签。

真实的人机交互提出了不同要求。在实时视频对话、具身交互和远程会议等场景中,信息不断到来,系统需要在观察尚不完整时形成判断,并随着新证据及时调整。

这带来了三个关键挑战:

因此,流式情绪理解需要回答的不只是“这是什么情绪”,还包括:现在的判断是否可靠,是否值得继续等待,以及是否需要更多证据?

StreamMER数据集支持连续对话中的情绪评测

为研究不完整观察下的情绪理解,团队基于《老友记》前两季构建了StreamMER数据集。

StreamMER保留了局部对话背景、说话人互动和场景信息,支持研究模型如何随着输入逐步到来形成情绪判断。

数据集具有以下特点:

StreamMER使研究者能够同时考察模型“识别得准不准”“何时作出判断”以及“为判断付出了多少计算成本”。

通过预测轨迹评估判断的可靠性

TRACE的核心洞察是:判断是否可靠,不仅取决于模型此刻有多自信,也取决于这个判断是如何形成的。

例如,模型连续多次判断为“悲伤”,与模型先后在“喜悦”“惊讶”“悲伤”之间切换,即使最终置信度相同,其可靠性也可能不同。

论文中的验证子集分析显示:

这些结果说明,预测轨迹中的波动能够提供单次置信度之外的信息。同时,轨迹不稳定的样本往往更能从上下文重判中获益:在发生一次类别切换的样本中,上下文重判带来74次有效纠正,而将原本正确的判断改错的情况为19次。

基于这一发现,TRACE综合分析置信度、预测分布的不确定性、类别切换和分布稳定性等信息,同时估计两个问题:

这使系统能够更有针对性地分配推理资源,将复杂的多模态分析用于更需要补充证据的样本。

TRACE框架实现按需多模态推理

TRACE由三个相互衔接的模块构成。

在线情绪判断

在线模块以Qwen2.5-Omni-3B为基础,持续处理音频前缀,利用语调、停顿、节奏和能量变化等线索,形成随时间更新的情绪概率分布。

训练时,团队对不同长度的音频前缀进行监督,并根据观察进度分配权重,让模型学习在证据尚不完整时形成初步判断。

轨迹可靠性评估

系统根据情绪判断轨迹、错误风险和预期纠正收益,在三种动作中动态选择:

上下文重判

当系统请求重判时,基于Qwen2.5-Omni-7B的模块结合当前话语的多模态信息、前文背景、历史摘要和已有预测轨迹重新分析。

该模块不仅输出情绪标签,还生成判断依据,并更新对话摘要,为后续话语提供背景信息。在线设置仅使用已到达的信息,后续话语只用于离线对比分析。

通过上述设计,TRACE让稳定样本沿低延迟路径完成判断,让存在歧义的样本获得更充分的分析。

蚂蚁×浙大新研究:让AI在流式对话中“读懂”情绪 | EMNLP'26图1
△TRACE整体框架。系统持续跟踪音频前缀的情绪预测轨迹,评估错误风险与重判收益,并按需引入多模态上下文。

实验结果与推理效率

团队在StreamMER上开展流式评测,并在MELD和MER2024的离线多模态情绪理解设置下进行补充验证。

蚂蚁×浙大新研究:让AI在流式对话中“读懂”情绪 | EMNLP'26图2
△不同方法在三个数据集上的情绪识别结果(单位:%)。Acc.为准确率,F1为加权F1,UAR为各类别召回率的平均值。

在StreamMER上,TRACE相较仅在线判断提升了9.60个百分点,同时避免了44.42%的上下文重判调用。在MELD和MER2024上,TRACE也分别减少了45.37%和41.79%的重判调用,体现了按需推理的价值。

效率方面,论文报告TRACE的实时因子(推理耗时与输入时长之比)为0.091,低于全量上下文重判的0.127,降幅约为28.3%。在流式决策策略实验中,TRACE的平均决策时间为3.10秒,全量重判策略为4.05秒。

这些结果表明,系统可以通过判断“哪些样本需要进一步分析”,在识别效果与计算成本之间取得更好的平衡。

蚂蚁×浙大新研究:让AI在流式对话中“读懂”情绪 | EMNLP'26图3
△不同方法的单样本推理延迟与实时因子(RTF)。横轴采用对数刻度;RTF越低,表示处理相同时长输入所需的推理时间越短。
蚂蚁×浙大新研究:让AI在流式对话中“读懂”情绪 | EMNLP'26图4
△不同重判调用比例下的识别准确率。横轴RR为上下文重判比例,纵轴ACC为准确率;基于预测轨迹的策略在多数调用比例下表现更优。

典型案例

论文展示了一个具有代表性的案例:随着音频逐步输入,模型的预测从“喜悦”转向“惊讶”,判断轨迹并不稳定。

当TRACE触发上下文重判后,模型结合带有指责意味的语气、直视的目光以及对质式对话内容,将情绪修正为“愤怒”。

另一个案例中,在线预测在“惊讶”“焦虑”和“愤怒”之间波动。引入语言内容与对话背景后,模型最终将情绪判断为“惊讶”。

这些案例体现了TRACE的作用:通过预测变化发现歧义,再用相关证据帮助模型修正判断。

蚂蚁×浙大新研究:让AI在流式对话中“读懂”情绪 | EMNLP'26图5
△上下文重判案例。两个样本的在线预测均出现类别切换,系统结合语气、表情和对话内容,分别将结果修正为“愤怒”和“惊讶”。

研究启示

这项研究为流式多模态系统设计提供了以下启示。

第一,单次高置信度不足以证明判断可靠。跟踪预测是否稳定、是否反复切换,能够为系统提供更丰富的可靠性信号。

第二,根据预期收益按需调用复杂推理。通过同时估计出错风险与纠正收益,系统能够将更多计算资源用于难以判断的样本。

第三,上下文的相关性比数量更重要。论文的上下文范围实验显示,加入前文能够改善情绪识别;继续加入后文并未带来进一步提升。这提示系统应选择与当前情绪相关的证据,并遵守在线场景的信息可用范围。

总结与展望

TRACE将流式视频情绪理解建模为一个持续形成、评估和修正判断的过程。通过StreamMER数据集、预测轨迹可靠性建模和选择性上下文重判,团队验证了在不完整观察下兼顾识别效果与推理效率的可行路径。

未来,这一方向仍可进一步探索更精准的调用策略、更丰富的真实交互数据,以及对复杂、细微情绪表达的理解能力,为实时多模态交互提供更及时、更可靠的情绪感知支持。

论文名称:Emotion Understanding in Streaming Video with Trajectory-Aware Reliability
论文链接:https://arxiv.org/abs/2608.26786

一键三连「点赞」「转发」「小心心」

欢迎在评论区留下你的想法!

— 完 —


【学术投稿】请在工作日发送邮件至:ai@qbitai.com,标题注明【投稿】,并告诉我们:你是谁,从哪来,投稿内容附上项目/主页链接,以及联系方式。

🎓 我们会 (尽量) 及时回复你 :)


🌟 点亮星标 🌟

科技前沿进展每日见

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
AI NLP
more
R-HORIZON:长程推理时代来临,复旦NLP&美团LongCat重磅发布LRMs能力边界探测新范式
EMNLP 2026 Main|预测越像真实环境,Agent反而做得更差?我们把世界模型的训练目标从"状态一致"换成了"行为一致"
可攻可防,越狱成功率近90%!六大主流模型全中招 | EMNLP'25
大模型时代下,nlp初学者需要怎么入门?
EMNLP 2026|「AI把数字说歪」,官方AI审稿现场演示了一遍
EMNLP 2025 | 动态压缩CoT推理新方法LightThinker来了
0.25秒识破未见攻击,这套检测方法没看过任何越狱样本 | EMNLP'26
2025年中国自然语言处理(NLP)行业现状及发展趋势分析,技术创新是推动其持续发展的关键动力「图」
LLM真能读懂报表吗?EMNLP'25首个工业级表格生成报告基准T2R-bench:最强大模型仅得62分
从57场面试到OpenAI offer:一位NLP博士的顶级AI公司求职复盘火了
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号