
点击蓝字 关注我们

欢迎各位专家学者在公众号平台报道最新研究工作,荐稿请联系小编Robert(微信ID:BrainX007); 或将稿件发送至lgl010@vip.163.com。
英文标题:AffectGPT : A New Dateset, Model, and Benchmark for Emotion Understanding with Multimodal Large Language Models.
成果简介
当AI试图理解人类情感时,传统的“喜、怒、哀、乐”分类已远不足以刻画现实中的复杂情绪。为此,研究人员构建了目前最大规模的情感描述数据集MER-Caption,涵盖超11万样本和近3000种细粒度情感类别,并提出了强化多模态融合的AffectGPT模型。在统一评测基准上,该模型相比现有方案取得超9%的性能提升,为多模态大语言模型迈向真正的“情感智能”奠定了数据、模型与评测的完整基础。
主要贡献
数据集:MER-Caption
采用“模型主导、人工辅助”的标注策略,在保证标注质量的同时大幅降低了人力成本,构建了目前规模最大的多模态情感描述数据集。该数据集包含11.5万个粗标注样本和3.1万个精标注样本,覆盖近3000种细粒度情感类别,是首个将情感描述从“贴标签”升级为“写描述”的大规模语料库。
模型:AffectGPT
针对现有MLLMs将多模态融合完全交由LLM处理、难以充分挖掘跨模态交互信息的局限,提出了预融合操作。通过在特征层面引入Q-Former或注意力机制,在音视频特征进入大语言模型之前先进行深度融合,显著提升了模型对多模态情感线索的感知与整合能力。
评测基准:MER-UniBench
针对MLLMs自由文本输出的特点,设计了面向集合的评测指标(如F_S值和命中率),而非传统分类任务中的准确率。该基准涵盖细粒度情感识别、基本情感识别和情感极性分析三类任务,为MLLM-based情感理解提供了公平、全面的评估平台。
方法
本文的方法可以概括为以下三个核心环节:
1)数据构建策略—模型主导、人工辅助:如图1所示,数据构建分为三个环节。第一步,描述生成:基于初步实验筛选,选用SALMONN作为音频大模型提取语音线索、Chat-UniVi作为视频大模型提取视觉线索,再由GPT-3.5将二者与文本内容融合,生成初步的情感描述。第二步,低层级过滤:利用TalkNet剔除音画不同步的样本,同时删除描述过短或过长的异常数据。第三步,高层级过滤:基于多个预训练的情感分类器进行模型集成,通过多数投票对描述进行一致性校验,与模型预测不一致的样本予以剔除,最终得到高质量的子集MER-Caption+。

图1.数据集构建流程
2)模型架构—预融合操作强化多模态交互:如图2所示,主流AV-LLM将音频、视频特征分别通过各自的编码器和投影层转换为token,再一并送入LLM进行跨模态交互——这种设计将融合重任完全交给语言模型,对于需要精细整合多模态情感线索的MER任务而言并不充分。AffectGPT的核心改进在于:在特征进入LLM之前,增加预融合模块,将音视频特征的跨模态交互前置。文中探索了两种方案:Q-Former方案:创建K个可学习的查询令牌,通过交叉注意力机制与音视频特征交互,将多模态信息蒸馏到查询令牌中,保留时序信息。注意力方案:对音视频特征进行时序压缩(平均池化),再通过注意力机制动态计算模态权重,强调重要模态的信息。经预融合处理后的特征再与文本token拼接,送入LLM进行自回归生成。这一设计将多模态交互从LLM内部剥离为独立模块,更充分地捕捉了MER任务中的跨模态特性。

图2.模型架构对比
3)评测方法—面向自由文本的定制指标: 针对MLLMs输出自由文本的特点,本文设计了专门的评测体系。对于细粒度情感识别,采用层级映射策略消除同义词和词形变体的影响(词形还原→同义词合并→情感轮映射),然后计算集合级别的精确率、召回率和F值,兼顾预测的准确性与完整性。对于基本情感识别,提出命中率指标,只检验真实标签是否出现在模型输出的情感集合中;对于情感极性分析,则采用加权F1分数作为主指标。通过这套定制化评价体系,实现了对MLLMs自由文本输出的量化评估。
研究结果
表1.主要实验结果

注:本表展示了各数据集主指标的评测结果,表中“MOSI”、“MOSEI”、“SIMS”和“SIMS v2”分别指代CMU-MOSI、CMU-MOSEI、CH-SIMS和CH-SIMS v2数据集。最后一列为数据集维度的平均分,即所有数据集的平均成绩。
表2.数据集对比实验

注:仅变更训练数据集,其余设置均保持一致,报告的是MER-UniBench上所有数据集的平均得分。
表3.过滤策略的必要性验证

注:除MER-UniBench整体结果外,本表还提供了各任务层面的结果。“E”和“S”分别为情感(Emotion)和情感极性(Sentiment)的缩写。
表4.预融合操作的作用分析

表5.输入模态的影响分析

注:“Face”与“Frame”的区别在于是否额外使用人脸提取器从视频帧中截取面部区域。

图3. 大语言模型、音频编码器与视频编码器的消融实验。
表3.LoRA秩值的影响分析。

注:本表统计了在LLM分支中使用LoRA时所带来的可训练参数量增量。第一行为未使用LoRA模块的基线模型。
研究结论
总的来说,该研究从数据、模型和评测三个维度系统推进了多模态大语言模型的情感理解能力。构建的大规模情感描述数据集MER-Caption,首次让机器以“写描述”而非“贴标签”的方式理解人类情感;提出的AffectGPT模型通过创新的预融合机制,让多模态信息在进入大语言模型之前实现充分交互;而统一评测基准MER-UniBench则为这一方向提供了公平、全面的评估工具。实验证明,这套方案显著超越了现有方法。我们期待这项研究能为情感AI从“识别情绪”走向“理解人心”贡献一份力量。
免责声明:原创仅代表原创编译,水平有限,仅供学术交流,如有侵权,请联系删除,文献解读如有疏漏之处,我们深表歉意。


公众号丨智能传感与脑机接口
