AffectGPT: 面向多模态大语言模型情感理解的新数据集、模型与评测基准

智能传感与脑机接口 2026-08-29 11:29
AffectGPT: 面向多模态大语言模型情感理解的新数据集、模型与评测基准图1

点击蓝字 关注我们

AffectGPT: 面向多模态大语言模型情感理解的新数据集、模型与评测基准图2




欢迎各位专家学者在公众号平台报道最新研究工作,荐稿请联系小编Robert(微信ID:BrainX007); 或将稿件发送至lgl010@vip.163.com。


英文标题:AffectGPT : A New Dateset, Model, and Benchmark for Emotion Understanding with Multimodal Large Language Models.

原文链接:https://doi.org/10.48550/arXiv.2501.16566

1

成果简介

      当AI试图理解人类情感时,传统的“喜、怒、哀、乐”分类已远不足以刻画现实中的复杂情绪。为此,研究人员构建了目前最大规模的情感描述数据集MER-Caption,涵盖超11万样本和近3000种细粒度情感类别,并提出了强化多模态融合的AffectGPT模型。在统一评测基准上,该模型相比现有方案取得超9%的性能提升,为多模态大语言模型迈向真正的“情感智能”奠定了数据、模型与评测的完整基础。


2

主要贡献

  • 数据集:MER-Caption

    采用“模型主导、人工辅助”的标注策略,在保证标注质量的同时大幅降低了人力成本,构建了目前规模最大的多模态情感描述数据集。该数据集包含11.5万个粗标注样本和3.1万个精标注样本,覆盖近3000种细粒度情感类别,是首个将情感描述从“贴标签”升级为“写描述”的大规模语料库。

  • 模型:AffectGPT

    针对现有MLLMs将多模态融合完全交由LLM处理、难以充分挖掘跨模态交互信息的局限,提出了预融合操作。通过在特征层面引入Q-Former或注意力机制,在音视频特征进入大语言模型之前先进行深度融合,显著提升了模型对多模态情感线索的感知与整合能力。

  • 评测基准:MER-UniBench

    针对MLLMs自由文本输出的特点,设计了面向集合的评测指标(如F_S值和命中率),而非传统分类任务中的准确率。该基准涵盖细粒度情感识别基本情感识别情感极性分析三类任务,为MLLM-based情感理解提供了公平、全面的评估平台。

3

方法

      本文的方法可以概括为以下三个核心环节:

1)数据构建策略—模型主导、人工辅助:如图1所示,数据构建分为三个环节。第一步,描述生成:基于初步实验筛选,选用SALMONN作为音频大模型提取语音线索、Chat-UniVi作为视频大模型提取视觉线索,再由GPT-3.5将二者与文本内容融合,生成初步的情感描述。第二步,低层级过滤:利用TalkNet剔除音画不同步的样本,同时删除描述过短或过长的异常数据。第三步,高层级过滤:基于多个预训练的情感分类器进行模型集成,通过多数投票对描述进行一致性校验,与模型预测不一致的样本予以剔除,最终得到高质量的子集MER-Caption+。

AffectGPT: 面向多模态大语言模型情感理解的新数据集、模型与评测基准图3

图1.数据集构建流程


2)模型架构—预融合操作强化多模态交互:如图2所示,主流AV-LLM将音频、视频特征分别通过各自的编码器和投影层转换为token,再一并送入LLM进行跨模态交互——这种设计将融合重任完全交给语言模型,对于需要精细整合多模态情感线索的MER任务而言并不充分。AffectGPT的核心改进在于:在特征进入LLM之前,增加预融合模块,将音视频特征的跨模态交互前置。文中探索了两种方案:Q-Former方案:创建K个可学习的查询令牌,通过交叉注意力机制与音视频特征交互,将多模态信息蒸馏到查询令牌中,保留时序信息。注意力方案:对音视频特征进行时序压缩(平均池化),再通过注意力机制动态计算模态权重,强调重要模态的信息。经预融合处理后的特征再与文本token拼接,送入LLM进行自回归生成。这一设计将多模态交互从LLM内部剥离为独立模块,更充分地捕捉了MER任务中的跨模态特性。

AffectGPT: 面向多模态大语言模型情感理解的新数据集、模型与评测基准图4

图2.模型架构对比


3)评测方法—面向自由文本的定制指标: 针对MLLMs输出自由文本的特点,本文设计了专门的评测体系。对于细粒度情感识别,采用层级映射策略消除同义词和词形变体的影响(词形还原→同义词合并→情感轮映射),然后计算集合级别的精确率、召回率和F值,兼顾预测的准确性与完整性。对于基本情感识别,提出命中率指标,只检验真实标签是否出现在模型输出的情感集合中;对于情感极性分析,则采用加权F1分数作为主指标。通过这套定制化评价体系,实现了对MLLMs自由文本输出的量化评估。


4

研究结果

表1.主要实验结果

AffectGPT: 面向多模态大语言模型情感理解的新数据集、模型与评测基准图5

注:本表展示了各数据集主指标的评测结果,表中“MOSI”、“MOSEI”、“SIMS”和“SIMS v2”分别指代CMU-MOSI、CMU-MOSEI、CH-SIMS和CH-SIMS v2数据集。最后一列为数据集维度的平均分,即所有数据集的平均成绩。


表2.数据集对比实验

AffectGPT: 面向多模态大语言模型情感理解的新数据集、模型与评测基准图6

注:仅变更训练数据集,其余设置均保持一致,报告的是MER-UniBench上所有数据集的平均得分。


表3.过滤策略的必要性验证

AffectGPT: 面向多模态大语言模型情感理解的新数据集、模型与评测基准图7

注:除MER-UniBench整体结果外,本表还提供了各任务层面的结果。“E”和“S”分别为情感(Emotion)和情感极性(Sentiment)的缩写。


表4.预融合操作的作用分析

AffectGPT: 面向多模态大语言模型情感理解的新数据集、模型与评测基准图8

表5.输入模态的影响分析

AffectGPT: 面向多模态大语言模型情感理解的新数据集、模型与评测基准图9

注:“Face”与“Frame”的区别在于是否额外使用人脸提取器从视频帧中截取面部区域。


AffectGPT: 面向多模态大语言模型情感理解的新数据集、模型与评测基准图10

图3. 大语言模型、音频编码器与视频编码器的消融实验。


表3.LoRA秩值的影响分析。

AffectGPT: 面向多模态大语言模型情感理解的新数据集、模型与评测基准图11

注:本表统计了在LLM分支中使用LoRA时所带来的可训练参数量增量。第一行为未使用LoRA模块的基线模型。


5

研究结论

     总的来说,该研究从数据、模型和评测三个维度系统推进了多模态大语言模型的情感理解能力。构建的大规模情感描述数据集MER-Caption,首次让机器以“写描述”而非“贴标签”的方式理解人类情感;提出的AffectGPT模型通过创新的预融合机制,让多模态信息在进入大语言模型之前实现充分交互;而统一评测基准MER-UniBench则为这一方向提供了公平、全面的评估工具。实验证明,这套方案显著超越了现有方法。我们期待这项研究能为情感AI从“识别情绪”走向“理解人心”贡献一份力量。


免责声明:原创仅代表原创编译,水平有限,仅供学术交流,如有侵权,请联系删除,文献解读如有疏漏之处,我们深表歉意。

AffectGPT: 面向多模态大语言模型情感理解的新数据集、模型与评测基准图12
AffectGPT: 面向多模态大语言模型情感理解的新数据集、模型与评测基准图13
AffectGPT: 面向多模态大语言模型情感理解的新数据集、模型与评测基准图14

公众号智能传感与脑机接口

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
more
别人都在拼云端,苹果把AI装进了桌面
苹果能否成为国内存储龙头打入西方存储供应链的敲门砖
苹果数亿美元买断新闻语料,AI版权“暗雷”如何拆解?
苹果撤回“隐藏邮件”域名变更计划,用户隐私保护机制维持原状
苹果发布会倒计时,首款折叠iPhone价格曝光
工信部官宣鸿蒙成世界第三大手机操作系统;苹果iPhone 18发布会定档9月10日;华为惠普签署专利交叉许可;特斯拉否认撤FSD上海数据中心...
苹果首款2nm芯片来了|联想发布可插卡的8EG5超频版小平板 4999起
折叠屏 iPhone 主板照片提前曝光,苹果即将官宣发布会
苹果M6芯片推动台积电扩产先进封装业务
46999元!苹果史上最猛新机
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号