Neural Networks:用于对话中基于脑电的情绪识别的超图多模态学习

智能传感与脑机接口 2026-07-22 08:54
Neural Networks:用于对话中基于脑电的情绪识别的超图多模态学习图1

点击蓝字 关注我们

Neural Networks:用于对话中基于脑电的情绪识别的超图多模态学习图2




欢迎各位专家学者在公众号平台报道最新研究工作,荐稿请联系小编Robert(微信ID:BrainX007); 或将稿件发送至lgl010@vip.163.com。


英文标题:Hypergraph multi-modal learning for EEG-based emotion recognition in conversation

原文链接:
https://doi.org/10.1016/j.neunet.2026.109057
Neural Networks:用于对话中基于脑电的情绪识别的超图多模态学习图3

1

成果简介

     对话中的情绪识别(Emotion Recognition in Conversation, ERC)对于诊断自闭症、抑郁症等健康状况,以及理解那些难以表达自己情绪的人的情感,非常有价值。目前的ERC方法主要依赖语义、音频和视频数据,但在整合生理信号(如脑电图 EEG)时面临重大挑战,比如信噪比低、个体差异大以及时间对齐问题。本研究提出了超图多模态学习(Hypergraph Multi-Modal Learning, Hyper-MML),这是一个用于识别对话中情绪的新框架。Hyper-MML能够有效地将EEG与音频和视频信息整合,捕捉复杂的情绪动态。首先,本文引入了带互交注意力机制(Mutual-cross Attention)的自适应脑编码器模块(Adaptive Brain Encoder with Mutual-cross Attention, ABEMA)来处理EEG信号。该模块能够捕捉不同频段中与情绪相关的特征,并通过分层互交注意力机制适应个体差异。其次,本文提出了自适应超图融合模块(Adaptive Hypergraph Fusion Module, AHFM),可以主动建模ERC中多模态信号之间的高阶关系。在EAV和AFFEC数据集上的实验结果表明,本文提出的Hyper-MML模型显著优于当前最先进的方法。提出的Hyper-MML可以作为医疗专业人员的有效交流工具,更好地与难以表达情绪的患者互动。官方实现代码可在 https://github.com/NZWANG/Hyper-MML 获取。


2

研究方法

     Hyper-MML 的基本框架如图1所示。对于一段连续对话,研究首先按照固定时间窗口将其划分为若干片段,每个片段包含时间上对应的 EEG、音频和视频信息。三种模态分别经过单模态编码器得到特征表示,随后由 AHFM 完成超图构建与多模态融合,最终通过多层感知机预测情绪类别。

Neural Networks:用于对话中基于脑电的情绪识别的超图多模态学习图4

图1 Hyper-MML模型的整体框架

(1)自适应脑编码器 ABEMA

ABEMA 的结构如图2所示,其主要作用是从噪声较强且个体差异明显的 EEG 信号中提取与情绪相关的稳定特征。

首先,原始 EEG 经过 0.5~50 Hz 的带通滤波,以去除基线漂移和高频噪声;随后采用独立成分分析(Independent Component Analysis,ICA)识别并去除与肌电活动相关的成分,从而降低自然说话过程中面部肌肉活动对脑电信号的干扰。

由于不同受试者的脑结构、电极位置和通道响应存在差异,ABEMA 为每名受试者设置一个可学习的线性变换矩阵,对 EEG 通道进行个体化校准。该层主要修正不同受试者之间的通道缩放、空间偏移和线性混合差异,为后续特征提取提供较为统一的输入。

经过个体校准后,模型使用 iTransformer 在 EEG 通道维度进行自注意力计算,学习不同脑区之间的空间关系。随后,通过快速傅里叶变换将 EEG 分解为 δ(0.5~4 Hz)、θ(4~8 Hz)、α(8~13 Hz)、β(13~30 Hz)和 γ(30~50 Hz)五个标准频段,并在每个频段中提取差分熵(Differential Entropy,DE)和功率谱密度(Power Spectral Density,PSD)特征。

ABEMA 的关键在于分层互交注意力机制。第一层互交注意力在每个频段内部融合 DE 与 PSD,使模型能够同时利用信号复杂度和频谱能量信息;第二层互交注意力进一步建立不同频段之间的联系,捕捉情绪状态引起的多频段协同变化。模型还会为五个频段学习自适应权重,使不同受试者能够形成个性化的频段组合。最后,处理后的特征与原始信息进行残差融合,并通过归一化和线性投影得到 EEG 表征。

Neural Networks:用于对话中基于脑电的情绪识别的超图多模态学习图5

图2 ABEMA 的 EEG 特征提取流程

(2)单模态特征编码

对于 EAV 数据集,音频特征通过 openSMILE 工具包的 IS10 配置提取,视频中的面部表情特征由预训练的 MA-NET 提取。考虑到 EEG 具有明显的时间依赖性,作者采用双向门控循环单元(BiGRU)进一步编码 EEG 特征。经过相应编码后,不同模态被映射到统一的特征空间,为后续超图融合提供基础。

(3)自适应超图融合模块 AHFM

普通图通常使用一条边连接两个节点,只能直接描述两两关系。在对话情绪识别中,EEG、声音和面部表情可能在同一时刻共同反映一种情绪。若将这种三元关系拆分成多个二元关系,容易损失多模态同步变化所包含的信息。超图中的一条超边可以同时连接三个或更多节点,因此更适合描述多模态情绪线索之间的高阶关系。普通图与超图的区别如图3所示。

Neural Networks:用于对话中基于脑电的情绪识别的超图多模态学习图6

图3 普通图与超图的关系表示

     对于包含 N 个时间片段的对话,AHFM 将每个片段中的 EEG、音频和视频分别视为一个节点,共构建 3N 个节点。在此基础上,模型设计了两类超边:片段内超边连接同一时间片段中的三种模态,用于描述某一时刻 EEG、声音和面部表情的协同关系;片段间超边则连接同一模态在不同时间片段中的节点,用于描述情绪随对话进程发生的连续变化。

    为了根据不同情绪和不同数据质量动态调整信息贡献,模型还为节点和超边引入了可学习权重。节点权重用于反映 EEG、音频和视频在当前识别任务中的重要性,超边权重用于衡量片段内多模态关系及片段间时间关系的强弱。经过多层超图卷积的信息传播后,三种模态的特征被拼接并输入分类器,得到最终情绪预测结果。


3

研究结果

表1: Hyper-MML在EAV数据集上的按被试表现

Neural Networks:用于对话中基于脑电的情绪识别的超图多模态学习图7


表2:本文的方法与其他竞争方法在EAV数据集上五种情绪类别(中性、愤怒、开心、伤心、平静)上的性能比较。统计显著性:*p<0.05,相比最佳基线。每列的最佳结果以加粗显示

Neural Networks:用于对话中基于脑电的情绪识别的超图多模态学习图8


表3:本文的方法与其他竞争方法在AFFEC数据集上的唤醒度和效价分类任务的性能比较。统计显著性:*p<0.05,与最佳基线相比。每列的最佳结果以粗体显示

Neural Networks:用于对话中基于脑电的情绪识别的超图多模态学习图9


表4 Hyper-MML在AFFEC数据集上的表现

Neural Networks:用于对话中基于脑电的情绪识别的超图多模态学习图10


表5:EAV和AFFEC数据集上脑电编码方法的比较。AFFEC的结果来自Felt-Arousal任务。每列的最佳结果以加粗显示

Neural Networks:用于对话中基于脑电的情绪识别的超图多模态学习图11


表6:EAV数据集上的模态贡献分析,比较单独模态和组合模态的表现。每列的最佳结果以粗体显示。

Neural Networks:用于对话中基于脑电的情绪识别的超图多模态学习图12

Neural Networks:用于对话中基于脑电的情绪识别的超图多模态学习图13

图4:在EAV数据集上,不同研究中单一模态表现的比较。E、A和V分别代表脑电、音频和视频模态


表7EAV和AFFEC数据集上的图结构比较。统计显著性:* 表示与Multi-GCN相比,p < 0.05。每列的最佳结果以加粗显示。

Neural Networks:用于对话中基于脑电的情绪识别的超图多模态学习图14


表8:在EAV数据集上对ABEMA和AHFM模块关键组件进行的消融研究结果。每一列的最佳结果以粗体显示。

Neural Networks:用于对话中基于脑电的情绪识别的超图多模态学习图15

Neural Networks:用于对话中基于脑电的情绪识别的超图多模态学习图16

图5:在EAV和AFFEC数据集上学习特征的T-SNE可视化。(a)EAV数据集在音频、视频、EEG模态及它们融合后的可视化。(b)AFFEC数据集的Felt-Arousal任务可视化,展示了GSR、眼动追踪、EEG模态及它们的多模态融合。每个点代表一个片段,颜色表示情绪类别


表9 MODMA 抑郁检测数据集上的跨域验证结果

Neural Networks:用于对话中基于脑电的情绪识别的超图多模态学习图17


4

研究结论

本研究提出了面向脑电对话情绪识别的超图多模态学习框架 Hyper-MML。该框架将 EEG 提供的神经生理信息与音频、视频等外在行为线索相结合,减少了模型对完整语言内容的依赖,并针对 EEG 信噪比低、个体差异明显和多模态关系复杂等问题进行了专门设计。其中,ABEMA 通过 EEG 预处理、受试者特定线性校准、频段分解以及分层互交注意力机制,学习具有个体适应性的脑电情绪表征;AHFM 则利用片段内和片段间超边,同时刻画多模态信息的瞬时协同关系与跨时间情绪演化,并通过可学习的节点和超边权重动态选择更有价值的信息。在 EAV 和 AFFEC 数据集上的实验表明,Hyper-MML 在整体性能、跨受试者泛化和模型可解释性方面均表现出较强竞争力。MODMA 数据集上的抑郁检测结果也显示了该框架向心理健康相关任务迁移的潜力。未来,该方法有望为语言表达受限人群的情绪理解、心理健康监测和情感感知式人机交互提供新的技术思路。


免责声明:原创仅代表原创编译,水平有限,仅供学术交流,如有侵权,请联系删除,文献解读如有疏漏之处,我们深表歉意。

Neural Networks:用于对话中基于脑电的情绪识别的超图多模态学习图18
Neural Networks:用于对话中基于脑电的情绪识别的超图多模态学习图19
Neural Networks:用于对话中基于脑电的情绪识别的超图多模态学习图20

公众号智能传感与脑机接口

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
more
斥资12个亿!年产数千台的无轨导航机器人基地在苏开工
直击2026世界机器人大会!OFweek维科网巡展直播合作招募启动
成都又一机器人“学校”来了!
千寻智能高阳团队新作|换了新硬件,老数据还有用吗?揭秘机器人学习中的"涌现式迁移"
机器人进厂造车,人干啥?
4000万参数读懂任意多目异构相机,地瓜机器人X-Lens让深度估计告别“大模型崇拜”
宿舍手搓双足机器人!22岁哈工大本科生拿下5亿元融资
换个地面/身体,机器人策略就失灵?让扩散策略读懂「动力学」| ICML'26
产量大爆发!人形机器人要长脑子了
获业内最大订单、参与国标制定,成都人形机器人企业“裂变”加速|在成都创未来
Copyright © 2025 成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号