
点击蓝字 关注我们

欢迎各位专家学者在公众号平台报道最新研究工作,荐稿请联系小编Robert(微信ID:BrainX007); 或将稿件发送至lgl010@vip.163.com。
英文标题:PH-EMO:Decoding Emotions from the Brain Inward-EEG-Grounded Multimodal Reasoning with LLMs
https://doi.org/10.1145/3774904.3792855
成果简介
情绪识别技术发展至今,AI已经能够通过面部表情、语音语调和对话内容来判断人的情绪状态。然而,这些方法存在一个根本性的缺陷:表情可以伪装,语气可以控制,单纯依赖外在表现做出的判断并不可靠。更重要的是,现有AI模型往往直接给出情绪标签,却说不清“为什么”——这种缺乏可解释性的“黑箱”特性,使其在心理健康监测、临床辅助诊断等严肃场景中难以真正落地。
针对这一瓶颈,香港浸会大学计算机科学系刘际明讲座教授团队提出了一种名为PH-EMO的创新框架。该框架的核心思路是“回归人类情绪发生的本来顺序”:外部事件触发→内部生理响应→外在行为表达。为此,团队设计了三大感知模块,分别将脑电波形图、音频信号和视频帧转化为结构化的文字证据;随后由一个中央大语言模型严格按照“触发→生理→表达”三步进行链式推理,最终生成包含完整推理路径的情绪分析报告。在EAV和LUMED-2两个公开基准数据集上的实验表明,PH-EMO在情绪分类准确率和推理可靠性两项指标上均显著优于现有最优模型。更重要的是,它所生成的每一步结论都有对应的多模态证据支撑,使AI的判断过程首次具备了临床级别的可解释性和可信度。
主要贡献
提出PH-EMO框架,首次将EEG生理证据作为视听分析的基础:不同于以往将EEG作为辅助信号的做法,PH-EMO构建了一个以大语言模型为核心的多模态框架,通过符合人类认知规律的推理流程,将脑电信号中蕴含的生理证据作为整个情绪分析的“锚点”——所有关于外部刺激和外在表现的解读,都需要经过内部生理状态的校准和验证。
设计了一种强制“内外对齐”的推理机制,实现端到端可解释性:PH-EMO的核心是一个严格遵循“外部触发→内部生理→外在表达”三段式流程的推理机制。这一设计确保了模型的每一步推理都建立在特定模态的证据之上,而非将所有信号混为一谈后直接跳到结论。通过强制因果顺序,模型不仅“说得出”结论,更“讲得清”来龙去脉,实现了从输入到输出的全程可追溯。
在两个公开基准上验证了识别精度、推理连贯性和解释忠实性:该团队在EAV和LUMED-2两个公开的多模态情绪数据集上开展了大量实验。结果表明,PH-EMO不仅在情绪分类准确率上超越了现有开源及闭源模型,更重要的是,其生成的推理链在连贯性和对输入证据的忠实度方面均显著优于对比方法。特别是团队提出的“推理可靠性得分(RRS)”指标,首次从量化层面证明了PH-EMO的解释“有据可查”,而非大模型的“想象”。
研究方法
PH-EMO的技术路线可以概括为“两步提取、一步推理”的流程。整体架构如图1所示。

图1.PH-EMO整体架构。
1)多模态语义提取——把信号“翻译”成文字:
PH-EMO部署了三个独立的感知模块,各自负责一种模态的信号处理:①脑电模块:输入预处理后的30通道脑电波形图,由视觉大模型Qwen2.5-VL进行解读,输出描述神经动态的文本,重点关注与唤醒度和效价相关的时域特征;②音频模块:输入原始音频流,由音频大模型Qwen2-Audio进行分析,输出描述音高变化、语调、韵律以及情感性言语内容的文本;③视觉模块:输入视频帧序列,由Qwen2.5-VL处理,输出描述微表情、面部动作单元变化、身体姿态及环境背景的文本。
2)模人类一致性推理——强制三步因果链:
这是PH-EMO方法的核心。与常规多模态融合将所有信号一次性输入不同,PH-EMO通过精心设计的思维链提示词,强制中央大语言模型(Qwen2.5-Omni)按照固定顺序生成三段推理文本。这种设计的关键在于严格的时序隔离:每一阶段只能访问预设的特定模态证据,而非全部信息。这使得模型的推理过程天然具备可追溯性——当某一阶段的判断出错时,可以明确归因于对应的模态模块,而非整个黑箱。①第一阶段(触发识别):模型主要依据音频和视频信号,识别引发情绪反应的外部事件或对话内容;②第二阶段(生理解读):模型依据脑电模块输出的文本证据,解读个体的内部情绪状态。这一阶段模型尚不能参考任何音频或视频信息,必须单纯依赖EEG证据;③第三阶段(表达分析):模型依据音频和视觉模块的文本输出,分析声音和面部行为如何印证、调节或可能掩盖第二阶段中推断出的内部状态。
3)评估策略——两个维度分别衡量:
由于PH-EMO输出的是自由文本而非固定类别,团队设计了两套评估方案:①分类准确率:将三段推理文本输入一个映射模块,由该模块提取情绪关键词并映射到预设的情绪类别,再与真实标签计算准确率和加权F1分数。②推理可靠性得分(RRS):这是一个专门衡量可解释性的量化指标。由一个独立的评判模型分别检查三段推理是否忠实于对应的输入证据——第一阶段对照音频和视频,第二阶段对照EEG文本,第三阶段对照音频和视觉文本。对每个样本的每个阶段给予二值一致性评分(0或1),最终对所有样本和所有阶段取平均值。RRS越高,说明模型的解释越有据可查,而非脱离证据的自由发挥。
研究结果
表1. S不同多模态大语言模型在EAV和LUMED-2数据集上的性能对比(准确率、F1分数、推理可靠性得分)。所有数值均以百分比(%)表示。

表2.EAV和LUMED-2数据集上的消融实验。其中E、A、V分别表示脑电、音频和视觉模态。所有数值均以百分比(%)表示。


图2.EAV数据集中的一个定性案例分析。PH-EMO生成了一步接一步的解释,追踪情绪从触发事件到生理唤醒再到外在表达输出的完整过程。文字下方的色条表示各模态证据在时间轴上的对应位置。
研究结论
该团队提出了PH-EMO框架,通过一个与人类情绪发展规律相一致的推理流程,将脑电信号与视听输入进行深度融合。其核心设计在于显式地建模从“外部触发”到“生理唤醒”再到“外在表达”的完整因果链条,使模型输出的解释严格忠实于输入的多模态证据。在EAV和LUMED-2两个公开的多模态情绪基准上的实验结果表明,PH-EMO在分类准确率和推理可靠性两个维度上均一致优于现有的多模态大语言模型。具体而言,PH-EMO在EAV数据集上达到80.71%的准确率和76.62%的推理可靠性得分,在LUMED-2数据集上达到76.42%的准确率和72.83%的推理可靠性得分,两项指标均显著超越对比模型。消融实验进一步验证了设计决策的有效性:移除EEG模态后,模型准确率下降约2至3个百分点;移除思维链推理模块后,推理可靠性得分下降超过3个百分点。这证明脑电信号提供的生理信息与视听信号并非冗余关系,而结构化的因果推理对生成可信的解释至关重要。定性的案例分析也印证了这一结论:PH-EMO能够从一段对话视频中依次识别出触发事件(如抱怨性言语伴随细微的皱眉)、内部生理响应(多通道脑电同步出现高幅脉冲)以及外在表达变化(语调尖锐化、面部持续紧张),形成一条完整的、可追溯的情绪推理链。这种“由内而外”的解读方式,使得AI的判断不再是难以理解的黑箱输出,而是每一步都有据可查的透明推理。
免责声明:原创仅代表原创编译,水平有限,仅供学术交流,如有侵权,请联系删除,文献解读如有疏漏之处,我们深表歉意。


公众号丨智能传感与脑机接口
