IEEE JBHI | 基于混合脑电图和眼动跟踪的疲劳检测

脑机接口社区 2025-06-21 09:39

该论文发表于IEEE JOURNAL OF BIOMEDICAL AND HEALTH INFORMATICS(中科院二区Top,IF= 6.7),题目为《Driving Fatigue Detection Based on Hybrid  Electroencephalography and Eye Tracking》。五邑大学电子与信息工程学院的连泽全为此论文的第一作者,五邑大学电子与信息工程学院王洪涛教授为此论文通讯作者。

论文链接:
https://ieeexplore.ieee.org/document/10643252 

01

论文概要

在当今社会,随着汽车数量的不断增加,驾驶安全问题日益受到关注。疲劳驾驶是导致交通事故的主要原因之一,给人们的生命财产安全带来了严重威胁。因此,如何准确、高效地检测疲劳驾驶状态,对于预防交通事故、保障道路交通安全具有重要意义。近年来,随着脑机接口技术的发展,基于脑电图(EEG)的疲劳检测方法逐渐受到研究者的关注。EEG能够直接反映大脑的活动状态,具有较高的时间分辨率,能够捕捉到与疲劳相关的微小脑电变化,基于EEG的单一模态方法在检测疲劳驾驶方面已经取得了重大成功。然而,单一模态的EEG数据可能存在信息不完整、易受噪声干扰等问题,限制了其在疲劳检测中的应用效果。为了克服这些局限性,本文提出了一种结合混合脑电图和眼动跟踪数据的新型多模态架构。主要组件包括,用于EEG编码的EEG卷积网络,用于眼动追踪数据的多层感知器(MLP)网络,用于特征融合的跨模态预测对齐,以及用于特征增强的一维注意力模块。实验结果表明,与单模态方法和基于典型相关性分析的多模态方法相比,本文所提出的方法在会话内、跨会话和跨受试者任务都具有卓越的有效性。

02

研究背景

疲劳驾驶是指驾驶员在长时间驾驶过程中,由于生理或心理因素导致的注意力下降、反应迟钝、判断失误等一系列状态。传统的疲劳检测方法主要依赖于驾驶员的主观报告、行为表现或生理指标等单一模态数据。例如,通过询问驾驶员的疲劳感受、观察其驾驶行为是否出现偏离车道、打哈欠等现象,或者测量心率、血压等生理指标来判断疲劳状态。

多模态方法是结合来自不同模态的信息,以获得比单一模态更全面、更准确的结果。模态可以是视觉、听觉、文本、生理信号(如脑电图EEG、心电图ECG)、行为数据等。通过整合这些不同模态的数据,多模态方法能够捕捉到单一模态无法提供的丰富信息和复杂模式。

本文通过整合脑电图和眼动追踪模式,提出了一种疲劳驾驶检测架构。这种方法综合考虑了大脑衍生信息和眼动追踪状态。为了提高融合效率并增强特征表示,分别提出了跨模态预测对齐模块和一维注意力模块。这种方法显着增强了架构的稳健性,并进一步提高了会话内、跨会话和跨被试任务中的检测性能。

03

数据采集与预处理

实验招募了14名健康参与者,使用Thrustmaster T300 GT车辆模拟器、32通道Brain Products LiveAmp EEG帽和Tobii Glasses 2眼动追踪眼镜进行数据采集。模拟驾驶90分钟为一个会话,每个受试者在一周内进行两次会话,总共 28 次,实验场景及细节如图1所示。EEG数据以250Hz的采样率采集,参考电极为FCz,电极阻抗保持在20kΩ以下,眼动追踪数据的采样率为100Hz。在数据预处理阶段,EEG数据经过坏通道插值、1-40Hz带通滤波和独立成分分析(ICA)去除眼伪影,将处理后的数据分割成不重叠的1秒时间窗口。眼动追踪数据则通过Tobii Pro Lab软件进行初步处理,提取关键指标,并进一步生成8个眼动追踪特征。采用最佳的60秒时间窗口进行特征生成,时间步长为1秒。

图 1 实验场景及细节
图 2 多模态架构

04

方法

如图2(a)所示,主要组件包括:用于EEG编码的EEG卷积网络,用于眼动追踪数据的多层感知器(MLP)网络,用于特征融合的新型非CCA跨模态预测对齐,以及用于特征增强的紧凑型一维模块。接下来将分别介绍四个模块。

1. EEG卷积网络:本文提出的EEG卷积网络结构如图2(b)所示。该网络由三个卷积块组成,分别用作时间过滤器、空间过滤器和深度时间过滤器。采用DepthWise和Separable卷积层来减少网络的参数。

超参数F1,D和F2控制滤波器大小,分别设置为8,2和16。这里,D表示DepthWise卷积的深度放大系数。由于网络中存在两个池化层,导致EEG信号的采样率降低了32倍,大约为8Hz。

EEG编码器的任务是在一个1秒时间窗口内处理32×250维的输入信号,而眼动编码器在一个60秒窗口内处理1×8个特征。采用不同的窗口长度有利于在短和长的时间上下文中进行特征提取。最后,两种编码器的统一输出维度为1× 64,便于实现无缝的多模态融合。

2. 跨模态预测对齐:我们提出了一种非典型相关分析(non-CCA)对齐方法,通过跨模态预测任务的优化来增强融合效果,如图2(a)右部所示。

通过使用相似性损失函数来实现单模态特征的对齐,将预测结果与它们在两个模态中的对应目标进行比较。假设有两个模态,其中x1和x2表示这些模态的输入数据。令z1,z2为x1和x2的编码一维特征,使用MLP从z1预测z2的特征:

其中h1,h2代表MLP的预测方法,p1和p2分别为z1和z2的预测结果。随后,使用以下方程计算预测结果与目标特征之间的负余弦相似度:

D(p1,z2)表示负余弦相似度函数,预测对齐损失定义如下:

Lalign表示对齐损失,其最小值为-1。随后采用停止梯度(stopgrad)操作,在优化的同时停止目标特征向量的梯度,使得对齐任务只会影响预测器梯度传播旁的参数,避免了优化器快速获得退化解。公式(2)变形为:

意味着这里的z2被处理为无梯度的常数向量。最后,将预测对齐损失改为:

随着反向传播的迭代,两种模态的特征将更能够相互预测,因此在潜在空间中彼此的相对性更强。

3. 一维注意力模块:一维注意力模块来增强编码特征的表示,如图2(a)中部所示,所提出的注意力模块应用于每个模态的主要编码的特征。令Of∈RD表示模态的一维输出特征,其中D为特征向量的长度。注意力权重α的计算如下:

这里,Os∈RD表示由一个得分函数fs得到的D个元素的得分,其中应用的得分函数是一个两层MLP。随后得到增强的特征如下:

⊗表示Hadamard积,(也称作元素乘积或逐元素乘积)。Hadamard积是一种在神经网络中用于结合两个向量元素对元素相乘的操作。O′f表示经过注意力模块后的增强特征。

4. 训练:在该架构中,最终的损失函数由两部分组成:跨模态对齐损失(Lalign)和交叉熵分类损失(Lclf)。总体损失函数表示如下:

考虑到不同模态之间数据量级的巨大差异,该多模态网络采用二阶段训练的方法来减轻潜在的过拟合风险。第一阶段使用EEG单模态数据对EEG卷积网络进行预训练,以获得合适的初始参数,第二阶段包括整个多模态网络的训练。

05

实验结果

为了全面评估所提出的方法,首先,我们分析了两种模态的数据,以评估使用多模态数据的可行性和所采用的标记方法的有效性。其次,分别在会话内、跨会话和跨受试者场景中评估疲劳检测性能。第三,我们研究了不同眼动追踪时间窗口的影响。第四,进行了消融研究,以评估所提出的多模态架构中每个模块的有效性。最后,我们利用公开的SEED - VIG数据进行了跨被试评估实验。

图 3 脑电数据可视化分析

首先,我们对EEG信号在theta、loweralpha和beta三个主要频段的功率分布进行了可视化分析,如图3(a)所示。然后对5个特定脑区进行统计分析,结果如图3(c)所示。五个脑区如图4(b),统计分析的目标是前额叶、额叶、中央区、顶叶和枕叶。结果显示,疲劳状态相比于警戒状态在所有会话的三个频段中,前额叶皮层内显着增加,顶叶和枕叶在较低的α频带表现出显著增加,额叶内的β频带明显降低,说明前额叶皮层是疲劳检测的最关键区域。

图 4 眼动数据可视化分析

图4(a)展示了受试者的注视平均时间和扫视平均时间的趋势,扫视平均时间随着任务时间的增加而呈上升趋势,注视平均时间呈下降趋势。图4(b)和(c)分别描绘了疲劳和警觉状态下的注视时间直方图。注视时间分为三类:express(<150ms),cognitive(150ms–900ms)和overlong(>900ms)。

统计分析结果如表1所示,在8个眼动特征中,扫视次数和扫视平均时间均显著增加,这说明随着实验时间的增加,被试者开始出现分心,注意力不集中的现象。

表 1 眼动特征的平均值

图 5 三个任务的分类结果

会话内、跨会话和跨受试者评估任务结果如图6所示。在会话内任务中,本文的方法在五种方法中取得了最高的性能(99.93%),与其他方法相比具有最低的标准差。在跨会话任务中,本文的多模态方法在五种方法中获得了最高的准确率88.67%。在跨被试任务中,也取得了最高准确率(78.19%)。综合来看,本文提出的多模态方法始终表现良好,在三个验证任务中实现了五种方法中最高的准确性。

图 6 不同时间窗口的评估结果

图6展现了眼动追踪时间窗口对眼动追踪方法和所提出的多模态方法的性能影响。从图中可以看出,60秒的时间窗口在两种模态方法下的跨会话和跨被试效果最优。

表 2 预训练的消融研究结果

预训练的消融结果见表2所示。通过预训练,模型在跨会话和跨被试任务中的表现分别从83.44%提高到86.48%和76.28%提高到77.39%。

表 3 跨模态预测对齐和一维注意力模块的消融结果

跨模态预测对齐和一维注意力模块的消融结果如表3所示。在跨会话任务中,对齐和注意力模块均使模型的性能分别提升了3.79%和0.96%。将这两个模块结合起来,可以获得4.62%的性能提升。然而,在跨被试任务中,注意力模块的采用导致了1.78%的性能下降,但仅使用对齐模块会带来1.52%的性能提升。

表 4 在SEED-VIG的评估结果

为了评估所提出的方法在其他数据集上的性能,使用公开可用的SEED-VIG数据集进行了跨受试者评估实验。本文提出的方法取得了96.92%的准确率,比基于DCCA和基于DGCCA的多模态方法分别高出9.97%和9.13%。这些结果进一步强调了所提方法的有效性。

06

总结与展望

本研究通过整合脑电图和眼动追踪模式,提出了一种疲劳驾驶检测的新架构。该架构由一个卷积EEG编码器和一个MLP眼特征编码器组成。在融合阶段,采用一个跨模态预测任务来对齐来自不同模态的特征,并加入了一个一维注意力模块来增强特征表示。本研究的实验结果说明利用多模态方法进行疲劳检测具有巨大优势。此外,消融研究结果证明了在跨会话任务中集成1D注意力模块并在跨会话和跨被试任务中采用跨模态预测对齐的优越性。这些发现表明开发改进的疲劳检测系统具有广阔的潜力,从而更好的避免疲劳驾驶带来的危害。

团队主页
www.scholat.com/team/hbci

撰稿人:陈俊杰;审稿人:黄海云

来源:脑机接口与混合智能研究团队

仅用于学术分享,若侵权请留言,即时删侵!

加入社群

欢迎加入脑机接口社区交流群,

探讨脑机接口领域话题,实时跟踪脑机接口前沿。

加微信群:

添加微信:RoseBCI【备注:姓名+行业/专业】。

加QQ群:913607986

欢迎来稿

1.欢迎来稿。投稿咨询,请联系微信:RoseBCI

点击投稿:脑机接口社区学术新闻投稿指南

2.加入社区成为兼职创作者,请联系微信:RoseBCI

一键三连「分享」、「点赞」和「在看」

不错过每一条脑机前沿进展

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
检测
more
ECCV 2026 Oral|首个端到端实时 DETR 旋转检测模型,中科大联合华为发布 RiO-DETR:2.7 ms 达到 78.4 AP50
摄像头版 AirPods 功能细节曝光:左右双摄、1MP 画质、支持人物检测
国家认监委关于下达《检验检测机构监督管理数据规范》等18项认证认可行业标准制修订计划项目的通知
Food Chem:核壳结构Cu@Pt纳米颗粒与L-半胱氨酸协同增强的电化学检测方法用于生物及食品样品中宽浓度范围褪黑素检测
【高温砺剑】计量守护机动车检测“生命线”
《计测技术》学刊“检测数智化技术”系列论文征集
《计测技术》推荐|航空工业计量所张学涛:飞机研制检测数字化体系
Anal Chim Acta:基于COF‑V/环糊精/金纳米复合修饰电极的MB竞争、主客体识别电化学检测非电活性手性氨基酸
刚刚,Claude文字水印细节全曝光,官方检测工具即将推出
2026年中国气体检测仪行业政策、市场规模、竞争格局及发展趋势分析:中国市场增速领跑全球,在全球市场占比逐步提升[图]
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号