基于脑电图和外周生理信号融合的参数化超矩阵多任务多模态深度学习模型在情感识别中的应用

《Frontiers in Neuroscience》:Application of a parametric supermatrix multi-task multimodal deep learning model based on electroencephalogram and peripheral physiological signal fusion in emotion recognition

【字体: 时间:2026年08月01日 来源:Frontiers in Neuroscience 4.0

编辑推荐:

  在有限计算资源下实现准确的情感识别在医疗保健、人机交互和智能系统等应用中仍具有挑战性。为解决这一问题,研究人员提出了一种参数化超矩阵多任务多模态情感识别模型(PH-MTM),该模型融合了脑电图(EEG)和外周生理信号(PPS)。对DEAP数据集中的生理信号进行

  
在有限计算资源下实现准确的情感识别在医疗保健、人机交互和智能系统等应用中仍具有挑战性。为解决这一问题,研究人员提出了一种参数化超矩阵多任务多模态情感识别模型(PH-MTM),该模型融合了脑电图(EEG)和外周生理信号(PPS)。对DEAP数据集中的生理信号进行预处理,提取差分熵(DE)和功率谱密度(PSD)特征,并根据国际10–20系统将这些特征组织成“频带数?×?8?×?9”的网格。改进的挤压激励(SE)注意力机制自适应地为不同频带分配权重,而卷积神经网络(CNN)则对跨频带和跨通道信息进行深度融合。为在不牺牲性能的情况下降低模型复杂度,基于矩阵分解的轻量级全连接层被集成到多任务学习框架中。由于DEAP仅包含32通道EEG信号,研究人员在62通道SEED数据集上进行了额外实验,以评估频带融合策略的可扩展性和鲁棒性。PH-MTM在DEAP上的效价和唤醒度分类准确率分别达到95.99%和96.51%,在SEED上的三分类情感识别准确率达到94.25%。EEG与不同类型PPS的融合分析表明,EEG与肌电图(EMG)结合效果最佳,效价和唤醒度准确率分别达到99.69%和99.74%。与现有方法相比,所提出的模型在保持低计算成本的同时,提高了识别准确率。此外,应用SHAP可视化分析不同频带特征的贡献,为基于多模态生理信号的情感识别提供了更深入的见解。
**论文解读文章**

**研究背景**
情感作为外部刺激或个人经历引发的认知过程,表现为一种心理状态。情感识别是情感计算的关键领域,旨在使机器准确理解人类情感并基于人机交互知识生成适当响应,在医疗保健、人机交互、交通安全、游戏开发、教育及军事医学研究中具有广泛应用。然而,个体有时会有意识或无意识地通过改变外部行为来隐藏真实情感状态(即社会掩饰现象),导致基于行为的情感识别受限。为克服这一挑战,研究人员采用神经影像学和生理信号评估技术,实时监测中枢神经系统(CNS)和外周神经系统的生理数据,包括脑电图(EEG)、眼电图(EOG)、肌电图(EMG)、温度(Temp)、皮肤电反应(GSR)、呼吸率(Resp)和心电图(ECG)。情感识别可分为单模态和多模态两类。由于情感复杂性,个体间生理反应差异显著,单模态模型往往仅提供一般性结果,且情绪调节系统在不同个体和不同情感状态下会触发不同的神经生理反应,对单模态模型构成重大挑战。相比之下,基于多模态生理信号融合的情感识别模型因能整合多种生理信号信息,具有更高的鲁棒性和准确性,克服了单信号无法充分捕捉情感复杂性的局限,在情感计算领域展现出更广阔的应用前景。

**研究内容与结论**
研究人员提出了一种名为参数化超矩阵多任务多模态(PH-MTM)的新方法,将SE注意力模块、卷积神经网络(CNN)和参数化超矩阵自定义全连接层集成到多任务学习框架中。该模型解决了不同电极布局的挑战,通过标准化EEG输入模块编码器将EEG特征映射到统一空间特征图,确保一致性;采用分层策略融合模态内和模态间情感信息,在模态内阶段结合EEG空间拓扑和统计特征提取模态特定表示,并在模态间阶段引入通道注意力机制自适应调整通道及其频带特征的权重;采用多任务学习框架使情感维度学习更高效,通过共享特征提取层减少模型训练复杂度;引入基于参数化超矩阵的密集层(PHMDense)显著减少参数数量和模型复杂度,同时保持分类准确率。在DEAP数据集上进行多模态生理信号情感识别,并在SEED数据集上进行62通道EEG情感识别实验以评估模型对不同电极布局和通道数的适应性。通过K折交叉验证评估模型稳定性,并使用双尾配对t检验检验实验结果显著性。采用SHAP方法可视化分析不同频带和特征对情感分类结果的贡献。实验结果表明,PH-MTM在DEAP数据集上对效价和唤醒度二分类的准确率分别达到95.99%和96.51%,在SEED数据集上三分类准确率达到94.25%。EEG与EMG融合效果最佳,效价和唤醒度准确率分别达到99.69%和99.74%。与现有方法相比,该模型在保持低计算成本的同时提高了识别准确率。该研究为多模态生理信号情感识别提供了新思路,有望在情绪障碍患者康复过程中实现更精准的个性化治疗。论文发表在《Frontiers in Neuroscience》。

**关键技术方法**
研究人员采用的主要关键技术方法包括:(1)信号预处理与特征提取:对DEAP和SEED数据集进行降采样、基线校正、数据分段和滤波处理,提取差分熵(DE)和功率谱密度(PSD)特征,并按国际10–20系统组织成“频带数?×?8?×?9”网格。(2)标准化空间频率输入模块(STIM):将多通道EEG和PPS频域特征映射到统一的二维空间拓扑网格,实现空间对齐和结构统一。(3)频带融合注意力机制(BFAM):基于改进的挤压激励(SE)注意力模块对各频带特征进行自适应加权。(4)参数高效特征建模单元(PEF):以多层CNN、参数化超矩阵自定义全连接层(PHMDense)和多任务学习分支为核心,其中PHMDense通过非负矩阵分解(NMF)将权重矩阵分解为两个较小张量,减少参数数量。(5)SHAP可视化方法:基于博弈论Shapley值计算各频带对模型预测的边际贡献,增强模型可解释性。样本队列来源:DEAP数据集(伦敦玛丽女王大学、特温特大学、日内瓦大学和瑞士联邦理工学院联合发布,包含32名受试者观看40段60秒音乐视频时的EEG和外周生理信号);SEED数据集(上海交通大学脑计算科学实验室提供,包含15名中国受试者观看15个中文电影片段时的62通道EEG信号)。

**研究结果**
**4.1 Experimental setup**:实验平台配置为Nvidia RTX 4090D显卡、AMD EPYC 9754处理器,软件环境为Python 3.8、TensorFlow 2.9.0和CUDA 11.2。数据集按试次级别以0.8:0.2比例划分为训练集和测试集,训练集进一步采用五折交叉验证。
**4.2 Dataset used for validation**:采用DEAP和SEED两个公开数据集。DEAP包含32名受试者的EEG和多种生理信号,SEED包含15名受试者的62通道EEG信号。
**4.3 Performance of PH-MTM on multiple EEG datasets**:在DEAP数据集上,效价和唤醒度二分类任务的五折交叉验证ROC曲线AUC均为0.99,混淆矩阵显示效价准确率95.99%、F1分数96.51%,唤醒度准确率96.51%、F1分数96.40%。在SEED数据集上,三分类任务准确率94.25%、F1分数94.22%,表明模型对不同电极布局和通道数具有良好的适应性。
**4.4 Visualization of EEG distinguishability features**:利用EEGLAB工具箱绘制32通道EEG地形图,显示θ波(4–8 Hz)功率峰值集中于右颞叶,α波(8–14 Hz)集中于中央-顶叶区域,β波(14–31 Hz)集中于中央-额-顶叶区域,γ波(>31 Hz)在左额中央区局部增加。t-SNE可视化显示PH-MTM能清晰区分情感特征。
**4.5 Ablation experiment**:消融实验逐步移除SE、PHMDense和多任务学习(MTL)模块,比较基线模型与完整PH-MTM。完整模型在效价和唤醒度上准确率分别达95.87%和96.21%,F1分数分别为95.82%和96.13%,浮点运算次数(FLOPs)为0.103 G,参数量为0.822 M,验证了各模块的有效性。
**4.6 Two-tailed paired t-test**:双尾配对t检验显示,PHMDense+MTL、MTL+SE、PHMDense+SE组合均显著提升模型性能(p<0.05),其中PHMDense+SE组合效果最显著(p=0.000),表明模块间协同作用。
**4.7 Comparative experiment**:与近年其他模型在DEAP和SEED数据集上比较,PH-MTM在效价和唤醒度准确率(95.99%、96.51%)及SEED三分类准确率(94.25%)上均优于现有方法。
**4.8 PH-MTM performance on different peripheral physiological signals**:单模态信号中,EOG情感分类性能最佳(准确率87.93%),其次为EEG(95.87%)、EMG(83.46%)、GSR(68.34%);所有PPS融合后准确率达95.54%。
**4.9 Performance of PH-MTM under different combinations of peripheral physiological signals**:EEG+EMG组合效果最佳,效价和唤醒度准确率分别达99.69%和99.74%;EEG+EOG次之(99.65%、99.67%);EEG+所有PPS融合准确率略低(99.36%、99.39%),可能因信息冗余。
**4.10 Cost analysis**:与近年其他深度学习模型相比,PH-MTM参数量最少(0.82 M),FLOPs为0.103 G,在EEG+EMG融合下准确率最高(99.69%、99.74%),展示了轻量高效优势。

**讨论与结论**
**讨论部分**:研究人员通过SHAP方法可视化EEG不同频带特征的可区分性。在DEAP数据集上,θ波和γ波特征分别在效价和唤醒度分类任务中贡献最大,PSD特征整体优于DE特征。在SEED数据集上,γ波贡献最大,在积极和消极情感分类中均起关键作用。多模态融合可视化显示,EEG作为主要模态,EMG作为辅助模态,γ波和β波在EEG的DE和PSD特征中贡献显著,EMG高频带比低频带贡献更大。成本计算对比表明,PH-MTM以最少参数(0.82 M)和较低FLOPs(0.103 G)实现了最高准确率,为轻量级模型设计提供了新思路。
**结论部分翻译**:本文提出了一种基于EEG和PPS融合的参数化超矩阵多任务多模态情感识别模型。首先,研究人员利用DEAP公共数据集对EEG和PPS进行预处理,提取DE和PSD特征,并根据10–20系统将EEG特征映射到“频带数?×?8?×?9”网格结构。然后,使用改进的SE注意力机制自适应分配频带特征权重,并结合CNN深度融合跨频带和跨通道特征。最后,采用基于矩阵分解的轻量级自定义密集层和多任务学习框架,提高情感分类的准确率和效率。所提出的方法在DEAP数据集上对效价和唤醒度任务分别达到99.69%和99.74%的准确率,验证了模型的效率和稳定性。为进一步验证频带融合方法的有效性,研究人员在SEED数据集的62通道EEG数据上进行了实验,测试集准确率达94.25%,证明了方法的有效性,突破了传统32通道EEG的限制。此外,所有PPS的联合分类性能优于单一EEG。该方法充分展示了多模态生理信号融合策略的有效性。此外,基于矩阵分解的新型密集层有效减少了模型参数数量,为后续开发低成本、更高效的多模态情感识别系统提供了新思路。然而,当前实验基于离线数据,在低延迟实时情感识别场景中的性能和稳定性尚未完全验证。未来研究将聚焦于优化该问题,以进一步提高模型的泛化性能和计算效率。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号