基于混合CNN-LSTM架构与情感融合的双模态语音情感识别

《Future Internet》:Bimodal Speech Emotion Recognition Using a Hybrid CNN-LSTM Architecture with Sentiment Fusion

【字体: 时间:2026年08月11日 来源:Future Internet 4.6

编辑推荐:

  语音情感识别(SER)是情感计算中的基础任务;然而,传统单模态方法常难以捕捉自发对话语音中复杂的情感线索。因此,融合声学与文本信息的双模态框架应运而生,以提供互补的语义与声学表征。本研究提出一种基于混合卷积神经网络–长短期记忆网络(CNN–LSTM)架构的双模

  
语音情感识别(SER)是情感计算中的基础任务;然而,传统单模态方法常难以捕捉自发对话语音中复杂的情感线索。因此,融合声学与文本信息的双模态框架应运而生,以提供互补的语义与声学表征。本研究提出一种基于混合卷积神经网络–长短期记忆网络(CNN–LSTM)架构的双模态SER框架。利用多模态EmotionLines数据集(MELD),该框架结合时序声学特征、统计声学特征与预测的文本情感。实验结果表明,所提模型对多数情感类别实现可靠识别,但因严重类不平衡,对代表性不足少数类的性能有限。为更好理解各模态贡献,研究人员进行了特征充分性与必要性分析。此外,对替代融合策略的评估显示,相较于简单特征拼接,表达性注意力网络未带来有意义的性能提升。这些发现表明,在对话式SER中,类不平衡而非融合复杂度仍是主要局限,凸显在追求更复杂多模态架构前解决数据不平衡的重要性。
研究背景方面,语音情感识别(SER)旨在从音高、语调与频谱等声学特性中辨识人类情绪状态,是情感计算的核心任务。尽管深度学习提升了SER性能,但受控环境下录制的行为语音数据集缺乏生态效度,且单模态数据常无法捕获口语表达的完整语境,自发对话中声音情绪与文本情感常存在错位,而双模态研究中对“哪一模态主导预测”的结论往往依赖单一评估方法,缺乏一致性。为此,研究人员以MELD数据集(提取自情景喜剧?老友记的13708条对齐音文语料,含七类情绪且存在严重类不平衡,训练集Neutral 4710条、Joy 1743条,Disgust 271条、Fear 268条)为基准,构建混合CNN–LSTM测试床,重点考察模态贡献与融合机制,而非单纯追求分类准确率。该研究发表于《Future Internet》,其意义在于将对话式SER的性能瓶颈从“架构不够复杂”重新定位到“数据类分布失衡”,为多模态情感建模提供诊断性视角。
关键技术方法上,研究人员采用MELD自然对话语料,将原始MP4转16 kHz单声道WAV并统一截断至3秒;文本侧用TimeLMs(RoBERTa-base微调的三类情感分类器)生成情感概率,音频侧并行抽取40维梅尔频率倒谱系数(MFCC)、12维色度(Chroma)、谱对比、过零率(ZCR)与均方根能量(RMS)等时序与统计量,分别送入一维CNN+LSTM的声学序列分支、全连接统计分支、One-Hot情感语义分支,三路拼接后经128维ReLU隐层与SoftMax输出七类概率,Adam优化(lr=0.001,batch=32,50 epoch);另设Sigmoid门控融合与跨模态缩放点积注意力两种替代融合对照;并以分支置零/剔除做充分性-必要性分析,以单类剔除做类级消融。
研究结果部分,第4.1节模型性能与误差分析显示,混合CNN–LSTM在七类上总体准确率49.77%,混淆矩阵高度偏向Neutral(召回78.50%,F1 0.6696)与Joy(召回56.47%,F1 0.4967);Fear零召回,Disgust召回1.47%,Surprise召回4.63%,Anger易混入Neutral/Joy,Sadness仅6.25%召回。三种融合机制对比中,拼接基线准确率最高,Sigmoid门控宏F1略优(0.2241 vs 0.2233),跨模态注意力无增益。第4.2节特征充分性与必要性指出,语义分支单独充分性22.18%、声学序列12.84%、统计分支21.15%;必要性上剔除语义掉至41.15%、剔声学序列掉至42.22%、剔统计仅掉至48.77%(降1.00%),统计子特征中仅Chroma有必要性(剔除降至49.46%),其余子特征剔除反略升;独立随机森林仅用统计特征达41.88%,印证统计分支在多模态下被冗余化。第4.3节类级消融表明,剔Neutral准确率暴跌至43.28%但宏F1升至0.2900,剔Surprise准确率最高57.06%,剔Joy宏F1最低0.2101,无单类剔除能同时优化准确率与宏F1。第4.4节讨论明确:瓶颈在类不平衡而非架构,Surprise因正负价混合而声学-语义签名不一致;统计声学特征被深度网络隐式吸收;表达性融合不抵拼接。
结论部分翻译:本研究构建并评估了一种双模态语音情感识别模型,该模型结合声学与统计音频特征与预测文本情感,以混合CNN–LSTM为基线、门控注意力变体作对照。混合CNN–LSTM在MELD上测试准确率为49.77%,性能集中于Neutral与Joy类,对Fear完全失效,对Disgust与Surprise近零识别。因此本研究核心贡献由性能声明转为多模态动态的诊断性调查:特征重要性分析揭示声学统计虽有中等基线预测力,但语义与声学序列(MFCC)分支才是严格必要的判别驱动;类级消融显示无单类移除可全指标一致优化;融合机制比较表明门控与跨模态注意力较简单拼接无实质优势。综上,本研究的性能主约束为训练数据类不平衡,而非模型架构或特征融合方式。
相关新闻
生物通微信公众号
微信
新浪微博

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号