《Pattern Recognition》:Diffusion-based cross-modal generation for audio-driven facial expression and emotion recognition
编辑推荐:
•一种新颖的基于扩散模型的生成框架,用于音频驱动的面部表情合成,确保高视觉保真度和时间一致性。•一种情感感知的对比学习策略,用于音频和视觉表示的鲁棒跨模态对齐。•一种多模态融合机制,联合利用音频线索和生成的面部特征以增强情感识别性能。•在基准数据集上的全面评估,证明了其性能优
- •
一种新颖的基于扩散模型的生成框架,用于音频驱动的面部表情合成,确保高视觉保真度和时间一致性。
- •
一种情感感知的对比学习策略,用于音频和视觉表示的鲁棒跨模态对齐。
- •
一种多模态融合机制,联合利用音频线索和生成的面部特征以增强情感识别性能。
- •
在基准数据集上的全面评估,证明了其性能优于现有最先进方法。
引言
音频驱动的面部表情生成和情感识别已成为多模态感知、情感计算和人机交互领域中的关键研究问题。通过联合分析语音信号和面部动态,此类系统旨在更自然、更准确地建模人类情感,从而在虚拟助手、数字化身、远程临场感、心理健康评估和智能辅导系统等方面得到应用 [1], [2], [3]。然而,由于音频和视觉模态之间时间结构的异质性、高维性以及对话者身份和情感背景的强依赖性,学习两者之间的有意义关联仍然具有挑战性。
深度学习在卷积神经网络、循环架构和基于 Transformer 的融合策略方面的最新进展,显著改善了音频-视觉建模能力。在说话人面部生成、唇形同步和多模态情感识别等任务中,这些方法展现了积极的效果 [4], [5], [6]。然而,当前大多数方法依赖于对抗学习框架或可预测生成,往往无法捕捉语音驱动面部表情固有的多样性和不确定性 [7]。此外,面部动态的时间不一致性以及跨说话者和情感状态的泛化能力下降,通常是由音频-视觉对齐不佳和情感感知表示学习不足所致。
生成扩散模型已成为高保真内容合成中生成对抗网络的有效替代方案,提供了更好的样本质量和稳定性。扩散模型通过将数据生成建模为渐进式去噪过程,能够对时间连贯性和视觉真实性进行精细控制 [8], [9]。尽管扩散模型在图像和视频合成中取得了成功,但基于扩散模型的框架在音频驱动的面部表情生成中的应用仍相对缺乏探索,尤其是在与情感识别任务结合的情况下。关键挑战在于有效地将扩散过程条件化于能够同时保持语义一致性和情感一致性的跨模态嵌入上。
与此同时,对比学习已成为跨模态表示对齐的有效范式,但现有方法主要面向识别任务设计,很少与生成模型集成以引导具有表现力和情感一致性的合成 [10], [11], [12]。因此,迫切需要一种统一框架,能够(i)学习情感感知的跨模态嵌入,(ii)利用基于扩散的生成实现时间一致和高保真的面部合成,以及(iii)联合优化生成和识别目标以实现鲁棒的多模态情感理解。
与分别采用扩散模型、对比学习或多模态融合的现有方法不同,本文提出的 DCL-MF 框架在统一架构中联合优化这些组件,以同时实现音频驱动的面部表情生成和情感识别。与直接将扩散过程条件化于音频特征不同,本文提出的框架首先通过跨模态对比学习学习一个情感感知的共享潜在空间。这些对齐后的表示随后用于引导扩散模型,从而改善语音与生成面部表情之间的语义一致性。此外,合成的面部表示通过多模态融合 Transformer 与音频嵌入集成,使生成的面部动态能够直接为情感识别做出贡献。这种对齐、生成、时间一致性和识别的联合优化使本文提出的框架区别于现有的顺序式或任务特定方法。本文的主要贡献总结如下。
- 1
我们提出了一种统一的基于扩散的对比学习与多模态融合(DCL-MF)框架,联合执行音频驱动的面部表情生成和情感识别。
- 2
引入了一种情感感知的跨模态对比学习策略,将音频和视觉嵌入对齐到共同的潜在空间,从而改善面部合成和情感分类。
- 3
开发了一种由对齐嵌入引导的条件潜在扩散模型,以生成时间一致且情感连贯的面部表情。
- 4
基于 Transformer 的多模态融合模块将生成的面部表示与语音特征结合,实现鲁棒的情感识别。
- 5
包括消融实验、统计显著性分析、跨说话者评估、跨数据集验证、噪声鲁棒性分析、时间一致性评估和计算复杂度分析在内的广泛实验,证明了所提框架的有效性。
章节摘要
文献综述
近年来,音频驱动的面部表情生成和多模态情感识别因其在情感计算和人机交互中的重要性而被广泛探索。早期方法依赖于语音特征与面部关键点之间的确定性映射,通常采用统计模型或基于回归的技术。然而,这些方法难以捕捉面部表情中复杂的时空动态和情感变化。随着
所提方法
本部分展示了所提的 DCL-MF 框架,用于基于声音生成面部表情和识别情感。图 1 展示了所提框架的整体结构。DCL-MF 框架由四个主要部分组成:(i)音频和视觉特征提取,(ii)对比跨模态表示学习,(iii)基于扩散的面部表情生成,以及(iv)用于情感识别的多模态融合。
图 1 中所示的面部动作单元模块旨在
实验评估
本部分对所提 DCL-MF 框架进行了全面而严格的评估。实验旨在评估:(i)跨模态表示的质量;(ii)面部表情生成的真实感和时间连贯性;(iii)情感识别的跨说话者鲁棒性;以及(iv)观测到的改进的统计准确性。
讨论
实验结果表明,所提框架的每个组件都贡献了互补的改进。对比学习缩小了语音和面部表示之间的语义差距,从而得到更强的情感感知嵌入。扩散生成器在保持时间连贯性的同时,生成了视觉真实的面部表情,优于确定性生成策略。此外,多模态融合模块有效地利用了互补的
结论与未来工作
本研究提出了一种 DCL-MF 框架,用于创建协作的音频驱动面部表情并识别情感。所提方法通过将对比跨模态对齐与基于扩散的生成建模相结合,成功解决了音频-视觉情感计算中的重要问题,如模态对齐不佳、情感表现力有限以及生成面部动态的时间不一致性。实现情感感知的共享潜在空间
CRediT 作者贡献声明
Preetam Suman:撰写 – 原稿,可视化,验证,软件,方法论,形式化分析,数据管理,概念构思。 Sasmita Padhy:撰写 – 原稿,可视化,验证,方法论,形式化分析,数据管理。 Naween Kumar:撰写 – 审阅与编辑,可视化,方法论,形式化分析。 Marwah A. Halwani:撰写 – 审阅与编辑,资源,方法论,形式化分析。 Ashish Khanna:撰写 – 审阅与编辑,项目管理,
利益冲突声明
作者声明,他们不存在已知的竞争性经济利益或个人关系,这些关系可能被认为会影响本文所报告的工作。
Preetam Suman | Sasmita Padhy | Naweeen Kumar | Marwah A. Halwani | Ashish Khanna | Ahmed Alyahya | Ahlam Almusharraf