
-
生物通官微
陪你抓住生命科技
跳动的脉搏
面向自适应座舱照明的连续音乐情感识别多模态框架
《Scientific Reports》:A multimodal framework of continuous music emotion recognition for adaptive cockpit lighting
【字体: 大 中 小 】 时间:2026年09月09日 来源:Scientific Reports 4.9
编辑推荐:
摘要持续音乐情绪识别仍对数据集偏移和不完善的歌词对齐较为敏感。我们提出了 Cockpit-EmoNet,该方法通过双向交叉注意力、特征级门控以及联合回归–对齐学习,将冻结的 MERT 声学编码器与部分微调的 GTE 文本编码器相结合。在合并的 PMEmo–DEAM 基准测试上
持续音乐情绪识别仍对数据集偏移和不完善的歌词对齐较为敏感。我们提出了 Cockpit-EmoNet,该方法通过双向交叉注意力、特征级门控以及联合回归–对齐学习,将冻结的 MERT 声学编码器与部分微调的 GTE 文本编码器相结合。在合并的 PMEmo–DEAM 基准测试上,Cockpit-EmoNet 的情感度(valence)PCC/CCC 达到 0.69/0.67,唤醒度(arousal)PCC/CCC 达到 0.81/0.79。在五次运行中,它显著降低了相对于仅使用交叉注意力(Cross-Attention Only)的歌曲级误差(\(p_{\textrm{adj}}<0.001\)),并改善了所有域内和跨数据集的评估设置。一项离线座舱照明分析进一步表明,较低的 VA 预测误差与较小的颜色及过渡偏差相关。受控的座舱验证进一步为下游照明应用提供了初步的物理与感知证据。