面向语音抑郁严重程度评估的可靠性感知框架:多语料库整合、校准优化与可解释性研究

《Computers》:MindVoice: A Web-Based Multi-Dataset Speech Depression Screening System with Pipeline-Aware Grad-CAM Explainability

【字体: 大 中 小 】 时间:2026年09月24日 来源:Computers 5.2

编辑推荐:

   摘要

  

摘要

尽管基于语音的抑郁症评估已引起广泛关注,但实现可靠的置信度、跨语料库适用性以及预测解释仍具有挑战性。本研究提出了一种面向纯语音抑郁严重程度评估的可靠性感知框架,并通过MindVoice进行部署。将痛苦分析访谈语料库(DAIC)、扩展痛苦分析访谈语料库(E-DAIC)和多模态精神障碍分析开放数据集(MODMA)整合为一个三类别的异构多语料库跨语言数据集。同时对音频文本抑郁语料库(EATD)进行四类别评估。应用领域特定特征归一化以减少因数据集差异产生的变异。随后,通过方差分析(ANOVA)和改进的人工蜂群(ABC)特征优化对CNN提取的语音表示进行精炼,并由多层感知机(MLP)将样本分配到严重程度等级。为提高预测概率的可信度,使用准确度和期望校准误差对七种校准方法(温度校准、Platt(Sigmoid)校准、保序校准、向量校准、矩阵校准、Dirichlet校准和Beta校准)进行比较。通过固定权重组合(基于分箱的可靠性权重为0.7,熵权重为0.3)量化可靠性,并与其他可靠性评估方法进行对比。提出了一种流水线感知的梯度加权类激活映射方法,通过将sklearn组件重构为Tensorflow组件以实现在混合流水线中的梯度反向传播,从而实现解释。该框架在合并语料库上达到76.5%的准确率,其中DAIC、E-DAIC和MODMA分别达到81.4%、72%和80%的准确率,EATD在四类别分类中达到78.5%的准确率。该框架为异构数据集提供了有效分类。其以MindVoice应用形式部署于Web端,融入了可靠性感知和可解释预测,比仅关注性能的传统评估提供了更可信的系统。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号