面向语音抑郁严重程度评估的可靠性感知框架:多语料库整合、校准优化与可解释性研究
《Computers》:MindVoice: A Web-Based Multi-Dataset Speech Depression Screening System with Pipeline-Aware Grad-CAM Explainability
【字体:
大
中
小
】
时间:2026年09月24日
来源:Computers 5.2
摘要
尽管基于语音的抑郁症评估已引起广泛关注,但实现可靠的置信度、跨语料库适用性以及预测解释仍具有挑战性。本研究提出了一种面向纯语音抑郁严重程度评估的可靠性感知框架,并通过MindVoice进行部署。将痛苦分析访谈语料库(DAIC)、扩展痛苦分析访谈语料库(E-DAIC)和多模态精神障碍分析开放数据集(MODMA)整合为一个三类别的异构多语料库跨语言数据集。同时对音频文本抑郁语料库(EATD)进行四类别评估。应用领域特定特征归一化以减少因数据集差异产生的变异。随后,通过方差分析(ANOVA)和改进的人工蜂群(ABC)特征优化对CNN提取的语音表示进行精炼,并由多层感知机(MLP)将样本分配到严重程度等级。为提高预测概率的可信度,使用准确度和期望校准误差对七种校准方法(温度校准、Platt(Sigmoid)校准、保序校准、向量校准、矩阵校准、Dirichlet校准和Beta校准)进行比较。通过固定权重组合(基于分箱的可靠性权重为0.7,熵权重为0.3)量化可靠性,并与其他可靠性评估方法进行对比。提出了一种流水线感知的梯度加权类激活映射方法,通过将sklearn组件重构为Tensorflow组件以实现在混合流水线中的梯度反向传播,从而实现解释。该框架在合并语料库上达到76.5%的准确率,其中DAIC、E-DAIC和MODMA分别达到81.4%、72%和80%的准确率,EATD在四类别分类中达到78.5%的准确率。该框架为异构数据集提供了有效分类。其以MindVoice应用形式部署于Web端,融入了可靠性感知和可解释预测,比仅关注性能的传统评估提供了更可信的系统。
生物通微信公众号
生物通新浪微博
今日动态 |
人才市场 |
新技术专栏 |
中国科学人 |
云展台 |
BioHot |
云讲堂直播 |
会展中心 |
特价专栏 |
技术快讯 |
免费试用
版权所有 生物通
Copyright© eBiotrade.com, All Rights Reserved
联系信箱:
粤ICP备09063491号