带有强烈情感色彩的讲话会显示出与抑郁症及自杀风险相关的声学特征
《Journal of Affective Disorders》:Emotionally engaged speech reveals acoustic markers of depression and suicide risk
【字体:
大
中
小
】
时间:2026年09月04日
来源:Journal of Affective Disorders 5.7
编辑推荐:
摘要
背景
重度抑郁症存在一个连续谱,从健康状态到缓解阶段,再到活动性抑郁阶段。区分这些状态仍然具有挑战性,而且自我报告可能无法完全捕捉到自杀风险。客观指标,如语音,整合了情感、认知和运动过程,为细致的状态区分提供了一条有希望的途径。
方法
共有99名参与者(健康对照组、
摘要
背景
重度抑郁症存在一个连续谱,从健康状态到缓解阶段,再到活动性抑郁阶段。区分这些状态仍然具有挑战性,而且自我报告可能无法完全捕捉到自杀风险。客观指标,如语音,整合了情感、认知和运动过程,为细致的状态区分提供了一条有希望的途径。
方法
共有99名参与者(健康对照组、抑郁缓解组和抑郁发作组)完成了包含积极、中性和消极情绪内容的单词阅读、问题回答和故事阅读任务。提取了23个声学特征,并使用长短期记忆网络对它们进行建模,以实现三类别抑郁分类和二元自杀风险识别。通过五折交叉验证和Shapley加性解释来评估模型性能并进行模型解释。
结果
基于语音的建模能够可靠地区分抑郁状态,其中缓解状态的声学特征处于中间位置。问题回答任务在抑郁(75.89%)和自杀风险(78.03%)方面的准确率最高。情绪材料增强了组间区分度,积极和消极情绪的语音表现优于中性语音。特征分析显示,对于健康/低风险群体,能量(Energy)、Teager能量(Teager Energy)和频谱平坦度(Spectral Flatness)是关键指标;而对于抑郁/高风险群体,则是音高轨道(PitchTrack)、零交叉率(Zero-Crossing Rate)和特定的MFCCs(Mel Frequency Cepstrums)。
结论
具有情感吸引力的语音任务能够实现对抑郁状态的细致区分,并有助于识别自杀风险。抑郁缓解状态在声学上表现为一个独特的中间状态,而不是完全回归到正常模式,这突显了情感语音范式在可扩展的心理健康评估中的价值。
章节片段
关键信息
关于这一主题已知的研究成果。
基于语音的抑郁检测方法显示出潜力,但大多数研究依赖于二元病例对照设计和中性语音材料,对抑郁缓解状态或状态级别的区分关注较少。
本研究的新发现。
语音能够可靠地区分三种抑郁临床状态,缓解状态表现出部分正常化特征,同时仍有一些偏离健康语音的表现。具有情感吸引力的任务……
背景
重度抑郁症(MDD)越来越被认为是具有异质性和动态性的临床状况,其症状表现、疾病进程和功能结果存在显著差异(Fried和Nesse,2015)。尽管传统的诊断框架主要将抑郁定义为一种由综合征是否存在来定义的分类障碍,但临床和纵向证据表明……
实验设计与语音数据收集
语音数据是根据标准化协议收集的,旨在描述不同抑郁状态下语音产生的状态依赖性和风险相关变化。重度抑郁症患者的录音在珠江医院心理治疗科进行,而健康对照组参与者则在南方医科大学心理学系的隔音实验室中接受评估。在两种环境中,环境噪声水平都……
伦理批准
该研究方案已获得南方医科大学伦理委员会的审查和批准(批准编号:NFYKDX003)。所有参与者及其法定监护人都在全面了解研究程序后签署了书面知情同意书(如适用)。该研究已在中国临床试验注册中心(ChiCTR2400083328)注册,并按照透明报告多变量预测模型个体预后的要求进行
问题回答任务
问题回答材料的制定基于已建立的心理学问卷和文献,确保了设计的系统性和情感相关性。每种情感状态(消极、中性、积极)包含八个问题,共计24个项目。向每位参与者提出三个问题,以引发有意义但非侵入性的回答(见补充文件1,材料1)。
单词阅读任务
单词阅读材料选自《中国情感词库》……
人口统计数据的统计结果
人口统计变量,包括年龄、性别、居住地、教育水平、家庭经济状况、独生子女情况、主要身体疾病、家族精神病史、家族自杀史、熟人自杀史和童年留守经历,在表1和表2中进行了总结。在这些变量中,只有教育水平在整体比较中显示出统计学上的显著差异(p = 0.008)。然而,后续的成对比较没有发现显著差异……
基于语音的抑郁临床状态区分
本研究结果表明,基于语音的建模能够有效区分健康对照组、抑郁缓解状态和抑郁发作状态的个体,支持抑郁状态的 multi-class 表示方式。在任务层面,问题回答任务的准确率最高(75.89%,p < 0.05),其次是单词阅读任务
局限性
尽管本研究取得了一些进展,但仍存在一些局限性需要考虑。首先,样本量虽然足够进行交叉验证,但限制了其在更广泛人群和临床环境中的普适性。当前样本主要由年轻普通话使用者组成,可能无法反映语言、文化或年龄相关的多样性。此外,语音数据是在高度控制的实验室条件下、使用标准化录音程序收集的。
结论
本研究表明,具有情感吸引力的语音任务能够实现对抑郁临床状态的细致区分。抑郁缓解状态在声学上表现为一个独特的中间状态,而不是完全回归到健康语音模式。同样的基于语音的方法还支持跨抑郁状态的自杀风险识别,表明自杀脆弱性可以独立于症状定义的抑郁严重程度来检测。
CRediT作者贡献声明
林群星:撰写——原始草稿、方法论、调查、形式分析。吴晓华:方法论、调查、数据整理。黄珊:软件、调查。雷岳轩:方法论、调查。程婉莹:可视化、调查、形式分析。梅一灵:调查。王伟杰:调查、形式分析。李崇:撰写——原始草稿。赵继波:撰写——审阅与编辑、监督、资金筹集。
资助
本研究得到了国家自然科学基金(资助编号:72174082和82373695)、广东省自然科学基金(资助编号:2023A1515011825)以及粤港精神疾病联合实验室(资助编号:2023B1212120004)的支持。
利益冲突声明
作者声明没有已知的财务利益或个人关系可能影响本文所报告的工作。
林群星|吴晓华|黄珊|雷岳轩|程婉莹|梅一灵|王伟杰|李崇|赵继波中国南方医科大学公共卫生学院心理学系数字心理健康与风险识别和控制实验室
生物通微信公众号
生物通新浪微博
今日动态 |
人才市场 |
新技术专栏 |
中国科学人 |
云展台 |
BioHot |
云讲堂直播 |
会展中心 |
特价专栏 |
技术快讯 |
免费试用
版权所有 生物通
Copyright© eBiotrade.com, All Rights Reserved
联系信箱:
粤ICP备09063491号