评估大型语言模型用于精神病风险评估

《npj Digital Medicine》:Evaluating large language models for assessment of psychosis risk

【字体: 时间:2026年07月24日 来源:npj Digital Medicine 18.0

编辑推荐:

  精神病预防依赖于对处于精神病临床高风险(CHR-P)个体的早期检测。CHR-P状态的有效性在一定程度上受到限制,因为临床评估需要专家对叙述性访谈进行解读,限制了可扩展性。在此,研究人员评估了大型语言模型(LLMs;在大型文本语料库上训练的深度学习模型,用于处理

  
精神病预防依赖于对处于精神病临床高风险(CHR-P)个体的早期检测。CHR-P状态的有效性在一定程度上受到限制,因为临床评估需要专家对叙述性访谈进行解读,限制了可扩展性。在此,研究人员评估了大型语言模型(LLMs;在大型文本语料库上训练的深度学习模型,用于处理和生成语言)是否能够从这些访谈中提取临床有意义的信息以支持精神病风险评估。研究人员在来自373名参与者(77.7%为CHR-P)的678份部分PSYCHS访谈转录文本上评估了11个开放权重LLM。模型推断出CHR-P状态,并估计了15个症状领域的严重程度和频率,以研究者评分作为基准。较大的模型取得了最强的分类性能(Llama-3.3-70B:准确率=0.80,灵敏度=0.93,特异度=0.58)。LLM生成的症状评分与研究者评分显示出良好的相关性(ICCsev=0.74,ICCfreq=0.75)。在大多数人口统计学组中,性能差异很小,但不同站点间存在差异。生成的摘要大部分忠实于源转录文本,临床相关虚构(confabulation)率较低(3%)。错误主要反映了对非临床经历的过度病理化。虽然准确率随模型规模扩展,但较小的模型以显著更低的计算成本实现了有竞争力的性能。这些发现表明,开放权重LLM具有从心理测量访谈转录文本中评估精神病风险的潜力,支持可扩展的人类在环早期检测方法。
精神病(psychosis)占全球年轻人健康负担的10%,约80%的首发精神病患者之前存在可检测的临床高风险状态(CHR-P),其特征为减弱的精神病症状和功能损害。目前,CHR-P的评估依赖于半结构化访谈(如PSYCHS),虽然预测准确性高,但需要经过专门培训的临床医生花费大量时间(每次评估可达2小时),导致仅有5-14%的后续发展为精神病的个体在CHR-P阶段被识别,限制了预防性护理的覆盖范围。此外,症状解读存在主观性,不同评估者和站点间差异显著。因此,需要标准化、可重复且可扩展的评估工具。大型语言模型(LLM)在医疗文本处理中展现出潜力,但尚未有研究评估其用于结构化精神病风险评估的能力。该论文发表在《npj Digital Medicine》,研究人员系统评估了11个开放权重LLM在从心理测量访谈转录文本中提取精神病风险信息的表现,旨在探索LLM辅助评估的可行性和计算性能权衡。

主要方法包括:使用加速医学合作伙伴精神分裂症(AMP-SCZ)数据集(多站点国际临床高风险队列,包含373名参与者、678份部分PSYCHS访谈转录文本)。对每个症状领域(共15个,如不寻常思维与经历、听觉感知异常等)构建特定提示,结合链式思维(CoT)提示策略,要求LLM以结构化JSON格式输出严重程度和频率评分(0-6级)及简短证据摘要。模型本地部署于安全机构基础设施(如NVIDIA A100 GPU),采用确定性解码(温度0)以确保可重复性。输出经模式验证和自动修复后,与研究者评分进行对比评估,指标包括分类性能(准确率、灵敏度、特异度、F1、MCC)、相关性(Pearson r、ICC)、AUC、算法公平性(人口统计均等、均等化几率)以及专家评估摘要质量和系统性失败模式。计算性能权衡通过峰值GPU内存和令牌生成速度衡量。

**CHR-P分类**:通过LLM评分推断CHR-P状态,最大模型Llama-3.3-70B-Instruct(700亿参数)取得最佳整体准确率(0.802)和高灵敏度(0.934),但特异度较低(0.580)。灵敏度普遍较高,但较小模型(<100亿参数)的假阳性率更高,中等模型(100-300亿参数)在二者间取得较好平衡。在个体症状领域,模型在“不寻常思维与经历”和“听觉感知异常”上分类性能最佳(F1=0.80和0.77)。

**症状严重程度与频率评分**:LLM评分与研究者评分在严重程度和频率上均呈现良好相关性,大型模型(如Llama-3.3-70B:ICCsev=0.743,ICCfreq=0.748)与中等模型(如Qwen3-30B-A3B:rfreq=0.772)表现接近。大多数分歧发生在相邻序数类别,但模型在低分区间存在系统性高估趋势。在听觉(ICC=0.86)和视觉(ICC=0.84)感知异常领域相关性最强,在色情幻想(ICC=0.20)和躯体感知异常(ICC=0.37)领域最弱。

**算法公平性**:基于Llama-3.3-70B-Instruct的分析显示,年龄(18岁以下与以上)、种族、第一语言和性别间的性能差异较小,但非二元性别参与者存在更明显偏差(人口统计均等差异0.18)。站点间差异较大,58%的站点在真阳性率(TPR)上偏差超过0.10,提示招募策略或访谈风格的影响。

**专家评估LLM生成摘要**:专家基于随机选取的10%摘要(来自最佳模型)重新评分,其与LLM评分(r=0.87)和研究者评分(r=0.86)均高度相关。93.3%的摘要完整代表转录内容,2.7%存在影响评分的虚构(confabulation,通常为未报告的症状困扰或功能损害),无安全信息遗漏。系统性失败模式分析显示,53%的严重偏差案例中LLM将正常经历(如对不良经历的不信任感)过度病理化,27%因跨症状领域信息导致过度评分,13%的LLM评分实际上与转录文本一致,提示研究者评分可能使用了转录外信息。

**计算性能权衡**:模型性能(F1)与模型规模呈正相关(Spearman ρ=0.81),但大型模型需要更高峰值GPU内存(如Llama-3.3-70B需约80GB)且令牌生成速度较慢。中等模型(如gemma-3n-E4B-it)在较低内存消耗(21.13 GB)和较高吞吐量(~7.59 tokens/s)下取得有竞争力性能,适合资源受限场景。

讨论部分总结:开放权重LLM可从精神病风险访谈转录文本中提取和评分临床症状,最佳模型在CHR-P分类上达到80%准确率,症状评分与研究者评分相关性良好,接近训练有素评估者间的一致性(ICC约0.74-0.75)。高灵敏度但低特异度的模式在筛查场景中可接受,但需注意假阳性负担。算法公平性整体良好,但站点差异需通过本地化提示和持续审计解决。LLM生成的摘要忠实度高,但虚构和过度病理化问题需临床监督。计算性能权衡表明,中等模型在效率和性能间取得平衡,适合部署。研究结论翻译:研究人员的结果表明,开放权重LLM具有从研究访谈转录文本中评估精神病风险的潜力。虽然较大的LLM表现最佳,但较小的模型可能是计算效率高的替代方案。这些结果突出了LLM辅助评估在人类在环框架内大规模改善精神病预防的前景。
相关新闻
生物通微信公众号
微信
新浪微博

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号