《Journal of the American Medical Informatics Association》:Artificial intelligence-based diagnostic decision support for primary care of older adults using collective intelligence and imitation learning
编辑推荐:
目的:老年人在初级保健中面临不成比例的诊断错误风险,然而有效的诊断决策支持系统(DDSS)仍然缺乏。现有基于人工智能(AI)的DDSS依赖于难以获取的金标准标签,诊断范围狭窄,且未能反映现实世界的不确定性。研究人员利用模仿学习和集体临床智能开发并验证了一种深度
目的:老年人在初级保健中面临不成比例的诊断错误风险,然而有效的诊断决策支持系统(DDSS)仍然缺乏。现有基于人工智能(AI)的DDSS依赖于难以获取的金标准标签,诊断范围狭窄,且未能反映现实世界的不确定性。研究人员利用模仿学习和集体临床智能开发并验证了一种深度学习DDSS,用于生成诊断和医嘱建议。
材料与方法:研究人员在来自≥65岁成年人初级保健就诊的结构化和非结构化电子健康记录数据上训练了一个多标签神经网络,以模仿临床医生的决策。模型在一个时间留出的测试集上使用区分度、校准度、基于阈值和复合指标进行评估。通过一项随机、盲法等效性研究评估临床有效性,将模型生成的推荐与观察到的临床医生决策进行比较。
结果:研究纳入了707 598次初级保健就诊,生成了涵盖669种诊断和1000项医嘱的建议。通用模型表现出色(微观c统计量0.995 [95% CI 0.995-0.996],宏观c统计量0.896 [0.888-0.897],微观F1分数0.904 [0.903-0.905],宏观F1分数0.384 [0.381-0.385],综合校准指数(ICI)0.0025 [0.0024-0.0026])。医嘱预测性能较低(微观c统计量0.812 [0.811-0.814],宏观c统计量0.786 [0.777-0.786],微观F1分数0.305 [0.303-0.307],宏观F1分数0.0286 [0.0277-0.0294],ICI 0.0145 [0.0141-0.0150])。在临床医生验证中,模型推荐与实际实践之间的诊断分歧在统计学上等效,而医嘱分歧则不然。
结论:模仿学习和集体临床智能提供了一个可行的框架,可以在无需专家裁定的训练标签的情况下生成反映真实世界实践的诊断和医嘱建议。随机、盲法的临床医生评估务实地在传统回顾性指标之外建立了初步的临床有效性。
论文解读
研究背景与问题
老年人在初级保健中面临不成比例的诊断错误风险,每年约5%的美国成年人经历门诊诊断错误,其中约半数可能导致严重伤害。尽管诊断卓越已成为患者安全的重要优先事项,但在这一人群中仍缺乏普遍适用的有效干预证据。现有基于人工智能(AI)的诊断临床决策支持系统(CDSS)存在三大局限:一是大多依赖金标准训练标签,但在初级保健中因诊断不确定性而难以获得;二是疾病特异性AI工具无法覆盖初级保健广泛的诊断范围;三是大多数诊断错误源于常见疾病的遗漏而非罕见病,且老年人的诊断谱系与年轻人群不完全重叠。此外,现有系统未能反映医患沟通的迭代过程。
研究内容与结论
研究人员引入了一种模仿学习框架,利用集体智能模拟真实世界的临床决策。该框架借鉴行为经济学中的描述性规范,预测同行临床医生在给定患者特征下会做出的诊断和医嘱选择,而非预测客观的真实诊断。研究人员训练并时间验证了一个基于AI的诊断CDSS,旨在模仿集体医师智慧,促进老年人的诊断卓越。
该研究具有重要的方法论意义:它证明了在没有专家裁定金标准标签的情况下,利用模仿学习和集体临床智能生成反映真实实践的建议是可行的。通过随机、盲法的临床医生评估,在传统回顾性指标之外建立了初步的临床有效性,为未来临床部署提供了依据。
关键技术方法
研究人员从美国宾夕法尼亚大学医学中心(Penn Medicine)单一学术医疗系统的电子健康记录(EHR)中提取数据,涵盖2015年7月1日至2023年6月30日期间65岁及以上患者的初级保健就诊记录。数据集按年份划分:训练数据为2015年7月至2021年6月,验证数据为2021年7月至2022年6月,测试数据为2022年7月至2023年6月。研究人员使用了两种方法从非结构化文本中提取特征:一是PyMetaMap软件库(UMLS MetaMap工具的Python封装)提取体征和症状相关的临床概念;二是BioClinicalBERT文档嵌入模型将文本转换为向量嵌入。所有结构化和非结构化特征向量被拼接成一个2738维的输入表示,目标变量为诊断和临床医嘱,构成多标签分类任务。研究人员训练了两种深度神经网络模型:通用模型在全数据集上训练,同行推荐模型则在通过社会网络分析识别的诊断专家子集上进行微调。
研究结果
研究人群:研究队列包括63 176名老年人,贡献了707 598次初级保健就诊。中位年龄74.2岁,63.2%为女性,29.2%为非裔美国人。预测任务涵盖669种诊断和1000项医嘱,最常见的诊断为高血压(50.9%)、血脂异常(36.2%)和糖尿病(35.3%)。
基于网络的同行推荐诊断专家识别:在437名受访临床医生中,93人回应(回应率23%),每人提名中位数6名同行。基于多种中心性度量,25名临床医生被分类为同行推荐的诊断专家。
预测性能:通用模型在诊断方面表现出优异的区分能力,微观c统计量为0.995,宏观c统计量为0.896。阈值性能保持较高水平,微观阳性预测值(PPV)@25%为0.925,F1分数@25%为0.904。医嘱预测性能显著低于诊断,通用模型微观c统计量为0.812,宏观c统计量为0.786。校准方面,通用模型表现最佳,诊断的综合校准指数(ICI)为0.00247,医嘱为0.0145。与XGBoost基准相比,通用神经网络模型在诊断和医嘱的宏观平均区分度上表现更优。
敏感性分析:特征消融显示,既往诊断对预测性能贡献最大。模型性能在不同患者亚组间保持一致,包括年龄、性别、种族和财务类别。
随机、盲法临床医生审查:10名初级保健临床医生审查了799次就诊。对于诊断,每例就诊的中位复合分歧数在各组间相似(通用模型:1,同行推荐模型:1,实际实践:1)。诊断分歧落在预先设定的等效范围内。相比之下,医嘱分歧超出了等效范围。在按常见老年疾病分层的事后分析中,各条件下的诊断分歧率相似。
讨论与结论
研究人员开发和验证了使用集体智能和模仿学习训练的深度神经网络模型,用于推荐初级保健环境中老年人的诊断和医嘱。这些模型并非学习专家裁定的标签,而是复制观察到的临床医生行为,反映了诊断决策固有的不确定性。
研究表明,模仿学习是利用现成EHR数据进行CDSS开发的可行途径。通用模型的强性能表明,即使在没有专家监督的情况下,从集体临床实践中学习也能产生高质量的建议。诊断预测的高性能可能归因于慢性病的稳定性和可预测性,而医嘱预测的较低性能则反映了临床决策中更大的变异性。
结论指出,模仿学习和集体临床智能提供了一个可行的框架,可以在无需专家裁定训练标签的情况下生成反映真实世界实践的诊断和医嘱建议。随机、盲法的临床医生评估务实地在传统回顾性指标之外建立了初步的临床有效性。