《Journal of the American Medical Informatics Association》:Artificial intelligence-based diagnostic decision support for primary care of older adults using collective intelligence and imitation learning
编辑推荐:
**目的**:老年人在初级保健中面临不成比例的诊断错误风险,然而有效的诊断决策支持系统(diagnostic decision support systems, DDSSs)仍然缺乏。现有基于人工智能(artificial intelligence, AI)的
**目的**:老年人在初级保健中面临不成比例的诊断错误风险,然而有效的诊断决策支持系统(diagnostic decision support systems, DDSSs)仍然缺乏。现有基于人工智能(artificial intelligence, AI)的DDSSs依赖难以获取的金标准标签,诊断范围狭窄,且未能反映真实世界的不确定性。研究人员利用模仿学习和临床医生集体智慧,开发并验证了一种深度学习DDSS,用于生成诊断和医嘱推荐。
**材料与方法**:研究人员在≥65岁成人的初级保健就诊中,利用结构化与非结构化电子健康记录数据训练了一个多标签神经网络,以模仿临床医生的决策。模型通过判别力、校准、基于阈值和复合指标在时间外测试集上进行评估。临床有效性通过一项随机、盲法等效性研究进行评估,该研究将模型生成的推荐与观察到的临床医生决策进行比较。
**结果**:研究纳入707,598次初级保健就诊,生成覆盖669种诊断和1,000项医嘱的推荐。通用模型表现出优异的性能(微平均c统计量0.995 [95% CI 0.995-0.996],宏平均c统计量0.896 [0.888-0.897],微平均F1分数0.904 [0.903-0.905],宏平均F1分数0.384 [0.381-0.385],综合校准指数(integrated calibration index, ICI)0.0025 [0.0024-0.0026])。医嘱预测性能较低(微平均c统计量0.812 [0.811-0.814],宏平均c统计量0.786 [0.777-0.786],微平均F1分数0.305 [0.303-0.307],宏平均F1分数0.0286 [0.0277-0.0294],ICI 0.0145 [0.0141-0.0150])。在临床医生验证中,诊断分歧在模型推荐与观察到的实践之间达到统计学等效,而医嘱分歧则未达到等效。
**结论**:模仿学习和集体临床医生智慧为生成反映真实世界实践的诊断和医嘱推荐提供了一个可行的框架,无需专家裁决的训练标签。随机、盲法临床医生评估以超越传统回顾性指标的方式务实确立了初步临床有效性。
**论文解读:基于模仿学习与集体智慧的老年人初级保健AI诊断决策支持系统**
**一、研究背景与问题**
老年人是诊断错误的高危人群。据估计,美国每年约有5%的门诊患者经历诊断错误,其中约半数可能导致严重伤害。老年人因合并症负担高、医疗复杂性大、在临床数据集中代表性不足以及认知障碍干扰病史采集等因素,面临更高的诊断错误风险。尽管诊断卓越已成为患者安全的重要优先事项,但针对这一人群的有效干预措施仍缺乏普遍适用的证据。现有基于人工智能(artificial intelligence, AI)的临床决策支持系统(clinical decision support systems, CDSSs)虽有望弥补这一缺口,但将其转化为有临床意义的床旁应用仍面临多重挑战。
当前诊断CDSS存在四个主要问题:第一,大多数系统依赖金标准训练标签,然而在初级保健中,由于诊断不确定性,获取明确标签往往代价高昂甚至不可行;第二,疾病特异性AI工具无法覆盖初级保健广泛而多样的诊断范围,后者可能涉及成百上千种疾病和诊断类别;第三,大多数诊断错误并非源于罕见病,而是源于对常见疾病的忽视,且老年人诊断谱与年轻人群并不完全重叠,需要针对年龄特定人群的定制工具;第四,多数诊断CDSS未能反映塑造诊断推理的医患间迭代沟通过程,尤其在依赖照护者提供病史的老年患者中更为突出。
**二、研究目标与开展的工作**
针对上述挑战,研究人员提出了一种模仿学习(imitation learning)框架,利用集体智慧(collective intelligence)对真实世界临床决策进行建模。该框架并非预测单一正确诊断,而是基于描述性规范(descriptive norms),预测同行临床医生在给定患者特征条件下会做出的诊断和医嘱选择,而非客观金标准。研究目标有三:其一,利用结构化与非结构化电子健康记录(electronic health record, EHR)数据,训练并验证一个基于模仿学习和集体智慧策略的深度学习CDSS,生成推荐的诊断和医嘱;其二,通过同伴提名的社会网络分析,识别“同行推荐”的初级保健诊断专家队列,并利用这些专家医生的就诊数据对通用模型进行微调;其三,受图灵测试启发,采用新颖的1b期随机、盲法、等效性研究设计,在临床部署前评估模型推荐的临床有效性,并与真实临床医生的实践进行比较。
**三、关键技术与方法**
研究数据来源于美国单一学术医疗系统Penn Medicine的EHR,涵盖2015年7月1日至2023年6月30日的初级保健就诊,纳入对象为≥65岁成人,共707,598次就诊。数据按时间划分训练集、验证集和测试集,以模拟真实部署场景。输入特征包括结构化数据(人口统计学、医疗利用、实验室检查、生命体征、诊断、药物)和非结构化数据(临床笔记)。非结构化文本通过两种方法处理:一是使用PyMetaMap提取症状相关临床概念,二是使用BioClinicalBERT文档嵌入模型生成向量表示。所有特征拼接为2,738维输入向量,目标变量为就诊期间记录的诊断和医嘱,构成多标签分类任务。研究人员使用PyTorch构建了一个多任务、多标签的前馈深度神经网络,同时预测诊断和医嘱。训练了“通用模型”和“同行推荐模型”两种模型,后者则使用社会网络分析识别出的25位同行推荐诊断专家的就诊数据进行微调。模型性能通过判别力(c统计量)、阈值指标(PPV, F1)、校准指标(ICI、斜率、截距)和复合指标(sBrier、R2、对数损失)评估,并用1000次bootstrap重抽样估计95%置信区间。临床有效性验证采用随机、盲法设计,由10名初级保健临床医生对799次测试就诊的模型推荐与真实实践进行评审。
**四、主要研究结果**
**1. 研究人群与标签分布**:研究队列包含63,176名老年人,贡献707,598次就诊,中位年龄74.2岁,女性占63.2%,黑人占29.2%。预测任务包含669种诊断和1,000项医嘱。最常见的诊断为高血压、血脂异常和糖尿病;最常见的医嘱为综合代谢面板、血脂筛查和血红蛋白A1c。标签患病率高度右偏,仅少数标签出现在≥5%的就诊中。
**2. 同行推荐医生识别**:通过社会网络分析,在437名被调查临床医生中,93人响应(23%响应率),基于多种中心性指标,25名临床医生被归类为同行推荐诊断专家。
**3. 预测性能**:通用模型在诊断预测上表现出优异判别力(微平均c统计量0.995,宏平均0.896,微平均F1@25%为0.904),校准良好(ICI 0.00247)。医嘱预测性能较低(微平均c统计量0.812,宏平均0.786),校准较差。同行推荐模型在所有指标上均低于通用模型。
**4. 基准比较**:与XGBoost基准相比,通用神经网络在诊断和医嘱的微平均判别力上相似,但在宏平均判别力上更高,表明其对低患病率类别的性能更好。
**5. 敏感性分析**:特征消融显示,既往诊断史对预测性能贡献最大,移除后诊断宏平均c统计量从0.896降至0.651;其他结构化与非结构化特征的影响较小。
**6. 患病率分层与亚组分析**:模型性能与标签患病率强相关。诊断任务中,高患病率类别判别力接近完美;医嘱任务中,判别力在各患病率层中较稳定但精确度受患病率影响。模型性能在年龄、性别、种族、支付类别及训练集是否见过的亚组中保持一致。
**7. 随机盲法临床评审**:对于诊断,通用模型和同行推荐模型与观察到的临床实践之间的分歧数均落在预设等效界值内(均值差异分别为-0.31和-0.33,90% CI均包含在±1以内);对于医嘱,两种模型的分歧均超过等效界值(均值差异分别为-1.3和-1.4),未达到等效。分层分析显示,在常见老年疾病(COPD、痴呆、帕金森病、卒中/TIA、心衰)中,诊断分歧率与观察实践无显著差异。
**五、讨论与结论**
这项研究表明,模仿学习和集体临床医生智慧为利用现有EHR数据开发CDSS提供了可行路径。模型对常见疾病的预测性能最强,而大多数诊断错误正发生于常见疾病。时间划分的验证方式反映了真实部署场景,且在新见患者中性能一致。随机、盲法评审证实了生态效度,即模型生成的诊断推荐与真实临床医生决策在评审者看来同等合理。
然而,研究也揭示了几点重要启示:一是医嘱预测性能低于诊断预测,可能反映医嘱行为的异质性和缺乏定制医学术语;二是对同行推荐医生进行微调并未提高整体判别力,提示通用模型已捕获大量诊断结构;三是模仿学习可能存在风险——如果集体实践中编码了系统性偏见(如种族、性别、保险方面的差异),模型可能将其大规模复制。因此,模仿学习应持续接受外部验证、公平性评估和专家审查。
研究局限性包括:将超过1,600个ICD-10编码映射为669个诊断类别降低了罕见疾病的粒度;模型仅预测单次就诊而未纳入纵向轨迹;EHR文档实践差异可能引入偏见;时间划分导致部分患者同时出现在训练和测试集中(但亚组分析显示性能一致);罕见标签在测试集中缺失;临床评审仅涉及10名评审者,且评估的是与临床医生判断的一致性而非绝对诊断准确性。未来工作应使用专家裁决参考标准、前瞻性临床部署和公平性感知方法进一步评估。
总之,研究人员训练并验证了利用结构化与结构化EHR数据推荐诊断和医嘱的深度神经网络模型。该方法不是寻找唯一正确诊断,而是生成与集体临床实践最一致的推荐,承认初级保健决策的迭代性和不确定性。在临床部署中,该模型将使用历史和实时EHR及症状数据,作为面向临床医生的决策支持工具,无需专门技术专业知识。未来需通过专家裁决标准、前瞻性研究和公平性方法进一步验证其改善诊断表现的潜力,而不仅仅是复现现有实践。