《Nature Biomedical Engineering》:CLEAR: an auditable foundation model for radiology grounded in clinical concepts
编辑推荐:
‘黑箱’深度学习模型用于医学影像解读限制了临床信任与性能退化分析。研究人员在此介绍概念级嵌入用于可审计放射学(CLEAR),一个基于临床概念的可审计基础模型。该模型在来自239,391名患者的超过87万图像-报告对上进行训练,学习视觉表征并将胸部X光片投影到一
‘黑箱’深度学习模型用于医学影像解读限制了临床信任与性能退化分析。研究人员在此介绍概念级嵌入用于可审计放射学(CLEAR),一个基于临床概念的可审计基础模型。该模型在来自239,391名患者的超过87万图像-报告对上进行训练,学习视觉表征并将胸部X光片投影到一个由大语言模型嵌入(LLM embeddings)定义的语义丰富空间中,使每个预测可分解为来自单个放射学观察的加权贡献。在来自美国、欧洲和亚洲的四个大型、经医师标注的数据集上进行的外部验证表明,CLEAR不仅实现了最先进的分类性能,还支持若干应用:可审计的零样本病理检测、放射学混杂因素的系统性识别以及从数据驱动概念创建专家级概念瓶颈模型(concept bottleneck models, CBMs)。通过将临床知识直接整合到其推理过程中,CLEAR提供了一个框架,用于稳健的模型审计、更安全的部署以及增强的医师–AI协作,朝着可信赖的医学AI迈进。
**研究背景、问题与意义**
在美国,医学影像错误每年导致估计4万至8万例可预防性死亡,放射学误诊影响高达每10名患者中的1例。诊断影像年支出超过1000亿美元,而解读错误导致重复扫描、治疗延迟和医疗事故成本每年超过40亿美元。尽管端到端机器学习在放射学任务(如疾病进展预测、组织分割、发现分类、生存预测、医学报告生成和多模态态势感知)中取得了显著进展,基础模型也可利用大规模未标记训练图像处理多种临床任务,但这些模型的决策过程和预测特征对即使经验丰富的放射科医生而言也大部分不可解释,且未必基于既定的临床概念或生物学过程。这种缺乏透明度不仅是学术关注,还使模型容易从数据中的混杂因素学习虚假相关性,导致泛化能力需要被信任而缺乏对性能退化潜在原因的洞察。为促进目标应用中的审计,可解释模型(如概念瓶颈模型CBMs)使用领域特异性、专家标注的概念来指导预测,但CBMs存在重要局限:概念选择常反映报告撰写者的主观性和约束,既非全面也非最优,难以扩展,且需密集概念标注,性能通常低于端到端模型,尚未成功应用于医学零样本图像分类。研究人员开展本研究,旨在利用放射学社区集体知识(封装在公开放射学报告中)构建一个全面且语义丰富的概念空间,用于胸部X光片(CXR)解读,开发可审计的基础模型CLEAR,该模型具有可分解的预测能力,支持零样本分类、数据审计和概念干预,并实现专家级可解释模型构建。论文发表在《Nature Biomedical Engineering》。
**主要关键技术方法**
研究人员从MIMIC-CXR、CheXpert-Plus和ReXGradient数据集(共873,342个图像-报告对,来自239,391名患者)中,利用大语言模型(LLM)提取368,294个放射学观察作为概念,经去重和规范化后形成概念空间。通过对比学习(CLIP架构)预训练DINOv2图像编码器和文本编码器,将CXR和报告映射到共享语义空间。在推理时,计算图像与所有概念之间的余弦相似度,得到概念相似度向量,再通过矩阵乘法投影到LLM嵌入空间(如SFR-Embedding-Mistral),生成基于概念的图像嵌入。零样本分类使用正负提示对(如“atelectasis”与“no atelectasis”)进行softmax归一化。线性探测使用逻辑回归在冻结的CLEAR嵌入上训练。数据审计通过原型嵌入差异分析识别概念差异。概念干预通过保留特定临床相关概念(如纵隔概念)并重新拟合线性分类器实现。概念瓶颈模型(CBM)通过数据驱动方法选择68个高质量概念,训练标准CBM和CLEAR CBM,并与三位经委员会认证的放射科医师比较。
**研究结果**
**Auditable zero-shot classification of diverse findings(可审计的多样化发现零样本分类)**
CLEAR通过将每个CXR编码为与368,294个临床观察的相似度向量,再投影到LLM嵌入空间,并使用正负提示对进行零样本分类。在VinDr-CXR(3,000张图像,21个发现)、PadChest(7,943张图像,55个发现)和Indiana(7,466张图像,30个发现)三个外部数据集上,CLEAR的零样本AUROC平均分别为78.2%、70.0%和优于CheXzero、BiomedCLIP、OpenAICLIP。在VinDr-CXR上,CLEAR显著优于CheXzero(P<0.01),尤其在“结节/肿块”、“肺肿瘤”、“肺纤维化”和“无发现”等类别。在PadChest上,CLEAR平均AUROC 70.0%,优于CheXzero(66.8%)、BiomedCLIP(59.2%)和OpenAICLIP(52.0%)。通过概念审计图,CLEAR能识别导致预测误差的语义概念,例如在肺炎检测中,PadChest测试集误差率最高的图像簇包含“间质性肺模式”和“舌叶肺不张”,这与Fleischner协会指南中识别的已知混杂因素一致。
**CLEAR improves concept-based image representations for training models(CLEAR改善了基于概念的图像表征用于训练模型)**
研究人员使用MIMIC-CXR训练集标签对CLEAR的图像嵌入进行线性探测,并在CheXpert测试集上评估。CLEAR在10个病理分类中平均AUROC达87.0%,显著优于CheXzero(71.8%)、BiomedCLIP和OpenAICLIP,例如肺不张AUROC 87.6%、实变90.5%、胸腔积液94.5%等。CLEAR还展现了良好的概率校准(ECE=0.072)。通过概念重要性分析,研究人员发现纵隔增大(EC)分类中最重要的概念实际上是肺不张相关,提示训练数据中存在混杂(MIMIC-CXR中EC标签常与肺不张共现)。通过概念干预——仅保留49,167个纵隔相关概念——CLEAR的EC分类AUROC从0.727提升至0.784(相对提升7.8%),干预后概念重要性完全由临床适当的纵隔概念驱动(如纵隔轮廓增宽、主动脉增宽)。这种诊断-干预-改进工作流在端到端黑箱模型中完全不可能实现。
**Expert-level inherently interpretable model building(专家级内在可解释模型构建)**
研究人员从368,294个概念中通过数据驱动方法选择68个高质量概念(使用MIMIC-CXR线性探测排名和GPT-4.1筛选),构建标准CBM和CLEAR CBM。在CheXpert测试集上,两种CBM对五种竞赛病理(肺不张、心脏肥大、实变、水肿、胸腔积液)的诊断性能与三位经委员会认证的放射科医师相当。CLEAR CBM在肺不张上MCC为0.587,显著优于放射科医师(0.546)和标准CBM(0.520);在实变上F1分数(0.264)显著低于放射科医师(0.386);心脏肥大、水肿和胸腔积液无显著差异。在外部数据集(VinDr-CXR、PadChest、Indiana)上,CLEAR CBM在心脏肥大、水肿和胸腔积液上AUROC均≥0.900,在所有放射学发现上≥0.800。CLEAR CBM的ECE值为0.007–0.040,优于标准CBM。
**Radiologist evaluation of concept clinical relevance(放射科医师对概念临床相关性的评估)**
三位经委员会认证的放射科医师(9、10、15年经验)对CLEAR顶级概念进行盲法评估,89.8%的概念被评为诊断相关,0%被评为数据集伪影(Fleiss’ κ=0.749)。CLEAR CBM的概念归因与既定放射学推理一致,例如肺不张中强调“双侧基底肺不张”、“肺容积双侧较低”等直接征象,而标准CBM给“左侧大量胸腔积液”等非特异性或潜在混杂特征赋予高权重;水肿中CLEAR强调“肺血管充血”、“广泛肺水肿”等特征,并适当降低“左上叶钙化结节”等无关发现权重。
**讨论总结与结论翻译**
讨论部分指出,大多数医学影像分析工具通过端到端机器学习方法提取模式,忽视了放射学报告中蕴含的丰富信息。CLEAR利用最大公开可用的放射学特异性配对CXR-报告数据集(约23万项研究,2011–2016年收集)进行大规模临床概念挖掘,开发了高性能、可审计的基础模型。概念级审计是CLEAR的关键进步:每个预测可展示最具影响力的临床观察,使放射科医师能够以与既定诊断推理一致的方式检查、批评和情境化模型输出。CLEAR的概念嵌入在零样本识别中表现出色,在外部分类基准上常优于最先进视觉-语言基础模型,同时通过概念审计保持可解释性。在概念归因分析中,研究人员发现肺不张相关概念主导了MIMIC-CXR数据集中纵隔增大的分类,揭示了潜在标签共现导致的虚假相关性,而CLEAR通过概念干预实现了可测量的诊断改进。CLEAR还识别了放射学文献中记录的真正临床诊断挑战(如肺炎检测中间质性肺模式和舌叶肺不张作为混杂因素)。研究人员进一步展示了基于数据驱动选择的概念子集可构建达到专家级性能的CBM,表明性能与可解释性之间的权衡可能通过精心选择概念和表征学习来克服。局限性包括:概念空间来源于公开数据集,可能无法完全捕捉全球或专科临床环境中的多样性;概念-图像映射是相关性的而非因果或空间可追溯的;不同LLM嵌入模型的选择会影响概念对齐和下游性能,未来需系统评估。
**研究结论**:通过将临床知识直接整合到推理过程中,CLEAR提供了一个框架,用于稳健的模型审计、更安全的部署以及增强的医师–AI协作,朝着可信赖的医学AI迈进。