可解释人工智能决策支持工具的临床可用性及多模态模型在非小细胞肺癌(NSCLC)中的评估

《Nature Medicine》:Clinical usability of an explainable AI decision support tool and evaluation of multimodal models in NSCLC

【字体: 时间:2026年09月14日 来源:Nature Medicine 52.5

编辑推荐:

  尽管经过十年发展,非小细胞肺癌(NSCLC)的免疫治疗(IO)选择仍主要依赖于亚组分析和并不完美的程序性死亡配体1(PD-L1)及临床评分。据研究人员所知,I3LUNG(NCT05537922)目前是最大的国际真实世界、多模态、基于人工智能(AI)的研究,共纳

  
尽管经过十年发展,非小细胞肺癌(NSCLC)的免疫治疗(IO)选择仍主要依赖于亚组分析和并不完美的程序性死亡配体1(PD-L1)及临床评分。据研究人员所知,I3LUNG(NCT05537922)目前是最大的国际真实世界、多模态、基于人工智能(AI)的研究,共纳入2,396例患者。研究人员将真实世界临床与血液(CB)数据、计算机断层扫描(CT)图像、数字病理学(DP)和基因组学整合到机器学习早期融合(MLEF)和深度学习中间融合(DLIF)模型中。仅基于CB的机器学习(ML)和深度学习(DL)模型在各结局中表现一致,在测试(TEST)集中的曲线下面积(AUC)最高达0.77。外部验证(EXVAL)中的性能下降可能反映了人群差异(AUC范围:0.55–0.72)。在独立TEST集中,AI模型显著超过了PD-L1、美国东部肿瘤协作组体能状态(ECOG PS)、中性粒细胞/淋巴细胞比值(NLR)、乳酸脱氢酶(LDH)和肺免疫预后指数(LIPI)评分。临床可用性研究表明,肺癌专家和非专家医生使用基于可解释AI(XAI)的ML(仅CB)工具后,预测能力均有所提高。尽管使用MLEF(CB+CT+DP)的多模态整合与更高性能相关,但其增量获益仍不确定,未在TEST和EXVAL中体现。I3LUNG项目是一个开创性框架,展示了AI工具的临床实用性。目前正在超过2,000例患者中开展决策支持系统(包括CB和多模态)的前瞻性验证。
**论文解读:I3LUNG研究——可解释AI决策支持工具与多模态模型在NSCLC免疫治疗中的临床评估**

**研究背景与问题**
免疫治疗(IO)已改变了晚期非小细胞肺癌(NSCLC)的治疗格局,但仅有20%–30%的患者获得长期获益,且多数面临原发或继发耐药。目前临床主要依赖程序性死亡配体1(PD-L1)表达、体能状态(ECOG PS)、中性粒细胞/淋巴细胞比值(NLR)、乳酸脱氢酶(LDH)及复合评分LIPI等进行疗效预测,但这些指标预测效能有限。近年基于AI的方法尝试整合影像、病理、基因组等多模态数据,但已有研究样本量小(约250–300例)、多为中心或单中心设计,缺乏外部验证和临床可用性评估。因此,I3LUNG(NCT05537922)项目在国际多中心框架下,旨在利用真实世界多模态数据开发并验证可解释的AI决策支持系统(PDSS),以优化NSCLC患者的IO治疗选择。

**研究设计与核心发现**
I3LUNG是目前最大的国际真实世界、多模态、基于AI的研究,纳入2012年9月至2023年10月期间来自6个中心的2,396例IIIC–IVB期NSCLC患者,包括欧盟内4个中心(INT-意大利、MH-希腊、GHD-德国、VHIO-西班牙)和欧盟外2个中心(UOC-美国、SZMC-以色列)。研究人员整合了CB数据(性别、ECOG PS、吸烟状态、PD-L1表达、转移部位、NLR和LDH)、CT影像、数字病理(DP)和基因组学数据,构建了机器学习早期融合(MLEF)和深度学习中间融合(DLIF)两类模型,并进行了公平性审计、可解释性分析(SHAP)和临床可用性研究。结果显示,仅依赖常规CB数据的ML和DL模型在独立TEST集中预测结局稳健,AUC最高达0.77,且显著优于PD-L1、ECOG PS、NLR、LDH和LIPI评分。多模态整合在交叉验证中显示出探索性增益,但未在TEST和外部验证(EXVAL)中一致重现。临床可用性研究表明,在XAI支持下,肺癌专家和非专家医生的预测准确性均显著提升。该研究发表在《Nature Medicine》,为AI工具在NSCLC免疫治疗中的实际临床应用提供了系统性框架,目前正在2,000余例患者中进行前瞻性验证。

**主要关键技术方法**
研究基于I3LUNG回顾性队列(NCT05537922),样本来自6个国际中心共2,396例,另设非IO对照队列(C-EGFR-INT、C-EGFR-UOC、C-StageIII-CHT、C-LineI-CHT)。方法包括:提取9项假设驱动的CB特征;CT影像采用PyRadiomics(PYRAD)和基础模型(FMRAD)提取特征;DP采用Prov-GigaPath基础模型;基因组学编码核心驱动基因(KRAS、TP53、STK11、ALK、EGFR、RET、ROS1)。ML采用逻辑回归/随机森林早期融合(MLEF)与Cox生存模型;DL采用基于注意力多实例学习(MIL)的中间融合(DLIF)并处理缺失模态。可解释性使用SHAP,公平性采用均衡几率(equalized odds),临床可用性采用两阶段医生评估设计。

**研究结果**
**1. 基于ML的仅CB模型提供稳健的IO结局预测(ML-based CB-only models provide robust IO outcome prediction)**
在C23合并队列(n=2,075)中,仅CB的ML模型对OS24、OS6和DCR的AUC在TEST分别达0.74、0.69和0.71,在EXVAL中分别为0.60、0.64和0.55,表明常规血液和临床数据即可捕获大部分预后信号。

**2. 多模态整合在MLEF中显示出探索性增益(Multimodal integration showed exploratory gains with MLEF)**
在交叉验证中,CB+DP+PYRAD或CB+DP+FMRAD组合在OS24和DCR上显著优于匹配的仅CB模型(如OS24 AUC 0.72 vs 0.60),但在独立TEST中未一致重现,提示其增量价值尚不确定。

**3. 生存分析在各队列中实现一致预测(Survival analysis achieved consistent prediction across cohorts)**
仅CB的Cox模型在C23队列的C-index在CV、TEST和EXVAL中分别为0.64、0.66和0.65;多模态CB+DP+FMRAD在CV中优于仅CB匹配模型(C2队列0.74 vs 0.63),但TEST和EXVAL中未体现。

**4. 多模态方法在NSCLC特定亚组中获得性能提升(Multimodal approaches gain performance in NSCLC-specific subgroups)**
在IO单药、PD-L1≥50%等亚组中,多模态模型的AUC显著高于仅CB匹配模型(如IO单药OS24 AUC 0.91 vs 0.54),提示特定临床情境下多模态可能更有价值。

**5. DL模型在仅CB任务中与ML表现相似,多模态整合未带来额外获益(DL models performed similarly to ML for CB-only models with no added benefit from multimodal integration)**
DL仅CB模型在TEST上对OS24、OS6和DCR的AUC分别为0.73、0.72和0.70,与ML相当;DLIF加入多模态后各结局均无显著改善,且替代融合架构结果类似,说明限制可能来自数据异质性而非模型架构。

**6. ML和DL仅CB模型优于单一生物标志物,且比LIPI评分能更好地分层患者(ML and DL CB-only models outperformed single biomarkers and better stratified patients than the LIPI score)**
在TEST中,ML和DL模型对OS24的AUC(0.74和0.73)显著高于PD-L1(0.53)、ECOG PS(0.62)、LDH(0.58)和NLR(0.66);Cox-ML和Cox-DL的C-index(0.65和0.63)均优于LIPI(0.55),并能更好地区分低、中、高风险组。

**7. ML模型在IO队列中的预测性能高于CHT和EGFR队列(ML models showed greater predictive performance in IO cohorts compared to CHT and EGFR cohorts)**
在四个非IO队列(两个EGFR-TKI队列和一个新辅助化疗队列)中,模型对缓解终点(ORR)的AUC波动在0.50–0.58,显著低于IO队列,提示模型可能捕捉了IO特异性的预测模式而非单纯预后。

**8. 对ML仅CB模型的公平性评估显示各中心间敏感性存在差异(Fairness evaluation of the ML CB-only models revealed variability in sensitivity across centers)**
以中心为受保护属性时,MH中心的OS6预测敏感性(TPR=0.96)显著高于其他中心;以性别为受保护属性时无显著差异。Cox模型按种族的C-index差异无统计学意义,但提示部署前需进行公平性校准和中心特定验证。

**9. ML仅CB模型的XAI分析与已知预后因素一致(XAI analysis for ML CB-only models aligns with established prognostic factors)**
SHAP分析显示,ECOG PS>0、骨转移、肝转移和脑转移是OS24的强负性预后因素,NLR对OS24和OS重要,高LDH影响DCR无应答预测,与临床认知一致。

**10. 医生–XAI协作改善了预测表现(Physician–XAI collaboration improved predictions)**
20名医生(10名肺癌专家、10名非专家)对100例TEST/EXVAL病例进行两阶段评估。在XAI辅助下,DCR预测敏感性从0.72升至0.87(P=0.0011),准确性从0.57升至0.65(P=0.0431);OS正确预测概率提高36%,医生间一致性从轻微(κ=0.11)改善至中度(κ=0.48)。

**讨论与结论**
讨论部分指出,I3LUNG是迄今最大规模、国际多中心、真实世界的NSCLC IO多模态AI研究。仅CB模型的稳健性提示常规临床数据已包含大量预后信息,而多模态整合的增益未能在独立验证中重现,可能受限于完整多模态样本量少、回顾性数据异质性以及完全病例分析的选择偏倚。与既往小规模多模态研究(如Vanguri等、Captier等)相比,I3LUNG提供了更全面的验证框架,并首次包含临床可用性研究。公平性审计揭示了中心间敏感性差异,提示部署前需进行站点特定校准。医生–XAI协作研究证明了XAI在真实临床场景中提升决策的潜力。

研究结论翻译:I3LUNG表明,经过整理的真实世界临床数据在预测NSCLC免疫治疗结局方面优于传统单一生物标志物。尽管该研究为回顾性设计,其临床可用性研究为未来在真实世界临床环境中评估PDSS实用性和XAI分析提供了可重复、结构化的参考框架,与FUTURE-AI框架一致。多模态整合虽有前景,但其附加价值仍需验证。为推动模型进入临床实践,正在实施临床转化路径,包括正在进行的多模态模型可用性研究2.0、在2,000例患者中的静默前瞻性验证,以及计划中的务实随机试验以支持监管审批,预计2–3年内完成部署。
相关新闻
生物通微信公众号
微信
新浪微博

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号