《Diagnostics》:Explainable AI in Healthcare: A Holistic View of Technical Approaches, Regulatory Frameworks, Reliable Clinical Implementation Insights and Limitations
编辑推荐:
摘要:生物医学应用中不透明的深度学习模型带来了与偏见、公平性和监管合规性相关的挑战。本文基于2019年至2026年间在Scopus、Web of Science和PubMed数据库中进行的有针对性筛选,呈现了一篇关于医疗健康领域中可解释人工智能(XAI)的叙述
摘要:生物医学应用中不透明的深度学习模型带来了与偏见、公平性和监管合规性相关的挑战。本文基于2019年至2026年间在Scopus、Web of Science和PubMed数据库中进行的有针对性筛选,呈现了一篇关于医疗健康领域中可解释人工智能(XAI)的叙述性综述,特别聚焦于医学诊断。涵盖的主题包括模型可解释性,涉及基于图像的模型和多模态模型,并重点关注作为难以解释系统的大型语言模型(LLMs)。本综述将XAI置于关键监管框架内,包括欧盟(EU)人工智能(AI)法案,强调了可解释性如何支撑对透明度、可审计性和问责制的法律要求。它审视了广泛使用的XAI方法,如Shapley加性解释(SHAP)、局部可解释模型无关解释(LIME)、注意力可视化、神经符号推理等。这些技术有助于识别偏见、检测虚假相关性,并分析LLM部署中的幻觉现象。它们代表了一种努力,在可行范围内最小化这些问题,并增加对预测结果的信心,同时不放弃在医学分类循环中进行清晰且适当的验证。在强调XAI优势的同时,本综述也指出了关键局限性,包括有限的解释保真度、认知过载以及误导性解释的风险。总体而言,它提供了一个简洁的综合,说明可解释性如何与伦理、法规和系统设计相交织,以支持医疗AI中的监督和透明度。此外,它还提出了在当前立法和指南中纳入技术性XAI方法的建议,以为AI模型部署提供一个稳健的框架。
1. 引言
本节定义了可解释性、可理解性、透明度、可信赖性、可靠性、问责制和公平性等关键术语。指出人工智能(AI)正通过提供高级计算模型快速变革医疗保健,但这些模型的“黑箱”特性限制了信任和临床采纳。可解释性对于临床医生验证AI决策、符合伦理标准以及遵守欧盟AI法案等法规至关重要。本综述旨在全面审视XAI技术方法及其在医疗保健中的适用性,并强调其如何弥合复杂AI模型与透明度需求之间的差距。文中举例说明了AI改善患者预后的案例,如在中国同济医院,LLM辅助阿尔茨海默病诊断使准确率提升6%,评估时间平均减少37分钟。此外,还介绍了Brainomix和骨视图技术等商业医疗解决方案。文章讨论了获取CE标志需遵守欧盟AI法案第48条,但该法案未规定具体XAI机制,而是采用技术中立方式。本综述试图填补现有立法中关于具体XAI方法实施的空白,并提供技术框架建议。
2. 材料与方法
本研究是一项叙述性综述,文献检索覆盖2019年至2026年7月20日,使用了Scopus、Web of Science、ScienceDirect和PubMed数据库。检索策略基于关键词组合,限定于标题、摘要、关键词和全文。排除非英语论文,优先考虑在欧盟境内开展并包含外部验证的同行评审研究。筛选由单一审阅者完成,并使用Zotero 9.0.6管理文献。写作过程中使用了语言支持工具(Microsoft Copilot with GPT-5和Grammarly)来提升清晰度和表达风格。
3. AI在医疗保健中的相关性
本节通过图表展示了AI相关出版物数量的快速增长趋势。主要区分了三种模态:传统图像模型、多模态模型以及新兴的LLM。
3.1 基于图像的模型
涵盖了多种医学影像模态,如全切片成像(WSI)、X光、正电子发射断层扫描(PET)、磁共振成像(MRI)、超声、计算机断层扫描(CT)和光学相干断层扫描(OCT)。例如,Yuan等人基于CheXpert数据集实现了0.93的曲线下面积(AUC);Suk等人结合MRI和PET在阿尔茨海默病诊断中达到93.52%的准确率;He等人提出的VISTA3D模型能够自动分割3D CT扫描。这些模型通常基于卷积神经网络或Transformer架构,缺乏可直接解释的决策路径,因此需要XAI方法提供透明度。
3.2 多模态模型
多模态模型整合了来自组学数据、影像、实验室结果、电子健康记录(EHR)等多种输入,以更贴近临床实践的多方面特性。例如,结合原癌基因数据与CT影像可改善非小细胞肺癌患者的免疫治疗预测;在心脏病学中,植入式心律转复除颤器(ICD)可利用AI基于人口统计学变量和生理数据进行个性化风险预测。由于这些模型融合了多个数据源,其决策背后的推理过程未知,因此可解释性对于提供背景和有效证明至关重要。
3.3 大型语言模型(LLM)
本节详细介绍了从早期模型(如BioLinkBERT、DRAGON、BioMedLM、PubMedBERT、BioGPT)到近期通用模型的发展历程。重点描述了各种基准数据集(MedQA、MedMCQA、PubMedQA、MMLU)和性能指标。例如,Med-PaLM2在MedQA上达到86.5%的准确率,Gemini-Med达到91.1%。文章阐述了Medprompt提示工程技术,包括零样本、少样本、思维链(CoT)和k近邻(kNN)等方法,最终使ChatGPT-4达到90.2%的准确率。截至2026年8月,顶级通用模型在MedQA上的表现已趋于饱和,排行榜已于2026年4月归档。从人类反馈中强化学习(RLHF)被用于调整LLM以适应人类偏好,从而构建更个性化的医疗模型。
4. 可信赖性、透明度和可解释性的重要性
成功实施AI医疗依赖于信任和可靠性。可解释性有助于培养信任,因为它允许临床医生理解和验证AI推荐。“聪明的汉斯”现象和Zech等人的跨医院肺炎X光分类研究说明了模型可能依赖虚假相关性(如医院元数据)而非有效的影像特征,导致外部验证时性能显著下降。可解释性不仅能增强信心,还能帮助发现训练过程中的偏差和现实世界中的错配。此外,LLM存在“幻觉”问题,即生成完全不准确的答案。MedFuzz算法表明,这些模型可能易受攻击,其答案并非基于扎实的医学知识,而是源于虚假相关性。XAI方法有助于进行回顾性调查和错误检测。
5. 生物医学伦理学原则
基于Beauchamp和Childress的《生物医学伦理学原则》,阐述了尊重自主性、行善、不伤害和公正四个原则。可解释性通过提高黑箱模型的透明度,增强了患者与医生共同决策中的自主性,支持行善和不伤害原则,并通过在资源匮乏地区提供更可靠的AI辅助诊疗来促进公正原则。世界卫生组织(WHO)也提供了相应的伦理和治理准则。
6. 现行立法
要获得CE标志,医疗设备必须遵守欧盟AI法案第48条,该条款链接至第9至15条。截至2026年8月,法案的实施时间表已被《数字综合法案》(2026/1744号条例)修改:附件III中的独立高风险AI系统要求推迟至2027年12月2日执行,附件I中的嵌入式系统推迟至2028年8月2日执行。高风险AI系统需在欧盟数据库中注册,但目前该数据库尚未投入运营。文章概述了第9至15条的核心要求,包括风险管理、数据治理、技术文档、记录保存、透明度、人工监督以及准确性、鲁棒性和网络安全。可解释模型有助于满足这些要求,特别是第13条(透明度)和第14条(人工监督)。此外,还需遵守其他并行法规,如NIS2网络安全指令、《网络弹性法案》和《版权指令》。
7. XAI对伦理和监管要求的潜在贡献
可解释性方法可以增强透明度,部分支持欧盟AI法案第13条的落实。虽然该法案未强制规定具体XAI技术,但诸如显著性图、注意力图和SHAP值等方法可以帮助部署者解释模型输出和理解系统限制。这种增加的透明度也有助于增强用户的自主性。
8. 探索性数据分析与可解释性的技术方法
本节提供了一个详尽的XAI方法分类法,涵盖四大类:
8.1 探索性数据分析
包括经典统计方法(如T分数和Z分数在骨密度评估中的应用)、降维技术(主成分分析PCA、线性判别分析LDA、独立成分分析ICA)和聚类方法(K均值、层次聚类、高斯混合模型GMM、基于密度的空间聚类DBSCAN)。这些方法有助于简化数据和揭示潜在模式,但可能牺牲语义可解释性。
8.2 白箱模型
指内在可解释的模型,如决策树、广义线性模型(GLM)、广义加性模型(GAM)、贝叶斯模型和支持向量机(SVM)。文章讨论了模型复杂度与可解释性之间的权衡,指出应针对特定任务选择最低必要复杂度。集成模型(Bagging、Boosting、Stacking、Voting)虽能提升性能,但会降低可解释性。深度学习模型尽管性能高,但本质上是黑箱,需要监控工具。
8.3 模型无关方法
包括LIME、SHAP和RISE等方法。LIME通过扰动输入特征生成局部代理模型来解释单个预测,已在心脏疾病预测和X光肺炎检测中得到应用。SHAP基于博弈论中的Shapley值,通过公平分配每个特征的贡献来解释模型输出,并满足局部准确性、缺失性和一致性三个性质,已用于脑梗死预测。RISE是一种基于随机掩码遮挡的方法,已应用于三维CT脑出血检测,生成的可视化热图能够准确定位出血区域。