可解释人工智能在皮肤科诊断中对临床医生与非专业人员的不同影响

《Nature Medicine》:Divergent impacts of explainable AI for dermatological diagnosis on clinicians versus lay people

【字体: 时间:2026年08月05日 来源:Nature Medicine 52.5

编辑推荐:

  人工智能(AI)正日益渗透到医疗保健领域,从作为医生助手到推动消费者应用。AI算法的黑箱特性使得人类与AI算法交互的能力面临挑战。为克服这一局限,可解释人工智能(XAI)提供了对AI决策过程的洞察,但证据表明XAI可能反而在人类决策过程中引入偏差。研究人员报告

  
人工智能(AI)正日益渗透到医疗保健领域,从作为医生助手到推动消费者应用。AI算法的黑箱特性使得人类与AI算法交互的能力面临挑战。为克服这一局限,可解释人工智能(XAI)提供了对AI决策过程的洞察,但证据表明XAI可能反而在人类决策过程中引入偏差。研究人员报告了两项大规模实验的结果,分别涉及623名非专业人员和153名初级保健医生(PCPs),实验中结合了基于公平性的皮肤科诊断AI模型和不同的基于XAI的解释,以考察XAI辅助,特别是多模态大语言模型(LLMs),如何影响诊断表现。通过公平性约束模型训练,一个在肤色间实现均衡表现的AI模型的辅助,提高了非专业人员和PCPs的最终诊断准确率,并减少了与肤色相关的表现差异。在此设置下,LLM解释产生了不同效果:非专业用户表现出更高的自动化偏差——当AI模型提供的诊断正确时准确率提升,但当模型出错时准确率下降;而经验丰富的PCPs则保持韧性,无论AI模型的准确率如何都从中受益。此外,在人类决策前呈现AI模型的诊断可能导致更强的锚定偏差。这些发现强调了XAI基于人类专业知识和AI预测提供时间的不同影响,揭示了LLM可作为医疗AI中的“双刃剑”,并为未来人类-AI协作系统设计提供启示。
**可解释人工智能在皮肤科诊断中对临床医生与非专业人员的不同影响:一项大规模实验研究**

**研究背景**
人工智能(AI)在医疗领域的应用日益广泛,皮肤科是其中发展迅速的领域之一,已有Nevisense和DermaSensor等获得美国食品药品监督管理局(FDA)批准的工具。皮肤疾病主要通过图像评估诊断,而全国皮肤科医生短缺,有效AI辅助可改善早期检测并减少不必要的就诊。同时,面向公众的AI诊断界面(如Google Lens)也被提出,以帮助普通公众做出知情医疗决策。可解释人工智能(XAI)旨在提升AI的可用性和采纳率,在皮肤科中,常用的XAI技术包括梯度加权类激活映射(GradCAM)和基于内容的图像检索(CBIR),以及近期兴起的多模态大语言模型(LLMs)。然而,先前研究表明XAI可能增加人类对AI的过度依赖,且人-AI协作医疗决策并不总是优于单独人类或AI决策。关于医学经验是否能改善人-AI协作诊断尚无共识,部分研究显示医学知识有助于更好的AI韧性,也有研究认为差异甚微,甚至AI可能误导人类导致更差诊断结果。随着皮肤科AI工具扩展,理解不同XAI方法(尤其是LLMs)如何影响普通公众和医学专家的诊断准确率至关重要。

**研究目的**
针对上述问题,研究人员设计了两项大规模实验,系统探究不同XAI方法和人-AI决策范式如何影响不同专业水平(普通公众和初级保健医生PCPs)的诊断表现。研究基于临床图像的皮肤疾病诊断真实场景,考察AI辅助的整体有效性、减少肤色间表现差异的效果,以及准确率-置信度校准。同时比较正确与错误的多模态LLM解释与传统XAI方法,并分析个体在AI遵从度上的差异对诊断表现的影响,以及人-AI决策范式(人类优先与AI优先)对诊断结果的影响。

**主要技术方法**
研究人员采用随机化被试间因子设计(4×2),共招募623名普通公众(来自Prolific和Facebook群组)和153名初级保健医生(PCPs,来自波士顿医疗中心、斯坦福大学等临床网络及平台),另招募320名医学生作为对照。研究1为二分类任务(黑色素瘤与痣),研究2为开放式鉴别诊断(四种主要皮肤病:特应性皮炎、玫瑰糠疹、莱姆病和皮肤T细胞淋巴瘤CTCL)。AI模型使用公平性约束的深度学习模型(条件域对抗神经网络CDANN),分别基于ViT-B/32(研究1)和DenseNet-121(研究2)训练,确保肤色间性能均衡。四种XAI方法包括:基础(预测与置信度)、GradCAM(热力图)、CBIR(视觉相似案例)和基于GPT-4V的多模态LLM(文本解释)。两种决策范式为人类优先(先人类决策,后AI建议)和AI优先(先看AI建议,再决策)。所有参与者评估12张临床图像,每张进行两轮决策。

**研究结果**

**1. 先进AI提升普通公众表现,LLM解释放大遵从度**
AI辅助使普通公众的黑色素瘤检测平均准确率从69.7%提升至75.8%(β=0.061,P<0.001),且肤色间诊断差异相对减少46.9%(从3.2%降至1.7%)。LLM解释带来最大提升(+7.7%),但正确AI预测时提升最大(+13.4%),错误AI预测时降低也最大(-21.1%),表明LLM放大了非专业人员对AI的遵从倾向,无论AI准确与否。非专业人员对LLM解释的信任度高于其他方法,尤其在解释质量低时更明显,且错误LLM解释破坏了置信度-准确率校准。

**2. PCPs可靠利用正确AI指导,同时抵御LLM解释的错误**
对于PCPs,AI辅助使top-1准确率从11.5%提升至33.0%(+21.5%),top-3准确率提升43.5%,肤色间差异从4.5%降至2.7%。与普通公众相反,错误AI预测对PCPs最终决策影响极小(所有XAI方法均无显著下降),表明PCPs依赖自身专业知识。医学生与PCPs的比较显示,医学生更易受AI误导,更高专业水平关联更谨慎的AI采纳。LLM解释对PCPs准确率提升最小(+17.7%),但改善了置信度-准确率校准,甚至在错误AI预测下仍保持校准优势。

**3. 更高AI遵从度与更低初始表现相关**
完全遵从AI(即只有AI正确时才正确)的参与者,在无AI辅助时初始准确率显著低于非遵从者(普通公众:65.8% vs. 72.5%,P<0.001;PCPs:差异显著,P<0.001)。LLM导致普通公众中完全遵从比例最高,而PCPs中比例最低。

**4. 将AI决策置于人类决策前放大遵从度**
AI优先范式下,非遵从者表现仍更好,但AI优先增加了遵从参与者比例(普通公众平均+8.4%,PCPs中LLM增加最多+19.0%),表明AI优先可能引发更强锚定偏差。

**5. 案例分析:人类与AI的互补优势**
AI在疾病表现细微时优于人类,但在非典型症状或意外特征时表现较差;人类在AI错误时仍能正确诊断。

**讨论与结论**
本研究通过两项大规模实验,揭示了不同XAI方法和人-AI决策范式对皮肤科协作诊断的影响。AI辅助显著提升诊断准确率并减少肤色差异,但LLM作为“双刃剑”对非专业人员带来过度依赖风险,而PCPs凭借医学专业知识形成“认知防火墙”。研究结论强调:医疗XAI系统需根据用户专业知识量身定制,避免“一刀切”;应采用“人类优先”工作流以保留独立推理、减少锚定偏差;需设计自适应系统处理个体AI遵从度差异,对高遵从用户提供迭代解释或触发二次意见。
论文发表期刊:*Nature Medicine*。
研究结论翻译:总之,我们的工作展示了在皮肤科诊断中使用XAI(尤其是LLMs)的潜力与挑战。AI协作可提高诊断准确率和公平性,但PCPs与普通公众使用AI辅助的显著差异表明需要精心设计系统。这些发现应推广至其他医学领域,并在AI系统中纳入更多患者信息(如病史、环境)加以验证。未来工作应聚焦于使解释对不同用户有帮助,同时鼓励批判性思维。
相关新闻
生物通微信公众号
微信
新浪微博

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号