决策解释的最优呈现方式:可解释性与系统可靠性对会话式AI辅助医学诊断绩效的影响研究

《Frontiers in Psychology》:Optimal presentation of decision explanations: investigating the effects of explainability and reliability on medical diagnostic performance with conversational AI

【字体: 大 中 小 】 时间:2026年09月25日 来源:Frontiers in Psychology 3.8

编辑推荐:

  摘要专业翻译 引言: 人工智能黑箱中决策理由的有效且高效呈现,仍是制约会话式AI在医学诊断中应用的关键因素。本研究探讨了决策解释格式与系统可靠性对医生诊断行为的影响。 方法: 开展了一项包含22名临床医生识别复杂肺部疾病的模拟诊断实验。操纵了四种解释格式和两种

  
摘要专业翻译 引言: 人工智能黑箱中决策理由的有效且高效呈现,仍是制约会话式AI在医学诊断中应用的关键因素。本研究探讨了决策解释格式与系统可靠性对医生诊断行为的影响。 方法: 开展了一项包含22名临床医生识别复杂肺部疾病的模拟诊断实验。操纵了四种解释格式和两种系统可靠性水平。测量了诊断准确率、任务完成时间、主观认知负荷(Subjective Cognitive Load, SCL)、信任评分(AI Trust Rating, ATR)及用户偏好。 结果: 解释格式对诊断准确率无显著影响,但对任务完成时间(Task Completion Time, TCT)、主观认知负荷和信任评分有显著影响。任务完成时间上观察到解释格式与系统可靠性之间存在显著交互效应。决策树解释产生的认知负荷最低,而流程图解释在两种可靠性条件下均导致最长的任务完成时间。高亮文本获得了最高的信任评分和主观偏好得分。系统可靠性与解释格式在人机协同诊断中发挥了互补作用,不同解释格式的效率随可靠性条件的变化而有所不同。 讨论: 上述发现凸显了决策解释格式与系统可靠性在会话式AI中的联合作用,为医疗AI界面的设计与优化提供了实证依据。

论文解读

一、研究背景与问题提出

随着大语言模型(Large Language Models, LLMs)的快速发展,会话式人工智能(conversational AI)凭借其接近人类自然语言交互的形态和较低的学习成本,被逐步引入医疗咨询、临床辅助诊断、医学教育及长期健康管理等诸多医疗实践环节。已有研究表明,会话式AI在缓解医生工作负荷、弥补临床经验不足以及提升诊断决策绩效方面具有显著潜力,尤其对于经验较少的临床医生和高误诊风险的诊断场景更为明显。
然而,在涉及复杂疾病的诊断情境中,会话式AI的实际部署仍面临重大挑战。其中最为突出的障碍之一,是医生对AI生成的诊断结论理解有限、信任不足。即便AI系统能够给出专业上合理且逻辑连贯的诊断建议,如果其决策背后的推理依据无法被医生充分理解,医生仍可能选择忽视或谨慎采纳这些输出。这一问题很大程度上源于现有AI系统决策过程透明度不足,其推理逻辑难以在有限时间内被人类用户理解和验证。学界将这一属性称为AI可解释性(explainability),即AI系统以人类用户可理解的形式呈现其决策理由和推理过程的能力。
尽管已有大量研究提出多种解释方法,如局部可解释模型无关解释(Local Interpretable Model-agnostic Explanations, LIME)和沙普利加性解释(SHapley Additive exPlanations, SHAP)等,但这些方法大多聚焦于局部信息或孤立线索的呈现,其适用性主要体现在结构相对简单或决策路径明确的任务场景中。在复杂疑难疾病的诊断中,医生往往需要对AI系统提供的多维信息进行整合性推理,这超越了评估单个特征重要性的范畴,要求理解并整合不同层级信息之间的关系。更重要的是,已有研究指出,AI可解释性的有效性在很大程度上取决于人机界面层面的交互设计,这对解释性信息的视觉组织提出了更高要求。
此外,AI系统的可靠性(reliability)也被广泛认为是影响医生信任和使用行为的另一关键因素。已有研究发现,用户对自动化系统的信任高度依赖系统可靠性,一旦出现错误,信任水平会迅速下降,且即使系统性能随后恢复稳定,信任也往往难以完全修复。在医疗领域,医生和患者对AI系统错误的容忍度普遍低于对人类医生错误的容忍度,这一现象被称为算法厌恶(algorithm aversion)。然而,可靠性与可解释性之间的关系并非简单的线性关系:高可靠性的AI系统更易建立医生的初始信任,而设计良好的可解释机制可能部分弥补系统可靠性不足所导致的信任损失。因此,不同解释呈现格式的有效性如何随AI可靠性变化而变化,目前尚缺乏充分的理解。
基于上述研究背景,本研究以肺部病变的典型鉴别诊断任务为实验场景,设计了一项模拟实验,考察在不同系统可靠性水平下,不同的AI解释格式如何影响医生的任务绩效和主观态度,旨在刻画复杂诊断任务情境下解释格式的特征,阐明可靠性与可解释性共同影响人机协同绩效的机制,为会话式AI在临床诊断支持中的设计和应用提供实证依据。

二、研究设计与关键方法

本研究采用4×2被试内设计。自变量A为决策解释格式,包含四种条件:决策树、流程图、表格和高亮文本。这四种格式代表了组织解释性信息的不同策略:决策树强调层级和分支关系,流程图强调流程和因果关系,表格便于分类比较,高亮文本在保留上下文信息的同时突出关键证据。自变量B为会话式AI的可靠性水平,分为高可靠性和低可靠性两个水平,通过在实验中设置不同的错误诊断建议频率来操纵。
研究人员共招募了22名全科医生参与实验,被试年龄27至39岁(M=32.6,SD=4.43),均具有两年以上临床经验。实验基于Docus.ai系统构建了原型界面,将四种决策解释方案嵌入其中。正式实验包含8个实验区块,对应预定义的条件组合,区块呈现顺序在被试间进行平衡以抵消练习效应和顺序效应。每个区块内包含5个诊断试次,每位被试共完成40个试次。每个试次中,被试先阅读患者临床资料(限时90秒),随后进入AI辅助诊断界面,查看AI的诊断结果和建议措施,并查看诊断过程的解释信息以确认病情,最终从三个选项中做出诊断判断。每个区块完成后,被试填写主观量表并休息3分钟。
研究收集的诊断绩效指标包括任务完成时间和诊断准确率;主观评价指标包括采用NASA-TLX方法测量的认知负荷、基于TrAAIT模型的5点李克特量表测量的AI信任评分,以及通过直接询问收集的主观偏好。数据分析采用重复测量方差分析(repeated-measures ANOVA),解释格式和AI可靠性作为被试内因素,分别对行为指标和主观指标进行分析。显著性水平设为0.05,多重比较采用Bonferroni校正。

三、研究结果

3.1 诊断准确率
解释格式对参与者的诊断准确率无显著影响,F(3, 63)=1.026,p>0.05。AI可靠性对诊断准确率有显著主效应,F(1, 21)=12.571,p<0.05。解释格式与可靠性之间的交互效应不显著,F(3, 63)=0.957,p>0.05。进一步分析表明,高可靠性条件下的诊断准确率(M=0.975,SD=0.042)显著高于低可靠性条件(M=0.955,SD=0.068)。
3.2 任务完成时间
解释格式对任务完成时间有显著主效应,F(3, 63)=9.879,p<0.001。AI可靠性也有显著主效应,F(1, 21)=5.653,p<0.05。解释格式与可靠性之间的交互效应显著,F(3, 63)=5.054,p<0.05。简单效应分析显示,在低可靠性条件下,流程图条件的任务完成时间(M=112.56,SD=26.32)显著长于决策树(M=107.03,SD=24.08)、表格(M=91.14,SD=15.63)和高亮文本条件(M=96.08,SD=15.40)。在高可靠性条件下,流程图条件的任务完成时间(M=98.78,SD=18.59)也显著长于高亮文本(M=87.34,SD=14.29)、决策树(M=79.01,SD=16.36)和表格条件(M=85.21,SD=17.43)。在四种格式中,决策树条件在高可靠性下产生了最短的任务完成时间。总体而言,无论可靠性水平如何,流程图格式的决策解释始终导致最长的任务完成时间。
3.3 主观认知负荷
解释格式对参与者的主观认知负荷有显著主效应,F(3, 63)=17.011,p<0.001。AI可靠性的主效应不显著,F(1, 21)=0.774,p>0.05。解释格式与可靠性之间的交互效应不显著,F(3, 63)=0.906,p>0.05。事后比较显示,决策树条件下的主观认知负荷(M=6.87,SD=1.03)显著低于高亮文本(M=7.92,SD=1.58)、表格(M=7.34,SD=1.32)和流程图条件(M=8.35,SD=1.49)。
3.4 信任评分
解释格式对信任评分有显著主效应,F(3, 63)=4.636,p<0.05。AI可靠性也有显著主效应,F(1, 21)=19.862,p<0.001。解释格式与可靠性之间的交互效应不显著,F(3, 63)=0.534,p>0.05。事后比较表明,高亮文本条件的信任评分(M=4.17,SD=1.03)显著高于表格(M=3.02,SD=0.82)、流程图(M=3.53,SD=0.69)和决策树条件(M=4.05,SD=0.78)。此外,高可靠性条件下的信任评分(M=4.66,SD=1.10)显著高于低可靠性条件(M=2.72,SD=1.72)。
3.5 主观偏好
在22名参与者中,高亮文本是最受青睐的格式,有8人选择;其次是决策树,有5人选择;表格和流程图分别有3人和2人偏好;其余4人报告无明显偏好。定性反馈显示:高亮文本因其与当前会话式AI中最常见的呈现方式一致、学习负担低、能保留完整诊断上下文而受到偏好;决策树因其清晰展示诊断过程中不同判断标准之间的层级关系、条件分支形式可可视化诊断逻辑而受到认可。

四、讨论与结论

本研究发现,决策解释格式的有效性与所呈现信息的组织结构、用户的认知资源分配以及AI系统的可靠性水平密切相关。决策树格式凭借清晰的层级分支结构,有效降低了认知负荷并在高可靠性条件下展现出效率优势;流程图格式因信息节点和路径较多,增加了信息处理量,导致较高的认知负荷和较长的任务完成时间;表格格式的并行呈现结构便于快速信息比较,但缺乏连贯的决策流程;高亮文本因符合医生既有的临床阅读和推理习惯而获得较高的信任评分和偏好度。
系统可靠性与解释格式在任务完成时间上存在显著交互效应,表明不同解释格式的效率随AI可靠性水平的变化而变化。在低可靠性条件下,部分解释格式较长的任务完成时间可能反映了医生在评估AI建议时进行了额外的验证和反思加工;在高可靠性条件下,用户对AI建议的验证需求减少,解释格式之间的差异更直接地反映在任务完成效率上。
在设计启示方面,决策树格式适合作为决策解释的核心视图;高亮文本格式在主观信任和用户偏好方面表现最佳,设计者应考虑将结构化决策树解释与文本高亮相结合;表格格式更适合作为特征权重或关键信息摘要的辅助快速比较工具;流程图格式应谨慎使用,在必须采用流程导向表达时,应通过减少分支路径和压缩层级深度来控制复杂度。
研究结论指出,解释格式的价值不在于最大化信息完整性,而在于实现任务复杂性、用户认知资源和系统可靠性之间的适当匹配。该研究从人因学视角揭示了解释格式与可靠性在医疗人机协同中的互补作用,为会话式AI临床决策支持系统的设计提供了实证依据和新见解。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号