可解释人工智能(XAI)评估策略是否一致?基于显著性图比较主观、客观与数学评估指标

《Computers in Human Behavior》:Are explainable AI (XAI) evaluation strategies aligned? Comparing subjective, objective, and mathematical evaluation measures using saliency maps

【字体: 时间:2026年09月04日 来源:Computers in Human Behavior 12.2

编辑推荐:

  本研究以显著性图为测试用例,系统比较了不同家族的可解释人工智能(XAI)评估方法,在相同的实验环境中评估了用户反应(信任、满意度)、用户能力(任务绩效)以及数学指标(用于衡量保真度、复杂度、鲁棒性和定位性)。研究人员表明,用户研究与数学指标并不一致:在数学指标

  
本研究以显著性图为测试用例,系统比较了不同家族的可解释人工智能(XAI)评估方法,在相同的实验环境中评估了用户反应(信任、满意度)、用户能力(任务绩效)以及数学指标(用于衡量保真度、复杂度、鲁棒性和定位性)。研究人员表明,用户研究与数学指标并不一致:在数学指标上评分最优的方法(即GBP)并非最能支持用户绩效的方法(即Grad-CAM)。这说明了不同评估方法家族之间的互补性,同时也揭示了它们之间的张力。研究人员进一步表明,尽管某些数学指标可能与用户绩效相关,但这些关系可能违反直觉且难以解释。结合第二点发现,这一结果挑战了数学指标可以作为用户研究直接替代物的假设。在引言部分,研究人员指出,增强用户期望(如满意度或理解力)是可解释人工智能(XAI)方法(如显著性图)的关键目标,实现这一目标需要对不同方法进行一致的评估和比较。一种流行的评估方法家族是用户研究,通过问卷进行主观评估,或利用用户能力或任务绩效进行客观评估。另一种更形式化的评估方法家族则侧重于可以通过数学指标评估的特定属性(如保真度)。在评估XAI方法时,一些研究人员认为数学指标是用户研究的补充,而另一些则希望这些指标可以部分甚至完全取代用户研究。这种希望部分源于用户研究的局限性,例如结果可能受到个体偏见的影响,且资源密集、难以规模化。相比之下,数学指标的计算易于扩展、通常标准化且可复现,能够应用于大规模数据集和多样化模型。然而,数学指标也存在重要局限,例如旨在测量同一属性的不同指标可能产生分歧。尽管已有大量研究使用用户研究或数学指标评估XAI方法,但文章往往只关注单一解释方法或单一评估方法,这留下了关于不同评估方法家族如何相互关联这一更普遍的问题。研究人员通过使用三种具有不同视觉特性的流行显著性图作为替身,在实践中比较评估方法家族,为这一方法论争论做出贡献。具体而言,研究人员进行了一项预注册的参与者间在线实验,参与者根据使用梯度加权类激活映射(Grad-CAM)、引导反向传播(GBP)或局部可解释模型无关解释(LIME)生成的显著性图来估计图像分类器的准确率。此外,研究人员使用一组数学指标系统地评估了这三种方法生成的显著性图。除了比较数据集级平均指标值的标准实践外,研究人员还检查了这些指标的统计显著性(??值),为其有效性提供了补充且更严格的视角。为确保研究的有效性,研究人员采用了严格的理解检查和测试试验,以确保每位参与者对显著性图和手头任务有充分理解。
**论文解读:可解释AI评估策略的一致性检验——基于主观、客观与数学评估指标的系统比较**

**一、研究背景与问题提出**

可解释人工智能(Explainable AI, XAI)领域的一个核心目标是提升用户的期望结果,例如满意度和理解力。显著性图(Saliency Maps)作为最广泛使用的XAI方法之一,旨在通过高亮影响AI模型决策的图像区域,使模型行为对用户透明。然而,如何系统、可靠地评估这些解释方法的有效性,一直是该领域的重大挑战。当前评估范式主要分为三大类:基于用户研究的主观指标(如信任、满意度)、基于用户研究的客观指标(如任务绩效、预测准确度)以及基于数学计算的量化指标(如保真度、鲁棒性)。学界对于数学指标应作为用户研究的补充还是替代存在争议,支持替代的动机源于用户研究成本高、难以规模化且易受个体偏见干扰;而数学指标则易于复现和扩展,适合大规模基准测试。然而,不同指标对于同一属性的评估结果可能互相矛盾,且现有研究往往仅聚焦于单一解释方法或单一评估范式,缺乏在统一实验框架下对跨家族评估方法的系统比较,导致学界对主观、客观与数学评估之间的一致性缺乏实证认知。为解决此问题,研究者以图像分类任务中的三种流行显著性图方法(Grad-CAM、GBP和LIME)为测试平台,实证检验了不同评估家族在同一实验设置下的趋同或分歧程度。

**二、研究方法概述**

研究采用预注册的参与者间在线实验设计,通过Prolific平台招募了168名具有信息与通信技术(ICT)背景的英语母语参与者(28.6%女性;4.8%博士,27.98%硕士;平均年龄31.19岁),样本量依据先验功效分析确定(目标效应量??=.175,功效1???=.80,??=.05)。参与者被随机分配到三个条件组,分别观看由Grad-CAM、GBP或LIME生成的显著性图,用于评估ResNet50分类器在ImageNet ILSVRC 2012验证集上12个类别图像上的表现。实验材料含12组试验,每组包含3张带显著性图的图像和6张无显著性图的图像。研究同时采集了三大类数据:①主观指标(采用Hoffman等人开发的8条目解释满意度量表、Thielsch等人信任量表等);②客观指标(参与者估计分类准确率与真实准确率的绝对差值、对6张额外图像的分类预测误差率);③数学指标(包括保真度指标Insertion、Deletion、Monotonicity,鲁棒性指标Average Sensitivity,复杂度指标Entropy Complexity和Sparseness,以及定位指标Energy Pointing Game)。数据分析综合运用方差分析(ANOVA)、t检验与线性混合模型(LMM),并进行了假设检验和稳健性验证。

**三、研究结果**

**(1)主观指标结果(RQ1.1与RQ1.2)**
方差分析显示,三种方法在解释满意度(????1.1)、对分类器的信任、对显著性图的信任以及感知可信度(????1.2)方面均无显著差异。估计边际均值显示Grad-CAM(??=3.98)、GBP(??=3.92)和LIME(??=3.87)的满意度得分接近,所有配对比较均不显著。这表明在主观体验层面,三种解释方法并未给用户带来可感知的差异。

**(2)客观指标结果(RQ2.1与RQ2.2)**
在准确率估计偏差方面(RQ2.1),方差分析揭示了显著的主效应,??(2,163)=5.69, ??=.004。计划对比显示,Grad-CAM组参与者的准确率估计显著优于GBP组(??(163)=?2.13, ??=.034, ??=?.43)和LIME组(??(163)=?3.36, ??=.001, ??=?.63),而GBP与LIME之间无显著差异。在分类错误检测方面(RQ2.2),Grad-CAM组(??=0.375)显著优于LIME组(??=0.408),??(163)=?2.74, ??=.007, ??=?.52,但未显著优于GBP组(??=0.395)。非参数Kruskal–Wallis检验验证了上述结果的稳健性。

**(3)数学指标结果(RQ3)**
对七个数学指标的系统评估显示,GBP在Deletion和Entropy Complexity两个指标上取得最优值,并与Grad-CAM在Monotonicity上并列最优;Grad-CAM在Sparseness上最优,并与LIME在Average Sensitivity上并列最优。综合来看,GBP在数学指标上展现出最一致的优势,Grad-CAM次之,LIME表现相对最弱。值得注意的是,数学指标上的领先者GBP在用户客观绩效上并非最优,而用户绩效上的领先者Grad-CAM在数学指标上仅选择性占优,这初步揭示了两类评估之间的张力。

**(4)相关分析结果(RQ4)**
线性混合模型分析显示,数学指标与用户准确率估计偏差之间存在复杂且不一致的关系。在预期方向上显著的关联仅出现在:GBP和LIME组的Deletion指标、GBP组的Entropy Complexity指标、以及Grad-CAM和GBP组的EPG指标。与之相反,多项指标呈现反直觉的显著关联,例如LIME组的Insertion、GBP组的Monotonicity和Sparseness、Grad-CAM和LIME组的Average Sensitivity等。这一结果表明,仅有少数指标(如Deletion和EPG)可能是用户绩效的可靠代理,大多数数学指标与用户理解之间的关系不仅不稳定,甚至方向相悖。

**四、讨论与结论凝练**

**讨论部分核心要义**:本研究揭示了XAI评估领域中一个关键的结构性矛盾——三类评估方法得出了截然不同的结论:主观指标无显著差异、客观指标支持Grad-CAM、数学指标支持GBP。研究认为,Grad-CAM的优势可能源于其匹配了人类可用的语义粒度,既具体指明相关区域又不至于细碎;LIME可能因超像素过大而过于粗糙,GBP则因过度聚焦边缘而过于精细。数学指标与用户理解之间的不一致可能源于指标构建方式与人类认知过程的根本差异,例如Insertion和Monotonicity高度依赖基线设置方式,而人类判断更依赖整体可理解性。复杂度与理解力的关系可能并非单调线性,过于稀疏的图缺乏上下文反而不利于理解。研究强调仅有定位指标(EPG)和Deletion在一定程度上可作为用户绩效的代理,但这仅针对特定显著性图方法成立。因此,将数学指标作为用户研究的直接替代物应极为谨慎。

**最终结论**:本研究以显著性图为测试平台,系统考察了XAI中三类评估指标——主观用户判断、客观用户绩效和数学指标之间的趋同与分歧。研究发现,参与者在Grad-CAM、LIME和GBP之间的信任或满意度上没有报告显著差异;Grad-CAM在支持用户预测模型性能方面最为有效;而GBP在数学指标上获得了最有利的评价。更重要的是,若干数学指标与用户理解并无关联,即便存在关联,也常常违反直觉。这些发现凸显了XAI领域面临的重大挑战:主观、客观和数学评估并不必然收敛,技术指标上的优势并不保证更好的用户体验。研究人员建议,数学指标不应被视为用户研究的替代品,而应作为互补工具,各自捕捉解释质量的不同维度。未来研究应探索如何系统性地结合不同指标家族,以满足XAI方法在不同应用情境下的期望目标。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号