《Pattern Recognition》:Improving attribution through transferable adversarial attacks
编辑推荐:
研究人员提出AttEXplore+,通过可迁移对抗攻击增强归因;并进一步提出AttEXplore++,相较于AttEXplore获得7.57%的性能提升,相较于当前最优方法(SOTA)提升32.62%。研究人员在ImageNet数据集上,使用插入(Insert
研究人员提出AttEXplore+,通过可迁移对抗攻击增强归因;并进一步提出AttEXplore++,相较于AttEXplore获得7.57%的性能提升,相较于当前最优方法(SOTA)提升32.62%。研究人员在ImageNet数据集上,使用插入(Insertion)和删除(Deletion)指标,对卷积神经网络(CNN)和视觉Transformer(ViT)模型进行评估。实验结果表明,AttEXplore+框架对随机性具有鲁棒性,且对参数敏感性表现稳定。研究人员已发布代码和工具包以支持可重复性和未来研究。
### 论文解读:通过可迁移对抗攻击改进归因
#### 研究背景与问题
深度神经网络(DNN)在医疗诊断、自动驾驶和金融预测等关键领域广泛应用,但其黑箱性质限制了决策过程的可解释性,阻碍了用户信任和模型评估。归因方法通过计算每个输入特征对模型输出的贡献,生成热力图以揭示决策依据,是提升可解释性的重要手段。然而,现有方法如Integrated Gradients(IG)依赖固定的基线样本,导致归因路径单一且易受梯度噪声影响。AttEXplore通过整合对抗攻击路径上的梯度,探索了非线性决策边界,但其仅使用了有限的对抗攻击策略,未能充分利用可迁移攻击的潜力。尚不清楚不同梯度获取策略对归因质量的贡献,以及可迁移攻击能否提供优于白盒扰动的收益。为此,研究人员在《Pattern Recognition》发表论文,提出AttEXplore+框架,系统性地将可迁移对抗攻击作为梯度获取算子,以增强归因的稳定性和有效性。
#### 主要技术方法
研究人员在AttEXplore+框架中集成了10种可迁移对抗攻击方法,涵盖三大类别:梯度编辑(如Momentum Iterative Method (MIM)、Momentum Integrated Gradients (MIG))、语义相似性(如Diverse Input Method (DIM)、Scale-Invariant Nesterov Iterative Method (SI-NIM)、Translation-Invariant Method (TIM))及目标修改(如Neuron Attribution-based Attack (NAA)、Structure Invariant Attack (SIA)、Gradient Relevance Attack (GRA)、Frequency-based Stationary Point Search (FSPS)),同时保留白盒基准(如Projected Gradient Descent (PGD)、Basic Iterative Method (BIM))。这些方法作为可插拔的梯度获取算子,替代AttEXplore中的单一梯度更新规则,沿非线性对抗路径累积梯度以生成归因。实验基于ImageNet数据集,使用1000个样本,评估模型包括Inception-v3、ResNet-50、VGG16(CNN)及MaxViT-T、ViT-B/16(ViT)。采用插入和删除分数作为评价指标,其中插入分数衡量逐步添加重要像素后模型输出的恢复程度,删除分数衡量逐步移除像素后输出的下降程度,二者均为因果评估标准。
#### 研究结果
**5.1 数据集和模型**:从ImageNet中提取1000个样本,选用三个经典CNN模型(Inception-v3、ResNet-50、VGG16)和两个Transformer模型(MaxViT-T、ViT-B/16),以评估框架在不同架构下的适用性。
**5.2 基线**:选取11种归因算法作为基线,包括BIG、DeepLIFT、EG、FIG、GIG、IG、MFABA、SG、SM、AGI及AttEXplore,其中AttEXplore为主要对比基准。
**5.3 评估指标**:采用插入分数(越高越好)和删除分数(越低越好),以最小化人工标注偏差,并将插入作为主要指标,因为其直接反映归因区域能否恢复类别证据。
**5.4 实验设置**:主实验在Linux平台使用两块Nvidia A100 GPU完成。在AttEXplore+中,为每个模型选择最优策略构建AttEXplore++:Inception-v3、VGG16、ViT-B/16采用MIG;ResNet-50、MaxViT-T采用GRA。额外验证使用100个固定随机子集,测试7个源-目标模型对、7种梯度方法、扰动预算?∈{4,8,12,16}及三种插入/删除基底(零、模糊、均值)。
**5.5 结果**:AttEXplore++在Inception-v3、ResNet-50、VGG16和ViT-B/16上取得最佳插入分数,在MaxViT-T上取得第二好。与AttEXplore相比,平均提升7.57%(CNN模型提升8.17%,Transformer模型提升6.36%);与所有基线相比,平均提升32.62%(CNN模型提升38.02%,Transformer模型提升21.82%)。
**5.6 迁移性效果**:通过比较不同可迁移攻击方法,发现更强可迁移性的攻击(如MIG、GRA)显著提升归因插入分数。MIG在Inception-v3、VGG16、ViT-B/16上最优;GRA在ResNet-50、MaxViT-T上最优。额外验证中,AttEXplore+GRA在跨模型、低预算和基底鲁棒性下持续改善插入分数,表明攻击成功率本身不足以作为归因质量的代理指标。
**5.7 定性分析**:在实验室长凳样本上,AttEXplore++生成高度聚焦的显著图,仅突出烧杯和测试条,压制非判别区域;而梯度方法存在噪声,基于扰动的方法照亮无关区域。在可迁移攻击变体比较中,MIG和GRA产生最清晰、语义对齐的归因,低迁移性攻击(BIM、PGD)产生扩散噪声图。
**5.8 随机性效果**:固定多样性概率(DP)为0.5、噪声幅度β为4.0、扰动率?为16,使用三种随机种子测试。结果表明随机性对大多数方法的插入和删除分数影响极小,归因性能保持稳定,证明AttEXplore+框架对随机性鲁棒。
**5.9 多样性概率效果**:在ResNet-50、VGG16、ViT-B/16上,增大DP通常提升插入分数;但在Inception-v3和MaxViT-T上,原始AttEXplore的插入分数随DP增大而下降,而经DIM和TIM优化后,插入分数随DP增加而提高。
**5.10 扰动率?效果**:在大多数情况下,更大扰动预算提供更宽的决策边界覆盖,提升插入分数。额外验证显示AttEXplore+GRA在低预算(?=4)下仍保持优势,插入分数从0.3441(?=4)升至0.4408(?=16),说明增益并非仅由高预算引起。
**5.11 噪声幅度β效果**:在AttEXplore+GRA中,β从3.0增至4.0时,所有模型的插入分数均上升;CNN模型删除分数随β增加而升高,而Transformer模型在β增大时删除分数逐渐降低,表明更大噪声幅度有助于提升插入指标,但需考虑模型特定删除行为。
#### 总结与讨论
**研究结论翻译**:本研究通过引入AttEXplore+及其优化变体AttEXplore++,检验了对抗迁移性与归因质量之间的联系。在ImageNet上的卷积和Transformer架构中,研究人员观察到插入分数的一致提升和删除分数的竞争性表现,表明高迁移性攻击能够暴露决策边界结构,从而产生更连贯且信息量更大的归因图。结合对多样性概率、扰动预算和噪声幅度的控制分析,该框架在随机性下表现稳定,并在不同架构中保持有效性。这些发现支持一个总体结论:在评估设定下,面向迁移的梯度路径是增强归因的实用且经验证实的机制。
**讨论概括**:该框架具有跨异构骨干的可迁移性、模块化可插拔性,并提供可操作的部署指南:MIG或GRA作为默认高迁移攻击;增大DP通常有助于ResNet、VGG和ViT家族;较大扰动预算提升插入分数;适度噪声幅度可锐化Transformer边界。但研究存在局限:评估仅限ImageNet分类和插入/删除指标,不能完全反映用户中心忠实性或任务效用;迁移有效性依赖于代理模型选择和超参数;攻击成功率低时不足以作为归因质量的代理;部分MaxViT相关比较存在模型依赖变异性;迭代攻击带来计算开销。未来方向包括扩展至检测、分割、检索、开放集和分布外(OOD)场景,纳入人类研究,降低计算成本,扩展至文本和多模态模型,以及形式化迁移诱导路径的忠实性条件。