
-
生物通官微
陪你抓住生命科技
跳动的脉搏
基于KL正则化强化学习的自适应测试时增强技术,用于提升视觉推理的鲁棒性
《Scientific Reports》:Adaptive test-time augmentation via KL-regularized reinforcement learning for robust visual inference
【字体: 大 中 小 】 时间:2026年07月21日 来源:Scientific Reports 4.9
编辑推荐:
摘要深度神经网络在面对现实世界中的图像损坏和分布变化时,其准确率往往会显著下降。为克服固定式、与输入无关的测试时增强方法的局限性,本文提出了一种自适应框架,该框架通过强化学习来学习针对每个样本的变换方法。增强策略的选择被视作一个马尔可夫决策过程,进而利用近端策略优化算法训练出能够
深度神经网络在面对现实世界中的图像损坏和分布变化时,其准确率往往会显著下降。为克服固定式、与输入无关的测试时增强方法的局限性,本文提出了一种自适应框架,该框架通过强化学习来学习针对每个样本的变换方法。增强策略的选择被视作一个马尔可夫决策过程,进而利用近端策略优化算法训练出能够根据综合奖励来选择特定样本变换的策略——该综合奖励结合了分类器置信度的提升以及针对模型自身软阈值输出的自一致性KL散度惩罚,从而保持整体信念的稳定性。在干净的CIFAR-10数据集(1000个样本)上,这种自适应集成方法的准确率从基准值的88.5%和静态TTA方法的87.3%提升到了90.0%,提升了1.5个百分点。在CIFAR-10-C数据集上(15种损坏类型,每种5种严重程度;每种情况1000张图像),整体Top-1准确率从基准值的75.7%和静态TTA方法的74.3%提升到了76.4%,提升了0.7个百分点,且这一结果还超过了在完全无标签情况下、不更新模型权重的TENT熵最小化基准方法的75.9%的准确率。在噪声、模糊、天气效应以及压缩失真等不同类型的损坏情况下,该自适应策略的改进效果始终为正,尤其在那些输入空间变换最为有效的纹理和压缩损坏场景中,其性能优于TENT方法。这些研究结果表明,通过学习得到的针对每个样本的增强策略,能够在多种图像条件下提升深度视觉模型的稳健性和可靠性,即便是在面对强大的基准分类器时也是如此。