针对标签噪声下强大且高效深度网络的判别性响应剪枝
《Pattern Recognition》:Discriminative response pruning for robust and efficient deep networks under label noise
【字体:
大
中
小
】
时间:2025年11月16日
来源:Pattern Recognition 9.1
编辑推荐:
金书文|毛俊竹|孙泽然|姚亚洲中国南京,210094,南京科技大学计算机科学与工程学院摘要剪枝被广泛认为是降低深度神经网络计算和存储需求的一种有效方法,有助于在资源有限的设备上部署轻量级模型。然而,大多数现有的剪枝技术都假设存在准确的训练标签,而忽视了现实环境中标签噪声的普遍存在
金书文|毛俊竹|孙泽然|姚亚洲
中国南京,210094,南京科技大学计算机科学与工程学院
摘要
剪枝被广泛认为是降低深度神经网络计算和存储需求的一种有效方法,有助于在资源有限的设备上部署轻量级模型。然而,大多数现有的剪枝技术都假设存在准确的训练标签,而忽视了现实环境中标签噪声的普遍存在。深度网络具有很强的记忆能力,容易过拟合噪声标签,因此对网络参数的删除极为敏感。这样一来,现有方法在直接应用于处理带有噪声标签训练的模型时往往存在局限性。为此,我们提出了判别响应剪枝(DRP)方法,以有效剪枝那些基于噪声标签训练的模型。具体而言,DRP首先识别干净样本和噪声样本,并将它们重新组织为特定类别的子集。然后,通过评估模型参数对每个子集的反应来估计其重要性,那些对干净数据反应强烈的参数会得到奖励,而对噪声数据过度拟合的参数则会被惩罚。之后,采用按类别加权聚合策略来计算最终的重要性得分,以此指导剪枝决策。我们在多种模型和噪声条件下进行了大量实验,以证明该方法的有效性和鲁棒性。
引言
尽管深度神经网络在众多应用中展现出卓越的性能,但其较高的计算需求给在资源受限的设备上部署带来了巨大挑战,比如边缘硬件和智能手机[1]。剪枝已被公认为是降低深度神经网络部署成本的有效方法[2]。它通过去除深度模型中多余的滤波器或通道,降低了DNN的存储需求和推理时间。目前大多数剪枝技术都是基于干净且标注准确的数据设计的。然而,在许多现实场景中,标签噪声不可避免,它会严重降低DNN的性能[3]、[4]。虽然已经有许多抗噪声方法被提出,但在噪声标签条件下训练的模型往往对网络参数的删除更为敏感,稳定性也较差[5]、[6]、[7]、[8]、[9]。尽管标签噪声在实际应用中非常重要,但针对这类场景的剪枝方法研究仍然较少。因此,迫切需要设计出适用于噪声标签场景的剪枝技术。
目前的模型剪枝研究主要聚焦于模型架构,而忽略了数据本身的特性,这使得这些方法在处理带有噪声标签训练的模型时效果不佳。例如,基于幅值 的滤波器剪枝[10]、激活值驱动的排序[11]以及通道选择[12]等传统剪枝方法,都是根据模型自身的特点设计的,没有考虑到数据质量带来的问题。因此,这些方法难以应对受噪声监督影响的参数剪枝难题。近年来,剪枝技术已扩展到更多领域,包括视觉变换器[13]、[14]、图神经网络[15]以及动态滤波器[16]等。不过,噪声标签对剪枝的影响仍大多未被研究。有一小部分研究开始考虑考虑数据集特性的方法。例如,[17]提出使用一阶泰勒展开来估计剪枝的影响。但这些方法本质上假设训练标签是准确的,无法解决噪声标注带来的梯度失真问题,因此在涉及标签噪声的实际应用中适用性有限。
为了解决上述问题,我们提出了一种简单而有效的方法,即DRP(判别响应剪枝),用于剪枝那些基于噪声标签训练的模型。其核心思想是将模型对噪声数据的反应作为评估参数重要性的依据之一。具体来说,DRP首先通过某种样本选择策略从训练数据集中挑选出一组干净样本和一组噪声样本。这两组数据随后又被进一步划分为特定类别的子集。对于干净数据,子集是根据其标签来划分的;而对于噪声数据,则是根据模型的预测结果来分组。接着,DRP会评估模型参数与每个子集的匹配程度,找出那些从干净数据中获取的信息较少,但从噪声数据中获取的信息较多的参数,并将其标记为可能被删除的对象。最后,通过综合参数对所有类别中干净数据和噪声数据的反应,来计算每个参数的重要性得分。此外,该评分过程还采用了按类别加权的机制,进一步提升性能。我们的主要贡献如下:
(1) 我们提出了一种简单而有效的方法DRP,用于解决存在标签噪声时的模型剪枝难题。该方法能够保留那些主要从干净数据中获取信息的参数,同时去除那些受噪声数据影响较大的参数。参数的重要性是根据其对干净数据和噪声数据的反应来评估的。
(2) DRP会选取具有代表性的样本,将它们划分为特定类别的子集,然后评估每个子集内参数的重要性。之后再通过按类别加权的聚合策略来整合这些重要性得分。
(3) 我们在合成数据和真实世界的噪声数据集上进行了大量实验,以充分验证DRP的有效性和优势。此外,还通过消融实验系统地分析并验证了该方法中各组成部分的作用。
章节节选
模型剪枝
剪枝是一种被广泛采用的模型压缩技术,能有效降低深度模型的部署成本,包括存储和计算时间方面的需求。现有研究大致可分为两类:非结构化剪枝和结构化剪枝。非结构化剪枝通常需要专门设计的硬件才能充分发挥作用,因为它是通过删除深度网络中的单个参数来产生不规则的权重分布的[18]。
基础知识
模型剪枝常被用于多类分类任务中,通过去除深度网络中冗余的连接、滤波器或神经元,从而在保持预测准确率的同时降低计算成本和模型规模。正式地,设表示原始网络权重,则表示剪枝后的权重。我们的目标是选择,使得经验损失的波动最小,同时满足一定的稀疏性要求:
实验设置
数据集:我们在合成数据和真实世界的噪声基准数据集上测试了我们的方法。对于合成数据集,我们使用了CIFAR100N和CIFAR80N[8]、[27]。CIFAR100N和CIFAR80N都是基于CIFAR-100[44]衍生而来的。前者具有对称和非对称噪声结构的封闭式噪声标签,而后者则通过将CIFAR-100的最后20个类别视为异常类别,从而模拟现实世界中的开放式噪声场景。对于真实世界的基准数据集,我们选择了Web-Aircraft数据集。
结论
在这项工作中,我们提出了DRP,这是一种简单而有效的剪枝方法,专为压缩基于噪声标签训练的模型而设计。DRP通过去除冗余且有害的参数,减少了深度网络的网络参数和计算成本,同时保持了模型的性能。该方法将噪声数据集重新组织为按类别划分的干净样本和噪声样本子集,然后在每个子集内评估参数的重要性。那些与
CRediT作者贡献声明
金书文:写作——初稿撰写、验证、方法论、形式分析、数据整理、概念构建。毛俊竹:写作——初稿撰写、方法论、研究分析、概念构建。孙泽然:写作——审阅与编辑、验证、监督、概念构建。姚亚洲:写作——审阅与编辑、监督、资源协调、资金筹集。
利益冲突声明
作者声明,他们不存在任何可能影响本文所述工作的已知财务利益或个人关系。
致谢
本研究得到了国家自然科学基金(编号:62202227、62472222)以及江苏省自然科学基金(编号:BK20240080)的支持。
生物通微信公众号
生物通新浪微博
今日动态 |
人才市场 |
新技术专栏 |
中国科学人 |
云展台 |
BioHot |
云讲堂直播 |
会展中心 |
特价专栏 |
技术快讯 |
免费试用
版权所有 生物通
Copyright© eBiotrade.com, All Rights Reserved
联系信箱:
粤ICP备09063491号