DBCore:塑造可泛化的核心集选择决策边界

《Pattern Recognition》:DBCore: Shaping generalizable decision boundaries for coreset selection

【字体: 时间:2026年07月08日 来源:Pattern Recognition 9.1

编辑推荐:

  新颖视角:研究人员引入了决策边界(DB)重构作为核心集选择(coreset selection)的新视角。方法论创新:提出了一种基于凸优化(convex optimization)的框架。展示的应用范围:超越经典方法和不同模态。强性能:在多种实验设置下取得了优

  
新颖视角:研究人员引入了决策边界(DB)重构作为核心集选择(coreset selection)的新视角。方法论创新:提出了一种基于凸优化(convex optimization)的框架。展示的应用范围:超越经典方法和不同模态。强性能:在多种实验设置下取得了优越结果。
**论文解读:DBCore——面向核心集选择的决策边界优化方法**

研究背景与问题:现代深度学习模型依赖大规模数据集、高容量模型和算力投入,但资源消耗巨大。核心集选择(coreset selection)通过挑选代表性样本缩小训练集,可加速模型学习、神经架构搜索和主动学习,然而现有方法多基于单一评分(如学习难度或到类别中心的距离),忽略样本间关系,易造成冗余。低选择率下,聚焦于决策边界(Decision Boundary, DB)附近样本会导致数据分布覆盖差、类原型缺失,引发过拟合和边界碎片化,损害泛化能力。因此,需要一种直接优化核心集所诱导决策边界的方法,兼顾全局结构保持与局部细节保留,以提升模型在不同噪声条件下的鲁棒性和泛化性。研究人员在论文《Pattern Recognition》中提出DBCore,将核心集选择重构为凸二次规划(Quadratic Programming, QP)问题,实现全局平滑与局部精细的决策边界塑造,并通过实验验证其优越性能。

主要关键技术方法:DBCore方法的核心在于构建凸二次规划(QP)目标函数,包含两个关键项:1) 全局形状保持项:利用基线校准距离(baseline calibrated distance)最小化样本到平滑决策边界的距离,其中样本到原始决策边界的距离由置信度裕度(confidence margin)近似;2) 局部细节保持项:通过类内余弦相似度(intra-class cosine similarity)矩阵最小化冗余,鼓励向原始边界靠近以保留局部结构。问题附加线性约束,包括总样本数固定和类别平衡(通过最大偏离率γ控制),并利用OSQP求解器(小规模数据)或预条件共轭梯度(PCG)法(大规模数据如ImageNet-1k)高效求解。实验在CIFAR-100、Tiny-ImageNet和ImageNet-1k三个公开数据集上进行,涵盖多种选择率(20%~80%),并引入图像失真、标签噪声和对抗攻击等鲁棒性测试,同时评估对不同网络架构(ShuffleNetV2、ResNet-50等)和经典模型(SVM、随机森林)的泛化能力。

研究结果:

5.2 与最先进方法的比较:在五个选择率(20%~80%)下,DBCore在CIFAR-100、Tiny-ImageNet和ImageNet-1k上的平均排名分别为1.2、1.0和1.6,在15个数据集-选择率组合中有13个取得最佳性能,尤其在低选择率(20%、30%、40%)下优势显著,表明平滑决策边界在样本稀缺时有效防止过拟合和边界碎片化。

5.3 经典机器学习模型实验:在CIFAR-100上以SVM和随机森林为基模型,DBCore在所有选择率下显著优于对比方法;在SVM场景中,20%选择率下仅需全数据训练模型60%的数据即可达到竞争性能,80%选择率下性能甚至优于全数据集训练。通过计算核心集训练模型所得决策边界与原始边界的相似度,发现DBCore在低选择率下相似度最高。

5.4 噪声数据集鲁棒性测试:在图像失真(高斯噪声、随机遮挡、模糊等)、标签噪声(随机标签翻转)和对抗攻击(PGD和GS攻击)等60种设置下,DBCore在55种(>90%)情况下排名第一,其中在Tiny-ImageNet的GS攻击实验中,仅用40%数据即可获得36.75%准确率,超越全数据集训练的32.99%。两样本t检验显示,在55个最优案例中,51个显著优于所有对比方法。

5.5 架构泛化能力实验:在CIFAR-100和Tiny-ImageNet上,以SVM或ShuffleNetV2为基模型,将核心集用于训练未见过的网络(如SENet、EfficientNet-B0),DBCore均保持良好性能,论证了其跨架构迁移能力,且可使用轻量基模型(如SVM)以减少训练开销。

5.6 架构一致性测试:在CIFAR-100上使用三种架构(ShuffleNetV2、SENet、ResNet-50)进行小选择率(20%、30%、40%)测试,DBCore在20%和30%下排名标准差最低(分别为1.33±0.47和1.33±0.47),表明其性能一致性强。

5.7 消融研究与扩展实验:消融分析表明,移除类内相似项或决策边界距离项均导致性能下降;严格或不加类别平衡约束均不如适度松弛约束;替换置信度裕度指标为其他方法(如Moderate-DS)导致性能降低,尤其在Tiny-ImageNet上。超参数dbase(基线距离百分位数)的实验显示,低选择率(20%)适合较大百分位数(70)以采用更安全的策略,高选择率(40%)则适合中等值(50)。联合调节dbase和权衡参数α发现,50百分位数结合合适α(0.01~0.1)可达到最优。此外,在微调场景(Swin-B预训练模型)中,使用较低基准分数(30百分位数)选择近边界样本,20%选择率下性能仅下降2.31%;在其他模态(文本分类AG News、音乐分类FMA)上,DBCore也优于对比方法,展示了跨领域适用性。

讨论与结论:研究人员指出,核心集选择问题可通过凸二次规划构建全局平滑、局部精细的决策边界来解决。dbase超参数主导性能,其最优值受模型容量与数据集关系影响,未来工作将探索元学习预测dbase,并考察概率校准算法对框架准确性和稳定性的影响。当前框架限于分类任务,扩展到回归任务需定义替代几何量。研究结论翻译:研究人员指出,核心集选择问题可以通过集体样本选择,将新决策边界有意地塑造为全局平滑且局部细致的凸二次规划问题来解决。提供了关于原始决策边界如何平滑化以保留核心集对原始边界整体形状的维持,以及如何通过向原始边界施加空间多样性来鼓励用有限样本保持精细边界形状的见解。实验结果表明,该方法在不同数据集、基模型和噪声条件下表现出持续且强大的性能、鲁棒性和泛化能力。研究人员相信,所提方法和实验结果可为处理数据集裁剪问题(尤其低选择率情况)提供启示。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号