DAWDet:一种基于动态内容感知的多分支框架,结合自适应小波提升算法用于小目标检测

《Pattern Recognition》:DAWDet: A Dynamic Content-Aware Multi-Branch Framework with Adaptive Wavelet Boosting for Small Object Detection

【字体: 时间:2025年12月27日 来源:Pattern Recognition 7.6

编辑推荐:

  小目标检测面临特征可分性不足、样本稀缺及信息损失三大挑战,本文提出DAWDet框架通过动态多分支特征金字塔网络增强细粒度特征表达,自适应标签分配策略优化预测框质量,并引入哈夫曼小波变换下采样模块有效保留高频细节,实验表明其效率与精度均优于现有方法。

  
吴玉婷|刘少蕾|朱东晨|王磊|李佳茂
中国科学院上海微系统与信息技术研究所,中国上海,200050

摘要

小目标检测(SOD)旨在对区域有限的目标进行分类和定位,在监控系统、智能交通和航空检查应用中发挥着关键作用。与一般目标检测相比,SOD面临三个根本性限制:特征表示能力不足、高质量训练样本稀缺以及严重信息丢失。为了解决这些问题,我们提出了DAWDet,这是一种专为SOD任务设计的新型框架。首先,我们基于自适应内容感知网格采样和精炼的网络拓扑结构,设计了动态内容感知多分支特征金字塔网络(DMFPN),以获得更丰富的目标位置信息和语义表示。其次,我们开发了自适应标签分配策略(ALAS),通过设计的一种重叠变换函数,优化了高质量小目标样本的回归分支。第三,为了减少信息丢失,我们在特征融合过程中加入了轻量级的Haar小波变换降采样(HWD)模块,在降低分辨率的同时有效保留了关键的高频细节。在标准SOD基准测试中的综合评估表明,我们的框架在保持计算效率的同时,实现了先进的性能。

引言

随着深度学习的快速发展,目标检测取得了显著进展。目标检测算法能够准确识别复杂真实世界场景中目标对象的类别和精确位置。在各种检测任务中,小目标检测已成为一个特别关键且具有挑战性的研究焦点。在航空监控、智能交通系统和遥感分析等实际复杂场景中[1],[2],由于传感器分辨率和视角限制,关键目标通常表现为密集分布的小实例。因此,小目标的检测性能对于确定智能决策系统的可靠性和有效性至关重要。
虽然大多数现有的目标检测器在中大型目标检测方面表现出强大的能力[3],但在处理小目标时性能会显著下降。与一般目标相比,小目标面临三个根本性限制:由于像素覆盖率低而导致的特征区分度降低 [4]、降采样和特征提取过程中的不可逆信息丢失 [5],以及正样本分布不平衡 [6]。这些持续存在的问题严重限制了复杂场景中小目标的可靠检测。
目前,主流的目标检测器主要分为两阶段和一阶段方法。两阶段检测器(例如Faster R-CNN [7]、Sparse R-CNN [8])虽然具有高精度,但由于其级联区域提案机制,推理速度较慢,不适合实时检测。此外,它们的区域提案往往无法准确匹配小目标,导致漏检或误检。一阶段检测器如YOLO系列[9]、[10]凭借其低延迟和高精度,在实际复杂场景检测中占据主导地位。然而,大多数主流的一阶段目标检测器是为一般场景中的全尺寸目标设计的,在小目标检测方面仍存在不足。具体来说,通用目标检测器忽略了小对象对高分辨率信息和局部细节特征的需求,小目标检测层的设计过于粗糙;在信息传输过程中使用大型卷积核和多次降采样操作会导致小目标细节信息的丢失;此外,由于一般目标和小目标之间的不平衡,小目标正样本不足的问题难以解决。一些工作试图改进小目标检测的性能。一些研究[11]、[12]改进了网络的特征融合结构,但计算成本相对较高,且针对小目标的特征融合方法不够精细。还有一些方法[13]、[14]在主干网络中加入了注意力机制,通过轻量级设计成功保持了模型效率,但忽略了全局信息对小目标的影响,检测性能仍有提升空间。
为了实现实际复杂场景中小目标的实时高精度检测,我们提出了一种基于动态多分支金字塔和Haar小波变换的端到端小目标检测器DAWDet。具体而言,为了解决小目标表示不足的问题,受到BiFPN [15]的启发,我们创新性地提出了一种精炼的动态多分支金字塔融合策略。它通过颈部低层中的双向连接保留了高分辨率特征图的位置信息,然后通过颈部深层中的多方向连接丰富了语义和梯度信息。此外,在特征融合过程中,我们借助动态内容感知网格采样重新组织特征,以实现适应不同目标大小的上采样操作。另外,为了减少特征融合阶段中小目标的信息丢失,我们将Haar小波变换集成到特征降采样中,同时捕获低频全局背景和高频局部纹理。为了解决小目标高质量预测框稀缺的问题,我们提出了一种自适应标签分配策略,以增强高质量小目标预测框的权重和影响力。
主要贡献总结如下:
  • 我们提出了一种新型的轻量级小目标检测框架,它结合了动态多尺度特征聚合和频域信息增强,成功保持了模型的实时处理能力和轻量级特性,同时显著提高了小目标的检测精度。
  • 我们开发了一种动态多分支特征金字塔融合方法,通过精细的跨层连接结构增强了小目标的细粒度信息。此外,为了改进小目标特征表示,我们在上采样过程中通过自适应感知区域内容动态构建采样网格,确保了小目标的精确特征提取。
  • 为了最小化信息丢失并有效利用高质量融合特征,我们提出了一种自适应标签分配策略,根据预测框的质量差异对其进行建模。结合Haar小波变换的频域分解特性,该方法有效保留了小目标的局部细节信息。
  • 本文的其余部分组织如下。第2节简要回顾了小目标检测的相关工作。第3节介绍了所提出方法的三个组成部分。第4节报告了实验设置和结果。最后,在第5节中,我们总结了本文的内容,并指出了局限性和未来的工作方向。

    相关研究

    自然图像中的目标检测可以分为两阶段检测器和一阶段检测器。与两阶段检测器相比,一阶段检测器计算速度快,精度损失低,因此在实际检测中具有更好的潜力。YOLOv10 [16] 和 YOLO11 [17] 是建立新最佳模型的新型一阶段检测器。YOLOv10 在推理过程中消除了NMS的需求,并提出了整体效率-精度驱动的模型

    我们的方法

    在本节中,我们首先介绍了基线模型YOLOv10的初步内容。接下来,我们将介绍所提出的DAWDet的框架。最后,我们将详细说明所提出的三个核心模块,包括DMFPN、HWD和ALAS。

    数据集和评估指标

    数据集。为了评估我们方法的优越性和有效性,我们在专为小目标检测设计的大规模基准测试数据集SODA-D [6]、VisDrone-2019 [32] 和 RGBT-Tiny [33] 上进行了广泛的实验。
    SODA-D 包含24,828张高质量图像,其中12,383张用于训练,5,017张用于验证,7,428张用于测试。数据集包含九个目标类别:人、骑手、自行车、摩托车、车辆、交通标志、交通灯、交通摄像头和警告锥。

    结论

    在本文中,我们提出了一种专为小目标检测设计的新型检测器DAWDet。该框架包含三个关键组成部分:(1)DMFPN,一种通过内容感知方法和精炼的网络拓扑结构增强跨层特征融合的动态特征金字塔网络;(2)ALAS,一种提高小目标正样本回归精度的自适应标签分配策略;以及(3)一种轻量级的Haar小波变换模块,有效保留了

    未引用的参考文献

    图1

    CRediT作者贡献声明

    吴玉婷:撰写 – 审稿与编辑,撰写 – 原稿,可视化,验证,监督,软件,资源,项目管理,方法论,调查,形式分析,数据管理,概念化。刘少蕾:撰写 – 审稿与编辑,撰写 – 原稿,监督。朱东晨:撰写 – 审稿与编辑,撰写 – 原稿,监督。王磊:撰写 – 审稿与编辑,撰写 – 原稿,监督。李佳茂:撰写 – 原稿

    利益冲突声明

    作者声明他们没有已知的可能会影响本文报告工作的财务利益或个人关系。

    致谢

    本工作得到了中国科学技术部国家科技重大项目(2021ZD0201403)、中国科学院青年创新促进协会(2021233)以及上海学术研究带头人(22XD1424500)的支持。
    相关新闻
    生物通微信公众号
    微信
    新浪微博

    热点排行

      今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

      版权所有 生物通

      Copyright© eBiotrade.com, All Rights Reserved

      联系信箱:

      粤ICP备09063491号