红外热成像技术具有隐蔽性强、穿透能力高、全天候可操作等优势,因此在军事和民用领域均得到广泛应用。作为红外视觉中的基本任务,IRSTD 在预警、救援以及地质分析等应用中发挥着重要作用 [1], [2], [3], [4], [5], [6]。然而,由于红外成像系统的局限性以及复杂的成像环境,IRSTD 仍极具挑战性。如图 1 所示,由于成像距离远,红外目标通常仅占据几个像素,导致结构信息和几何特征微弱。与此同时,远距离红外辐射衰减导致低信杂比(SCR),使得目标容易被淹没在复杂背景中。此外,不同场景下显著的目标尺度变化进一步增加了检测难度。因此,IRSTD 主要面临的挑战包括目标尺寸小、结构信息弱、信杂比低以及尺度变化大。
大量传统红外小目标检测方法 [7], [8], [9], [10], [11], [12] 已被提出以解决该问题。然而,这些方法严重依赖人工设计的先验知识和手动设计特征,限制了其在多种红外场景中的鲁棒性和泛化能力。得益于强大的表示学习能力,基于深度学习的方法显著提升了红外小目标检测性能。现有方法大致可分为基于边界框的检测方法和逐像素分割方法两类。大多数基于边界框的方法是从可见光目标检测器改编而来的 [13], [14], [15]。例如,Ciocarlan 等人 [16] 通过引入专用检测头和对抗决策策略来抑制背景干扰,增强了基于 YOLO 的红外检测。相比之下,基于分割的方法由于其像素级定位能力而受到越来越多的关注 [17], [18], [19], [20], [21], [22], [23], [24]。代表性工作如 MSHNet [21]、DNA-Net [22] 和 UIU-Net [23] 利用多尺度特征提取与融合来改善目标表示。此外,基于 Transformer 的红外小目标检测方法,如 RKformer [25]、TCI-former [26] 和 DATransNet [27],通过自注意力机制进一步增强了全局上下文建模能力。
尽管基于深度学习的方法相较于传统方法取得了更优异的性能,但它们在稀疏目标表示方面仍缺乏有效的先验。因此,这些方法往往依赖于日益复杂的架构来增强特征表示,这不可避免地导致了更高的计算成本。近期,已有若干研究将 Top-k 稀疏选择引入红外小目标检测,如 TriHANet [28]、HPFNet [29]、SeRankDet [30] 和 DifRankNet [31],其中通过稀疏特征过滤或基于注意力的选择来增强目标响应并抑制背景干扰。然而,现有方法要么仅对单尺度特征独立执行稀疏选择,要么依赖于有限的 k 值选择策略,要么忽略了注意力图中红外小目标的结构特性,这可能导致跨尺度交互有限、适应性差以及面向目标的解释性较弱,从而限制了在复杂场景中的检测性能。
为了解决上述问题,我们提出了一种用于红外小目标检测的 LGTS 网络。具体而言,首先采用 U-Net 主干网络提取层次化多尺度特征。然后,在浅层多尺度特征上引入 LATS 模块,执行渐进式多尺度自适应 Top-k 选择,以实现由粗到细的稀疏细化并增强不同尺度间的交互。与此同时,在深层特征上设计了 GATS 模块,利用红外目标在注意力矩阵中的行列稀疏性,执行协作式行列 Top-k 选择以增强显著目标区域的结构依赖性建模。此外,引入了自适应多 k 融合以提升两个模块的 Top-k 选择能力,使 LGTS 在复杂红外场景中取得卓越性能。本文的主要贡献总结如下:
- 1.
提出了一种基于局部-全局注意力 Top-k 选择的新颖红外小目标检测网络模型。通过对红外目标特征提取施加稀疏约束,增强了网络的检测性能。
- 2.
引入了一种渐进式局部注意力 Top-k 选择模块。通过采用由粗到细的局部注意力选择策略,显著提高了局部注意力计算的准确性,增强了网络的特征提取能力。
- 3.
提出了一种专用的全局注意力 Top-k 选择模块。通过对小尺度特征上的全局注意力机制应用 Top-k 选择,增强了 Transformer 对目标区域的关注,从而提升了检测性能。
本文其余部分组织如下。第 2 节回顾了基于 CNN 和 CNN-Transformer 的红外小目标检测方法。第 3 节介绍了所提出的 LGTS。第 4 节在三个公开数据集上将 LGTS 与 16 种方法进行了对比评估。第 5 节讨论了其泛化能力和局限性。最后,第 6 节对本文进行总结。