LR-SMAN:用于多光谱目标检测的低秩对称互注意力网络

《Pattern Recognition》:LR-SMAN: Low-Rank Symmetrical Mutual Attention Network for multispectral object detection

【字体: 大 中 小 】 时间:2026年09月25日 来源:Pattern Recognition 9.1

编辑推荐:

   •用于多光谱目标检测的低秩对称互注意力网络。•对称互注意力(SMA)实现了平衡的双向跨模态融合。•张量核范数正则化(TNNR)强制实施低秩跨模态亲和关系。•在 VEDAI、M3FD 和 LLVIP 上取得了最先进的结果,特别是在低光照场景中。引言多光谱目标检测,特别是结合配对

  
  • •
    用于多光谱目标检测的低秩对称互注意力网络。
  • •
    对称互注意力(SMA)实现了平衡的双向跨模态融合。
  • •
    张量核范数正则化(TNNR)强制实施低秩跨模态亲和关系。
  • •
    在 VEDAI、M3FD 和 LLVIP 上取得了最先进的结果,特别是在低光照场景中。

引言

多光谱目标检测,特别是结合配对的 RGB 和红外(IR)图像,因其在下照度、夜间场景和恶劣天气等挑战性条件下的鲁棒性而受到越来越多的关注 [1], [2], [3]。RGB 图像提供了丰富的纹理和颜色线索,但在光照不佳时其可靠性急剧下降 [4], [5]。相比之下,IR 图像捕捉热辐射,对光照变化不那么敏感,但通常表现出较低的空间分辨率和较弱的结构细节 [6], [7]。鉴于它们的互补性,联合利用 RGB 和 IR 模态是实现现实应用中可靠目标检测的一条有前景的途径,包括自动驾驶 [8]、监控 [3] 和遥感 [9], [10], [11]。
尽管取得了实质性进展,但有效融合 RGB 和 IR 信息仍然并非易事。一个基本挑战源于两种模态的异构特性 [7]。尽管 RGB 和 IR 图像观察的是同一个物理场景,但它们在外观、噪声统计和空间细节方面可能存在显著差异。朴素的融合策略,如特征拼接或逐元素操作,往往难以协调这些差异,导致检测性能不佳,特别是在复杂场景中 [1], [2]。
为了解决这个问题,最近的研究越来越多地采用基于注意力的机制来建模跨模态交互。特别是,Transformer 风格的架构利用自注意力和交叉注意力来捕捉模态间的长程依赖和语义对应关系。例如,CFT [12] 引入了跨模态融合 Transformer 来学习模态间依赖关系,而 C2Former [13] 采用校准 Transformer 来同时对齐和融合特征。同样,ICAFusion [14] 提出了一种迭代交叉注意力方案来逐步优化特征。然而,这些方法的一个共同局限性是它们依赖于方向性或不对称的交叉注意力,其中一种模态充当主要查询并从另一种模态检索信息。这样的设计隐含地假设查询模态始终更可靠,但在动态环境中,RGB 或 IR 都可能因眩光、烟雾或黑暗而退化,因此这一假设很少成立。
更重要的是,现有的基于注意力的融合方法通常以完全数据驱动的方式学习跨模态亲和关系,而不施加显式的结构约束。虽然 MROD-YOLO [10] 和 DPAL [11] 等方法改进了遥感中的特征表示,但它们主要强调多尺度聚合或视角对齐,往往忽略了模态间的内在几何关系。从表示的角度来看,RGB 和 IR 描述了相同的物理场景布局,这表明它们的跨模态关系应该允许一种紧凑的共享低维结构 [15]。没有约束,Mutualformer [16] 和 SeaDATE [17] 中的注意力机制可能会产生过于复杂或有噪声的亲和图,这可能放大模态特定伪影并降低检测鲁棒性。在严重的模态不平衡或低对比度条件下,这个问题尤为突出。
受这些观察的启发,我们认为有效的多光谱目标检测不仅需要平衡的跨模态交互,还需要跨模态关系的显式结构正则化。在这项工作中,我们提出了 LR-SMAN,一个用于 RGB-IR 目标检测的低秩对称互注意力网络。与现有的基于注意力的方法不同,LR-SMAN 在跨模态亲和建模中明确强制实施对称性和结构紧凑性。
具体来说,我们引入了一种对称互注意力机制,能够在 RGB 和 IR 表示之间实现双向、模态平衡的信息交换。通过从配对的模态特定亲和图构建共享共识拓扑,所提出的机制缓解了模态主导问题并稳定了跨模态融合。为了进一步保留模态特定的判别线索,我们设计了一种跨模态残差聚合策略,通过残差连接集成跨模态信息,促进稳定优化和有效特征增强。
此外,我们引入了一种基于张量的低秩正则化。通过将模态特定亲和图堆叠成统一张量并在多个结构方向上施加低秩约束,所提出的正则化明确抑制了跨模态关系中的冗余和噪声。这种设计鼓励学习的亲和图捕捉内在的共享语义结构,同时对模态特定干扰保持鲁棒性。值得注意的是,低秩正则化仅在训练期间应用,在推理期间不引入额外的计算开销。
所提出的 LR-SMAN 框架集成到标准的双流检测架构中,可以端到端地训练。在广泛使用的多光谱检测基准上进行的广泛实验表明,LR-SMAN 在挑战性场景(涉及低光照、小目标和复杂背景)中比最先进的方法取得了有竞争力的性能。
总之,本研究的主要贡献如下:
  • •
    我们提出了 LR-SMAN,一种新型多光谱目标检测网络,结合了对称互注意力和对配对模态特定亲和张量的显式结构正则化。
  • •
    我们开发了一种平衡且稳定的跨模态交互机制,通过对称互注意力和残差聚合来缓解模态主导问题。
  • •
    我们引入了一种基于张量的低秩正则化策略来约束共享共识亲和图,从而产生紧凑、鲁棒且具有判别性的多光谱表示。

章节摘要

多光谱目标检测

多光谱目标检测通过联合利用异构感知模态(最常见的是可见光(RGB)和热红外(IR)图像)扩展了常规目标检测,以提高在低光照、恶劣天气和背景杂乱等挑战性条件下的鲁棒性 [18]。与单模态检测器 [19], [20] 不同,单模态检测器依赖于单一视觉线索,当外观信息受损时往往会退化,多光谱方法 [21], [22], [23] 旨在

问题设置与概述

多光谱目标检测旨在通过联合利用不同模态(如 RGB 和红外(IR)图像)的互补信息来识别和定位对象。虽然两种模态都捕捉同一个物理场景,但它们在外观、噪声特性和空间分辨率方面存在显著差异。RGB 图像提供了丰富的纹理和颜色线索,但在低光照条件或恶劣天气下会退化,而 IR 图像对光照变化更具鲁棒性,但

数据集

(1) VEDAI:VEDAI 数据集 [44] 是广泛使用的空中车辆检测基准。每张原始图像约为 16,000×16,000 像素,空间分辨率约为每像素 12.5cm×12.5 cm。在我们的实验中,数据集按 8:2 的比例随机划分为训练集和测试集。我们使用 1246 张配对图像,其中每对包含对齐的 RGB 和 IR 模态,尺寸为 1024×1024 像素。数据集涵盖了多种场景,包括草地

结论

本文提出了 LR-SMAN,一个用于 RGB-IR 多光谱目标检测的低秩对称互注意力网络。所提出的 SMA 从模态特定亲和图构建共享共识拓扑,以实现平衡的跨模态交互,而 TNNR 在训练期间对配对亲和张量施加低秩结构先验。在 VEDAI、LLVIP 和 M3FD 上的实验表明,LR-SMAN 在具有挑战性的多光谱场景下取得了具有竞争力且稳定的性能。

CRediT 作者贡献声明

吴新浩 (Xinhao Wu):撰写 – 初稿,可视化,验证,方法论,调查,正式分析,数据管理。陈金 (Jin Chen):撰写 – 审阅与编辑,验证,正式分析,数据管理。高全学 (Quanxue Gao):撰写 – 审阅与编辑,监督,项目管理,方法论,概念化。杨明 (Ming Yang):撰写 – 审阅与编辑,项目管理。高新波 (Xinbo Gao):监督,项目管理,资金获取。

利益冲突声明

作者声明他们没有已知的竞争财务利益或个人关系可能会影响本文报告的工作。

致谢

作者感谢匿名审稿人和 AE 提出的建设性评论和建议。本工作得到了 国家自然科学基金(资助号:62576263)、陕西省基础研究计划(资助号:2025JC-QYCX-051)、陕西省数理学基础研究计划(资助号:25JSZ008)、中央高校基本科研业务费以及 西安电子科技大学创新基金的支持。
吴新浩 | 陈金 | 高全学 | 杨明 | 高新波
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号