面向弱监督可见光-红外行人重识别的多层级协同对齐框架

《Pattern Recognition》:Multi-level synergy alignment framework for weakly supervised visible-infrared person re-identification

【字体: 大 中 小 】 时间:2026年09月25日 来源:Pattern Recognition 9.1

编辑推荐:

   •提出了一种用于弱监督VI-ReID的多层协同框架。•CSCB通过频域融合改进跨谱结构。•SOSA学习语义锚点以实现判别性的全局-局部表示。•UDES通过可靠性调制减少有噪声的跨模态监督。引言行人重识别(ReID)旨在从不同摄像头的非重叠视角检索同一行人的图像,已成为智能监控

  
  • •
    提出了一种用于弱监督VI-ReID的多层协同框架。
  • •
    CSCB通过频域融合改进跨谱结构。
  • •
    SOSA学习语义锚点以实现判别性的全局-局部表示。
  • •
    UDES通过可靠性调制减少有噪声的跨模态监督。

引言

行人重识别(ReID)旨在从不同摄像头的非重叠视角检索同一行人的图像,已成为智能监控、跨摄像头检索和公共安全应用中的重要技术[1]。大多数传统ReID方法依赖于可见光(VIS)图像进行身份匹配。然而,在夜间、低光照或复杂光照条件下,VIS摄像头的成像质量往往下降,导致识别性能不可靠。为了支持全天候监控,红外(IR)摄像头通常与VIS摄像头协同部署,由此产生了可见光-红外行人重识别(VI-ReID)[2]。与单模态ReID相比,VI-ReID需要在区分身份差异的同时,克服由不同成像机制、颜色信息和纹理分布引起的巨大模态差异[3]、[4]。
现有的大多数VI-ReID方法遵循全监督学习范式,依赖精确标注的跨模态身份对应关系。然而,在大规模VIS和IR图像之间建立可靠的身份对应关系需要大量的人工标注工作,而摄像头视角、光照条件和成像质量的差异进一步增加了标注难度。为了降低这种标注依赖,弱监督VI-ReID逐渐受到关注。在该设置下,仅可获得模态内身份标签,即VIS和IR图像在各自模态内独立标注,而无法获得显式的跨模态身份对应关系[5]。尽管这种设置减轻了标注负担,但由于缺乏直接的跨模态监督,难以在VIS和IR图像之间建立可靠的身份关联。
弱监督VI-ReID在信号表示、结构语义和优化可靠性方面面临挑战。在信号表示层面,VIS和IR图像表现出显著的低级成像差异,其中颜色、纹理和边缘响应等模态相关因素可能干扰具有身份判别性的表示学习,这促使了基于对齐的策略来缓解表示漂移[6]、[7]、[8]。在结构语义层面,缺乏显式的跨模态对齐参考使得全局表示不足以捕捉细粒度身份线索,如头肩区域、躯干轮廓和局部外观细节。在优化可靠性层面,跨模态对应关系通常通过模型预测或基于聚类的伪标签生成来推断,不可靠的伪标签可能引入噪声监督,从而降低训练稳定性和对齐性能[9]、[10]。
为应对这些挑战,本文提出了一种多层协同对齐框架(MSAF),从信号表示、结构语义和优化可靠性三个层面提升弱监督VI-ReID的性能。跨谱一致性模块(CSCB)执行频域特征分解和自适应融合,以整合互补的频域成分并减少谱成像差异的影响。自组织语义锚定(SOSA)模块通过可学习原型发现判别性局部语义锚点,从而构建更具表达力的全局-局部表示。遵循基线方法[5]中的异构专家设计,不确定性驱动的专家协同(UDES)机制通过动态门控策略估计样本级可靠性,并调节跨模态预测分数,以减少优化过程中不可靠伪标签的影响。
本文的主要贡献总结如下:
  • •
    提出了一种用于弱监督VI-ReID的多层协同对齐框架(MSAF)。通过从信号表示、结构语义和优化可靠性层面联合建模跨模态差异和伪标签噪声,MSAF为弱监督可见光-红外身份匹配提供了一个统一框架。
  • •
    为增强模态鲁棒的行人表示,集成了CSCB和SOSA以利用互补的信号级和结构级线索。CSCB通过频域分解和自适应融合整合互补的频域成分,以增强跨谱结构表示,而SOSA通过可学习原型发现判别性局部语义锚点,以构建全局-局部表示。
  • •
    引入了一种感知可靠性的优化机制,称为UDES,以提升跨模态关联学习的质量。UDES通过动态门控策略估计样本级可靠性,并调节跨模态预测分数,从而减少弱监督训练过程中不可靠伪标签的负面影响。
  • •
    在SYSU-MM01和LLCM上的大量实验证明了所提框架的有效性。

章节片段

可见光-红外行人重识别

VI-ReID旨在匹配从不同谱模态捕获的行人图像,可被视为常规ReID在全天候监控方面的重要扩展。Wu等人[2]首次引入了RGB-红外跨模态ReID任务,并构建了SYSU-MM01基准数据集,该数据集已成为该领域应用最广泛的数据集之一。由于VIS图像包含丰富的颜色和纹理信息,而IR图像主要反映热辐射响应,因此存在显著的……

框架概述

如图1所示,本文提出了一种用于弱监督VI-ReID的多层协同对齐框架(MSAF)。MSAF通过信号表示、结构语义和优化可靠性层面的协同建模来缓解模态差异和伪标签噪声。在信号表示层面,跨谱一致性模块(CSCB)对中间骨干特征执行频域分解和自适应融合,以整合互补的……

数据集与评估协议

为评估所提出的多层协同对齐框架(MSAF)的有效性,本文在两个公开的可见光-红外行人重识别数据集上进行了实验,即SYSU-MM01[2]和LLCM[19]。在训练过程中,本文遵循弱监督VI-ReID设置,即仅使用模态内身份标签,而无法获得可见光和红外图像之间显式的跨模态身份对应关系。
SYSU-MM01包含由……采集的491个身份……

结论

本文提出了一种用于弱监督VI-ReID的多层协同对齐框架(MSAF)。通过联合集成CSCB、SOSA和UDES,MSAF在一个统一框架内缓解了跨谱成像差异、局部结构语义不足以及不可靠的跨模态监督。这种设计使模型能够在没有显式跨模态身份对应关系的情况下学习更具模态鲁棒性和身份判别性的表示。实验结果表明……

CRediT作者贡献声明

田青:写作–审阅与编辑、监督、资源、项目管理、资金支持。张炳辉:写作–初稿、验证、软件、方法论、形式化分析、概念化。程凯扬:写作–审阅与编辑、形式化分析。欧玮华:写作–审阅与编辑、可视化。万军:写作–审阅与编辑、资源。雷震:写作–审阅与编辑、资源。

利益冲突声明

作者声明不存在任何已知的可能影响本文所述工作的竞争性财务利益或个人关系。

致谢

本工作得到国家自然科学基金(资助编号:62176128)、江苏省基础研究计划(资助编号:BK20231143)、教育部藏学信息处理重点实验室开放项目(资助编号:QHSF-CS-2609)、中央高校基本科研业务费专项资金(项目编号:NJ2023032),以及江苏省333高层次人才培养工程的资助。
田青|张炳辉|程凯扬|欧玮华|万军|雷震
相关新闻
生物通微信公众号
微信
新浪微博

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号