UMAFusion:面向红外与可见光图像融合的不确定性感知语义注入与模态自适应门控方法

《Infrared Physics & Technology》:UMAFusion: Uncertainty-Aware Semantic Injection and Modality-Adaptive Gating for infrared and visible image fusion

【字体: 时间:2026年09月09日 来源:Infrared Physics & Technology 3.8

编辑推荐:

   **摘要** 红外-可见光图像融合(IVIF)旨在生成一张融合图像,既保留显著的热目标信息,又保留丰富的可见光纹理,从而在复杂光照条件下实现稳健的感知能力。近期的任务驱动型IVIF方法得益于语义引导,但仍面临两个关键问题:(i) 在模糊区域(如低光区域、遮挡和物体边界处)语

  

**摘要**

红外-可见光图像融合(IVIF)旨在生成一张融合图像,既保留显著的热目标信息,又保留丰富的可见光纹理,从而在复杂光照条件下实现稳健的感知能力。近期的任务驱动型IVIF方法得益于语义引导,但仍面临两个关键问题:(i) 在模糊区域(如低光区域、遮挡和物体边界处)语义线索不可靠;(ii) 模态可靠性在空间上存在变化,而静态融合规则无法应对。为解决这些问题,我们提出了UMAFusion,一种任务驱动型IVIF框架,包含模态自适应门控(MAG)模块和不确定性感知语义注入模块(U-SIM)。具体而言,MAG通过学习逐像素的softmax权重图来应对空间上变化的模态可靠性,强制红外特征与可见光特征之间产生显式竞争,从而强调更可靠的模态并减少退化线索的泄漏。与此同时,U-SIM通过从轻量级语义头部派生熵归一化的置信度图,并利用该图对语义特征注入进行门控,来缓解语义引导不可靠的问题,从而在可靠区域增强引导效果,同时抑制不确定的语义信息。此外,我们采用了一种可靠性校正的语义损失函数,在训练过程中对模糊像素进行降权。在MSRS、LLVIP、HDO和M3FD数据集上的大量实验表明,UMAFusion在所采用的评估协议下,在融合质量与下游语义分割和物体检测任务的性能之间取得了良好的平衡。源代码可在 https://github.com/heyuan-yuan/UMAFusion 获取。

**引言**

图像融合是一项基础的低层视觉任务,旨在整合来自多个来源的互补信息,生成单一的信息丰富的表示。现代感知系统越来越多地依赖异构传感器,从互补的物理感知模态来表征同一场景[1]、[2]、[3]。其中,可见光相机捕获反射光,提供丰富的纹理和颜色线索,但在光照变化、眩光、雾霾和低光条件下,其成像性能会显著下降。相比之下,红外传感器检测发射的热辐射,能在黑暗或恶劣天气条件下可靠地突出显著目标(如行人和车辆),但红外图像通常存在空间细节有限和表观纹理丰富度较低的问题。基于这些互补特性,红外-可见光图像融合(IVIF)旨在将这两种模态整合为一张融合图像,既能为人工检查提供信息,又能为下游感知任务提供可靠的数据[1]、[3]、[4]。该能力在夜间驾驶辅助和视频监控系统等安全关键场景中具有重要价值,因为在这些场景中,可靠的目标感知和场景理解是不可或缺的[5]、[6]、[7]。

IVIF有着悠久的历史,早期的方法大多通过利用手工设计的先验知识和多尺度表示来提高视觉可解释性,例如金字塔/变换分解[8]、稀疏表示[9]和导向滤波[10]。然而,这些传统方法通常依赖手工特征和固定融合规则,难以适应空间上变化的模态可靠性和复杂的光照变化。此外,设计能够在多种真实条件下泛化的鲁棒手工特征和自适应融合规则仍然具有挑战性。因此,数据驱动的深度学习框架因其能够从数据中学习非线性跨模态表示的能力而被广泛采用。

近期的深度融合方法涵盖了重建、生成建模、注意力和特征分解、光照建模以及退化感知融合[11]、[12]、[13]、[14]、[15]、[16]。尽管这些进展显著提高了图像级别的融合质量[1]、[4],但大多数现有模型仍然主要依赖保真度导向的目标函数(如像素或结构相似度)。虽然这些目标函数确保了与输入的视觉相似性,但它们无法显式保留感知模型所需的语义判别线索——如清晰的物体边界或小热目标。这一局限性催生了任务驱动范式,该范式通过引入高层监督信号(如语义分割或物体检测)来更好地将融合输出与下游需求对齐[17]、[18]、[19]、[20]。近期的语义注入框架逐步注入语义线索或强制语义一致性,以增强任务相关性,同时保持场景保真度[21]、[22]、[23]。然而,在真实场景中,这些方法仍然容易受到两种关键失效模式的影响:

- **(C1) 语义引导不可靠。** 大多数语义引导融合方法将辅助语义预测视为确定性先验,几乎均匀地将其注入融合表示中[17]、[21]。在实践中,语义预测器在具有挑战性的区域(如低光背景、小目标、遮挡和物体边界处)往往存在不确定性,这些区域的类别后验概率模糊不清,且模型校准可能较差[24]、[25]、[26]。在没有可靠性控制的情况下注入这些不确定的语义信息可能会将错误的语义线索传播到融合特征中,导致鬼影、边界模糊,甚至抑制真实的热目标。

- **(C2) 逐像素模态竞争不足。** 红外和可见光模态的相对可靠性在空间上存在变化,并随光照条件改变。例如,夜间车辆前灯可能导致可见光图像严重过曝,而红外图像保持稳定;反之,在照明良好或有阴影的区域,可见光纹理至关重要,而热对比度较弱。然而,许多融合设计仍然依赖静态算子(加法/拼接)或隐式注意力机制,这些机制可能无法强制模态之间产生清晰的竞争,可能导致退化的模态线索泄漏到融合表示中[11]、[13]、[27]。尽管近期的专门设计,如AGMFusion[28]和基于注意力的重加权方法[29],提供了精细的特征引导,但它们通常不会施加显式的逐像素模态竞争。因此,网络可能无法在眩光或热对比度较弱的情况下始终如一地优先选择局部可靠的模态。

为了有针对性地解决这些失效模式,我们提出了UMAFusion,该框架在顺序设计中集成了两个互补机制。首先,模态自适应门控(MAG)模块通过强制红外和可见光特征之间的逐像素竞争来解决模态可靠性问题(C2)。这确保了融合基线由最具信息量的局部信号构建,防止退化特征(如受眩光污染的可见光线索)污染融合表示。在此基础上,不确定性感知语义注入模块(U-SIM)针对语义可靠性问题(C1)进行改进。U-SIM利用这些精炼的特征来估计基于熵的置信度图,随后通过该图对语义注入进行门控以抑制不可靠的语义信息。这两个模块共同构成了一个可靠性感知的流水线,其中显式的模态竞争为后续可靠性门控的语义引导提供了更干净的特征基础。与传统主要隐式估计特征重要性的注意力或门控机制不同,MAG通过softmax归一化的双分支加权方案引入了红外和可见光模态之间显式的逐像素竞争。在每个空间位置上,一个模态贡献的增加必然意味着另一个模态贡献的减少,这有助于抑制局部退化的线索,如可见光眩光或微弱的热响应。而确定性语义注入策略将语义预测视为均匀可靠的先验信息,U-SIM则估计基于熵的置信度图,并根据语义信息的可靠性来注入语义特征。因此,UMAFusion的新颖之处在于联合建模模态可靠性和语义可靠性,以实现任务兼容的红外-可见光融合。

本工作的主要贡献总结如下:

1. 我们提出了UMAFusion,一种任务驱动型IVIF框架,通过集成可靠性感知的模态选择与语义引导来提高融合质量和下游兼容性。
2. 为缓解问题C1,我们引入了U-SIM模块和可靠性校正的语义损失函数。U-SIM利用基于熵导出的置信度选择性注入语义特征,而损失函数通过停止梯度的置信度图对模糊像素进行降权,在不鼓励退化的置信度操纵的情况下减少了不可靠的语义引导。
3. 为缓解问题C2,我们引入了MAG模块,该模块学习softmax归一化的红外和可见光权重图,以强制显式的逐像素模态竞争,并在眩光或热对比度较弱时优先选择局部可靠的模态。

本文其余部分组织如下:第2节回顾了IVIF和语义引导融合的相关工作。第3节介绍了提出的UMAFusion框架。第4节报告了实验结果和分析。最后,第5节总结了本文内容并讨论了未来方向。

**相关工作**

本节从三个角度回顾了与本工作相关的代表性文献:(1) 基于深度学习的红外-可见光图像融合;(2) 语义引导和任务驱动融合;(3) 不确定性建模和自适应模态竞争。

**方法**

在本节中,我们详细介绍了所提出的UMAFusion框架。首先概述整体架构和数据流,然后依次描述双流特征提取、模态自适应门控(MAG)模块和不确定性感知语义注入模块(U-SIM)。最后,我们建立了联合损失函数和可靠性感知的优化目标。

**实验**

本节对所提出的UMAFusion框架进行了系统的实验评估。我们首先介绍实验设置,包括数据集、评估指标和实现细节。随后,将UMAFusion与几种代表性的最先进融合方法进行定性和定量比较,以验证其在复杂场景下的性能。最后,通过一系列消融研究检验核心模块(如U-SIM和MAG)的具体贡献。

**结论**

在本文中,我们提出了UMAFusion,一种集成了模态自适应门控和不确定性感知语义注入的任务驱动型红外-可见光图像融合框架。MAG执行逐像素的模态竞争,根据局部可靠性自适应地平衡红外和可见光特征;而U-SIM则利用来自轻量级语义头部的基于熵的置信度图来调节语义特征注入,减少模糊区域中不确定引导的影响。

**CRediT作者贡献声明**

何媛媛:撰写——初稿、可视化、验证、方法论、调查研究、形式分析、数据整理、概念构思。高雪艳:撰写——审阅与编辑、验证、方法论、调查研究、形式分析。周亚东:撰写——审阅与编辑、撰写——初稿、验证、方法论、调查研究。尹子渡:撰写——审阅与编辑、监督、概念构思。赵珊:撰写——审阅与编辑、监督、资源提供、项目管理。

**资助**

本工作得到了国家自然科学基金[项目编号62466062, 62266052]和云南省应用基础研究重点项目[项目编号202401AU070059, 202401AS070035]的支持。

**利益冲突声明**

作者声明不存在可能影响本文所述工作的已知竞争性经济利益或个人关系。

何媛媛 | 高雪艳 | 周亚东 | 尹子渡 | 赵珊 | 杨洋
云南师范大学信息科学与技术学院,昆明,650500,中国
相关新闻
生物通微信公众号
微信
新浪微博

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号