ResGASP-GAN: 一种带有PatchGAN鉴别器的残差组归一化ASPP-SE生成对抗网络用于低光照图像增强

《Mathematics》:ResGASP-GAN: A Residual Group-Normalized ASPP-SE GAN with a PatchGAN Discriminator for Low-Light Image Enhancement

【字体: 时间:2026年07月19日 来源:Mathematics 2.3

编辑推荐:

  低光照彩色图像增强对于基于视觉的决策系统仍是一项具有挑战性的任务,该系统必须同时从单一退化的观测中解决光照校正、噪声抑制、对比度恢复和色彩保留问题。本研究提出了ResGASP-GAN,一种基于生成对抗网络(GAN)的低光照图像增强框架,其核心是一个残差输出生成

  
低光照彩色图像增强对于基于视觉的决策系统仍是一项具有挑战性的任务,该系统必须同时从单一退化的观测中解决光照校正、噪声抑制、对比度恢复和色彩保留问题。本研究提出了ResGASP-GAN,一种基于生成对抗网络(GAN)的低光照图像增强框架,其核心是一个残差输出生成器,该生成器在条件对抗设置中集成了与批次大小无关的归一化、多尺度上下文聚合和通道级特征重校准。研究人员将组归一化(GN)整合到所提出的生成器中,以减小小批次训练中对批次统计量的依赖,同时挤压激励(SE)模块自适应地实现通道级特征重校准,有助于保留结构和色度信息。所提出的生成器使用反射填充卷积来减少边界伪影,并包含一个由膨胀残差块和空洞空间金字塔池化(ASPP)组成的多尺度瓶颈,以捕获空间变化的照明模式。该模型通过一个复合目标函数进行优化,该函数结合了对抗项和L1重建损失,平衡了感知真实性与像素级保真度。实验评估使用了LOL-v1、LOL-v2-Real和LOL-v2-Synthetic数据集,并采用了基于参考的指标:峰值信噪比(PSNR)、结构相似性指数(SSIM)和学习感知图像块相似度(LPIPS)。同时使用了无参考感知指标,包括自然图像质量评估器(NIQE)和盲/无参考图像空间质量评估器(BRISQUE)。结果表明,所提出的方法在LOL-v2-Real上达到了具有竞争力的结构相似性和视觉图像质量,在LOL-v1上具有竞争力的重建性能,在LOL-v2-Synthetic上具有良好的泛化能力,在该数据集上报告的指标中取得了第二好的PSNR = 22.30 dB、SSIM = 0.9154和LPIPS = 0.1022。相比之下,使用无参考指标时,本研究取得了非常好的结果,最低的BRISQUE为10.4540,具有竞争力的NIQE为4.4396,提供了高质量的可视感知重建。总体而言,所提出的架构为低光照图像增强提供了一种具有竞争力的基于GAN的替代方案,结合了残差连接、多尺度上下文建模和通道级特征细化。该架构在所有讨论的模型中提供了最低的推理时间,这在机器人导航和建图等实时户外应用中非常需要。
论文解读:ResGASP-GAN:一种用于低光照图像增强的残差组归一化ASPP-SE生成对抗网络

**研究背景与现存问题**
低光照条件会通过增加噪声、降低对比度和扭曲色彩来降低图像质量,从而损害自动驾驶、监控、医学成像、机器人技术和消费摄影等关键计算机视觉任务。传统的低光照增强方法,如灰度变换、直方图均衡化和基于Retinex的技术,虽然简单且计算成本低,但难以在多样化的场景中提供鲁棒且视觉一致的结果,常导致过增强、伪影、颜色失真或泛化能力差。生成对抗网络(GAN)在低光照图像增强(LLIE)领域展现出潜力,但现有GAN架构仍难以同时恢复空间变化的照明、保持结构细节和维持色彩一致性,常导致噪声放大、伪影、颜色偏差或过/欠曝光。这些不足促使研究人员设计一种结合组归一化(GN)、多尺度上下文建模和通道级特征重校准的新型架构。

**研究内容与结论**
本研究提出ResGASP-GAN,一种基于ResUNet-like生成器和条件PatchGAN鉴别器的GAN框架,用于低光照图像增强。生成器集成了GN、反射填充卷积、膨胀残差块、空洞空间金字塔池化(ASPP)和挤压激励(SE)注意力,以改善训练稳定性、捕获多尺度上下文信息并保留结构和色度细节。实验在LOL-v1、LOL-v2-Real和LOL-v2-Synthetic三个数据集上进行,使用全参考指标(PSNR、SSIM、LPIPS)和无参考指标(NIQE、BRISQUE)评估。结果表明,该模型在LOL-v1上取得具有竞争力的性能,在LOL-v2-Real上获得第二高的SSIM(0.8446),在LOL-v2-Synthetic上取得第二好的PSNR(22.30 dB)、SSIM(0.9154)和LPIPS(0.1022)。无参考指标方面,该模型在LOL-v1上取得最低的BRISQUE(10.4540)和具有竞争力的NIQE(4.4396)。研究还通过消融实验验证了残差连接(RC)、谱归一化(SN)、SE、ASPP、优化器(AdamW vs. Adam)和归一化方法(GN vs. BN)的贡献,确认AdamW-GN结合RC、SN、SE和ASPP的配置在多个指标上实现了平衡的性能。该架构在保持高模型容量(26.3 M参数,171 GFLOPs)的同时,实现了0.0366秒/张的快速推理时间,优于其他高容量LLIE方法。该研究发表在《Mathematics》上。

**主要关键技术方法**
研究人员主要采用以下关键技术:1)基于ResUNet的编码器-瓶颈-解码器生成器,使用残差学习预测照明校正残差;2)组归一化(GN)替代批次归一化(BN),以支持小批次训练并稳定优化;3)空洞空间金字塔池化(ASPP)模块,通过并行膨胀卷积(膨胀率1, 2, 4, 6)捕获多尺度上下文信息;4)挤压激励(SE)注意力模块,用于通道级特征重校准,强调照明和色彩相关特征;5)条件PatchGAN鉴别器,使用谱归一化约束Lipschitz常数,输出局部图像块的logit图;6)复合损失函数,结合对抗损失和L1重建损失。实验数据来自LOL-v1(485训练/15测试)、LOL-v2-Real(689训练/100测试)和LOL-v2-Synthetic(900训练/100测试)数据集。

**研究结果**
**4.1 数据集**:研究人员使用LOL-v1、LOL-v2-Real和LOL-v2-Synthetic三个公开数据集,均包含低光照与正常光照图像对,按照标准协议划分训练和测试集,并有意省略数据增强以保持原始分布。

**4.2 评估指标**:采用全参考指标PSNR(像素级保真度)、SSIM(亮度、对比度、结构相似性)、LPIPS(基于预训练网络的特征感知相似性),以及无参考指标NIQE(自然场景统计偏离度)和BRISQUE(空间域局部统计偏离度)。所有指标定义明确,用于评估模型性能。

**4.3 数值结果**:通过对比多个近期LLIE方法,该模型在LOL-v1上PSNR为20.34 dB,SSIM为0.8550,LPIPS为0.1412;在LOL-v2-Real上PSNR为19.62 dB,SSIM为0.8446,LPIPS为0.2060;在LOL-v2-Synthetic上PSNR为22.30 dB,SSIM为0.9154,LPIPS为0.1022,在对比方法中均排名第二(仅次于Song [20])。无参考指标方面,在LOL-v1上NIQE为4.4396,BRISQUE为10.4540(最低);在LOL-v2-Real上NIQE为4.8255,BRISQUE为11.4650;在LOL-v2-Synthetic上NIQE为4.3764,BRISQUE为10.5250。效率对比显示,该模型推理时间最短(0.0366 s),但FLOPs和参数量最高。

**4.4 消融研究**:通过启用/禁用RC、SN、SE、ASPP、优化器和归一化方法,评估各组件贡献。结果表明,完整配置(RC+SN+SE+ASPP+AdamW+GN)在三个数据集上取得了平衡的最佳性能。GN相比BN在小批次训练中更稳定,尤其在LOL-v1上AdamW-GN将PSNR从19.25 dB提升至20.34 dB,SSIM从0.8460提升至0.8550。在LOL-v2-Real上,GN改善了LPIPS、NIQE和BRISQUE。在LOL-v2-Synthetic上,GN配置在PSNR和SSIM上均优于BN。消融研究确认,RC有助于结构保持,SE和ASPP分别贡献通道重校准和上下文聚合,但单一指标最大化(如PSNR)可能牺牲其他感知质量。

**4.5 定性结果**:通过展示LOL-v1、LOL-v2-Real和LOL-v2-Synthetic上代表性样本的增强图像及归一化CIE-LAB直方图(L*、a*、b*通道),定性显示模型能有效恢复亮度、对比度和色彩分布,增强图像与真实图像在直方图上高度重叠,表明良好的色彩保真度和结构保留。在LOL-v2-Synthetic上,增强图像与真实图像略有色调偏差,但整体可见性显著提升。

**讨论与结论**
讨论部分指出,该模型提供了一个平衡的GAN替代方案,特别在真实低光照条件下,GN适合小批次训练,谱归一化稳定了鉴别器,多尺度瓶颈和SE机制增强了上下文和判别能力。在LOL-v2-Synthetic上表现最佳,因合成退化更规则;在LOL-v2-Real上PSNR较低但SSIM较高,表明结构保持良好。模型在推理时间上具有优势,得益于全卷积架构的GPU并行性。消融研究显示各组件交互依赖数据集和指标,最终配置是权衡结果。研究结论翻译如下:
本研究提出了一种基于GAN的低光照图像增强框架,构建于ResUNet-like生成器和条件PatchGAN鉴别器之上。所提出的生成器结合了组归一化、反射填充卷积、膨胀残差块、空洞空间金字塔池化和挤压激励注意力,以改善训练稳定性、捕获多尺度上下文信息并保留相关结构和色度细节。在LOL-v1、LOL-v2-Real和LOL-v2-Synthetic上的实验评估表明,该模型在LOL-v1上取得具有竞争力的性能,在LOL-v2-Real上取得具有竞争力的结构相似性,而在LOL-v2-Synthetic上取得最佳基于参考的结果,表现为更高的PSNR和SSIM值以及更低的LPIPS值。总体而言,这些结果表明,所提出的架构通过整合稳定优化与多尺度特征建模,是低光照图像增强的一种可行替代方案。从实际应用角度,该框架适用于监控、自主感知、夜间成像和计算机辅助视觉分析等低光照场景。然而,在更具挑战性的真实低光照条件下鲁棒性略有下降,表明需要进一步改进以增强对复杂光照分布的泛化能力。未来工作将集中于提高对严重且空间非均匀退化的鲁棒性,扩展到更广泛的真实低光照数据集,并探索资源受限部署的更高效实现。消融结果进一步支持最终设计选择,表明ResGASP-GAN的合理性更多源于RC、SN、SE、ASPP和AdamW-GN的联合行为,而非任何孤立组件或单一指标。该分析强化了所选配置作为在异质低光照条件下实现照明校正、结构保持和感知/无参考质量的平衡解决方案。
相关新闻
生物通微信公众号
微信
新浪微博

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号