## 中文标题 LPD-Net:物理启发性先验引导的轻量级自适应权重驱动双流网络用于结构保持的水下图像增强

《Frontiers in Computer Science》:LPD-Net: lightweight adaptive weight-driven dual-stream network guided by physics-inspired priors for structure-preserving underwater image enhancement

【字体: 时间:2026年09月04日 来源:Frontiers in Computer Science 3.4

编辑推荐:

   **摘要** **引言:** 水下视觉传感受到波长依赖性吸收和散射的严重干扰,这些现象会导致非线性色彩偏移和结构雾化。现有增强方法常常面临色彩恢复与几何完整性之间的根本性权衡,其中色彩校正通常以模糊细粒度细节或放大噪声为代价。 **方法:** 提出了一

  


**摘要**

**引言:** 水下视觉传感受到波长依赖性吸收和散射的严重干扰,这些现象会导致非线性色彩偏移和结构雾化。现有增强方法常常面临色彩恢复与几何完整性之间的根本性权衡,其中色彩校正通常以模糊细粒度细节或放大噪声为代价。

**方法:** 提出了一种轻量级物理启发性双流网络(LPD-Net),用于结构保持增强,建立了从物理退化现象到目标神经算子的显式映射。设计了一种双流架构,通过利用原始传感器流作为保真度锚点、物理启发性先验流作为指导,来解耦色彩恢复与几何重建。一个关键创新是空间差异门控融合机制,该机制通过数据驱动感知动态优化原始传感器观测与经验先验之间的像素级权重。通过采用端到端联合优化,该网络在清澈水域中自适应抑制先验引起的伪影,同时在浑浊场景中利用物理启发性指导。

**结果:** 使用水下图像增强基准(UIEB)和大规模水下图像数据集(LSUI)评估了所提出模型的性能。实验结果表明,LPD-Net实现了卓越的恢复质量,在峰值信噪比(PSNR)上比完全对齐的竞争基线高出0.67 dB,并获得了最低的感知失真(0.1227 学习感知图像块相似度(LPIPS))。该框架仅需1.84 M参数的最小占用空间,在中等GPU上以256 × 256分辨率实现了27.70帧/秒(FPS)的核心神经推理吞吐量。

**结论:** 所提出的LPD-Net为结构保持的水下图像增强提供了一种鲁棒、高效且高保真的解决方案。其分辨率无关的设计和具有竞争力的吞吐量展示了在自主水下平台和结构调查系统上实时部署的巨大潜力。
## 论文解读文章

### 研究背景与问题

水下光学成像面临波长依赖性吸收与散射造成的严重退化。自主水下航行器(AUV)在海底资源勘探、水工结构健康监测等任务中高度依赖光学感知,而水下环境中光的选择性衰减与体积散射导致图像呈现蓝绿色偏和对比度损失,形成“雾化效应”。由于水下图像退化的非线性和极端不规则性,在色彩恢复与纹理增强之间找到稳定平衡仍是持久挑战。对于微混凝土裂缝检测等工程应用而言,这些退化会破坏定量缺陷评估所需的细粒度几何细节,因此亟需鲁棒且轻量化的增强算法作为嵌入式平台预处理模块。

现有方法呈现两种范式:基于物理模型的方法依赖逆成像模型,如多尺度Retinex色彩恢复(MSRCR)和暗通道先验(DCP)等,虽能改善色彩,但常常过度补偿物理信号而放大低光区域高频噪声,造成不可逆的伪影。数据驱动的深度学习方法虽取得了显著进展,但现有物理嵌入网络往往将物理先验视为静态输入,未考虑其在不同水域类型中的空间可靠性,导致过度平滑或传播先验引起的伪影,难以满足需要精确结构分析的应用场景。

### 研究内容与意义

针对上述问题,研究人员提出了轻量级物理启发性双流网络(LPD-Net),以动机驱动范式将物理退化现象显式映射到特定神经算子,解决色彩恢复与结构保持之间的根本冲突。该框架通过自适应噪声门控融合(ANGF)机制动态调节物理先验的贡献,并利用CNN细化模块重建几何边缘。在UIEB和LSUI基准上的实验表明,LPD-Net取得了显著优于现有最先进方法的恢复质量,同时保持极低的计算开销和参数量,为结构保持的水下图像增强提供了高效、鲁棒的解决方案。该研究成果发表于《Frontiers in Computer Science》。

### 关键技术与方法

研究采用了以下核心技术方案。实验样本队列来源为两个公开基准:UIEB数据集(890对图像,800对用于训练、90对用于测试,涵盖绿色、蓝色和浑浊场景)和LSUI数据集(4,279对真实深海水下图像,3,850对用于训练、429对用于测试)。主要方法包括:一,利用MSRCR算法生成物理启发性先验,作为颜色校正的经验引导;二,设计自适应噪声门控融合模块,将原始特征、先验特征与空间差异特征拼接,经卷积和Sigmoid函数生成像素级空间权重图γ,再通过加权线性组合完成动态融合;三,构建CNN细化模块,集成混合域注意力(HDA)、大核注意力(LKA)和复合形状卷积(CSC)进行多尺度结构重建,并通过全局残差连接锚定到原始输入;四,采用包含像素损失、结构相似性(SSIM)损失、UCIQE质量损失和Laplacian边界正则化的复合损失函数进行端到端联合优化。

### 研究结果

**3.1 实验设置**:基于PyTorch框架实现,采用AdamW优化器,初始学习率2×10-4,最小学习率1×10-6,余弦退火策略,训练补丁尺寸256×256,批次大小2,在UIEB和LSUI上均训练500轮次。所有对比方法均在单一NVIDIA GeForce RTX 3050 GPU上以256×256分辨率进行标准化推理效率基准测试。

**3.2 全分辨率图像定量与定性评估**:在原生全分辨率图像上,LPD-Net在UIEB数据集上PSNR达22.4800 dB,较UIR-Baseline提升0.29 dB,SSIM达0.9146;在LSUI数据集上PSNR达26.5045 dB,较UIR-Baseline提升0.67 dB,SSIM达0.8833。局部感兴趣区域可视化表明,大尺寸图像处理不引入结构边界退化或块状伪影,红色光谱得到自然恢复且不损伤背景结构完整性。

**3.3 固定分辨率图像定量与定性评估**:在统一的256×256分辨率协议下,LPD-Net在UIEB上PSNR达22.7348 dB,在LSUI上达26.7107 dB,分别较物理先验最先进方法DPF-Net高出1.15 dB和5.63 dB。Transformer架构方法U-Shape因过平滑效应导致性能严重下降,PSNR仅19.8543 dB(UIEB);而卷积主导的双流架构有效保留了锐利边缘和纹理边界。

**3.4 高分辨率图像块鲁棒性分析**:在不重采样的256×256裁剪图像块评估中,LPD-Net在LSUI上以26.2864 dB PSNR、0.8879 SSIM和0.1236 LPIPS全面领先。Canny边缘图显示,所提方法产生干净、连续且定位良好的结构轮廓,对比之下Pure-MSRCR和DPF-Net产生密集但嘈杂的边缘响应,UIR-Baseline和Semi-UIR则因过平滑导致边缘稀疏。

**3.5 机制分析**:全分辨率样例(Image 8056)的边缘图表明,Pure-MSRCR产生大量虚假边缘,Baseline因过平滑生成不完整的稀疏边缘,而所提方法在全局结构完整性与局部纹理细节之间实现平衡,提取的边缘边界与参考图高度一致。灰度直方图分析显示,所提方法动态范围显著扩展且分布均匀,避免了极端像素值累积,有效抑制了量化噪声和人工色带。

**3.6 消融研究**:单独使用MSRCR先验的配置PSNR仅为14.78 dB(UIEB)和13.99 dB(LSUI),而集成CNN细化骨干后大幅提升至22.19 dB和25.84 dB。将自适应门控替换为静态拼接或平均融合,PSNR和SSIM均出现明显下降,其中平均融合的SSIM在UIEB上降至0.9097,LSUI上降至0.8552,证实自适应门控作为智能信号选择器对结构保持不可或缺。

**3.7 自适应权重分析**:学习和空间权重图γ可视化显示,清澈但偏蓝的潜水员场景(Image 925)平均γ值为0.6478,网络更依赖先验流进行色彩校正;严重浑浊的珊瑚礁场景(Image 8056)平均γ值为0.7053,网络更多锚定原始特征以抑制先验伪影。两种场景下γ的标准差分别为0.033和0.037,证明该模块执行的是像素级局部调制而非空间不变全局权重。

### 讨论

自适应门控机制使网络能够依据局部退化强度动态调节物理先验的影响,解决了传统“恢复-增强冲突”。效率基准显示,LPD-Net在RTX 3050 GPU上以1.838 M参数和13.79 G MACs实现28.00 FPS纯骨干推理,而Transformer模型U-Shape尽管理论MACs较低,实际推理仅为15.81 FPS,且在自注意力计算期间出现高内存峰值。端到端延迟优化表明,未优化的Python版MSRCR预处理占用总循环115.25 ms(超过75%);通过编译为C++并结合查找表和核尺寸上限优化,预处理降至5.50 ms,总端到端延迟42.31 ms,支持23.63 FPS的准实时吞吐量。将非学习型先验生成放在主机CPU/图像信号处理器(ISP)上是有意的资源争用缓解设计,确保GPU算力集中于深度神经网络。未来工作方向包括优化混合域注意力中的快速傅里叶变换(FFT)在非2的幂分辨率下的计算峰值,并将框架集成到自主缺陷检测系统中,以及在深海热液喷口等极端环境下开展评估。

### 研究结论

本文提出了一种物理启发性自适应双流网络,以解决水下图像增强中颜色恢复与结构噪声抑制之间的权衡。通过引入自适应“噪声门”机制,在不同退化条件下实现了原始图像保真度与物理启发性指导之间的动态平衡。在UIEB和LSUI数据集上的广泛评估表明,所提出的方法取得了具有竞争力的性能,在客观指标(PSNR和SSIM)和感知质量方面均对代表性数据驱动基线实现了持续改进。Canny边缘分析和图像块评估进一步支持了该框架在保持结构细节方面的有效性,表明其适用于高精度检测任务。此外,该网络直接在高分辨率输入上运行,规避了固定分辨率处理流程常引入的插值伪影,从而更好地维持结构完整性——这对实际工程应用至关重要。尽管有效,模型仍保持仅1.84 M参数的紧凑规模,在视觉增强质量与计算效率之间提供了出色平衡。
相关新闻
生物通微信公众号
微信
新浪微博

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号