《Sensors》:LapCR-Net: A Lightweight Monocular Depth Estimation Network via Laplacian Residual Reconstruction
编辑推荐:
单目深度估计(Monocular Depth Estimation, MDE)旨在从单张二维(2D)RGB图像中预测逐像素深度,是自动驾驶与移动端三维重建等应用中的关键技术。然而现有轻量级方法受限于计算资源,常依赖浅层特征直接回归深度,导致跨尺度残差信息建模不
单目深度估计(Monocular Depth Estimation, MDE)旨在从单张二维(2D)RGB图像中预测逐像素深度,是自动驾驶与移动端三维重建等应用中的关键技术。然而现有轻量级方法受限于计算资源,常依赖浅层特征直接回归深度,导致跨尺度残差信息建模不足,难以在复杂场景中保持结构一致性与细粒度细节恢复。针对此,研究人员提出LapCR-Net,一种基于拉普拉斯残差重建的轻量级单目深度估计网络。具体而言,研究人员构建渐进式拉普拉斯残差框架,将深度预测分解为由粗到细的多尺度精炼过程;为增强解码器特征表示,引入结构感知特征重标定(Structure-aware Feature Recalibration, SFR)模块与深度引导卷积模块(Depth-guided Convolution Module, DCM),强化空间语义关联并改善跨尺度残差预测;进一步设计不确定性驱动协同精炼策略,通过估计预测不确定性自适应调节残差校正强度,在锐化物体边界的同时抑制纹理伪影。在NYU-Depth V2与KITTI基准上的大量实验表明,LapCR-Net仅以5.4 M参数即取得具竞争力的精度,在结构保持与细节重建上优势明显,实现了精度与计算效率的良好权衡。
研究背景与动机
单目深度估计(MDE)凭借单相机即可推断场景三维几何的优势,广泛应用于机器人导航、自动驾驶与三维重建。但从二维视觉信息推断深度本身是不适定问题,易受尺度模糊、纹理缺失与光照变化干扰。在移动平台等资源受限场景下,现有轻量级网络多借助深度可分离卷积降低复杂度,却因有效感受野不足、解码端采用无结构上采样(双线性插值或转置卷积)而产生过平滑与高频细节丢失;同时多数方法将编码器特征提取与解码器重建分离优化,跨尺度语义不一致与结构过平滑问题未被统一解决。为此,研究人员开展本研究,目标是构建统一轻量框架,在少量参数下联合增强多尺度特征表示、约束上采样过程并自适应校正高频结构残差。
研究内容与结论概要
研究人员提出LapCR-Net,采用改进U形编码-解码架构:编码器以MobileNetV3-Large为骨干,嵌入FA-Mobile多尺度增强、三重交叉注意力(Triple Cross-Attention, TCA)与全局门(Global Gate, GG)瓶颈全局建模;解码器采用渐进拉普拉斯残差重建,由SFR提供结构感知引导、DCM以粗尺度重建深度为显式空间先验生成拉普拉斯残差,并由Sigma Head估计像素级不确定性图参与自适应残差调制。训练采用不确定性感知深度损失与边缘感知平滑损失联合优化。论文发表于《Sensors》。实验在NYU-Depth V2、KITTI及零样本SUN RGB-D上验证,结果表明该网络仅5.4 M参数、5.551 G FLOPs,在RTX 3090达110 FPS(9.09 ms),Jetson Orin NX 8 GB嵌入式端达13.7 FPS(72.0 ms,峰值内存587.95 MB),在室内外基准上取得竞争精度,边界区域与高结构复杂度场景优势显著,为资源受限场景提供实用方案。
主要关键技术方法
研究人员以MobileNetV3-Large为预训练骨干,在编码器各多尺度层加入FA-Mobile双分支(局部分支点卷积+全局平均池化门控)增强;瓶颈处堆叠TCA(沿高度-通道、宽度-通道、通道三维交叉池化与可学习融合)与GG(全局平均池化+双全连接通道重标定)。解码端以瓶颈全局特征线性投影得粗深度,逐层2×上采样,跳接特征经SFR(深度可分离卷积+SE+方向空间注意力)重标定后送入DCM;DCM将前尺度深度上采样对齐作引导,经深度引导卷积与残差头预测当前尺度拉普拉斯残差Δdk,按dk=↑dk-1+Δdk累加精炼,末层4×上采样得全分辨率深度。Sigma Head以1×1卷积+Softplus输出正不确定性σ,参与损失Ldepth=Σ(1/(2σ2))‖d?-d‖2+log σ。样本来自公开队列:NYU-Depth V2(微软Kinect采集室内50688对训练验证、654对测试)、KITTI(64线LiDAR对齐RGB,27052对训练验证、1000对测试)、SUN RGB-D仅作零样本泛化评测。
研究结果
3.1 实验设置:在PyTorch 2.0、RTX 3090、AdamW+One-Cycle余弦退火(lr 1e-4→1e-6,batch 16,50 epoch)下完成,输入尺寸KITTI 640×192、NYU 416×352,评测采用Eigen/Garg裁剪与尺度对齐。
3.2 消融研究:渐进消融自基线(MobileNetV3+U-Net)起逐加FA-Mobile、TCA+GG、SFR、DCM、拉普拉斯重建、Guided Refine,NYU上RMSE由0.4113降至0.3654;独立消融去FA-Mobile则RMSE升至0.3723,去TCA升至0.3741,去不确定性损失升至0.3743,证实各组件互补且TCA长程依赖贡献最大。
3.3 定量结果:同协议重训对照LapDepth/GuideDepth/DaNet,LapCR-Net在NYU获RMSE 0.3654、AbsRel 0.1032、SqRel 0.0599最优;KITTI上AbsRel、SqRel、Acc1(93.5%)领先。扩展对照(保留官方权重)中LapCR-Net的RMSE/SqRel低于HR-Depth、Lite-Mono、BoRe-Depth,虽Depth Anything的AbsRel更低但参数量大数倍。边界区敏感性分析(Sobel 85/90/95分位+膨胀1/3/5)显示LapCR-Net Boundary RMSE始终最低,较Depth Anything最多降8.9%。
3.4 定性结果:NYU室内办公、浴室阴影、杂乱家具场景均保持几何结构连续;KITTI行人与路面过渡平滑;SUN RGB-D零样本下床、浴缸、冰箱等局部不连续处优于GuideDepth/Lite-Mono。
3.5 效率与部署:桌面端5.551 G FLOPs、110 FPS;Jetson Orin NX 8 GB(15 W)13.7 FPS、72.0 ms、587.95 MB峰值内存、11.25 W,证实轻量可嵌入式部署。
讨论部分总结
研究人员指出LapCR-Net核心收益是以紧凑架构换取可靠深度重建而非全面超越大体量模型;拉普拉斯分解将目标由拟合全深度分布转为易优化的局部残差,DCM以粗深度作空间约束抑制跨尺度误差累积;精度-效率权衡中额外计算多用于结构精炼而非吞吐最大化;场景分层(按对数深度梯度分低中高复杂度)显示高复杂度组LapCR-Net的RMSE 0.5619、AbsRel 0.1287反超Depth Anything 3.9%/16.6%。局限在于大均匀弱几何变动区域高频信息少、且未利用视频时序,未来方向为时空残差建模与跨帧不确定性融合。
结论部分翻译
本文提出LapCR-Net,一种基于渐进拉普拉斯残差重建的轻量级单目深度估计框架。其创新性在于统一重建框架内协同解决跨尺度不一致与结构过平滑:不直回归密深度图,而是通过结构感知特征重标定、深度引导残差学习与不确定性感知精炼的协同优化,将深度恢复分解为低频结构预测与高频残差校正。LapCR-Encoder借协同特征建模增强多尺度语义几何表示,LapCR-Decoder以残差耦合拉普拉斯重建渐进重构深度,配合不确定性引导自适应残差精炼,在轻量约束下提升结构一致性、边界保持与细节保持。NYU-Depth V2与KITTI实验证得以5.4 M参数取得竞争性能,边界评估与复杂度分层进一步表明其在高复杂几何场景优势放大;桌面与嵌入式评测确认实用推理效率与低内存,适用于资源受限需结构可靠深度的视觉感知任务。当前框架面向静态RGB未用时序,未来将扩展至轻量时空残差建模以保嵌入效率。