PDN-MVSNet:一种基于纹理先验的多视图立体网络,用于弱纹理重建

《Knowledge-Based Systems》:PDN-MVSNet: A Texture-Prior–Informed Multi-View Stereo Network for Weak-Texture Reconstruction

【字体: 大 中 小 】 时间:2026年01月06日 来源:Knowledge-Based Systems 7.6

编辑推荐:

  多视立体视觉中提出PDN-MVSNet框架,通过融合纹理先验与几何约束解决低对比度区域和误差传播问题。采用Texture-Prior Multi-scale Feature Extractor增强微结构特征,Dual Normal-Depth Regularizer双向正则化抑制尺度漂移,Normal-Similarity Adaptive Cost Aggregation动态聚合邻域支持。在DTU、Tanks and Temples等数据集上实现0.303mm整体精度和64.64平均F-score,显著优于基线方法。

  
Jie Han|Ning Yang|Jun Fang|Lanbo Zhao|Wei Wei|Lin Hu
西安西北工业大学自动化学院,中国陕西省西安市710129

摘要

在真实场景中,多视图立体(MVS)技术仍然面临两个相互关联的挑战:一是低对比度或反射区域,其特征金字塔无法提取足够的判别性线索;二是缺乏显式几何约束时,从粗粒度到细粒度的误差会不受控制地传播。我们提出了PDN-MVSNet框架,该框架结合了纹理先验和几何信息,使重建过程能够利用每个位置上最有信息量的信号。首先,纹理先验多尺度特征提取器(TP-MFE)通过将可学习的特征与手工制作的先验相结合,增强了结构信息,在线索较微弱时的判别能力。其次,双法线-深度正则化器(DNDR)在深度和表面法线之间建立了双向一致性机制,将深度转换为法线再反向转换,从而在抑制尺度漂移的同时细化特征,并生成与边缘对齐的法线。第三,法线相似性自适应成本聚合(NS-ACA)模块根据法线一致性重新分配成本体积中的邻域权重,提高了对光照变化、遮挡边缘和低对比度环境的鲁棒性。在DTU、BlendedMVS和Tanks and Temples数据集上的广泛评估表明,PDN-MVSNet具有竞争力的平均性能:在DTU数据集上的整体准确率为0.303毫米,在Tanks and Temples数据集上的平均F分数为64.64,且在8个场景中均取得了领先。

引言

多视图立体(MVS)技术可以从校准的图像集重建出密集的三维场景,并支持摄影测量[1]、地图绘制[2]和机器人导航[3]。基于学习的MVS技术已经超越了传统的几何处理方法[4],但在光度线索微弱且缺乏显式几何控制的粗粒度到细粒度细化过程中仍会出现问题。两个主要问题如下:特征金字塔可能无法捕捉到微弱但可恢复的结构[5];如果没有跨尺度的几何约束,早期的深度误差会传递到后续阶段并逐渐累积[6]。这与先前的观察结果一致,即多尺度纹理模式难以捕捉,且几何信息没有紧密集成到匹配和正则化过程中[7],[8]。
特征金字塔网络(FPNs)[5]常用于MVS中的多尺度特征提取。最近的方法通过可变形卷积[9],[10],[11]、注意力机制[11],[13]以及法线/曲率线索[14]来扩展功能。然而,仍存在方法上的不足:当单一尺度(或松散融合的)表示占主导时,真实纹理中的复杂尺度耦合微结构难以捕捉。纹理分析显示了丰富的跨尺度行为[15],[16];低层CNN特征缺乏上下文信息,而高层语义信息则削弱了对于对应关系至关重要的像素级细节。这促使人们开发出编码光照鲁棒性微结构的补充先验[17],当这些先验以多尺度方式融合时[18],可以引导主干网络放大细微但具有判别性的模式,而不仅仅依赖于更深层次的神经网络。
在MVS中,有效的成本体积必须保留不同视图之间的差异以实现可靠的对应关系。然而,通用的3D CNN正则化器可能会过度平滑深度边界[14],尤其是在局部证据较弱时,导致细节丢失和空洞出现。图1展示了这一点:Patchmatchnet[9]和CDS-MVSNet[14]在低对比度区域的重建结果中出现了缺失的细结构和空洞。这种平滑处理会降低边界清晰度,并抑制细粒度细节所需的各向异性支持。此外,当成本体积无法区分相似的假设时,粗粒度的深度估计可能不可靠;由于后续阶段依赖于这些估计结果,早期的错误会累积下来。因此,我们的首要目标是提高粗粒度的准确性和边缘感知能力,以减少下游误差的累积,同时保持细粒度的稳定性。
传统的成本聚合通常依赖于基于光度或方差的度量方法,这些方法通常采用近乎均匀的权重分配。在复杂场景中(如光照变化、遮挡边界和特征贫乏的邻域),这种不加区分的聚合方法会错误估计可见性或混合不兼容的支撑信息,从而在3D结果中引入结构偏差和噪声。基于学习的方案(如DeepMVS[19]、FADE[20])通过多级融合和可见性预测来改进匹配效果;[12],[21]使用多尺度池化来调整权重。然而,仍存在两个限制:(1)平面/块状假设和密集采样会增加计算复杂性;(2)几何信息通常在聚合之后才进行处理——可见性或遮挡的判断规则存在于聚合器之外。如果没有在聚合过程中使用显式的几何先验,网络必须通过增加容量来隐式推断几何信息,这在处理细结构和非朗伯反射表面时较为脆弱。
为了解决线索微弱且容易混淆情况下的重建问题,我们提出了PDN-MVSNet。设计原则是:在微结构可恢复时利用互补的先验来增强特征,并嵌入显式的几何信息来调节不同尺度上的假设。我们通过一个逐步优化的框架来实现这一目标,该框架包含三个协同工作的组件,以解决上述问题。
图1中的证据表明,结合纹理线索和显式几何信息对现代MVS有益。图1(a)展示了带有黄色框的参考视图,该框标记了一个用于检查的低对比度屋顶区域。图1(b)至图1(d)展示了三个尺度感知指标:梯度幅度图揭示了在不同视图间保持一致性的微弱边缘流动;拉普拉斯响应突出了区分表面变化的细微强度变化;LBP图展示了具有单调灰度不变性的局部微模式。图1(e)和图1(f)展示了两种代表性的基于学习的基线方法[9],[14]的重建结果。在标记区域内,这两种方法在早期证据较弱时都表现出边界过度平滑和空洞现象。图1(g)展示了我们在同一位置的重建结果,具有更清晰的不连续性和更少的空洞。这种改进反映了三种信号的协同作用:纹理指标使微弱的高频结构变得可见,并在光度线索不足的情况下引导特征形成[15],[16];几何感知的法线-深度一致性在不同尺度上稳定了假设并减少了漂移;法线引导的聚合通过将邻域支持与表面方向对齐来保持不连续性。所选的指标是一类典型的代表,涵盖了的一阶梯度、二阶拉普拉斯响应以及具有良好研究一致性的局部二值模式[17]。这些先验并不局限于这些选择,根据数据特征可以替换为其他经典滤波器或现代变体。在我们的框架中,这些通道是可以互换的,它们的效用来自于多尺度融合以及在推理过程中与几何推理的结合。
为什么选择这些先验?我们采用了三个基本的组成部分:(1)通过局部排名变换(LBP/Census)实现的单调灰度不变性和边界鲁棒性,这些经典的非参数成本在辐射度变化下已被证明对于对应关系具有鲁棒性[17],[23];(2)通过一阶梯度捕捉到的定向结构,这是密集/块状描述符中的核心元素,在弱纹理或重复纹理下仍能保持可靠的匹配[24];(3)通过二阶运算符强调的细微过渡和零交叉点,这些运算符基于边缘理论和尺度空间分析[25]。此外,结合一阶和二阶高斯导数可以产生互补(近乎正交的)响应,有助于纹理/材料的识别[26]。因此,我们采用了Sobel、Laplacian和LBP作为轻量级但原理性的先验,并在第3.2.2节中提供了具体实现细节。
PDN-MVSNet在DTU、Tanks and Temples和BlendedMVS基准测试中进行了评估。实验结果表明其性能处于领先水平:在DTU数据集上的整体准确率为0.303毫米,在Tanks and Temples数据集上获得了最高的平均F分数64.64,优于之前的方法。
总之,本文提出了一种基于纹理先验和几何感知的级联网络,用于多视图立体重建,具有三项关键创新:
(1) TP-MFE:一种纹理先验多尺度特征提取器,它将可学习的CNN特征与轻量级先验(如梯度/Laplacian/LBP)相结合。先验驱动的空间注意力和通道级重新校准能够自适应地降低不可靠先验的权重,从而在纹理质量较差的区域保持鲁棒性。
(2) DNDR:一种双法线-深度正则化器,它在深度和法线之间建立双向循环,强制边缘对齐的一致性并抑制从粗粒度到细粒度的漂移。
(3) NS-ACA:一种法线相似性自适应成本聚合机制,它根据法线一致性重新分配成本体积中的邻域权重,提高了对光照变化、遮挡边界和低对比度区域的鲁棒性。
本文的其余部分安排如下:第2节回顾相关工作;第3节详细介绍了PDN-MVSNet的架构和模块;第4节展示了实验和比较结果;第5节对本文进行了总结。

部分摘录

基于学习的MVS方法

基于深度神经网络(DNNs)的MVS方法已经得到了广泛研究。例如,MVSNet提出了一种端到端的流程,包括提取基于2D CNN的特征、通过单应性变形构建成本体积以及使用3D CNN进行正则化。一些方法试图通过粗粒度到细粒度的策略和循环神经网络(RNNs)来减少3D CNN成本体积正则化的计算负担。

网络

如图2所示,PDN-MVSNet通过两个模块处理已知相机参数的多视图图像。基于纹理先验的多尺度特征提取(TP-MFE)通过ASFF将手工制作的纹理先验与主干特征相结合,形成一个具有纹理感知能力的多尺度金字塔用于匹配。深度估计模块遵循严格的从粗粒度到细粒度的步骤(第1阶段1/8 → 第2阶段1/4 → 第3阶段1/2 → 精细化1/1)。在第k阶段,像素x处的深度假设以双线性方式为中心

数据集

我们使用了DTU数据集[22]、Tanks and Temples数据集[57]和BlendedMVS数据集[58]。DTU数据集[22]包含在七种不同光照条件下捕获的100多个场景,分为训练集、验证集和评估集。它遵循[59]中的方法论,并按照[36]中的描述进行了预处理。Tanks and Temples数据集[57]包括真实的室内和室外场景,分为中级和高级子集。BlendedMVS数据集[58]是一个

结论

在本文中,我们提出了PDN-MVSNet,这是一个结合了纹理先验和几何约束的新框架,用于解决多视图立体重建中的挑战,特别是在纹理缺失的区域。我们的主要贡献包括:(1)TP-MFE模块通过将可学习的CNN特征与手工制作的多尺度先验相结合,增强了纹理可识别区域中的特征提取能力;(2)DNDR模块强制深度图和法线图之间的边缘一致性,减轻了

CRediT作者贡献声明

Jie Han:写作 – 审稿与编辑、原始草稿撰写、可视化、验证、监督、软件开发、资源管理、方法论设计、研究调查、资金获取、正式分析、数据管理、概念构思。Ning Yang:资源管理、项目协调。Jun Fang:正式分析、数据管理。Lanbo Zhao:资源管理、研究调查。Wei Wei:资源管理、研究调查。Lin Hu:资源管理、研究调查。

利益冲突声明

作者声明没有已知的财务利益冲突或个人关系可能影响本文的研究结果。

致谢

本研究未获得任何外部资助。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号