DOU-Pose:面向重复性低纹理智能交通环境中自动驾驶车辆的鲁棒相机视觉定位

《Sensors》:DOU-Pose: Robust Camera-Based Visual Localization for Autonomous Vehicles in Repetitive and Low-Texture Intelligent Transportation Environments

【字体: 时间:2026年08月11日 来源:Sensors 4.0

编辑推荐:

  精确且鲁棒的车辆定位是自动驾驶的关键前提。然而,现有的视觉位姿估计方法在重复性结构或稀疏纹理占主导的场景中往往表现不佳。这些条件导致3D场景坐标的预测产生歧义,并出现高比例的结构性离群值——即形成连贯聚类、足以欺骗标准估计器的错误预测。为解决上述局限性,本文提

  
精确且鲁棒的车辆定位是自动驾驶的关键前提。然而,现有的视觉位姿估计方法在重复性结构或稀疏纹理占主导的场景中往往表现不佳。这些条件导致3D场景坐标的预测产生歧义,并出现高比例的结构性离群值——即形成连贯聚类、足以欺骗标准估计器的错误预测。为解决上述局限性,本文提出了DOU-Pose(Depthwise Over-parameterized U-shaped Pose estimation),一种基于可微采样一致性(Differentiable SAmple Consensus, DSAC)*流程构建的视觉位姿估计框架。其核心思想是通过改进特征提取来增强场景坐标回归的判别能力。具体而言,研究人员将标准卷积层替换为深度过参数化卷积(Depthwise Over-parameterized Convolution, DO-Conv),该卷积在训练阶段引入辅助的可学习深度卷积核以丰富网络的表征能力,同时允许在推理阶段将其融合为单一卷积核。此外,研究人员设计了一种采用转置卷积的U形回归网络,以保留空间细节并强化细粒度几何推理能力。整个流程通过将密集场景坐标预测与可微鲁棒估计器耦合,实现端到端训练。大量实验表明,DOU-Pose在公开基准上取得了具有竞争力的性能,并在自采集的Campus-AV数据集上展现出显著的鲁棒性提升,尤其是在重复性和低纹理的户外驾驶场景中。
**DOU-Pose:面向重复性低纹理智能交通环境中自动驾驶车辆的鲁棒视觉定位方法解读**

**一、研究背景与动机**

精确且鲁棒的车辆定位是自动驾驶系统与智能交通系统(Intelligent Transportation Systems, ITSs)安全运行的基础前提。尽管多传感器融合系统(如GNSS/LiDAR/IMU)在实践中被广泛采用,但在城市峡谷、隧道等复杂环境中,卫星信号易受遮挡或多径效应干扰,导致定位可靠性显著下降。在此类场景下,视觉位姿估计通过估计相机相对于预建场景的六自由度(Six-Degrees-of-Freedom, 6-DoF)位姿,提供了一种重要的互补解决方案。近年来,基于学习的视觉定位方法取得了显著进展,其中场景坐标回归(Scene Coordinate Regression, SCR)方法,如DSAC++和DSAC*,通过训练神经网络预测查询图像中每个2D像素对应的3D世界坐标,进而利用透视n点(Perspective-n-Point, PnP)算法在随机采样一致性(RANSAC)框架内估计相机位姿,在精度与鲁棒性之间取得了有效平衡。

然而,将SCR方法直接应用于真实世界的自动驾驶场景仍面临严峻挑战。与室内环境相比,驾驶场景呈现出更强的视觉模糊性、更大的外观变化以及更严重的结构重复。具体而言,交通环境中普遍存在的重复性结构(如高速公路护栏、具有相似窗户的建筑物立面、围栏、道路边界和车道标线)往往在局部外观上高度相似,却对应不同的全局3D位置。对于局部感受野受限的标准卷积神经网络(CNN)回归网络而言,仅依据局部外观区分这些区域极为困难,易产生歧义性预测。更为棘手的是,这些错误并非孤立的随机离群值,而是常形成连贯的几何结构,对鲁棒估计器仍具有迷惑性,从而显著增加位姿估计失败的风险。此外,稀疏纹理或无纹理区域(如大面积均匀沥青路面、天空、过度曝光表面或弱纹理墙面)同样构成重大挑战。在这些区域中,可用的判别性图像线索有限,网络难以仅凭外观推断稳定的对应关系,导致预测的场景坐标噪声大、不稳定,从而减少有效对应点数量,明显降低PnP-RANSAC流程的整体鲁棒性。因此,提升视觉模糊区域中场景坐标预测的质量,对于实现自动驾驶中的可靠定位至关重要。

**二、研究内容与总体架构**

针对上述问题,研究人员提出了DOU-Pose(Depthwise Over-parameterized U-shaped Pose estimation)框架。该框架并非单纯依赖下游鲁棒估计来剔除错误对应关系,而是致力于从根本上提升场景坐标预测的质量。其核心策略包含两点:其一,在回归骨干网络中引入深度过参数化卷积(DO-Conv),以增强网络在感知混叠和弱纹理条件下的特征判别能力,并在推理阶段融合辅助核参数化;其二,将回归网络重构为带有转置卷积和跳跃连接的U形架构,使深层上下文特征与浅层高分辨率线索相结合,实现空间上更精确的场景坐标预测。通过将这些改进嵌入可微RANSAC框架,DOU-Pose实现了从密集场景坐标回归到最终相机位姿估计的端到端训练,有效结合了增强的场景坐标预测与基于几何的位姿估计结构。该研究发表在《Sensors》期刊上。

**三、主要技术方法**

研究人员采用的主要技术方法包括:1)**深度过参数化卷积(DO-Conv)**:在训练阶段引入辅助深度卷积核,通过核折叠(kernel folding)技术使推理阶段仅需执行标准卷积;2)**U形编码器-解码器架构**:采用DO-Conv编码器提取多尺度特征,通过转置卷积解码器恢复空间分辨率,并利用跳跃连接融合深浅层特征;3)**可微RANSAC位姿优化**:基于DSAC*流程,通过软内点计数进行概率性假设选择,实现梯度从位姿损失到场景坐标回归网络的反向传播;4)**两阶段训练策略**:先通过热身(warm-up)阶段初始化网络,再进行端到端优化;5)**RGB-D双模态支持**:在RGB模式下使用PnP求解器,在RGB-D模式下使用Kabsch算法进行3D-3D对应配准。实验数据来源于7-Scenes、12-Scenes公共基准数据集以及研究人员自采集的Campus-AV数据集(使用配备ZED 2i相机的网联自动驾驶汽车平台采集,包含50,000帧同步图像,其中37,500帧为训练集,12,500帧为测试集)。

**四、实验结果与结论**

**4.1 公共基准数据集性能**

在7-Scenes和12-Scenes室内基准上,DOU-Pose取得了与强基线方法相当的性能。在7-Scenes数据集上,DOU-Pose的平均平移和旋转误差分别为2.81 cm和0.90°,定位精度为81.48%,相较于DSAC*的78.23%提升了3.25个百分点。在具有挑战性的Heads和Stairs场景中提升尤为显著,其中Heads场景精度从92.4%提升至99.4%,Stairs场景精度从56.3%提升至64.2%。在12-Scenes数据集上,DOU-Pose取得了1.03 cm、0.44°的平均误差和99.50%的定位精度。在RGB-D输入模式下,DOU-Pose在7-Scenes和12-Scenes上的定位精度分别达到94.53%和99.83%。

**4.2 Campus-AV实车数据集性能**

在自采集的Campus-AV户外实车数据集上,DOU-Pose展现出明显的鲁棒性优势。相对于DSAC*,DOU-Pose将平均平移误差从5.410 m降低至4.803 m(相对降低11.2%),平均旋转误差从7.597°降低至7.260°(相对降低4.4%)。严格成功率(2 m/2°)从10.8%提升至16.8%,宽松成功率(5 m/5°)从53.3%提升至62.8%。在1 m、2 m和5 m平移阈值下的累积成功率分别从3.9%、15.1%和59.8%提升至6.2%、22.8%和69.1%。逐帧误差分析显示,在重复性结构(帧003450-003619)和低纹理区域(帧003620-003749)的连续路段中,DOU-Pose在大部分帧上均保持更低的平移和旋转误差轨迹。

**4.3 消融研究**

在7-Scenes数据集上的消融实验表明,DO-Conv模块和转置卷积模块均能独立提升定位精度,且两者具有互补性。相较于基线模型,单独引入DO-Conv将平均精度从78.2%提升至80.1%,单独引入转置卷积提升至79.0%,而完整模型达到81.48%的最佳结果。在Campus-AV数据集上,DO-Conv将严格和宽松成功率从10.8%和53.4%提升至14.6%和59.3%,转置卷积变体达到12.9%和56.7%,完整模型则取得16.7%和62.8%的最高成功率。

**五、讨论与结论**

消融实验结果验证了DO-Conv和转置卷积两种设计各自的有效性及其互补性,表明DO-Conv增强了特征表征能力,而转置卷积改善了空间细节恢复能力。在模型复杂度方面,核折叠技术使DOU-Pose的参数量从训练时的11.42 M降至推理时的11.09 M,推理延迟从58.96 ms降至57.21 ms,在RTX 3070上达到17.48 FPS。

本文提出了DOU-Pose,一种集成深度过参数化卷积和U形架构的视觉位姿估计框架,旨在改善自动驾驶中感知混叠和特征稀疏条件下的场景坐标预测。实验结果表明,该方法在公共室内基准上取得了与强基线方法相当的性能,并在包含重复性和低纹理户外序列的Campus-AV数据集上相对于DSAC*实现了指标提升。未来工作将致力于通过扩展涵盖多样天气条件的数据集并引入动态目标过滤模块,进一步增强系统在复杂动态环境中的鲁棒性。
相关新闻
生物通微信公众号
微信
新浪微博

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号