《International Journal of Computer Assisted Radiology and Surgery》:Self-supervised monocular depth estimation for colonoscopy using normal-guided cross-attention
编辑推荐:
**目的**:可靠的结肠镜场景三维重建可通过指示已检查区域和揭示息肉几何结构,促进导航并增强病灶评估。然而,由于镜面高光(specular highlights)和低纹理区域(low-texture areas),结肠镜中的准确深度估计仍极具挑战性。本研究旨在
**目的**:可靠的结肠镜场景三维重建可通过指示已检查区域和揭示息肉几何结构,促进导航并增强病灶评估。然而,由于镜面高光(specular highlights)和低纹理区域(low-texture areas),结肠镜中的准确深度估计仍极具挑战性。本研究旨在通过整合表面法线(surface normal)信息来改进结肠镜中的单目深度估计(monocular depth estimation)。
**方法**:研究人员提出一种自监督深度学习方法(self-supervised deep learning method),通过交叉注意力机制(cross-attention mechanism)整合表面法线信息进行相对深度估计。首先由现有法线估计模型预测表面法线,然后将其作为辅助几何先验(auxiliary geometric priors)。深度估计网络采用交叉注意力自适应地将法线特征与图像特征融合,实现空间选择性几何细化(spatially selective geometric refinement)。
**结果**:定量和定性比较表明,所提出方法在SimCol3D、C3VD和真实结肠镜数据上均优于最先进的自监督方法。该方法生成的深度图更真实,保留了黏膜褶皱和管腔几何结构。消融研究验证了交叉注意力模块对于有效利用法线信息以实现准确深度估计至关重要。
**结论**:通过利用交叉注意力将预测的表面法线与图像特征融合,所提出方法增强了结肠镜中单目深度估计的准确性和鲁棒性。该方法为将几何先验纳入自监督框架提供了一种通用且轻量级的策略,为三维重建(3D reconstruction)和内镜导航(endoscopic navigation)等下游任务带来潜在益处。
**论文解读:基于法线引导交叉注意力的自监督结肠镜单目深度估计**
**研究背景、存在问题与研究动机**
结直肠癌(colorectal cancer)是全球最常见且最严重的恶性肿瘤之一。结肠镜(colonoscopy)仍是临床检测的金标准,但其有效性高度依赖内镜医师的视觉判断和手动操作。结肠的复杂结构以及具有挑战性的光照条件(如镜面高光、低纹理黏膜表面)常使视觉检查困难,导致息肉漏检。深度学习通过三维(3D)重建增强空间理解,有望缓解这些局限。准确的深度估计可改善导航、辅助识别未检查区域,并支持息肉评估。
近年来,随着深度学习的快速发展,单目深度估计(monocular depth estimation)取得了显著进展。大量自监督方法利用连续帧间的光度一致性(photometric consistency),无需真实深度标注即可从单目图像推断可靠深度图,并在自然室外或室内场景中表现有效。然而,这些假设在结肠镜中不成立。内镜成像中,镜面高光(specular highlights)、光照变化和低纹理黏膜表面引入了反射率与几何之间的歧义;组织非朗伯(non-Lambertian)外观导致光度损失与真实深度相关性差。因此,现有针对自然场景的单目深度估计方法难以在内镜环境中恢复准确几何,产生不稳定预测。
为此,研究人员提出一种新颖的自监督框架,通过整合表面法线(surface normal)信息作为几何引导,改进结肠镜中的单目深度估计。与依赖光度一致性或显式约束的方法不同,本研究将表面法线作为辅助先验,引导结构深度特征的学习,从而减少光照变化影响,提高预测深度的几何可靠性。为了有效整合法线信息,设计了交叉注意力机制(cross-attention mechanism),自适应融合表面法线与图像特征之间的空间和语义关系,使网络选择性关注几何相关区域,减轻镜面高光或低纹理的影响。该论文发表在《International Journal of Computer Assisted Radiology and Surgery》。
**主要关键技术方法(不超过250字)**
为开展研究,作者构建了包含深度模块和位姿模块的自监督框架。深度模块采用轻量级混合编码器(hybrid encoder),结合卷积层和Transformer注意力提取多尺度特征;同时使用现有法线估计模型(off-the-shelf normal estimation model,[18])预测表面法线,并作为几何先验。通过多头部交叉注意力(multi-head cross-attention)将图像特征作为查询(query)、法线特征作为键(key)和值(value),实现自适应融合。解码器采用UNet结构,结合跳跃连接和多尺度预测头输出逆深度图。位姿模块基于ResNet-18估计相邻帧间的相对摄像机位姿(rotation R和translation t)。训练采用自监督策略,基于光度一致性损失(photometric loss)和边缘感知平滑损失(edge-aware smoothness loss),并去除镜面高光。所有实验使用SimCol3D、C3VD和HyperKvasir真实结肠镜数据,其中样本队列来源:SimCol3D包含37.8K张475×475图像,训练11个序列、验证1个序列、测试3个序列;C3VD包含10,015帧来自22个视频序列,训练18个序列、测试3个序列、验证1个序列。
**研究结果**
**Overall performance(总体性能)**:在SimCol3D和C3VD数据集上的定量比较(表1)表明,所提出方法在所有评估指标上均优于三种对比方法(PC-Depth、NASDE、Lite-Mono、DAV2)。在SimCol3D上,基于误差的指标改进高达约50%。DAV2和NASDE表现较差,原因是NASDE原本针对自然场景且使用3D卷积导致参数过多,难以学习单目到深度的映射。
**Generalization ability(泛化能力)**:将SimCol3D训练模型直接应用于C3VD(无微调)进行跨数据集泛化测试(表2),所提出方法在所有对比方法中表现最佳,表明其具有良好的泛化能力。此外,在SimCol3D上训练的模型在C3VD上的性能优于在C3VD上训练和测试的模型,这可能归因于SimCol3D中更广泛的摄像机运动范围提供了更丰富的监督。
**Ablation studies(消融研究)**:为验证交叉注意力融合机制的有效性,比较了两种替代方案:输入级直接拼接RGB图像和法线图(Ours
inp),以及特征级逐元素相加(Ours
feat)。在SimCol3D和C3VD上的结果(表3)显示:所有纳入法线信息的变体均优于基线(Lite-Mono),表明法线信息有效;而使用交叉注意力的方法进一步优于Ours
inp和Ours
feat,因为直接拼接或逐元素相加无法建模两种模态间的复杂空间对应和重要性,而交叉注意力实现了更自适应、几何感知的特征交互。
**定性结果**:在真实结肠镜图像(HyperKvasir数据集)上,所有方法在单个序列(709张图像)上微调3个epoch后评估。所提出方法预测的深度图更可靠,尤其在反射区域,归因于法线图提供的强几何约束,帮助模型在挑战性反射区域保留局部表面结构。
**结论部分讨论与翻译**
讨论部分指出,所提出方法通过交叉注意力融合预测表面法线与图像特征,有效提升了结肠镜中单目深度估计的准确性和鲁棒性,在镜面高光和低纹理区域表现优异。消融研究证实了交叉注意力模块的关键作用。该方法为自监督框架中融入几何先验提供了通用轻量级策略,对三维重建和内镜导航等下游任务具有潜在价值。
**结论(原文翻译)**:
本文提出了一种基于法线的交叉注意力深度估计模型用于结肠镜。为减轻镜面高光的不利影响,利用表面法线作为辅助几何信息,并采用交叉注意力有效融合法线和图像特征进行深度估计。在SimCol3D、C3VD以及来自HyperKvasir数据集的真实结肠镜图像上的实验结果表明,所提出方法在挑战性的光照和反射条件下实现了准确的深度预测。