机器人内窥镜动态场景深度数据集(DRENDS)

《Scientific Data》:A Dataset for Depth in Robotic Endoscopy with Dynamic Scenarios (DRENDS)

【字体: 时间:2026年08月11日 来源:Scientific Data 7.2

编辑推荐:

  深度感知在机器人微创手术中仍然是许多下游任务的关键挑战,需要先进的深度估计技术及其验证所需的真实数据。现有数据集缺乏动态场景下带有真实深度信息的数据;因此,研究人员提出了DRENDS(Depth in Robotic Endoscopy with Dynami

  
深度感知在机器人微创手术中仍然是许多下游任务的关键挑战,需要先进的深度估计技术及其验证所需的真实数据。现有数据集缺乏动态场景下带有真实深度信息的数据;因此,研究人员提出了DRENDS(Depth in Robotic Endoscopy with Dynamic Scenarios),这是一个新颖的数据集,包含在机器人腹腔镜操作人体模型和离体猪组织过程中捕获的高分辨率立体图像序列,以及每帧的真实点云和标定数据。数据在三种光照条件下、跨不同解剖结构采集,涉及组织操作和非刚性变形。用于立体图像校正、处理相机视角遮挡以及生成每帧深度图的代码已开源,以保证可重复性和易于适应性。最后,研究人员还使用最先进的深度估计模型进行了基线评估,以建立数据集上的基准性能。结果和数据凸显了机器人手术中度量的时间一致深度估计所面临的挑战和潜力,鼓励在医疗应用中进一步推动组织变形预测的研究。研究人员公开发布DRENDS,以促进该关键领域的创新与合作。
**论文解读:动态场景下机器人内窥镜深度数据集(DRENDS)的构建与基准评估**

手术场景理解依赖于对手术数据的分析,其中深度估计是众多下游任务发展的关键支柱之一。在机器人微创手术(robotic minimally invasive surgery, RMIS)中,通过分析腹腔镜图像获得可靠的深度估计,可以支持力估计、三维重建、增强现实和自主操作。然而,集成主动传感器(如激光雷达和飞行时间传感器)常因成本高和流程复杂而受限,因为RMIS的工作空间受充气腹腔体积限制,要求传感器体积小、量程低。因此,被动RGB相机结合算法成为有前景的方案,但其严重依赖带有三维真值的数据用于算法验证和深度学习训练。现有数据集如SERV-CT、Hamlyn、EndoAbs、SCARED、EndoSlam、SimCol3D和C3VD等虽各有贡献,但普遍通过固定组织位置和假设刚性属性来简化深度获取问题。实际手术中,组织运动和不可刚性变形常由操作和生理活动引起,而目前尚无数据集在这种动态条件下捕获深度信息。为弥补这一空白,研究人员提出了DRENDS数据集。

DRENDS数据集是在英国利兹大学使用达芬奇研究套件(Da Vinci Research Kit, dVRK)和达芬奇Si系统采集的。硬件包括达芬奇机械臂、Omega7触觉设备作为工具操作器、达芬奇系统立体内窥镜相机(phantom设置中为Ikegami 720p相机,离体设置中为1080i Panasonic相机),以及LUCID Vision Labs的Helios2+飞行时间(time-of-flight, ToF)相机。样本来源包括:人体模型(phantom)使用EasySurg训练系统的合成腹部器官(结肠、肠、胃、肝、胰),离体(ex vivo)使用猪离体组织(不含胰)。采集在三种光照条件(高光、标准光、外部光)下进行,采用两种策略:序列(sequence)采集50个非连续帧,每个对应不同的组织变形状态;视频(video)以16帧每秒(FPS)连续记录组织变形过程。共获得phantom数据15个序列和15段90秒视频,合计23,250帧;离体数据12个序列和12段60秒视频,合计12,120帧。标定方面,使用张正友方法估计立体内窥镜的固有参数,并利用OpenCV进行立体校正;通过非线性最小二乘优化估计ToF相机与RGB相机之间的刚体变换。数据处理流程包括:噪声滤波(去除无效值、时间滑动窗口平滑、双边滤波)、遮挡掩码生成(使用Segment Anything Model v2分割手术工具,基于表面法线去除内窥镜视野外表面)、坐标变换补偿(在Blender中手动调整虚拟相机位置以校正残余错位),以及离体图像的patch-based非局部均值去噪。数据集以CC BY-4.0许可证在Zenodo公开,包含34,650帧带深度真值的图像,并提供生成掩码和深度图的代码。

技术验证部分报告了标定精度和时间同步结果。标定结果显示重投影误差和三维对齐误差均在可接受范围内。在phantom视频中,立体对之间的平均时间偏移为8毫秒(最大50毫秒),RGB-ToF平均偏移为33毫秒(剔除一个异常视频后);离体视频中对应平均偏移分别为9毫秒和12毫秒。这些偏移相对于采集速率很小,保证了动态场景分析的时间对齐可靠性。基准评估方面,研究人员选择了9个公开发布的深度估计模型,分为三类:相对单目模型(Monodepth2、MiDaS、Depth Anything Model V2的相对变体DAMv2)、度量单目模型(ZoeDepth、Depth Pro、DAMv2的度量变体DAMv2-metric)和度量立体模型(RAFT-Stereo、UniMatch、FoundationStereo)。评估采用空间精度指标(平均绝对误差MAE、均方根误差RMSE、对数RMSE、绝对相对误差AbsRel、阈值精度δ)和时间一致性指标(深度时间一致性误差DTCE),并报告原始输出和按序列对齐后的结果。

基准结果表明,原始输出下,立体模型最接近开箱即用,在phantom上MAE约为18毫米,离体上约为12毫米(AbsRel分别为0.10和0.13);度量单目模型因训练分布与腹腔镜图像差异大,产生数百毫米级误差(最高约850毫米),AbsRel在2到7之间,δ≈0;相对单目模型在度量空间下无定义,仅报告对齐后结果。按序列对齐后,所有模型误差降至毫米级,立体模型仍最优(phantom上约7–8毫米,离体约5毫米),其中DAMv2相对变体在单目模型中表现最强(phantom上10.48毫米,离体6.75毫米)。时间一致性方面,立体模型在原始协议下具有最低DTCE,对齐后仍保持稳定;ZoeDepth尽管空间精度最差,原始DTCE却极低(phantom 13.3毫米,离体3.3毫米),说明其尺度误差在帧间几乎恒定,揭示了时间平滑与绝对精度是不同属性。光照条件对性能影响较小,外部光、标准光和高光下的指标差异远小于模型间和子集间的差异。phantom子集比离体子集更难,表现为对齐误差更高、阈值精度更低和时间一致性更差,原因在于phantom具有更宽的深度范围和平滑、低纹理、高反光表面。

讨论部分指出,DRENDS解决了动态手术场景中深度真值稀缺的关键问题。深度标注继承了主动ToF传感的物理限制,包括深度不连续处噪声增加、对表面反射率敏感以及工具-组织交互时的部分遮挡。处理流程通过轻量滤波抑制测量噪声,同时保留传感器观测的自然特性。数据仅来自单一实验设置,包含phantom和离体组织,限制了标本间解剖结构的多样性,但提供了可控场景,能够在难以于无约束临床环境中分离的条件下系统分析度量精度和时间一致性。研究人员预期DRENDS将加速以下方向的研究:(i)具有可靠尺度的度量深度估计;(ii)变形下的时间一致深度预测;(iii)结合学习与手术先验和多传感器约束的混合方法。通过公开数据集和处理工具,旨在支持可重复比较,并促进可转化为机器人辅助手术可靠三维感知的方法开发。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号