PICO:面向六自由度手术工具姿态估计的投影信息一致性优化方法

《International Journal of Computer Assisted Radiology and Surgery》:PICO: Projection-Informed Consistency Optimisation for 6DoF surgical tool pose estimation

【字体: 大 中 小 】 时间:2026年09月25日 来源:International Journal of Computer Assisted Radiology and Surgery 2.8

编辑推荐:

  目的:精确的六自由度(6DoF)手术工具姿态估计对于自动化、机器人本体感觉以及与被操作组织的安全交互至关重要。基于运动学的方法因机器人臂的缆绳驱动特性而存在累积误差;基于视觉的方法通常依赖外部标记物或跟踪器。尽管近期出现了基于视觉的改进方法,但这些两阶段姿态估

  
目的:精确的六自由度(6DoF)手术工具姿态估计对于自动化、机器人本体感觉以及与被操作组织的安全交互至关重要。基于运动学的方法因机器人臂的缆绳驱动特性而存在累积误差;基于视觉的方法通常依赖外部标记物或跟踪器。尽管近期出现了基于视觉的改进方法,但这些两阶段姿态估计方法常因累积误差和计算开销而缺乏实时鲁棒性。方法:研究人员提出一种新颖的端到端可训练模型PICO。该模型采用多任务学习(multi-task learning)架构,在回归平移和旋转参数的同时预测分割图和深度图。研究人员定义了两个代理任务,在二维(2D)和三维(3D)空间中强制执行几何一致性,从而提高准确性和鲁棒性。为此,提出了投影损失(projection loss)和点对点损失(point-to-point loss)。结果:研究人员在SurgRIPE数据集上评估了该方法,并使用标准6DoF姿态估计指标与现有最先进方法进行基准比较。结果显示该方法在所有四个子集上均表现出持续强劲的性能,尤其是在旋转方面,即使在遮挡情况下也排名第二。该方法还表现出可比的平移性能,在遮挡情况下尤其具有竞争力。结论:PICO证明了多任务学习和几何感知代理任务对于鲁棒、可靠的手术工具姿态估计的有效性,尤其是在遮挡场景中,并突显了未来应用的潜力。
手术机器人自主化要求安全地与手术环境交互,而精确的手术工具位姿感知是术前规划和避免工具-组织损伤的基础。达芬奇手术系统依靠正向运动学由关节角测量值估计工具位姿;但由于缆绳驱动机构存在缆索松弛、滑轮摩擦和多关节误差累积,末端位姿误差可达1.02 mm,无法满足自主手术对安全性的要求。基于视觉的方法虽然直接感知场景,但外部标记物或跟踪器需额外灭菌流程并依赖无遮挡视线;现有两阶段视觉方法先预测关键点、分割或2D-3D对应关系,再通过Perspective-n-Point(PnP)或渲染比较等步骤求解位姿,中间误差累积和高计算开销使其难以实时运行。此外,手术图像缺少真实位姿标注,进一步增加了直接回归6DoF位姿的难度。因此,研究人员提出了PICO,一种端到端可训练的单阶段模型。

在SurgRIPE数据集上的实验表明,PICO在四个测试子集上旋转误差均排名第二,遮挡条件下平移性能仍具竞争力;相比另一种单阶段方法,旋转误差显著降低,且推理速度约33 FPS,满足实时要求。该研究表明,结合几何一致性代理任务的多任务学习可提高遮挡场景下手术工具姿态估计的鲁棒性,为无标记实时手术机器人感知提供了可行路径。

关键方法:采用SurgRIPE公开数据集(来自MICCAI 2022挑战赛),含大号持针器(large needle driver, LND)和马里兰双极镊(Maryland bipolar forceps, MBF)单目RGB图像,共1147+1109张,90:10训练/验证,各含遮挡与非遮挡测试子集。网络为ResNet-50编码器与U-Net解码器结构,多任务头分别输出分割、深度和6DoF位姿;旋转经奇异值分解投影至SO(3)。定义投影损失和点对点损失,在2D/3D空间施加几何一致性约束。推理时移除解码器,用微调YOLOv5生成边界框。总损失为分割、深度、投影、点对点、旋转及平移损失之和;采用Adam优化器与10-4学习率训练50轮。

研究结果

结果:在SurgRIPE四个测试子集上,PICO在旋转误差上均排名第二,仅低于IMF;例如LND上旋转误差为5.78°,IMF为5.18°,MBF遮挡下PICO为21.02°,IMF为18.44°。平移误差与最先进方法相当,遮挡情况下超过多数方法,如LND遮挡平移误差为8.87 mm,而PVNet为28.09 mm。与另一种单阶段方法相比,PICO在四个数据集上的旋转误差大幅降低,例如LND从27.21°降至5.78°。平均距离(ADD)指标上,PICO在四个数据集的ADD值分别为0.12、0.08、0.13和0.09,是所列方法中最低的。

运行时间分析:在NVIDIA Tesla T4 GPU上,端到端推理速度约为33.3 FPS,即约30 ms每帧;对比两阶段PVNet在GTX 1080 Ti上约25 FPS,PICO达到了通常认为的实时性能。

消融研究:消融实验表明,辅助任务分别约束不同位姿分量。深度监督主要约束z平移,在LND、LND遮挡和MBF上取得最低平移误差,分别为6.22、8.36和5.27 mm;分割监督通过编码工具投影形状改善旋转,在LND和MBF上将旋转误差从18.89降至11.11、从12.95降至9.67。但两者联合优化时性能提升未叠加;加入投影和点对点损失后,二者经单一预测变换耦合,在LND、MBF、MBF遮挡及LND遮挡平移上均优于仅分割-深度配置。

误差分解与ADD指标:为解释ADD得分偏低的原因,研究人员将平移误差分解为图像平面(x,y)与深度(z)分量,并与逐样本ADD距离比较。四组数据中z误差均值分别为3.88、6.09、3.90和11.82 mm,均大于xy误差的2.68、1.17、1.34和5.82 mm;z误差与ADD距离的Spearman相关系数分别为0.955、0.978、0.963和0.982,远高于xy误差对应的0.449、0.650、0.602和0.847。这表明ADD主要对深度误差敏感,深度估计是制约ADD性能的主要因素。

讨论部分指出,多任务学习与几何感知代理任务的组合可提供鲁棒且准确的位姿估计;消融结果说明辅助任务作用于不同位姿分量,而投影和点对点损失通过单一变换耦合二者,恢复了联合优化中丢失的性能。深度估计误差是ADD指标的主要限制因素,辅助深度任务可直接改善该环节。与多阶段方法相比,PICO在不牺牲平移精度的情况下大幅提升旋转精度,证明端到端单阶段网络在几何一致性损失引导下可媲美迭代优化方法。研究局限性包括:非方形裁剪缩放到固定方形会带来轻微纵横比失真;伪深度生成通过随机点采样和邻近像素填充,可能平滑边界并产生不真实深度;公开带真实位姿标注的数据集稀少,限制比较与复现。未来工作将改进深度建模,并通过数据增强和域适应提升对未见器械与手术环境的泛化能力。

研究结论部分可翻译为:该工作解决了单目RGB图像中准确且鲁棒的6DoF手术工具姿态估计问题,提出实时端到端可训练的PICO模型;通过多任务学习联合预测分割和深度,并回归旋转和平移;定义投影与点对点两个代理任务,在2D和3D空间强制执行几何一致性。SurgRIPE实验表明,PICO在遮挡场景下取得了与现有方法相当的平移和旋转精度,显著优于另一种单阶段方法,且运行速度约33 FPS,适合实时手术应用。未来改进将聚焦深度建模,并利用域适应和数据增强提高对未见场景的泛化性。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号