基于单切口腹腔镜胆囊切除术(Single-Incision Laparoscopic Cholecystectomy, SILC)手术视频利用人工智能进行自动化手术阶段识别与分析

《Surgical Endoscopy》:Automated surgical phase recognition and analysis in single-incision laparoscopic cholecystectomy using artificial intelligence

【字体: 时间:2026年07月12日 来源:Surgical Endoscopy 2.4

编辑推荐:

  背景(Background):单切口腹腔镜胆囊切除术(Single-Incision Laparoscopic Cholecystectomy, SILC)相比传统多孔腹腔镜胆囊切除术技术难度更高、学习曲线更陡峭。基于深度学习(Deep Learning, D

  
背景(Background):单切口腹腔镜胆囊切除术(Single-Incision Laparoscopic Cholecystectomy, SILC)相比传统多孔腹腔镜胆囊切除术技术难度更高、学习曲线更陡峭。基于深度学习(Deep Learning, DL)的SILC手术阶段识别与预测系统有助于手术质量评估、提升培训效率及保障手术安全。研究人员旨在开发一套针对SILC的多中心手术阶段识别与预测系统。 方法(Methods):本研究纳入来自两家医学中心的148例SILC手术视频。由外科医生对视频进行标注,基于122例视频开发深度学习模型,并在另外26例视频中通过与外科医生标注的真实基准(Ground Truth)对比测试模型性能。模型训练用于识别SILC手术阶段,采用准确率(Accuracy)、精确率(Precision)、召回率(Recall)及杰卡德指数(Jaccard Index)评估阶段分类性能;手术阶段预测采用平均绝对误差(Mean Absolute Error, MAE)的变体进行评估。 结果(Results):分析的SILC视频平均手术时长为14.36 min,各病例间存在较大变异。Trans-SVNet模型在手术阶段分类中表现出色,总体准确率、精确率及召回率分别为0.933、0.939和0.939。在阶段转换预测方面,模型的整体inMAE为37 s,eMAE为34 s,pMAE为50 s。值得注意的是,增加训练样本量可显著提升模型性能。 结论(Conclusions):研究人员成功构建了Trans-SVNet模型,可实现全长SILC视频中手术阶段的自动分类与时间预测。经持续完善后,人工智能有望应用于大规模手术数据分析,实现具临床价值的未来应用。
《利用Trans-SVNet对单切口腹腔镜胆囊切除术视频进行自动化手术阶段识别与分析》论文解读
一、研究背景与立题依据
单切口腹腔镜胆囊切除术(Single-Incision Laparoscopic Cholecystectomy, SILC)是治疗良性胆囊疾病的先进微创术式,具有术后疼痛轻、美容效果好及住院时间短等优势,但其操作技术要求高于传统三孔或四孔腹腔镜胆囊切除术(Laparoscopic Cholecystectomy, LC),学习曲线更陡峭。手术流程建模(Surgical Process Modeling, SPM)可通过划分明确的手术阶段辅助手术分析与教学,近年来基于深度学习(Deep Learning, DL)的图像识别技术已逐步应用于常规LC的手术阶段识别(Surgical Phase Recognition)、剩余手术时间预测及技能评估。然而,SILC省去了穿刺器(Trocar)置入步骤,且胆囊常可直接经单切口取出而无需取物袋,其手术流程、视觉场景及阶段顺序与传统LC存在显著差异,既往针对传统LC的研究成果无法直接迁移至SILC。因此,研究人员开展此项研究,旨在开发并验证一种基于深度学习的SILC全自动手术阶段识别与预测系统,以服务于手术质量评估、规范化培训及术中决策支持。该论文发表于《Surgical Endoscopy》。
二、主要关键技术方法
研究人员收集浙江大学医学院附属第二医院(SAHZU)与同济大学附属东方医院(EH)共148例SILC全段手术视频(含20例非充气法SILC,排除传统多孔LC),按约5:1划分为训练集(122例)与测试集(26例),由两名外科医生共识标注为6个手术阶段:P0其他(Other)、P1准备(Preparation)、P2胆囊三角解剖分离(Dissection of Calot's triangle)、P3夹闭与切断(Clipping and cutting)、P4胆囊床剥离(Gallbladder dissection)、P5胆囊取出清理与止血(Gallbladder retrieval, cleaning, and coagulation)。视频以1秒间隔抽帧得127,496张图像,预处理缩放至512×512像素并行随机裁剪、水平翻转及色彩抖动。核心模型Trans-SVNet采用分阶段训练策略:先用ResNet50作为视觉编码器(Visual Encoder)提取空间特征,再训练时序卷积网络(Temporal Convolutional Network, TCN)捕捉时序依赖,最后冻结上述两者参数,以拼接特征输入Transformer模块进行时空特征融合(Hybrid Vector Aggregation)。阶段分类以One-hot编码计算准确率(Accuracy)、精确率(Precision)、召回率(Recall)及杰卡德相似系数(Jaccard Index);阶段预测以线性插值得倒计时标签,采用区间内平均绝对误差(inMAE)、终末平均绝对误差(eMAE)及预测侧平均绝对误差(pMAE)评估。实验基于PyTorch 1.12.1框架、NVIDIA Tesla V100 32 GB GPU完成。
三、研究结果
Statistics used to analyze the SILC videos(SILC视频时长与阶段统计分析)
研究人员对148例SILC视频进行统计,平均手术时长为14.36 ± 6.55 min。六阶段中P3(夹闭与切断)耗时最长(平均3.47 ± 2.42 min),P0(其他,含建立气腹等)最短(平均0.51 ± 0.69 min)。SILC较传统LC总时长偏短,主要因无Trocar穿刺步骤及胆囊可经单切口直接取出,且入组病例炎症粘连较轻、Calot三角解剖清晰,且均由Tang和Hu两位术者完成。
Results of the surgical phase classification and prediction(手术阶段分类与预测结果)
当训练样本由60例增至122例时,模型性能显著提升。以122例训练、26例测试的最终结果为例:Trans-SVNet对测试集21,484帧图像的总体阶段分类准确率(Accuracy)达0.933,精确率(Precision)为0.939,召回率(Recall)为0.939,各阶段杰卡德指数良好。阶段预测任务中,整体inMAE为37 s,专注于临近转换期的eMAE为34 s,pMAE为50 s。P2(胆囊三角解剖)与P3(夹闭切断)因视觉重叠大、转换边界模糊(P2终点常以P3开始界定而非独立明显动作),虽样本量最多但仍为最难区分的阶段。
四、讨论与结论总结
讨论指出,Trans-SVNet引入Transformer的自注意力机制(Self-Attention Mechanism),通过时空矢量提取与混合特征聚合联合优化,克服了传统CNN+LSTM/TCN流水线中空间信息稀释与扩张卷积致时序线索丢失的问题,分类性能指标优于已报道的同类LC阶段识别研究。SILC短时长特性及P2/P3难区分问题在讨论中被明确归因。作者提出未来可通过扩大多中心、多术者、多年龄层样本,探索更先进网络架构,或合并P2与P3为单一阶段以简化分类任务。该模型可自动索引提取SILC关键手术片段,辅助基于视频的外科技能评估(如OSCE、OCHRA框架),并可结合解剖结构分割、安全视野(Critical View of Safety, CVS)验证等模块支持术中决策。局限性为目前仅含两中心两名术者数据,以及P2/P3边界主观模糊影响判别。
结论(Conclusions)翻译:
研究人员成功开发了Trans-SVNet模型,可实现全长单切口腹腔镜胆囊切除术(SILC)视频中手术阶段的自动分类与时序预测。借助混合矢量聚合Transformer(Hybrid Vector Aggregation Transformer)技术,该方法有望用于实时术中手术阶段识别,提升手术流程效率。为使该系统向医疗器械注册审批迈进,后续将开展严格的临床性能评价,识别并解决确保其安全、有效整合入日常临床实践的关键挑战。
相关新闻
生物通微信公众号
微信
新浪微博

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号