综述:整形外科术前风险预测中人工智能与机器学习模型的方法学质量与性能:一项系统评价

《Journal of Plastic, Reconstructive & Aesthetic Surgery》:Methodological Quality and Performance of Artificial Intelligence and Machine Learning Models for Preoperative Risk Prediction in Plastic Surgery: A Systematic Review

【字体: 时间:2026年07月19日 来源:Journal of Plastic, Reconstructive & Aesthetic Surgery 2.0

编辑推荐:

  摘要人工智能(AI)和机器学习(ML)方法越来越多地被应用于整形手术的术前风险预测中,但这些模型的方法学质量及临床适用性尚未得到系统评估。本系统评价采用PROBAST+AI框架,对整形手术中AI/ML术前风险预测模型的质量、偏倚风险及预测性能进行了评估。研究检索了截至2025年1

  

摘要

人工智能(AI)和机器学习(ML)方法越来越多地被应用于整形手术的术前风险预测中,但这些模型的方法学质量及临床适用性尚未得到系统评估。本系统评价采用PROBAST+AI框架,对整形手术中AI/ML术前风险预测模型的质量、偏倚风险及预测性能进行了评估。研究检索了截至2025年10月的五个数据库,最终有10项研究符合纳入标准,涵盖自体乳房重建(n=2)、异体乳房重建(n=5)、头颈重建(n=1)、烧伤手术(n=1)以及美容手术(n=1)。其中随机森林是最常用的算法(n=4),其次是神经网络(n=2)、结合RUSBoost的深度森林(n=1)、支持向量机(n=1)以及逻辑回归(n=1)。在8项报告区分能力的研究中,AUC值在0.66到0.82之间。研究发现了若干关键的方法学缺陷:仅有2项研究(20%)进行了外部验证,7项开发研究中的5项(71.4%)每个变量的事件数低于10,说明样本量不足,还有7项研究(70%)未报告模型校准情况。对102组领域级评分进行的预一致性评估显示,Cohen's kappa值为0.240,经患病率调整后的偏倚调整Kappa值为0.039,这一结果与基于PROBAST的系统评价的已有基准相符。所有分歧均通过结构化共识得以解决。目前用于整形手术术前风险预测的AI/ML模型表现参差不齐,且存在诸多方法学局限,难以在临床中应用。在将其投入临床使用之前,需要开展具有严谨方法学的多中心前瞻性验证研究。

引言

准确的术前风险分层对于优化患者选择、帮助患者做出知情同意决策以及提升手术效果至关重要。传统的风险评估工具,如美国外科医师学会手术风险计算器(ACS-SRC)和ASA身体状态分类法,依赖的统计方法由于其线性假设和有限的变量纳入范围,可能会高估或低估风险。1, 2 这些传统方法往往无法捕捉影响术前结果的复杂非线性相互作用,比如患者人口统计学特征、合并症以及手术相关因素之间的相互作用3
人工智能(AI)和机器学习(ML)作为强大的替代方案,已在多个外科领域展现出比传统风险计算器更出色的预测性能1, 2。AI模型能够分析大量数据集,发现传统分析中难以察觉的细微模式,并通过持续学习不断改进3, 4。有一项关于重大腹部手术中基于AI的并发症预测的系统评价显示,所纳入模型的准确率在78%到95%之间,不过在不良事件属于少数类别的不平衡数据集中,仅以准确率作为指标容易高估性能,应结合区分度和校准度等指标综合判断4。诸如MySurgeryRisk和POTTER这类经过验证的工具,对于术后并发症和死亡率的AUC值在0.77到0.94之间,但这些工具主要是为急诊普通外科以及混合住院手术人群开发的;针对整形手术的特定性能数据较为有限,POTTER显示伤口相关结果的并发症AUC值大约在0.68到0.78之间5, 6。在整形手术领域,机器学习算法在预测乳房重建和腹壁重建后的并发症方面表现良好(AUC为0.71-0.78,准确率为72-85%)3。此前关于AI在整形手术中应用的系统评价虽概述了该技术从图像分析、手术规划到结果预测等各个子领域的广泛应用,但并未采用针对特定预测模型的质量评估框架,也未将术前风险分层作为一项独立的临床任务进行重点研究3, 7, 8。Spoer等人指出,大多数整形手术相关的AI研究仍处于早期探索阶段,缺乏正式的偏倚评估;Al-Juhani等人则主要研究了机器学习在诊断和术中应用方面的情况;这两项评价均未使用PROBAST+AI来评估方法学质量,也未将研究范围限定在术前预测模型上,而这正是本次评价要弥补的空白。
尽管已有这些令人瞩目的成果,但仍存在诸多挑战,包括数据质量问题、算法偏倚、外部验证不足,以及缺乏能够证明可改善患者预后的前瞻性研究1, 2, 4。此外,AI在整形手术术前风险预测中的应用也尚未得到系统评估。本研究旨在全面梳理目前关于AI和ML在整形手术围手术期风险分层中应用的现有证据,分析这些模型的性能、方法学质量以及临床适用性。

章节节选

方法

本系统评价采用PROBAST+AI框架,对整形手术中用于术前风险分层的AI/ML预测模型的方法学质量、偏倚风险及性能进行了评估。该系统评价已在PROSPERO平台上注册(CRD420261294407,首次提交时间为2026年1月27日,2026年6月可公开查询),并且是按照PRISMA 2020指南开展的9。此次注册是在2025年10月完成数据库检索之后才进行的,属于回顾性注册。

研究选择与特点

共有10项研究12, 13, 14, 15, 16, 17, 18, 19, 20, 21符合纳入标准,被纳入最终分析(见表1)。这些研究发表于2022年至2025年间,其中6项(60%)来自美国,其他国家包括阿根廷、中国、英国和韩国。8项研究(80%)采用回顾性队列设计,1项研究(10%)采用前瞻性观察性方法,另有1项为前瞻性应用研究(10%)。

讨论

这是首项基于PROBAST+AI对整形手术中AI和ML术前风险预测模型进行的评估。尽管所报告的区分度值在0.66到0.82之间,但PROBAST+AI评估显示,所有8项开发研究的方法学质量都存在较高或不确定的问题,全部10项评估研究的偏倚风险也都处于较高或不确定水平。没有一项研究在两个评估阶段都获得“低”等级评价。研究发现了三个关键问题:外部验证不足,

结论

本系统评价表明,整形手术中的AI和ML术前风险预测模型在开发阶段就普遍存在较高的方法学问题,而在评估阶段则存在较高的偏倚风险,其根本原因在于几乎所有研究都没有进行外部验证,未能报告模型校准情况,且样本量不足。所有符合本研究纳入标准的整形手术术前AI/ML风险预测模型,均不存在足够良好的方法学

伦理审批

无需审批

利益冲突

未引用参考文献

29

资金支持

Anisha R. Kumar|Suryakant Singh|Masaru Ishii
纽约州斯托尼布鲁克大学医学院外科耳鼻喉科,斯托尼布鲁克
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号