《Frontiers in Digital Health》:Artificial intelligence in surgical decision-making across the perioperative continuum: a scoping review
编辑推荐:
背景:人工智能(AI)在支持围手术期连续体临床决策中的作用尚未完全明确。尽管许多AI模型在预测性能方面表现良好,但其在现实世界中基于专科和围手术期分期的实际手术决策过程中的作用尚未被充分描绘。
目的:描绘AI在围手术期连续体中应用于手术决策的现有文献,描述其在
背景:人工智能(AI)在支持围手术期连续体临床决策中的作用尚未完全明确。尽管许多AI模型在预测性能方面表现良好,但其在现实世界中基于专科和围手术期分期的实际手术决策过程中的作用尚未被充分描绘。
目的:描绘AI在围手术期连续体中应用于手术决策的现有文献,描述其在术前、术中和术后阶段的使用,并识别影响临床实施的关键障碍与空白。
方法:根据PRISMA-ScR指南进行范围综述。检索PubMed、Scopus和Google Scholar,以评估AI在手术决策中的应用研究。符合条件的研究包括将机器学习(ML)、深度学习(DL)、放射组学(radiomics)或计算机视觉(computer vision)应用于诊断、风险分层、手术规划、术中引导或术后结局预测的原始研究和证据综合。使用标准化数据表提取并图表化研究特征、围手术期分期、临床应用、AI方法和报告的实施障碍。
结果:共纳入55篇证据来源。涉及多阶段或跨阶段围手术期应用的来源构成最大类别,而在特定阶段应用中,术前应用最常见,主要集中于诊断、风险分层和手术规划。术中应用较少,且受数据可用性、工作流整合和实时实施挑战的限制。术后应用主要涉及并发症预测、生存评估和恢复监测。
结论:AI在手术决策中的应用正在快速扩展,其中术前应用显示出相对高于术中及术后应用的证据成熟度。然而,在整个围手术期连续体中,前瞻性验证和现实世界实施仍然有限。
1 Background
手术决策是一个高风险且复杂的过程,贯穿患者选择、手术规划、术中管理和术后护理的完整围手术期连续体。传统决策依赖临床经验、启发式判断和基于人群数据的传统风险评分,但日益增长的患者复杂性、不断扩大的治疗选择以及对个体化和数据驱动医疗的需求,使传统方法面临挑战。人工智能(AI)作为一种变革性技术,通过分析高维临床数据,有望增强手术决策。过去十年中,AI和机器学习(ML)技术在预测手术结局方面表现出色,但预测准确性并不足以保证临床实用性。手术决策必须是可理解、负责任且能整合入临床工作流的,尤其是高风险或不可逆决策。不恰当校准或不透明的AI模型可能导致不必要的手术回避、过度治疗或干预延迟。区分以预测为主要目的的AI系统和旨在影响或支持临床决策的AI系统至关重要。围手术期各阶段存在不同的决策挑战:术前涉及手术候选资格、治疗策略和手术方案;术中要求时间敏感地在不确定条件下解读生理变化和手术指标;术后需要决定处置、监测和早期干预。AI系统的可接受参数因阶段而异,延迟、可解释性、鲁棒性和容错性最为关键。早期AI主要聚焦风险分层,但模型通常只报告区分度,未展示对临床行为或患者结局的影响。近期文献强调AI作为决策支持工具而非自主决策者,应当结合人类监督,并纳入共享决策。泛化性、可解释性、透明度、监管、前瞻性评估以及公平性等问题,是临床转化的主要挑战。
2 Methods
本范围综述遵循PRISMA-ScR指南进行。检索PubMed/MEDLINE、Scopus和Google Scholar三个数据库,检索时间为2026年2月15日,限定2019年1月1日至2025年12月31日发表的英文文献。检索策略专门针对明确涉及AI支持手术或围手术期决策的研究,数据库特定检索词结合了人工智能或机器学习与手术或围手术期术语以及决策支持概念。初步检索获得2900条记录,经过预定义的相关性细化步骤移除2124条,去除6条重复后,770条记录进入标题和摘要筛选。两名研究者独立筛选,排除665条,105篇报告进入全文评估,最终50篇被排除(缺乏明确围手术期临床应用25篇、不合资格AI应用10篇、缺乏临床决策支持作用9篇、方法学细节不足6篇),纳入55篇证据来源。资格标准包括评估AI在手术决策或围手术期临床决策支持中的应用,涉及术前、术中、术后或跨阶段临床应用,采用ML、深度学习(DL)、放射组学、计算机视觉等AI方法,具有诊断、风险分层、患者或治疗选择、手术规划、术中引导或监测、术后预测等决策支持作用。数据提取使用标准化表格,包括作者、年份、国家、研究设计、专科、围手术期分期、临床应用、AI方法、数据来源、验证方法、性能指标、决策角色、实施特征和报告障碍。将证据分为原始研究和二级证据分别综合。翻译就绪度根据验证成熟度、工作流整合可行性、临床医生接受度和真实世界实施证据进行描述性评估。实施障碍采用社会技术框架分类。
3 Results
研究选择过程最终纳入55篇证据来源,包括8项原始研究和47项二级证据。原始研究涵盖回顾性和前瞻性建模研究、多中心比较研究、诊断模型研究以及模型开发与验证研究;二级证据包括系统综述、范围综述、叙述性综述和荟萃分析。研究覆盖骨科、神经外科、胃肠外科、肿瘤科、颌面外科和麻醉学等多个专科。AI应用主要用于诊断支持、风险分层、手术规划、术中引导和术后结局预测。按围手术期分期分布,31篇(56.4%)涉及多阶段或跨阶段应用,15篇(27.3%)以术前应用为主,5篇(9.1%)为术后应用,4篇(7.3%)为术中应用。术前应用最成熟,主要集中于诊断、风险分层和手术规划;术中应用较少,受数据可用性、工作流整合和实时实施挑战限制;术后应用主要涉及并发症预测、生存评估和恢复监测。实施结局分析显示,工作流整合是术中及术后应用的主要障碍,可解释性和临床医生信任是各阶段共同关注点。验证成熟度有限,多数研究依赖回顾性数据,缺乏外部或前瞻性验证。只有两项原始研究报告外部验证,四项原始研究(Yu等、Yang等、Merali等和Gong等)提供了前瞻性评估证据。术中AI还面临高质量注释手术视频数据缺乏、数据治理限制和标准化存储库缺失等障碍。总体证据成熟度呈现术前相对高于术后和术中的梯度,但所有阶段的真实世界实施证据仍然有限。
4 Discussion
4.1 术前阶段:AI应用在术前最普遍,包括诊断、风险分层、患者选择和手术规划,尤其在影像密集型肿瘤学、神经外科规划和骨科结局预测中较为成熟。AI可辅助判断手术候选性、疾病分期、治疗策略和手术方案优化。多数研究报告在高维数据分析方面优于传统统计模型,但收益在某些领域并不显著,且存在依赖回顾性数据、外部验证不足、异质性和泛化性等问题,伦理和可解释性也限制临床采纳。
4.2 术中阶段:术中AI应用相对较少,集中在实时图像解读、解剖识别、手术工作流分析和生理监测。AI有潜力支持实时决策,但多数证据仍处于回顾性或概念验证阶段,缺乏前瞻性验证。主要实施障碍包括实时数据处理要求、延迟限制、工作流整合困难和临床医生信任不足。计算机视觉模型需要大量高质量注释手术视频,但数据获取因隐私、治理、注释负担和标准化存储库缺乏而受限。
4.3 术后阶段:术后AI应用主要关注并发症预测、生存预测、复发预测和恢复预测。此阶段受益于丰富的纵向结局数据。AI可支持术后监测、随访规划、并发症风险分层和个体化恢复路径。模型预测准确性可接受,但与传统统计模型相比优势不一定明显。主要障碍包括缺乏前瞻性研究、临床随访整合困难以及潜在决策偏倚。大语言模型在文档记录、出院摘要和护理过渡支持方面引发了新兴趣,但实际采用仍然缓慢。
4.4 专科差异:不同专科的AI应用和成熟度差异明显。影像密集型领域如肿瘤学、胃肠外科和神经外科应用最多,成熟度较高;骨科和普外科应用较广但更异质;颅颌面和美容外科在模拟、解剖建模和结局预测方面有特定应用;微创和影像引导手术中的术中应用有初步验证,但其他专科较少。
4.5 整体解读:证据成熟度呈现梯度,术前相对更成熟,但所有阶段常规临床实施的证据仍有限。文献仍以预测模型为主,而非已完全实现并能影响临床决策和患者结局的决策支持系统。AI应被视为人机协作光谱中的一部分,而非完全自动化或仅由临床医生决策。可负担性、可及性、成本效益和基础设施也是成功实施的重要决定因素。
5 Conclusion
本范围综述描绘了AI在围手术期连续体手术决策中的应用现状。术前应用相对术中及术后具有更高的证据成熟度,但所有阶段的真实世界实施证据仍然有限。尽管AI在许多外科领域展示了强大的预测性能,但支持AI决策支持系统常规部署的证据仍然不足。未来进展不仅取决于改进模型性能,还取决于加强验证、证明临床效用、整合临床工作流以及评估对患者结局和决策的真实影响。AI有望增强手术决策,但多数证据仍处于早期或中期转化阶段,需要优先开展多中心评估、监管与工作流整合,并证明有意义的临床获益,同时确保AI补充而非替代临床判断、专业责任和以患者为中心的护理。
6 Recommendations
未来的AI手术研究应更重视临床效用和决策支持,而非仅模型开发。AI系统应围绕明确的围手术期决策点设计,如手术候选资格、治疗选择、术中干预阈值和术后处置规划。验证要求应与预期用途匹配:本地部署模型需时间验证、校准监测和前瞻性影响评估;多机构部署工具需跨不同人群和医疗环境的外部验证。前瞻性评估仍至关重要。应评估决策影响、临床医生行为、工作流结果和患者中心结局。AI集成应发生在共享决策框架中,保留临床医生监督和患者自主性。监管框架应区分预测模型和临床决策支持系统,明确术中及术后AI系统的指导。实施挑战包括工作流整合、互操作性、用户接受度、基础设施和法规依从性。应持续评估AI系统在人口学和临床亚组中的偏倚,透明报告训练数据、性能和局限性。成功转化需要临床医生、数据科学家、工程师、伦理学家、管理者和管理机构的多学科协作。
7 Limitations
本范围综述存在局限性。首先,现有文献大多以预测为导向,直接证明AI影响临床决策、临床医生行为或患者结局的证据有限。其次,检索策略专门针对明确与手术决策和围手术期实施相关的AI应用,可能遗漏了没有明确临床决策支持背景的技术导向研究。第三,研究在临床背景、结局、数据来源、方法和实施环境方面存在显著异质性,限制可比性和定量合成。第四,验证质量参差不齐,多数研究依赖回顾性单中心数据,较少在真实临床环境中进行前瞻性评估。第五,监管和实施细节常报告不足,难以区分实验模型和可临床部署系统。第六,数据质量和偏倚仍是重要问题。第七,同时纳入原始研究和二级证据可能引入重叠,因此分别解释并避免定量合并。最后,发表偏倚可能影响证据,因为阳性结果的研究更易发表。尽管如此,本综述为AI手术决策提供了临床基础的综合,并确定了安全、有效和公平实施所需解决的关键方法论、实施和转化差距。