《European Spine Journal》:Large language models in the vertical integration of spine surgery workflow: a scoping review
编辑推荐:
目的:评估大语言模型(Large Language Models, LLMs)和多模态大语言模型(Multimodal Large Language Models, MLLMs)在脊柱手术工作流程中的临床可靠性与推理能力的现有证据。本范围综述采用新型垂直整合成
目的:评估大语言模型(Large Language Models, LLMs)和多模态大语言模型(Multimodal Large Language Models, MLLMs)在脊柱手术工作流程中的临床可靠性与推理能力的现有证据。本范围综述采用新型垂直整合成熟度量表(Vertical Integration Maturity Scale, VIMS)映射模型在垂直工作流程五个阶段中的成熟度,识别持续存在的研究空白及临床实施的技术前提。方法:在PubMed、Embase和Scopus中系统检索2023年1月至2026年1月间发表的同行评审研究。基于人群、概念和情境(Population, Concept, and Context, PCC)框架,根据生成式人工智能在脊柱疾病临床评估和手术治疗中的应用筛选研究。数据通过独立双编码,采用二维框架进行分析,该框架将五个VIMS层级映射至五个功能工作流程阶段。综合归纳包括按模型架构、输入模态和性能基准进行分类,并计算评估者间信度以验证新框架。结果:在351篇识别记录中,40项研究符合纳入标准。研究密度在第三阶段(评估性决策逻辑)的VIMS层级1处达到峰值(n=15),表明方法论上侧重于循证指南检索而非患者特异性综合。尽管ChatGPT-4与临床指南的一致性较高(61.1%至88.2%),但在复杂脊柱畸形中的诊断准确率降至11.1%。第四阶段(触觉性手术规划)存在关键证据空白,完全没有评估自主工作流代理能力(VIMS 4–5)的研究。这一缺失可能反映了依赖专有、非版本控制模型的回顾性研究设计的局限性。虽然定性综合提示混合架构和检索增强生成(Retrieval-Augmented Generation, RAG)可能弥合现有语义差距,但这些趋势的推断强度目前受限于异质性基准指标。结论:当前LLMs在基础医学知识方面表现出熟练性,但在非确定性手术场景中的推断有效性方面仍存在显著证据空白。推进临床整合需要模块化多模态集成系统,将放射影像数据与领域特异性推理支架协同处理。至关重要的是,未来研究必须从回顾性算法基准测试转向标准化、前瞻性临床试验,以评估算法决策与实际手术结局的对比。
引言
大语言模型(LLMs)和多模态大语言模型(MLLMs)的快速发展推动了其在专科手术工作流程中整合的研究,其基于Transformer的架构能够综合异构医学数据集以支持高级决策。脊柱手术是人工智能(AI)整合的主要领域,因为退行性疾病的患病率不断增加且手术决策固有复杂。尽管循证指南提供了结构化方法,但对患者报告结局和多模态数据的解读常受显著的观察者间变异限制。高维计算系统可通过综合复杂变量(如诊断影像和步态分析)来促进个体化规划,从而补充传统手术判断。在此框架下,LLMs提供了可重复的数据综合潜力,可能增强临床一致性。通过增强人类决策,这些技术促进了个体化范式,使客观分析支持临床专业知识。越来越多的医学专业人员寻求将LLMs应用于临床实践,然而这些模型的可靠性和推断有效性在很大程度上仍未经验证。现有文献描述了总体AI趋势,但关于LLMs在复杂多步骤环境中推理能力的证据映射仍存在关键研究空白。本范围综述采用新型垂直整合成熟度量表(VIMS)框架,将当前证据映射至手术工作流程的五个不同阶段,从初次分诊到围手术期管理。研究人员将垂直整合定义为在人类监督下能够导航多步骤工作流程的临床决策支持系统的实施。通过这一双轨框架,研究人员阐明了当前模型如何与VIMS层级对齐,从基础回想到自主伙伴关系。在人群、概念和情境(PCC)框架指导下,本研究评估了LLMs和MLLMs处理病史、检查和影像数据以制定脊柱疾病诊断和治疗计划的能力。
方法
本研究依据PRISMA-ScR指南实施。选择该方法旨在系统识别脊柱手术工作流程中LLMs临床可靠性方面的持续研究空白和局限性。检索策略方面,在PubMed、Embase和Scopus中执行系统检索。检索字符串利用布尔运算符整合与大语言模型和脊柱手术相关的关键词和MeSH术语。资格标准采用PCC框架定义:人群为接受脊柱疾病评估或手术的患者;概念为LLM和MLLM应用;情境为从初次分诊到术后恢复的垂直临床工作流程实施。纳入标准限于2023年1月至2026年1月21日间以英文发表的同行评审研究。缺乏LLM组件或仅关注非生成式AI架构的研究被排除。研究选择由两名盲法评审员独立进行筛选和全文资格评估,通过共识解决分歧,并记录于PRISMA流程图。数据提取和综合采用标准化表格捕获研究特征、模型架构、分配的VIMS层级、工作流程阶段分类、性能指标和局限性。为解决专科手术环境中AI代理评估缺乏标准化指标的问题,研究人员开发并应用了一个新型二维分析框架,旨在弥合技术模型性能与实际手术效用之间的差距。第一维度利用VIMS量化临床推理深度,五个层级从基础回想到与人类专家的自主伙伴关系。第二维度将这些成熟度层级映射至垂直手术工作流程的五个离散阶段,从初次分诊到围手术期管理。这种双轴方法有助于对模型可靠性进行精细评估,并识别LLM辅助脊柱手术工作流程中的研究空白和当前局限性。由于纳入研究可能跨越多个垂直手术工作流程阶段,两名作者独立为每项研究编码所有适用阶段。对于需要互斥类别的Cohen κ统计可靠性分析,评定者根据每项研究的主要方法学假设分配单一主要阶段。
结果
研究选择和特征方面,系统检索共获得351条记录,其中40项研究符合最终纳入标准。文献显示研究活动显著加速,从2023年的1篇增至2024年的14篇,并在2025年达到24篇峰值。评估主要集中于专有OpenAI GPT系列(n=31),包括GPT-4(n=21)、GPT-3.5(n=13)和GPT-4o(n=11)。其他评估模型包括Google Gemini(n=7)和Anthropic Claude(n=2)。虽然基础模型是主要焦点,少数研究利用检索增强生成(RAG)将模型输出锚定于循证脊柱手术指南,少数研究整合卷积神经网络(CNN)架构以促进多模态关联。大多数评估专有系统的研究使用宽泛的模型标识,未记录特定版本锁定的API端点,从而在聚合数据集中引入了纵向变异性。对40项纳入研究的独立双编码显示较高的评估者间信度:垂直手术工作流程分类的主要阶段分配一致性κ=0.74,VIMS分配一致性κ=0.88。所有分类差异均通过共识讨论解决。将纳入研究映射至分析框架后,显示在早期和中段工作流程的低成熟度层级存在显著聚集。研究密度在第三阶段VIMS 1处最高(n=15),表明当前研究设计主要侧重于静态检索循证指南,而非测试患者特异性推断综合。第四阶段存在显著证据空白,仅有2项研究处于VIMS 2。这种缺乏可能反映了制定具体手术构造的技术复杂性以及研究设计中对复杂多模态影像解读的前提要求。没有任何研究在任何工作流程阶段评估VIMS 4或VIMS 5的应用。
按垂直工作流程阶段分析
第一阶段:初次分诊
六项研究使用标准化临床查询或结构化情景评估初次分诊能力。此阶段原始放射影像的直接解读仍未得到解决。ChatGPT-4和GPT-4o在高质量文本情景中的诊断准确率达到100%。值得注意的是,LLM生成的管理计划在全面性方面超过委员会认证的外科医生(+34%;p=0.0176)。然而,优越的结构格式和定性呈现分数与临床精确度或循证指南依从性无关。在马尾综合征分诊中,与多学科团队的一致性达到99.7%(κ=0.764)。尽管如此,第一阶段研究中注意到过度转诊的系统性趋势,其特征是对手术紧迫性高敏感性但特异性欠佳,可能增加专科转诊负担。研究表明迭代模型更新已基本缓解了与ChatGPT-3.5相关的来源捏造和幻觉。与既定临床协议的细微不一致仍然存在,诊断可靠性仍次于结构一致性和格式。
第二阶段:多模态关联
十一项研究评估了临床症状与多模态数据(如MRI和CT影像)的关联。证据显示向多模态特征提取的转变,然而,将原始影像与临床发现整合的统一诊断综合仍未实现。独立LLMs在视觉空间任务中表现出显著局限性。在青少年特发性脊柱侧凸的标记中,与专家的一致性可忽略不计(κ≤0.053),超过73%的解剖分配被确定为结构错误。模型无法可靠地定位椎体节段或量化病理严重程度(κ=0.364),除非集成外部软件。在个体评估中,专门架构在狭窄诊断任务中实现了更高敏感性,而独立通用模型在相同应用中表现欠佳(~70%)。相反,专门的视觉语言模型表现出高内部一致性,但因训练参数狭窄而在一般识别任务中失败。新兴的混合系统评估表明,将专门机器学习与LLM推断推理相结合,在椎管狭窄分类中产生强临床一致性(κ=0.849),并在复杂疾病组合中实现高预测准确性(F1=0.905)。然而,由于文献中报告的性能指标异质性,这些架构比较属于描述性趋势而非统计确定性。至关重要的是,尽管有这些性能提升,复杂诊断路径中30%的高紧急度建议在临床上仍不安全。
第三阶段:评估性决策逻辑
二十二项研究评估了循证指南一致性以及整合患者特异性因素以确定手术候选资格。在十六项使用标准化指南提示的研究中(评估VIMS 1),ChatGPT-4和ChatGPT-4o实现的一致性率在61.1%至88.2%之间。虽然特定腰椎融合模型超过委员会认证基准(88.2%对比72.6%),但性能仍不一致。其他研究报告较低的一致性(42–59%),主要由于回答不完整和遗漏关键指南因素。九项研究使用临床情景(评估VIMS 3水平),揭示了理论与专家级判断之间的成熟度差距(李克特评分3.90对比4.70)。诊断精度与病例复杂性呈负相关,在复杂脊柱畸形中降至11.1%。尽管脊柱肿瘤学中与多学科团队的一致性达73%,但手术干预的评估者间信度仍低于人类共识(κ=0.548)。
第四阶段:触觉性手术规划
两项研究评估了模型的手术构造选择和生物力学规划能力。Kartal等人发现手术建议存在差异,其特征是无法整合复杂变量(如脊柱稳定性和既往手术史),导致临床不适当的选择。在青少年特发性脊柱侧凸中,模型与专家的一致性可忽略不计(κ≤0.053对比κ=0.913)。精度因结构无效的解剖标记(错误率73.6%–80.8%)而根本受损,使得自动Cobb角量化和随后的手术规划在临床上无效。
第五阶段:围手术期管理
五项研究评估了术后风险分层和并发症管理。连续模型迭代显示了性能提升。与NASS指南关于血栓栓塞和抗生素预防的一致性从ChatGPT-3.5的33–62.5%提高到ChatGPT-4.0的81–92%。在小儿手术部位感染(SSI)预防中,与专家共识的一致性达到92.8%。当前证据表明向利用非结构化数据集的预测建模转变。专门化的GatorTron LLM架构在预测脓毒症和肺部事件方面优于传统计算机视觉模型,神经系统并发症的特异性达0.946。对于脊柱SSI管理,ChatGPT-4综合了异质数据(包括病史、放射学描述、生化标志物和微生物学),专家评定的精度高(κ=0.62–0.83)。
讨论
对40项纳入研究的分析显示了从被动信息检索向主动临床综合的转变。这一进展标志着LLMs从简单查询工具重新定位为五阶段脊柱手术工作流程的潜在功能组件。然而,临床整合目前受到一系列相互关联的成熟度空白的制约。尽管LLMs表现出高指南依从性,但当前评估显示其缺乏复杂病理所需的临床情境化能力,导致诊断模糊或不合理的临床确定性。此外,大多数研究仍受限于单模态纯文本评估,无法有效处理多模态形态测量数据,从而排除了真正的手术规划。技术不稳定性(特别是提示依赖和幻觉)进一步需要持续的人类监督以确保安全。解决这些架构和临床障碍对于垂直工作流程整合至关重要。
临床推理缺口:指南、启发式与决断性
本综述识别的主要冲突是LLM输出与既定临床实践指南之间的差异。虽然19项研究使用指南一致性作为基准,但该方法假设指南代表静态金标准,往往忽视初级研究与正式编码之间的发展延迟。有趣的是,尽管模型通常比委员会认证的外科医生表现出更高的一致性率,但它们缺乏复杂手术决策所需的细微灵活性。外科医生经常根据患者特异性因素偏离严格协议,腰椎融合等手术的依从性在临床实践中仅达60%。由于手术实践仍存在异质性,但对循证路径的依从性与更优结局相关,研究人员认为垂直整合不取决于静态指南的自动化,而在于创建经过验证的医学知识库以支持动态实时查询。从VIMS 1级向3级的转变进一步受到推理衰减的阻碍,即LLM在复杂患者叙述的多步整合中可靠性崩溃。这种衰减恰好发生在非结构化数据(如症状慢性化和心理社会稳定性)必须综合为个体化手术候选资格时。标准架构常遭受错误传播,初始数据聚合期间的细微误解导致重大管理失败。此外,存在明显的启发式障碍,模型作为高效数据检索器,但无法复制专科研究金级别的临床直觉。专家外科医生利用从纵向经验中获得的启发式来权衡变量并主动行动。当前LLM倾向于将这些关键修正因素视为临床噪声,退回到通用免责声明或僵化的指南依从性。未来研究应优先采用迭代提示策略,带有思维链(Chain-of-Thought, CoT)支架以维持长形式临床逻辑,而非依赖传统聊天界面的单向数据输入。最终,细微临床情境化能力仍是将AI安全整合至脊柱实践的前提。结果揭示了决断性悖论:专科培训的外科医生在超过95%的复杂场景中表现出临床决断性,而LLM的决断性低至24%。面对非标准化数据时,模型倾向于算法保守主义,而非作为坚定的临床伙伴。这种犹豫阻止了当前LLM在高风险脊柱手术所定义的争议或紧急情况下作为可靠辅助。相反,LLM偶尔表现出人为的过度确定性,通过捏造建议来满足提示,这种失败的特征是无法承认知识局限。这种虚假确定性对患者安全构成重大风险。在缺乏直接文本先例的情况下,模型可能缺乏提出针对性手术干预所需的认知代理。要实现VIMS 3或4级,系统必须整合置信度校准机制,自动标记模糊场景以供人类升级。弥合这一差距需要转向能够进行分布外推断的模型,基于领域特异性微调而非对显式训练参数的概率依从。
证据完整性与结构可靠性
LLM的临床实施从根本上受到概率推理与验证证据库之间脱节的阻碍。该风险主要由数据污染驱动。在异质数据集上训练导致LLM在过时协议和恢复偏倚之间摆动,优先考虑未经证实的试验而非既定安全基准。目前,LLM缺乏自主批判性评估的能力,常优先考虑高容量数据而非方法学严谨性。在快速发展的领域(如微创和内镜脊柱手术)中,这种无法权衡证据仍是VIMS 3级整合的明确障碍。这一证据缺口因人为幻觉(特别是引文捏造)而加剧。尽管错误频率迭代降低,但残余风险仍是脊柱手术中的关键责任。因此,当前架构不能作为自主权威,必须强制实施人类在环协议。专业专家对LLM生成的临床计划进行严格验证是确保数据准确性和应对现代脊柱实践复杂医疗法律要求的先决条件。这些输出的可靠性在结构上受到异质提示设计的损害。高度结构化的提示常通过使用预处理情景诱导提示过拟合,这些情景隔离诊断特征而省略真实世界实践中固有的数据噪声。这引发了关于生态效度的重大关切,因为当前基准常使用预过滤输入,无意中暗示了正在测试的启发式,无法复制人类专家所需的独立变量加权。专有模型中的可重复性挑战加剧了这种结构脆弱性。由于大多数系统经历持续、未公开的算法更新,证据库容易遭受时间退化。使用宽泛模型标识而无版本控制意味着相隔数月发表的研究可能评估根本不同的算法,从而排除可靠的跨研究验证。随着领域发展,未来临床基准必须优先考虑开源架构或强制使用严格版本化的API端点,以确保纵向科学完整性。最后,系统可靠性受到已记录的自校正缺陷的损害。一旦发生初始逻辑失败,模型表现出对其自身错误输出的统计偏倚,使迭代对话成为不可靠的错误修正方法。因此,临床安全不能依赖自主自校正,初始提示的精确性成为临床安全的关键决定因素。解决这些不一致需要向模拟脊柱门诊的诊断复杂性和噪声的标准化手术推理基准转变。这种方法学转变必须超越目前主导文献的单向干净数据输入,并批判性评估当前聊天机器人界面是否适合整合至垂直工作流程。
弥合语义差距:混合架构与RAG
当前垂直整合轨迹表现出观察到的性能上限。虽然此限制部分由基于文本的架构的单模态性决定,但也在很大程度上受现有文献中抽样伪影的影响,该文献以回顾性、低成熟度评估为主。尽管有十一项研究指示向多模态特征提取的初步转变,但仍存在深刻的语义差距,其中高语言熟练度常掩盖解剖基础和空间推理方面的根本缺陷。要实现VIMS 4级,该领域必须从单体设计转向模块化混合集成,将空间几何计算与情境推理解耦,并通过前瞻性临床研究设计验证。在这些新兴框架中,专门化的机器学习模型(如针对图像分割优化的CNN)可执行高精度空间任务,使LLM作为中央协调器,将这些发现综合为个体化计划。尽管异质报告指标排除了跨研究确定性统计荟萃分析,但定性综合表明,将形态学参数作为离散标记整合至多模态集成中,为克服目前将独立代理限制在VIMS 3级的推理差距提供了可行途径。此外,RAG代表了解决证据完整性缺口的有前景的架构转变。通过将推理锚定于精心策划的实时数据库,RAG使模型能够优先考虑当代主要文献而非静态训练数据中固有的遗留快照,从而减少人工幻觉的频率。尽管该声明的推断强度目前受限于研究间缺乏可比较的基准,但这种数据同步促进了从算法不透明向可验证的临床决策支持引擎的转变。
伦理治理与问责
虽然全面的伦理分析超出了本综述的范围,但将AI整合至手术流程的法律和伦理影响至关重要。LLM在脊柱手术中的临床整合从根本上受到算法不透明性的限制,这阻碍了手术问责所需的建议透明论证。除了推理透明度,这些模型还引入了关于数据主权、法律责任以及未策划训练数据中固有系统性偏倚延续的重大责任。因此,维持安全的手术工作流程仍取决于强制的人类在环监督,以确保模型输出与不断演变的医疗法律要求和护理标准同步。
局限性
本范围综述主要受限于关注英文文献和通用LLM,可能遗漏私营机构环境中使用的专有或专门架构。关于在生物医学语料库上微调的领域特异性模型的证据显著缺乏。此外,生成式AI的快速演变格局表明,最新迭代可能具有当前数据集未完全捕获的能力。至关重要的是,所有40项纳入研究完全依赖回顾性基准测试、临床情景或模拟数据集。完全缺乏前瞻性患者队列或随机对照试验,从根本上限制了评估算法决策与实际临床结局对比的能力。此外,对异质基准(如一致性百分比、Cohen κ、F1分数、李克特量表)的依赖排除了正式定量荟萃分析。因此,关于特定架构设计(如混合集成或RAG)相对优越性的结论来自指标不可公度的跨研究比较。这种指标异质性削弱了这些比较性声明的推断强度,需要谨慎解释当前性能趋势,直到建立标准化的、领域特异性评估框架。为解决这一方法学缺口,本综述提出的新框架代表了构建标准化评估方法学的必要第一步。该框架旨在统一未来研究报告,并安全加速跨不同研究中心临床整合AI的评估。最终,需要持续协作努力以进一步标准化该领域的研究方法。应用所提出框架的一个基本挑战是捕获所研究文献的全面广度。研究人员有意采用多阶段分类方法进行视觉综合,因为将综合研究限制在单一领域会人为地低估其临床覆盖范围。尽管为验证评估者间信度而分配了主要阶段,但读者应认识到该分类框架旨在映射手术人工智能的总体格局,并非严格隔离研究或将解释限制于单一方法学假设的狭窄范围。
结论
本综合识别了脊柱AI中的关键范式转变,从被动信息检索转向自主临床综合。虽然前沿LLMs在基础医学知识方面表现出高熟练度,但当前文献揭示了其在手术实践非确定性场景中推断有效性的显著证据空白。实现真正的工作流程代理和自主伙伴关系需要超越单模态语言框架。未来整合依赖于开发混合多模态集成系统,原生整合DICOM数据和纵向患者指标以及专门化分层推理支架。建立经过验证的前瞻性证据基础是安全实施的必要条件。至关重要的是,未来研究优先事项必须从回顾性算法基准测试转向严格的临床验证。建立前瞻性队列和随机对照试验以评估算法决策与实际手术结局的对比,是安全临床实施的绝对前提。