《Life》:Generative AI and Large Language Models in Rehabilitation: A Scoping Review
编辑推荐:
生成式人工智能(generative artificial intelligence, AI)和大型语言模型(large language models, LLMs)在康复中的应用日益受到评估,但其临床有效性、可重复性和安全性仍不确定。本范围综述(scopin
生成式人工智能(generative artificial intelligence, AI)和大型语言模型(large language models, LLMs)在康复中的应用日益受到评估,但其临床有效性、可重复性和安全性仍不确定。本范围综述(scoping review)系统梳理了同行评审的生成式AI/LLMs研究,涵盖康复评估、临床推理、决策支持、计划、教育和功能分类。遵循JBI方法学和PRISMA-ScR,检索了五个数据库,纳入2015年1月1日至2026年7月24日发表的英文研究。两名研究人员独立进行研究筛选、数据提取、方法学评价和应用领域编码。在2126条记录中,纳入43篇出版物,代表42项独特研究,主要来自2025-2026年,涉及GPT/ChatGPT/OpenAI系列系统。在独特研究层面,确定了六个应用领域:临床推理和决策支持(n = 13)、康复教育、模拟和反馈(n = 10)、康复计划和处方(n = 9)、指南依从性和临床问题支持(n = 6)、自适应反馈和康复支持(n = 2)以及评估和功能分类(n = 2)。证据集中在基准、情景和教育评估中,患者水平结局有限。异质的方法、不完整的可重复性报告、不一致的安全性评估和可能的选择性发表限制了可比性和临床普适性。因此,生成式AI/LLMs应主要用作临床医生监督的辅助工具,并优先考虑前瞻性验证、标准化报告和积极的安全性评估。
1. 引言
该文指出,生成式人工智能(generative artificial intelligence, AI)和大型语言模型(large language models, LLMs)已迅速扩展到康复领域,但自由文本生成过程可能产生幻觉、上下文丢失、不准确引用和过度自信。康复决策涉及损伤、活动限制、参与限制、环境障碍、患者目标、恢复阶段、疼痛反应、合并症和功能适应等多维度因素,因此评估需包括临床相关性、完整性、适用性、指南一致性、个体化、安全性以及使用前所需专家修正程度。现有综述多聚焦特定模型或功能,缺乏康复特定且全面的证据图谱。本文旨在系统梳理生成式AI和LLMs在康复评估、临床推理、决策支持、计划、教育、功能分类等领域中的应用证据。
2. 材料与方法
2.1. 研究设计
该范围综述遵循乔安娜·布里格斯研究所(Joanna Briggs Institute, JBI)范围综述方法学,报告遵循PRISMA-ScR清单。采用PCC框架制定纳入标准。注册于OSF,属于方法学记录。
2.2. 纳入标准
纳入同行评审全文原始实证研究,评估生成式AI或LLM系统用于康复相关评估、临床推理、决策支持、计划、教育等。排除无生成式AI/LLM成分及非原始研究。检索限于英文文献,时间2015年1月1日至2026年7月24日。
2.3. 检索策略
检索PubMed/MEDLINE、CINAHL、Web of Science Core Collection、Scopus和IEEE Xplore。概念块包括生成式AI/LLM和康复/功能情境。
2.4. 研究筛选
两名研究者独立筛选标题摘要和全文,基于预先设定的标准,分歧通过共识解决。报告了筛选一致性,标题摘要阶段94.89%一致(κ=0.726),全文阶段91.11%一致(κ=0.800)。
2.5. 数据提取
使用标准化Excel表单,提取作者、年份、国家、设计、康复领域、AI模型版本、提示策略、重复运行、结局指标等。报告级和独特研究级分别汇总。
2.6. 方法学质量评价
采用MMAT、JBI工具、QUADAS-3等。评价结果用于描述性解释,不排除文献。
2.7. 结果综合
由于异质性,采用叙述性综合,按PCC映射。应用领域编码由两名研究者独立完成,Cohen’s κ=0.850。
3. 结果
3.1. 文献检索与筛选
共2126条记录,排除重复后1526条,筛查后135篇全文,最终43篇出版物(42项独特研究)。排除原因包括会议摘要、无关情境、患者教育等。
3.2. 方法学评价结果
多数为定量描述性研究(31项),其次混合方法(5项)等。常见局限为特异性案例集、缺乏外部验证。
3.3. 研究的一般特征
出版年份集中于2025-2026(38项)。主要模型家族为GPT/ChatGPT/OpenAI(40项)。最常见的康复情境为肌肉骨骼、骨科、运动、脊柱和姿势康复(15项),其次康复教育(9项)。
3.4. 应用领域映射
六个领域数量分别为:临床推理和决策支持(13项)、康复教育模拟反馈(10项)、康复计划和处方(9项)、指南依从性和临床问题支持(6项)、自适应反馈和康复支持(2项)、评估和功能分类(2项)。
3.5. AI模型与提示/实施策略
GPT系列占95.2%,Gemini占23.8%,DeepSeek占16.7%。提示策略包括直接提问、结构化临床场景、指南派生问题、角色扮演、零样本/少样本、多模态等。
3.6. 结局领域与测量
最常见结局为准确性、指南依从性或与专家一致性(33项),其次临床推理、治疗计划质量(25项)。直接患者水平结局极少。
3.7. 模型报告、可重复性、安全性与证据缺口
33项报告精确版本,12项报告完整提示,8项报告访问日期,6项报告可变性处理,5项报告重复运行,5项报告生成设置,2项报告检索增强生成。安全性评估不完整,如红旗标志检测、禁忌症识别等未系统评估。
4. 讨论
4.1. 任务依赖的表现与方法学解释
证据显示任务就绪度梯度。在有限、有明确参考标准的任务(如指南相关问题)中表现稳定,在个体化计划、纵向适应等任务中不可靠。没有模型跨任务一致优越。方法学设计如小样本、作者制定评分标准可能导致偏差。
4.2. 临床有效性和实践适用性的局限
主要差距在于结构化基准与常规康复实践之间的鸿沟。多数研究使用静态或模拟案例,无法反映纵向康复决策。适用性受限于缺乏外部验证、指南一致性不佳、引用不可靠、禁忌症检测不足等。仅一项研究直接评估患者水平结局。
4.3. 风险分层的康复与数字化实施
提出风险分层策略,包括低风险(教育、文档)、中风险(评估支持、计划草案)、高风险(自主分诊、红旗标志解读、运动剂量与进展)。目前证据支持临床医生监督的辅助使用。
4.4. 安全性、治理与操作性人工监督
平均准确率不足以作为安全指标,需要失败模式分析、禁忌症测试、引用验证、不确定性评估。治理需具体操作,如模型版本日志、可追溯来源、临床医生签署、升级路径、定期再验证。人工监督应记录为可重复过程。
4.5. 局限性
检索未包括Embase等数据库,可能漏掉相关研究;英文限制可能引入语言偏倚;发表偏倚可能;证据异质性阻碍定量综合;依赖代理结局,未评估电子病历整合等。
4.6. 未来研究方向
提出五阶段路线图,从基准测试到前瞻性验证到监督工作流到多中心试验到监管生命周期管理。所有阶段需报告精确模型版本、提示、访问日期、生成设置等。
5. 结论
43篇出版物代表42项研究,显示实质性探索潜力但缺乏自主临床有效性证据。当前最合理角色是临床医生监督的辅助工具。需优先处理可重复性、引用验证、人工监督和安全监测。