《Intelligent Oncology》:Comparative evaluation of large language models for guideline-concordant decision support in colorectal cancer multidisciplinary team care: A source-masked retrospective study
编辑推荐:
背景:结直肠癌(colorectal cancer, CRC)的多学科团队(multidisciplinary team, MDT)决策整合了影像学、病理学、外科、肿瘤内科、放疗科等多领域信息,但面临信息整合耗时、指南更新频繁、会议时间有限等实际约束。大型语言
背景:结直肠癌(colorectal cancer, CRC)的多学科团队(multidisciplinary team, MDT)决策整合了影像学、病理学、外科、肿瘤内科、放疗科等多领域信息,但面临信息整合耗时、指南更新频繁、会议时间有限等实际约束。大型语言模型(large language models, LLMs)在医学文本理解与问答任务中展现出潜力,然而LLM生成的治疗建议与真实世界MDT决策在同期指南框架下的比较证据仍然有限。
方法:研究人员开展了一项来源遮蔽(source-masked)的回顾性比较研究,纳入2022年1月1日至2024年12月31日期间在山东医药大学烟台附属医院接受MDT会诊的91例初治结直肠癌患者(41例结肠癌,50例直肠癌)。研究人员将标准化临床提示词分别提交至五个LLM——ChatGPT-5.0(OpenAI)、Claude-4.5(Anthropic)、Grok-4.0(xAI)、DeepSeek-V3.2(DeepSeek)和Doubao-Seed1.6(ByteDance)——生成治疗建议。所有建议经来源中性标准化处理后,由五名具有5年以上MDT经验的高年资临床医师依据与MDT决策日期同期版本的CSCO和NCCN指南,采用5点Likert量表独立评分。主要统计分析采用累积链接混合效应模型(cumulative link mixed-effects models, CLMMs),以MDT建议为参照类别,并纳入临床病例与评审者的交叉随机截距。
结果:在91例患者共546条建议中,与MDT建议相比,五个LLM来源均显示出显著更高的获得更高指南一致性评分的累积优势比(odds ratios, ORs):ChatGPT-5.0为9.68(95% CI, 6.81–13.75),Claude-4.5为25.08(95% CI, 17.09–36.80),DeepSeek-V3.2为25.69(95% CI, 17.45–37.83),Doubao为19.35(95% CI, 13.31–28.11),Grok-4.0为24.21(95% CI, 16.49–35.54);所有Holm校正后P值均<0.001。调整肿瘤部位与疾病分期后结果保持一致。按肿瘤部位分层的亚组分析显示结肠癌与直肠癌队列中方向性效应相似。描述性分析显示,直肠癌中评分差异最大:MDT平均评分为2.66±1.23,而DeepSeek-V3.2为4.68±0.63。评审者间一致性方面,MDT建议的组内相关系数[ICC (2, k)]最高,为0.828(95% CI, 0.766–0.870),高于所有LLM来源。
结论:在本回顾性来源遮蔽评估框架下,LLM生成的结直肠癌治疗建议获得了比MDT建议更高的评审者赋分指南一致性评分。该发现仅涉及标准化纯文本评估框架下的指南一致性,不应被解读为个体化诊疗、临床安全性或患者结局优越的证据。评审者间一致性并未在LLM输出中统一更高,运行间可重复性未予评估,来源遮蔽的成功性亦未经验证。这些结果支持将LLM作为指南一致性审计、结构化文档记录和基于清单的决策支持的辅助工具开展前瞻性评估,并需持续的临床医师监督与专项安全性评价。
论文解读文章
一、研究背景与问题
结直肠癌(colorectal cancer, CRC)是全球最常见的恶性肿瘤之一,疾病负担日益严峻。其治疗决策需整合肿瘤分期、病理学、影像学发现、分子检测、体能状态、合并症及患者个体化因素,常涉及手术、放化疗、全身治疗与支持治疗等多模式策略。在这一决策密集型临床场景中,多学科团队(multidisciplinary team, MDT)肿瘤委员会通过整合影像学、病理学、外科、肿瘤内科、放疗科、护理、营养及基因组学等多领域专业知识来协调复杂的肿瘤决策,旨在提升治疗建议的一致性、透明度与指南对齐度,从而保障患者安全与治疗质量。研究表明,MDT建议的依从性与结直肠癌患者的无病生存期和总生存期相关。
然而,MDT实施面临诸多实际约束:信息聚合耗时、指南更新日益频繁、沟通负担沉重、会议时间有限,这些因素可能导致病例信息综合不完整或建议变异。近年来,人工智能(artificial intelligence, AI)与大型语言模型(large language models, LLMs)在医疗应用中的探索加速推进。LLM在医学文本理解、问答和摘要任务中展现出潜力,但关于LLM生成建议与真实世界MDT决策在同期结直肠癌指南框架下的比较证据仍然有限。既往研究虽已考察LLM在部分真实临床场景中的应用,但尚未系统回答LLM输出能否在MDT工作流程中发挥辅助决策支持或指南一致性审计工具的作用。基于这一空白,研究人员开展了来源遮蔽(source-masked)的回顾性比较研究,对五个LLM使用真实世界结直肠癌MDT病例进行系统评估。该研究并非检验LLM能否替代MDT,而是考察LLM输出是否可作为MDT工作流程中的辅助决策支持或指南一致性审计工具。
二、研究设计与主要结论
研究人员回顾性纳入2022年1月1日至2024年12月31日期间在山东医药大学烟台附属医院接受MDT会诊的结直肠癌患者。经筛选105例后,最终分析队列包含91例初治患者,其中结肠癌41例、直肠癌50例。研究人员将标准化临床提示词统一提交至五个LLM——ChatGPT-5.0(OpenAI)、Claude-4.5(Anthropic)、Grok-4.0(xAI)、DeepSeek-V3.2(DeepSeek)和Doubao-Seed1.6(ByteDance)——生成治疗建议。所有建议经来源中性标准化处理后,由五名具有5年以上MDT经验的高年资临床医师依据与MDT决策日期同期版本的CSCO和NCCN指南,采用5点Likert量表独立评分。主要统计分析采用累积链接混合效应模型(cumulative link mixed-effects models, CLMMs),以MDT建议为参照类别。
研究得出以下核心结论:在调整临床病例与评审者变异后,与MDT建议相比,五个LLM来源均显示出显著更高的获得更高指南一致性评分的累积优势比,所有Holm校正后P值均<0.001。调整肿瘤部位与疾病分期后结果保持一致,按肿瘤部位分层的亚组分析显示结肠癌与直肠癌队列中方向性效应相似。描述性分析显示直肠癌中评分差异最大。评审者间一致性方面,MDT建议的组内相关系数[ICC (2, k)]最高。研究结果表明,LLM生成建议在标准化纯文本评估框架下获得了更高的指南一致性评分,但不应被解读为个体化诊疗或临床结局优越的证据;LLM有潜力作为MDT工作流程中的指南一致性审计、结构化文档记录和基于清单的决策支持的辅助工具,需前瞻性评估并保持临床医师监督。
三、主要关键技术方法
研究人员采用以下关键技术方法开展研究:其一,来源遮蔽比较设计,对五个LLM(ChatGPT-5.0、Claude-4.5、Grok-4.0、DeepSeek-V3.2、Doubao-Seed1.6)与真实MDT建议进行盲法比较;其二,标准化提示词与建议文本标准化流程,所有来源建议统一转换为四字段模板(分期/临床问题摘要、推荐初始治疗策略、关键指南依据、额外检查或注意事项),去除来源标识并随机化呈现顺序;其三,指南锚定的5点Likert量表评分体系,五名高年资临床医师依据与MDT决策日期同期版本的CSCO和NCCN指南独立评分;其四,累积链接混合效应模型(CLMMs)作为主要推断分析方法,纳入临床病例与评审者的交叉随机截距,以MDT为参照类别进行Holm校正的成对比较;其五,评审者间一致性评估,采用双向随机效应组内相关系数[ICC (2, k)]、二次加权kappa系数和Kendall协和系数(W)。样本队列来源于山东医药大学烟台附属医院2022至2024年间的真实MDT会诊病例。
四、研究结果
4.1 研究人群与基线特征
研究最终纳入91例初治结直肠癌患者,其中结肠癌41例、直肠癌50例。平均年龄67.4±10.3岁,男性50例(54.9%)。TNM分期分布:I期15例(16.5%)、II期13例(14.3%)、III期38例(41.8%)、IV期25例(27.5%)。错配修复(mismatch repair, MMR)状态:pMMR/MSS 71例(78.0%)、dMMR/MSI-H 6例(6.6%)、未知14例(15.4%)。远处转移24例(26.4%)。
4.2 各肿瘤分期的治疗建议模式
研究人员按临床分期划分七个亚组,描述MDT与LLM来源间治疗策略分布的差异。在I期结直肠癌中,75条LLM输出中有74条(98.7%)推荐单纯手术,而MDT建议中仅2/15(13.3%)推荐单纯手术,MDT更频繁推荐单药化疗(46.7%)或手术加辅助化疗(33.3%)。在II期结肠癌中,单纯手术与手术加辅助化疗各占全部建议的45%,DeepSeek-V3.2最常推荐单纯手术(86%),而Grok-4.0最常推荐手术加辅助化疗(86%)。在II期直肠癌中,MDT在6例中推荐手术加辅助化疗4例(66.7%)、单纯手术2例(33.3%),LLM建议则包括手术优先、新辅助化疗和同步放化疗策略。在III期结肠癌中,手术加辅助化疗为整体最常见策略,MDT在13例中推荐该方案10例(76.9%),而DeepSeek-V3.2(30.8%)和Doubao(46.2%)更频繁提出新辅助化疗后手术。在III期直肠癌中,LLM输出比MDT建议更频繁包含新辅助治疗成分,ChatGPT-5.0在25例中24例(96.0%)包含含新辅助化疗(neoadjuvant chemotherapy, NACT)的策略,而MDT仅2/25(8.0%)包含NACT类别,12/25(48.0%)推荐手术加辅助化疗。在IV期结肠癌和直肠癌中,LLM频繁推荐全身治疗包括靶向治疗加化疗,Grok-4.0和DeepSeek-V3.2在9例直肠癌中7例(77.8%)推荐靶向治疗加化疗,而MDT在9例直肠癌中3例(33.3%)推荐单纯手术。
4.3 比较评分分布分析
在结肠队列中,MDT评分分布于全部五个类别,而LLM评分更集中于4分和5分。在直肠队列中,MDT评分更频繁出现在较低类别,而LLM评分仍集中于4分和5分。这些分布描述了当前来源遮蔽评估框架内的指南一致性评分,并不确立患者结局或个体化临床适宜性的差异。
4.4 描述性评分汇总与评分层级构成
描述性分析显示,两个队列中所有五个LLM来源的平均评分均高于MDT建议。结肠队列中,Claude-4.5平均评分最高(4.57±0.74),MDT为3.37±1.26;直肠队列中,DeepSeek-V3.2平均评分为4.68±0.63,MDT为2.66±1.23。来源内比较显示,MDT建议在直肠癌中的平均指南一致性评分低于结肠癌,而LLM来源的相应差异较小且未达统计学显著。评分层级的堆叠分布进一步显示,结肠队列中LLM评分更集中于"完全适用"(5分)类别,直肠队列中MDT评分更频繁分布于1–3分。
4.5 累积链接混合效应模型分析
主要推断分析在个体评分层面采用CLMM,纳入临床病例与评审者的交叉随机截距。在主要CLMM中,推荐来源与获得更高指南一致性评分的概率显著相关。与MDT建议相比,五个LLM来源在Holm校正后均显示出显著更高的获得更高评分的累积优势比:ChatGPT-5.0为9.68(95% CI, 6.81–13.75),Claude-4.5为25.08(95% CI, 17.09–36.80),DeepSeek-V3.2为25.69(95% CI, 17.45–37.83),Doubao为19.35(95% CI, 13.31–28.11),Grok-4.0为24.21(95% CI, 16.49–35.54)。调整肿瘤部位与疾病分期后结果保持一致。按肿瘤部位分层的CLMM在结肠癌与直肠癌队列中均显示相似的方向性效应。所有拟合模型均成功收敛。
4.6 评审者间一致性分析
MDT建议的评审者间一致性最高,ICC (2, k)为0.828(95% CI, 0.766–0.870),其次为Doubao(0.717)和DeepSeek-V3.2(0.653)。加权kappa分析显示相似模式,MDT平均一致性最高(0.473),其次为Doubao(0.327)和DeepSeek-V3.2(0.242)。Kendall协和系数显示所有来源均具有统计学显著的一致性,但幅度因来源而异。这些发现表明,LLM评分在Likert量表上端的集中可能反映天花板效应而非评审者一致性的统一改善。
4.7 评分≥4的比例
LLM来源评分≥4的描述性比例高于MDT建议。直肠癌亚组中,MDT评分≥4的比例为26.8%,Claude-4.5和DeepSeek-V3.2分别为95.6%和94.8%。这些比例仅总结评审者赋分的指南一致性评分,不应用于确立临床安全性、可靠性或患者获益。
4.8 评审者层面按疾病分期的平均评分模式
热图显示评审者特定平均评分因推荐来源和疾病分期而异。在I期病例中,LLM来源的评审者特定平均评分集中于量表上端,而MDT平均评分在评审者间范围为2.20至4.93。在II期病例中,MDT评审者特定平均评分范围为2.62至4.15,LLM均值普遍高于4.0。在III期病例中,MDT评审者特定平均评分范围为2.92至4.08。在IV期病例中,MDT评审者特定平均评分范围为2.92至4.64。这些热图模式为描述性呈现,推断性比较应依据CLMM分析。
五、讨论总结与结论翻译
5.1 讨论部分总结
研究观察到LLM与MDT建议在疾病连续谱上存在系统性差异。在I期结直肠癌中,LLM建议更频繁遵循单纯手术策略(98.7%),而MDT建议中80%包含化疗相关干预。研究人员指出,回顾性MDT病历可能未完全反映导致治疗升级的患者特异性或情境性因素,该发现应被解读为记录在案的治疗策略与指南依从性的差异,而非MDT建议构成不当过度治疗的证据。这一模式与既往人群研究证据一致,即辅助治疗在低风险患者中存在过度使用且无明确生存获益,可能反映防御性实践或委托偏差(commission bias)。LLM建议的相对一致性提示此类系统可作为决策审计或降级提示工具,促使团队明确论证超出指南分期标准的升级理由。
在局部晚期直肠癌中,主要差异涉及治疗时序。LLM建议比MDT建议更频繁包含新辅助治疗成分,这与"实施差距"(implementation gap)一致,即循证支持的策略可能延迟融入常规实践。RAPIDO、PRODIGE 23等里程碑试验支持II/III期直肠癌的全新辅助治疗(total neoadjuvant therapy, TNT)策略,但临床工作流程中的采纳可能受操作因素制约。LLM输出在纯文本评估环境中似乎与TNT时代试验证据和当代指南路径更对齐,提示LLM可作为MDT中的证据更新提示工具。
评审者特定评分显示不同来源的离散模式不同。MDT建议在多个描述性热图中具有更宽的评审者特定平均评分范围,但正式一致性指标并未在LLM输出中统一更高,MDT建议的ICC (2, k)最高。评分集中不应等同于更优的评审者间可靠性或更低的评审者偏差。LLM生成建议可能为指南一致性审查和文档记录提供结构化参考点,而临床医师监督对于纳入患者偏好、合并症、资源约束等文本摘要中未完全呈现的语境因素仍然必要。
5.2 结论部分翻译
在本回顾性来源遮蔽评估中,LLM生成的结直肠癌建议获得了比相应MDT建议更高的评审者赋分指南一致性评分。该发现涉及标准化纯文本评估框架下的指南一致性,不应被解读为个体化诊疗、临床安全性或患者结局优越的证据。评审者间一致性并未在LLM输出中统一更高,运行间可重复性未予评估,来源遮蔽的成功性亦未经验证。这些结果支持将LLM作为指南一致性审计、结构化文档记录和基于清单的决策支持的辅助工具开展前瞻性评估,并需持续的临床医师监督与专项安全性评价。