
-
生物通官微
陪你抓住生命科技
跳动的脉搏
评估大语言模型在骨质疏松性椎体压缩骨折患者咨询中的应用:一项两阶段比较研究
《Journal of Orthopaedic Surgery and Research》:Evaluating large language models for patient consultations on osteoporotic vertebral compression fractures: a two-phase comparative study
【字体: 大 中 小 】 时间:2026年09月09日 来源:Journal of Orthopaedic Surgery and Research 3.8
编辑推荐:
摘要目的评估大语言模型为骨质疏松性椎体压缩骨折(OVCF)患者生成信息的质量、可读性、错误模式及专家评定的应答安全性,并探讨在模拟书面咨询环境中某一选定模型与脊柱外科医生之间的差异。方法本两阶段序贯基准研究评估了ChatGPT-5.1、Gemini 2.5 Pro、DeepS
评估大语言模型为骨质疏松性椎体压缩骨折(OVCF)患者生成信息的质量、可读性、错误模式及专家评定的应答安全性,并探讨在模拟书面咨询环境中某一选定模型与脊柱外科医生之间的差异。
本两阶段序贯基准研究评估了ChatGPT-5.1、Gemini 2.5 Pro、DeepSeek-V3.2和Qwen3-Max。在第一阶段中,四个模型回答了26个由专家开发的OVCF相关问题。三名资深脊柱外科医生使用预设的5分制标准独立评估准确性、全面性及专家评定的应答安全性。同时评估了应答长度、可读性、综合模型排名一致性以及预设错误类别。在第二阶段中,ChatGPT-5.1和一名脊柱外科医生使用相同的标准化指令独立回答了17个去标识化的患者提出问题。准确性、全面性及专家评定的应答安全性由两名资深脊柱外科医生通过共识评估,而共情性和可用性由一名研究人员评分。采用Friedman检验和配对Wilcoxon符号秩检验,并使用Benjamini-Hochberg校正法对多重比较进行校正。
在第一阶段中,四个模型在准确性(Friedman χ2(3) = 12.64,P = 0.00548,Kendall's W = 0.162)、全面性(χ2(3) = 38.68,P = 2.03 × 10?8,W = 0.496)和专家评定的应答安全性(χ2(3) = 19.86,P = 0.000182,W = 0.255)方面存在差异。经多重性校正后,ChatGPT-5.1和DeepSeek-V3.2总体评分高于Gemini 2.5 Pro,但与Qwen3-Max的若干比较未达到统计学显著性差异。四个模型均出现了遗漏性错误。在第二阶段中,ChatGPT-5.1与医生对照在准确性(配对均差,0.24;95% CI ? 0.12至0.59;校正后P = 0.2482)或专家评定的应答安全性(差值,0.53;95% CI ? 0.06至1.12;校正后P = 0.1469)方面未检测到统计学显著性差异。ChatGPT-5.1在全面性、研究人员评定的共情性及可用性方面评分更高(校正后P分别为0.0012、0.0011和0.0012),且估计阅读年级要求更低。
ChatGPT-5.1和DeepSeek-V3.2生成了结构化的OVCF患者教育内容,并获得专家的好评,但仍存在具有临床意义的遗漏。探索性的第二阶段比较仅涉及17个问题和一名医生对照,未确立等效性、非劣效性或真实世界临床安全性。大语言模型可辅助在临床医生监督下的患者教育和沟通,但不应替代诊断、影像判读、个体化风险评估、手术决策或并发症管理。
评估大语言模型为骨质疏松性椎体压缩骨折(OVCF)患者生成信息的质量、可读性、错误模式及专家评定的应答安全性,并探讨在模拟书面咨询环境中某一选定模型与脊柱外科医生之间的差异。
本两阶段序贯基准研究评估了ChatGPT-5.1、Gemini 2.5 Pro、DeepSeek-V3.2和Qwen3-Max。在第一阶段中,四个模型回答了26个由专家开发的OVCF相关问题。三名资深脊柱外科医生使用预设的5分制标准独立评估准确性、全面性及专家评定的应答安全性。同时评估了应答长度、可读性、综合模型排名一致性以及预设错误类别。在第二阶段中,ChatGPT-5.1和一名脊柱外科医生使用相同的标准化指令独立回答了17个去标识化的患者提出的问题。准确性、全面性及专家评定的应答安全性由两名资深脊柱外科医生通过共识评估,而共情性和可用性由一名研究人员评分。采用Friedman检验和配对Wilcoxon符号秩检验,并使用Benjamini-Hochberg校正法对多重比较进行校正。
在第一阶段中,四个模型在准确性(Friedman χ2(3) = 12.64,P = 0.00548,Kendall's W = 0.162)、全面性(χ2(3) = 38.68,P = 2.03 × 10?8,W = 0.496)和专家评定的应答安全性(χ2(3) = 19.86,P = 0.000182,W = 0.255)方面存在差异。经多重性校正后,ChatGPT-5.1和DeepSeek-V3.2总体评分高于Gemini 2.5 Pro,但与Qwen3-Max的若干比较未达到统计学显著性差异。四个模型均出现了遗漏性错误。在第二阶段中,ChatGPT-5.1与医生对照在准确性(配对均差,0.24;95% CI ? 0.12至0.59;校正后P = 0.2482)或专家评定的应答安全性(差值,0.53;95% CI ? 0.06至1.12;校正后P = 0.1469)方面未检测到统计学显著性差异。ChatGPT-5.1在全面性、研究人员评定的共情性及可用性方面评分更高(校正后P分别为0.0012、0.0011和0.0012),且估计阅读年级要求更低。
ChatGPT-5.1和DeepSeek-V3.2生成了结构化的OVCF患者教育内容,并获得专家好评,但仍存在具有临床意义的遗漏。探索性的第二阶段比较仅涉及17个问题和一名医生对照,未确立等效性、非劣效性或真实世界临床安全性。大语言模型可辅助在临床医生监督下的患者教育和沟通,但不应替代诊断、影像判读、个体化风险评估、手术决策或并发症管理。