今日动态 返回首页
会员注册 登录 生物通快讯免费订阅
  • 首页 今日动态 人才市场 新技术专栏 中国科学人 云展台
    BioHot
    • 定制我的BioHot
    • 进入我的BioHot
    • 进入我的集采
    • 肿瘤癌症研究
    • 免疫/基因/细胞疗法
    • 神经生物学
    • 健康与疾病
    • 衰老机制与长寿
    • 单细胞技术
    • 基因编辑-CRISPR
    • RNA研究
    • 肠道菌与人体微生态
    • 细胞代谢
    • AI生物信息学
    • COVID
    云讲堂直播 会展中心 特价专栏 技术快讯 免费试用

  • 生物通官微
    陪你抓住生命科技
    跳动的脉搏

生物通首页  >  今日动态  >  正文

评估大语言模型在骨质疏松性椎体压缩骨折患者咨询中的应用:一项两阶段比较研究

《Journal of Orthopaedic Surgery and Research》:Evaluating large language models for patient consultations on osteoporotic vertebral compression fractures: a two-phase comparative study

【字体: 大 中 小 】 时间:2026年09月09日 来源:Journal of Orthopaedic Surgery and Research 3.8

编辑推荐:

   摘要目的评估大语言模型为骨质疏松性椎体压缩骨折(OVCF)患者生成信息的质量、可读性、错误模式及专家评定的应答安全性,并探讨在模拟书面咨询环境中某一选定模型与脊柱外科医生之间的差异。方法本两阶段序贯基准研究评估了ChatGPT-5.1、Gemini 2.5 Pro、DeepS

  

摘要

目的

评估大语言模型为骨质疏松性椎体压缩骨折(OVCF)患者生成信息的质量、可读性、错误模式及专家评定的应答安全性,并探讨在模拟书面咨询环境中某一选定模型与脊柱外科医生之间的差异。

方法

本两阶段序贯基准研究评估了ChatGPT-5.1、Gemini 2.5 Pro、DeepSeek-V3.2和Qwen3-Max。在第一阶段中,四个模型回答了26个由专家开发的OVCF相关问题。三名资深脊柱外科医生使用预设的5分制标准独立评估准确性、全面性及专家评定的应答安全性。同时评估了应答长度、可读性、综合模型排名一致性以及预设错误类别。在第二阶段中,ChatGPT-5.1和一名脊柱外科医生使用相同的标准化指令独立回答了17个去标识化的患者提出问题。准确性、全面性及专家评定的应答安全性由两名资深脊柱外科医生通过共识评估,而共情性和可用性由一名研究人员评分。采用Friedman检验和配对Wilcoxon符号秩检验,并使用Benjamini-Hochberg校正法对多重比较进行校正。

结果

在第一阶段中,四个模型在准确性(Friedman χ2(3) = 12.64,P = 0.00548,Kendall's W = 0.162)、全面性(χ2(3) = 38.68,P = 2.03 × 10?8,W = 0.496)和专家评定的应答安全性(χ2(3) = 19.86,P = 0.000182,W = 0.255)方面存在差异。经多重性校正后,ChatGPT-5.1和DeepSeek-V3.2总体评分高于Gemini 2.5 Pro,但与Qwen3-Max的若干比较未达到统计学显著性差异。四个模型均出现了遗漏性错误。在第二阶段中,ChatGPT-5.1与医生对照在准确性(配对均差,0.24;95% CI ? 0.12至0.59;校正后P = 0.2482)或专家评定的应答安全性(差值,0.53;95% CI ? 0.06至1.12;校正后P = 0.1469)方面未检测到统计学显著性差异。ChatGPT-5.1在全面性、研究人员评定的共情性及可用性方面评分更高(校正后P分别为0.0012、0.0011和0.0012),且估计阅读年级要求更低。

结论

ChatGPT-5.1和DeepSeek-V3.2生成了结构化的OVCF患者教育内容,并获得专家的好评,但仍存在具有临床意义的遗漏。探索性的第二阶段比较仅涉及17个问题和一名医生对照,未确立等效性、非劣效性或真实世界临床安全性。大语言模型可辅助在临床医生监督下的患者教育和沟通,但不应替代诊断、影像判读、个体化风险评估、手术决策或并发症管理。

目的

评估大语言模型为骨质疏松性椎体压缩骨折(OVCF)患者生成信息的质量、可读性、错误模式及专家评定的应答安全性,并探讨在模拟书面咨询环境中某一选定模型与脊柱外科医生之间的差异。

方法

本两阶段序贯基准研究评估了ChatGPT-5.1、Gemini 2.5 Pro、DeepSeek-V3.2和Qwen3-Max。在第一阶段中,四个模型回答了26个由专家开发的OVCF相关问题。三名资深脊柱外科医生使用预设的5分制标准独立评估准确性、全面性及专家评定的应答安全性。同时评估了应答长度、可读性、综合模型排名一致性以及预设错误类别。在第二阶段中,ChatGPT-5.1和一名脊柱外科医生使用相同的标准化指令独立回答了17个去标识化的患者提出的问题。准确性、全面性及专家评定的应答安全性由两名资深脊柱外科医生通过共识评估,而共情性和可用性由一名研究人员评分。采用Friedman检验和配对Wilcoxon符号秩检验,并使用Benjamini-Hochberg校正法对多重比较进行校正。

结果

在第一阶段中,四个模型在准确性(Friedman χ2(3) = 12.64,P = 0.00548,Kendall's W = 0.162)、全面性(χ2(3) = 38.68,P = 2.03 × 10?8,W = 0.496)和专家评定的应答安全性(χ2(3) = 19.86,P = 0.000182,W = 0.255)方面存在差异。经多重性校正后,ChatGPT-5.1和DeepSeek-V3.2总体评分高于Gemini 2.5 Pro,但与Qwen3-Max的若干比较未达到统计学显著性差异。四个模型均出现了遗漏性错误。在第二阶段中,ChatGPT-5.1与医生对照在准确性(配对均差,0.24;95% CI ? 0.12至0.59;校正后P = 0.2482)或专家评定的应答安全性(差值,0.53;95% CI ? 0.06至1.12;校正后P = 0.1469)方面未检测到统计学显著性差异。ChatGPT-5.1在全面性、研究人员评定的共情性及可用性方面评分更高(校正后P分别为0.0012、0.0011和0.0012),且估计阅读年级要求更低。

结论

ChatGPT-5.1和DeepSeek-V3.2生成了结构化的OVCF患者教育内容,并获得专家好评,但仍存在具有临床意义的遗漏。探索性的第二阶段比较仅涉及17个问题和一名医生对照,未确立等效性、非劣效性或真实世界临床安全性。大语言模型可辅助在临床医生监督下的患者教育和沟通,但不应替代诊断、影像判读、个体化风险评估、手术决策或并发症管理。

相关新闻
生物通微信公众号
生物通新浪微博
微信
新浪微博
我要投稿
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热搜:大语言模型|骨质疏松性椎体压缩骨折|患者教育|生成质量|脊柱外科|安全性评估

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号