《Journal of Cardiovascular Development and Disease》:A Multidimensional Evaluation of Large Language Model Responses to the 2024 ESC Hypertension Guidelines: A Comparative Study
编辑推荐:
专业摘要翻译:
大型语言模型(large language models,LLMs),包括ChatGPT、Gemini和DeepSeek,在医学领域的应用日益广泛;然而,它们在多个临床相关维度上的表现仍未被完全理解。本横断面比较研究评估了三个LLM对从2024
专业摘要翻译:
大型语言模型(large language models,LLMs),包括ChatGPT、Gemini和DeepSeek,在医学领域的应用日益广泛;然而,它们在多个临床相关维度上的表现仍未被完全理解。本横断面比较研究评估了三个LLM对从2024年欧洲心脏病学会(European Society of Cardiology,ESC)高血压指南中选取的75个临床问题所产生的225条响应。两位委员会认证的心脏病专家独立评估了这些响应,评估涵盖五个预设维度:准确性、临床相关性、完整性、无偏见与错误信息以及一致性。在准确性、临床相关性、完整性或无偏见与错误信息方面,三个模型之间未观察到统计学显著差异(所有p > 0.05)。在响应一致性方面发现了显著差异(p = 0.032),事后分析显示ChatGPT与Gemini之间存在显著差异。三个LLM的总体适用性评分无显著差异(p = 0.227)。这些研究结果表明,尽管总体表现相当,响应一致性是评估LLM用于基于指南的临床应用时应考虑的一个额外维度。未来研究应纳入更广泛的临床场景和更新的LLM版本,以进一步明确其在临床决策支持中的作用。
论文解读文章:
高血压作为一种慢性无症状疾病,是全球死亡和致病的主要原因之一。多数情况下,高血压确诊时器官损害已经发生,因此早期诊断极其依赖患者教育和及时治疗,医疗专业人员和患者能否快速、完整地获取准确信息,可能对长期临床结局产生积极影响。近年来,ChatGPT、Gemini和DeepSeek等大型语言模型(large language models,LLMs)因能快速便捷地访问医学信息,在医疗领域日益普及,不仅用于信息获取,还用于医学教育和患者沟通。然而,语言模型在提供信息准确性和完整性方面存在严重隐忧,且公众轻易访问也带来了错误信息传播等问题。已有研究显示LLMs能在标准化医学执照考试中取得高准确率,并能检索心血管护理指南,但这些研究多仅评价原始准确性。针对这一空白,研究人员执行了一项多维评估,纳入一致性和完整性维度,聚焦于新发布的2024年ESC高血压指南。
研究人员开展了一项横断面、比较性研究,系统考察三个公开可用的LLM(ChatGPT、Gemini和DeepSeek)对基于2024年ESC高血压指南的75个临床问题的回答表现。该研究在2025年3月期间,通过各自的网页界面提交问题,使用默认参数,每个问题均在新会话中独立提交,仅纳入初始响应,并对响应进行匿名化处理以JSON格式记录。两位委员会认证的心脏病专家独立评估了这些响应,评估前的一致性 Cohen’s κ = 0.82,表明评估者间信度较强。
在方法层面,研究人员从2024年ESC高血压指南的主要主题中预先选定了75个临床问题,以广泛覆盖指南内容,包括血压测量与诊断(n = 19)、心血管风险分层(n = 15)、生活方式干预(n = 9)、药物启动与靶目标(n = 14)以及难治性、继发性与特殊临床情况(n = 18)。三个特定LLM的选择基于其代表性:分别由OpenAI、Google和DeepSeek开发,评估的模型版本为ChatGPT(GPT-4o)、Gemini(Gemini 1.5 Pro)和DeepSeek(DeepSeek-V3)。每个响应在五个预设维度上采用二元评分(适当 = 1;不适当 = 0):准确性(与指南概念和临床推荐一致)、临床相关性(提供直接可操作的临床信息)、完整性(包含核心诊断或治疗推荐)、无偏见与错误信息(无虚构引用、无商业偏见、无事实错误)以及一致性(相关临床概念问题间推荐的稳定性和连贯性)。五个维度得分相加得到每个响应的总分(0–5分)。统计分析使用Cochran’s Q检验比较配对二元结局,事后两两比较使用McNemar检验,总体适用性评分差异使用Friedman检验。
研究结果分为两部分。第一部分为各维度适用性。共225条AI生成响应被独立评估。Cochran’s Q检验显示,三个LLM在准确性(p = 0.297)、临床相关性(p = 0.773)、完整性(p = 0.826)以及无偏见与错误信息(p = 0.704)方面均无统计学显著差异。但在一致性维度存在显著差异(p = 0.032),事后McNemar检验显示ChatGPT与Gemini之间差异显著(p = 0.014),而ChatGPT与DeepSeek(p = 0.164)及DeepSeek与Gemini(p = 0.442)之间无显著差异。第二部分为总体适用性评分。ChatGPT的中位总分为2(范围0–5),DeepSeek为4(范围1–4),Gemini为3(范围1–5),Friedman检验显示三个LLM的总体适用性评分无显著差异(p = 0.227)。
在讨论部分,研究人员指出,尽管总体适用性和大多数评估维度无显著差异,但响应一致性存在差异,ChatGPT表现出比Gemini更大的变异性。这一发现提示,除准确性外,响应一致性也是评估LLM在基于指南的临床问题中表现的重要特征。由于该研究为探索性研究,配对发现需谨慎解读并在更大研究中验证。一致性差异可能源于训练数据、模型优化、推理策略或专有设计特征的不同,但这些底层因素未公开,无法确定确切原因。一致性差异不应解释为某一LLM的整体优越性,而应视为不同模型架构或训练策略的反映。准确但一致的响应对于无专家监督的临床应用尤为重要,不一致的推荐可能影响用户信心和决策支持质量。既往研究多集中于LLM响应的准确性,而本研究采用的多维评估框架补充了临床相关性、完整性、无偏见与错误信息及一致性,为LLM的临床应用评估提供了更全面的视角。
临床意义方面,研究表明LLM用于临床的评估应超越单纯响应准确性,响应一致性可提供补充信息;LLM生成响应应视为支持性信息,而非临床判断或循证指南的替代品。局限性方面,响应由两位心脏病专家评估,虽经独立评估后共识,仍不能完全排除主观解读;研究仅基于2024年ESC高血压指南问题,结果可能无法推广至其他医学专科或临床指南;研究为探索性设计,使用预设75个问题而非正式计算样本量;二元评分系统可能无法充分捕捉LLM回答的质量细微差别;尽管新会话可减少会话内上下文残留,但专有LLM提供商的微妙后端缓存或跨会话优化无法完全控制;LLM持续更新,研究结果仅反映2025年3月期间模型表现。
结论部分翻译如下:本研究利用源自2024年ESC高血压指南的指南性临床问题,对三个公开可访问的大型语言模型进行了多维比较。尽管三个LLM表现出相当的总体适用性,但观察到响应一致性存在差异。这些发现表明,LLM用于医学应用的评估应超越单纯准确性,还应考虑一致性、临床相关性、完整性和无偏见与错误信息。未来研究需纳入更广泛的临床场景、更新的LLM版本和更全面的评估框架,以更好地明确LLM在临床决策支持中的作用。