
-
生物通官微
陪你抓住生命科技
跳动的脉搏
真实临床场景下三种医学大型语言模型的跨专科、多复杂度性能与安全性系统评估
《BMC Medical Informatics and Decision Making》:Evaluating medical Large Language Models (LLMs) for clinical decision support: real-world performance across specialties and complexity levels
【字体: 大 中 小 】 时间:2026年09月25日 来源:BMC Medical Informatics and Decision Making 5.5
编辑推荐:
摘要背景大型语言模型(LLMs)在临床决策支持系统方面展现出日益增长的潜力,然而,利用真实患者数据、涵盖不同医学专科和病例复杂度的评估仍十分有限。大多数现有研究依赖标准化医学考试而非真实临床场景,仅有少数使用真实患者诊疗数据。本研究系统性地利用真实临床医师评估,对三种医学大型
大型语言模型(LLMs)在临床决策支持系统方面展现出日益增长的潜力,然而,利用真实患者数据、涵盖不同医学专科和病例复杂度的评估仍十分有限。大多数现有研究依赖标准化医学考试而非真实临床场景,仅有少数使用真实患者诊疗数据。本研究系统性地利用真实临床医师评估,对三种医学大型语言模型在不同医学专科和病例复杂度水平上的表现进行了评估。
我们进行了一项前瞻性横断面评估,参与者为三位来自内科、外科和儿科的董事会认证医师(n = 3)。每位医师将15个真实患者病例分为三个复杂度级别(简单、中等、复杂),共评估45个病例(n = 45)。医师围绕三个临床决策支持维度评估了LLM的表现:诊断、治疗方案和处方建议。我们基于QUEST方法学,使用多维度评估框架对MediSearch、MedGemma和OpenEvidence进行了评估,测量了质量、可靠性、时间效率、医师满意度、临床适用性和安全性。统计分析包括三因素方差分析(ANOVA)及事后比较。
MedGemma的总体表现优于OpenEvidence(平均评分 7.1 ± 1.4)和MediSearch(6.4 ± 1.6)(平均评分 7.8 ± 1.2)。所有医学LLMs在病例复杂度增加时均表现出显著的性能下降(简单:8.2 ± 0.9;中等:7.0 ± 1.1;复杂:6.1 ± 1.3;P < 0.001)。内科病例的LLM效用最高(7.6 ± 1.2),其次为儿科(7.1 ± 1.4)和外科(6.6 ± 1.5)。诊断准确率以MedGemma最高(82%),OpenEvidence为76%,MediSearch为71%。关键安全性差异显现,MedGemma的高风险建议率显著低于MediSearch(3.2% vs 12.4%)。
在本项对45个病例(每个专科5个病例,由3位医师评估)的初步评估中,医学LLMs在不同专科和病例复杂度水平上表现出差异化的性能。重要的是,所有模型在病例复杂度增加时均出现显著性能下降,表现最好的模型(MedGemma)从简单病例到复杂病例准确率下降18%。安全性评估在所有模型中发现了令人担忧的模式,包括幻觉、遗漏禁忌症和剂量错误,且模型之间存在显著差异。这些发现表明,当前医学LLMs存在重大局限性,不适合在无监控的情况下用于临床。本试点研究揭示了必须通过更大规模、更严格的研究加以解决的重要知识空白和安全隐患,之后方可考虑临床转化。未来研究应优先考虑:(1) 在多机构、更大且更多样的病例样本中进行验证;(2) 在运营环境中进行全面的安全评估;(3) 探究性能局限性背后的机制;以及(4) 若最终推进部署,制定适当的临床监管策略。现有证据不支持临床应用建议。
大型语言模型(LLMs)在临床决策支持系统方面展现出日益增长的潜力,然而,利用真实患者数据、涵盖不同医学专科和病例复杂度的评估仍十分有限。大多数现有研究依赖标准化医学考试而非真实临床场景,仅有少数使用真实患者诊疗数据。本研究系统性地利用真实临床医师评估,对三种医学大型语言模型在不同医学专科和病例复杂度水平上的表现进行了评估。
我们进行了一项前瞻性横断面评估,参与者为三位来自内科、外科和儿科的董事会认证医师(n = 3)。每位医师将15个真实患者病例分为三个复杂度级别(简单、中等、复杂),共评估45个病例(n = 45)。医师围绕三个临床决策支持维度评估了LLM的表现:诊断、治疗方案和处方建议。我们基于QUEST方法学,使用多维度评估框架对MediSearch、MedGemma和OpenEvidence进行了评估,测量了质量、可靠性、时间效率、医师满意度、临床适用性和安全性。统计分析包括三因素方差分析(ANOVA)及事后比较。
MedGemma的总体表现优于OpenEvidence(平均评分 7.1 ± 1.4)和MediSearch(6.4 ± 1.6)(平均评分 7.8 ± 1.2)。所有医学LLMs在病例复杂度增加时均表现出显著的性能下降(简单:8.2 ± 0.9;中等:7.0 ± 1.1;复杂:6.1 ± 1.3;P < 0.001)。内科病例的LLM效用最高(7.6 ± 1.2),其次为儿科(7.1 ± 1.4)和外科(6.6 ± 1.5)。诊断准确率以MedGemma最高(82%),OpenEvidence为76%,MediSearch为71%。关键安全性差异显现,MedGemma的高风险建议率显著低于MediSearch(3.2% vs 12.4%)。
在本项对45个病例(每个专科5个病例,由3位医师评估)的初步评估中,医学LLMs在不同专科和病例复杂度水平上表现出差异化的性能。重要的是,所有模型在病例复杂度增加时均出现显著性能下降,表现最好的模型(MedGemma)从简单病例到复杂病例准确率下降18%。安全性评估在所有模型中发现了令人担忧的模式,包括幻觉、遗漏禁忌症和剂量错误,且模型之间存在显著差异。这些发现表明,当前医学LLMs存在重大局限性,不适合在无监控的情况下用于临床。本试点研究揭示了必须通过更大规模、更严格的研究加以解决的重要知识空白和安全隐患,之后方可考虑临床转化。未来研究应优先考虑:(1) 在多机构、更大且更多样的病例样本中进行验证;(2) 在运营环境中进行全面的安全评估;(3) 探究性能局限性背后的机制;以及(4) 若最终推进部署,制定适当的临床监管策略。现有证据不支持临床应用建议。