Skyer:一种评估大语言模型在急诊科分诊中有效性的新型基准

《Canadian Journal of Emergency Medicine》:Skyer: a novel benchmark for evaluating the effectiveness of large language models in emergency department triage

【字体: 时间:2026年07月12日 来源:Canadian Journal of Emergency Medicine 1.7

编辑推荐:

  目的:急诊科(ED)过度拥挤导致诊断困难、等待时间延长,并损害适当的分诊,通常由人为错误和疲劳引起。大语言模型(LLMs)可以协助ED工作人员进行分诊,通过缓解这些问题改善患者护理。方法:研究人员设计了一种评估方法(Skyer基准)来评估15种大语言模型(LL

  
目的:急诊科(ED)过度拥挤导致诊断困难、等待时间延长,并损害适当的分诊,通常由人为错误和疲劳引起。大语言模型(LLMs)可以协助ED工作人员进行分诊,通过缓解这些问题改善患者护理。方法:研究人员设计了一种评估方法(Skyer基准)来评估15种大语言模型(LLMs),包括DeepSeek-R1(70B,7B),ChatGPT版本(4,4.5-preview),Gemini迭代(1.5-pro,2.0-Pro-experimental,2.5_03-25,2.5_05-06),Mistral-7B,Llama-3.3,Gemma模型(2-27b-it,3-12b-it,3-27b-it),Qwen-2.5和Phi-4-14B。研究人员通过使用55个逼真的临床儿科场景评估了模型在ED分诊中的性能。主要目标是使用一个加权系统评估模型的分诊性能,该系统除了考虑简单准确性外,还考虑了过度分诊和分诊不足的影响。次要目标是通过在三个场景中重复测试来评估模型的一致性。结果:研究人员的发现表明,只有两个模型,ChatGPT-4.5-preview和Gemini-2.5_05-06,表现出优越且可靠的分诊性能。ChatGPT-4.5-preview(准确性77%,平均权重377.5/550)和Gemini-2.5_05-06(准确性74%,平均权重365/550)显著优于人类分诊专家的准确性(准确性64%,平均权重253.5/550)和其他模型。这种差异具有统计学显著性(p值<0.05),效应量极大(Cohen’s D=2.18和1.98)。此外,它们由于其分诊性能的可接受一致性(85%和82%)表现出足够的可靠性。结论:研究人员的工作建立了Skyer作为大语言模型(LLMs)的一种评估方法。Skyer选择了性能最佳的模型,这些模型表现出显著高于人类专家的分诊性能,并显示出一致的结果。这些大语言模型(LLMs)可以简化过度拥挤的ED中优质医疗服务的提供。尽管结果令人鼓舞,但研究人员发现了限制这些大语言模型(LLMs)取代人类专家的局限性。相反,研究人员展示了它们在过度拥挤的ED中辅助工作人员的重要潜力。
在《Canadian Journal of Emergency Medicine》发表的这项研究聚焦于利用大语言模型(LLMs)缓解急诊科(ED)过度拥挤引发的诊断挑战、等待时间延长和分诊不当问题。当前存在的核心问题是,人类分诊人员易因疲劳和人为错误导致分诊偏差,而先前评估LLMs分诊效能的研究多基于虚拟或教科书式场景,缺乏真实临床环境验证,且主要面向成人,儿科领域因疾病谱复杂、年龄依赖性强、数据隐私限制等面临更大挑战。为此,研究人员开展了系统性研究,设计了Skyer基准测试,通过55个逼真的合成儿科临床场景(反映父母主诉),评估15种前沿LLMs的分诊准确性、加权评分(区分过度分诊与分诊不足的临床影响)和一致性。结论显示,仅ChatGPT-4.5-preview和Gemini-2.5_05-06在分诊准确性(77%和74%)、加权总分(377.5/550和365/550)和一致性(85%和82%)上显著优于人类专家(准确性64%,加权总分253.5/550),差异具有统计学意义(p<0.05,Cohen’s D分别为2.18和1.98)。重要意义在于,Skyer基准为评估LLMs的ED分诊效能提供了标准化工具,证明高性能模型可作为辅助工具优化分诊流程,但尚不能替代人类专家。

### 主要关键技术方法

研究人员采用了以下关键技术方法:首先,由经验丰富的儿科医生创建55个逼真的合成儿科临床场景(涵盖常见和严重疾病),场景描述基于父母主诉形式,规避真实数据隐私和模型训练集重叠风险。分诊评分依据美国急诊严重指数(ESI)和加拿大分诊与急性量表(CTAS)双系统,要求模型和人类专家(1名医生、3名分诊护士)对每例场景赋予1(危及生命)至5(非紧急)的分诊等级。核心分析工具是Skyer加权系统,该系统基于患者预后、安全、满意度、资源消耗、人员疲劳和ED流程影响六个变量对准确分诊、过度分诊(高估病情)和分诊不足(低估病情)赋予正负权重(范围+5至-5),最终以加权总分反映模型综合表现。统计方法包括Welch单侧t检验比较模型与人类专家差异,Cohen’s D评估效应量,Mann-Whitney U检验验证显著性,并通过三次重复测试计算一致性(一致性≥80%视为可靠)。

### 研究结果

**模型分诊准确性比较**
通过ESI和CTAS系统评估,六种最佳模型(包括ChatGPT-4.5-preview、Gemini-2.5_05-06、Deepseek-R1-70b、Gemini-1.5-pro、Gemini-2.0-pro-experimental、Gemma-3-27b-it)的分诊准确性范围为64%–80%,过度分诊率为7%–29%,分诊不足率为2%–24%。与之对比,人类专家准确性为56%–69%,过度分诊率为0%–18%,分诊不足率高达24%–44%。其中ChatGPT-4.5-preview在两个系统中均取得最高平均准确性(77.5%)。

**加权评分与统计显著性**
基于Skyer加权系统(满分550分),ChatGPT-4.5-preview平均加权总分377.5分,Gemini-2.5_05-06为365分,显著高于人类专家的253.5分(p<0.05)。效应量极大(Cohen’s D=2.18和1.98),且Mann-Whitney U检验结果一致。Deepseek-R1-70b、Gemini-1.5-pro、Gemini-2.0-pro-experimental和Gemma-3-27b-it的加权总分虽高于人类专家(效应量较大或中等),但未达到统计学显著性。其他模型表现未超越人类专家。

**一致性评估**
对最佳模型进行三次重复测试(除Gemini-2.0-pro-experimental因无法获取未测试),仅ChatGPT-4.5-preview(85%)、Gemini-1.5-pro(83%)和Gemini-2.5_05-06(82%)在分诊任务中展示出可接受的一致性(≥80%),表明其可靠性。Deepseek-R1-70b和Gemma-3-27b-it虽在初次评估中表现良好,但一致性不足,不适合临床应用。

### 讨论总结与结论翻译

讨论部分指出,ChatGPT-4.5-preview和Gemini-2.5_05-06在分诊准确性、加权评分和一致性上均优于人类专家和其余模型,而Gemini-1.5-pro虽一致性高但无统计显著性,Gemma-3-27b-it和Deepseek-R1-70b因一致性差而不可靠。与既往研究比较,先前研究对LLMs分诊能力结论不一,部分显示不可靠或低准确性,部分支持高表现;Skyer的独特之处在于使用合成儿科场景和加权系统,区别于仅聚焦问答或对话的基准(如ClinicBench、Healthbench)。优势包括逼真儿科场景、挑战性ED环境和关注过度/分诊不足的不同影响;局限性在于伦理问题(患者可能夸大症状、过度依赖AI、模型幻觉风险)。临床意义:高性能模型可作为分诊护士的辅助工具(提供评分并人工复核),或采用分级分诊系统(高危直接就诊,中低危二次护士分诊)。研究启示:Skyer为评估ED辅助LLMs提供基础,未来可开发基于AI的患者代理。
**结论翻译**:研究人员的Skyer基准使用了合成的逼真儿科ED病例,相较于先前研究更具挑战性。分诊性能基于分诊准确性、加权评分和一致性进行评估。研究表明,ChatGPT-4.5-preview和Gemini-2.5-05_06在分诊中表现强劲,为现有ED分诊系统提供了可靠辅助。研究人员提出,这些高性能模型可作为ED中的辅助工具,在人类专家的严密监督下运行。它们可带来多重收益,包括减少患者等待时间、降低工作人员倦怠、降低误诊率以及改善患者预后。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号