
-
生物通官微
陪你抓住生命科技
跳动的脉搏
检索增强大语言模型在急诊科中等急性度患者早期恶化风险富集中的表现评估
《BMC Emergency Medicine》:Low-burden identification of severe early deterioration among mid-acuity emergency department attendances initially triaged as category 3 using a retrieval-augmented large language model: a retrospective outcome-defined case-control study
【字体: 大 中 小 】 时间:2026年09月25日 来源:BMC Emergency Medicine 3.1
编辑推荐:
摘要 背景 中等急性度的急诊科(ED)就诊患者在临床上具有高度异质性:仅有一小部分患者会早期恶化,但广泛升级处置将造成巨大的复核负担。我们评估了检索增强是否能在低负担条件下改善风险富集能力,并将其与仅使用提示词的大语言模型(LLM)进行比较。 方法 我们在香港某急诊科2
中等急性度的急诊科(ED)就诊患者在临床上具有高度异质性:仅有一小部分患者会早期恶化,但广泛升级处置将造成巨大的复核负担。我们评估了检索增强是否能在低负担条件下改善风险富集能力,并将其与仅使用提示词的大语言模型(LLM)进行比较。
我们在香港某急诊科2025年所有由护士分诊为第三类(Category-3)的就诊记录中开展了一项嵌套的回顾性结局定义病例对照研究。病例组定义为ED登记后24小时内死亡或直接收入ICU/PICU;在完成预设排除标准后,采用日历月引导的随机抽样方法选取472例结局阴性对照组,并在模型推理前固定,最终病例与对照比例为1:4。两种DeepSeek-V3配置使用相同的分诊时输入;MECR-RAG还额外检索了本地指南章节及2024年的相似病例。主要分析比较了在10%结局阴性警报负担下的线性插值敏感性,以及受试者工作特征曲线下部分面积(pAUC,0–0.10)。预测类别≤2定义了单独的固定阈值操作警报。当可计算时,将NEWS2纳入作为事后探索性临床比较指标。
队列共包含590例就诊(118例病例;472例对照)。在10%结局阴性警报负担下的插值敏感性,MECR-RAG为68.1%(95% CI 56.5–76.3),基线模型为27.8%(23.9–32.5);pAUC分别为0.0408(0.0321–0.0508)和0.0152(0.0124–0.0186)。在类别≤2水平,MECR-RAG预警了80/118例病例(67.8%)和43/472例对照(9.1%),基线模型则为104/118例(88.1%)和160/472例(33.9%),阳性似然比分别为7.44(95% CI 5.45–10.16)和2.60(2.26–3.00)。事后探索性完整病例分析纳入280/590例就诊(47.5%);在10%结局阴性警报负担下的插值敏感性,NEWS2为58.3%,MECR-RAG为54.2%(差异?4.0个百分点,95% CI ?21.8至13.7)。
与仅使用提示词的大语言模型相比,检索增强改善了低负担条件下的鉴别能力。但在事后探索性完整病例比较中,其未显示出优于NEWS2的表现,其增量临床价值尚未得到证实。这些结果涉及窄范围的严重结局终点,未能确立分诊正确性、临床实用性或部署就绪度。