AI辅助、教科书与混合学习方式在急性腹痛诊断中的应用:一项急诊实习医生的回顾性队列研究

《Frontiers in Public Health》:AI-assisted vs. textbook-based vs. blended learning for acute abdomen diagnosis: a retrospective cohort study of emergency interns

【字体: 时间:2026年09月09日 来源:Frontiers in Public Health 4.1

编辑推荐:

  背景:大型语言模型(large language models, LLMs)正在重塑医学教育。目的:探讨学习方式(AI辅助、教科书或混合学习)是否与急诊实习医生对急性腹部疾病的诊断准确性相关。方法:研究人员回顾了一项三级医疗中心72名急诊实习医生在12个月内作

  
背景:大型语言模型(large language models, LLMs)正在重塑医学教育。目的:探讨学习方式(AI辅助、教科书或混合学习)是否与急诊实习医生对急性腹部疾病的诊断准确性相关。方法:研究人员回顾了一项三级医疗中心72名急诊实习医生在12个月内作出的720项临床决策。实习医生被分为三组:教科书组(n = 27)、AI辅助组(n = 21)和混合组(n = 24)。采用倾向评分匹配(propensity score matching)与配对分层广义估计方程(pair-stratified generalized estimating equation, GEE)来控制选择偏倚和聚类效应。结果:诊断准确性分别为教科书组73.0%、AI辅助组82.4%和混合组87.1%(p < 0.001)。混合学习相比教科书学习的优势最显著(校正后比值比(adjusted OR)= 3.21,95%置信区间(CI):1.87–5.51,p < 0.001),其次是AI辅助学习(adjusted OR = 1.68,95% CI:0.99–2.85,p = 0.053)。匹配分析确认了混合学习的获益(p = 0.011)。亚组分析提示重症病例(OR = 4.92)和非典型表现(OR = 3.85)的效应更大,E值为5.88,支持结果对未测量混杂因素的稳健性。结论:将AI工具与传统资源相结合的混合学习方式与诊断准确性关联最强,提示在急诊培训中,整合而非单一使用的学习方式可能更有助于临床推理能力的培养。
**研究背景与问题**

急性腹痛约占急诊科(emergency department, ED)全部就诊量的5%–10%,且始终是临床诊断中最具挑战性的表现之一。其鉴别诊断范围涵盖自限性疾病到危及生命的外科急症,要求临床医生在时间压力下综合处理复杂数据。对于处于急诊轮转最初几周的实习医生而言,这一任务的难度因经验有限和临床推理能力尚在发展中而进一步加大。传统医学教育遵循师徒式模式,通过案例教学、教科书学习和逐步自主来培养临床推理能力。然而,医学知识的快速膨胀与病例复杂性的日益增加,已使这些传统方法不堪重负。大型语言模型(large language models, LLMs)的出现为快速获取诊断信息和决策支持提供了新可能。尽管已有系统综述表明LLMs的诊断准确性因问题类型、临床领域和模型版本而异,但多数研究仅孤立地考察LLM性能,而非探讨当受训者将其纳入日常临床工作流程时这些工具如何影响学习效果。在急诊外科领域,AI在风险分层与诊断支持方面已显示出应用前景,但这些进步能否转化为受训者采用AI作为学习工具后临床推理能力的提升,目前仍不明确。针对这一研究空白,研究人员开展了本项研究,旨在比较急诊实习医生在评估急性腹痛时三种学习方式(教科书、AI辅助、混合)的诊断准确性,并假设AI辅助与混合学习优于纯教科书学习,其中混合学习获益最大。

**研究方法与关键技术**

本研究为一项回顾性观察性队列研究,在某三级医院急诊科开展(2025年6月至2026年6月),该科室年接诊量约7万例次。研究连续纳入轮转期间共72名实习医生,每人贡献10项临床决策,总计720项决策。学习方式分组为教科书组(n = 27)、AI辅助组(n = 21)和混合组(n = 24),并通过自我报告的AI使用频率进行交叉验证。研究采用了以下关键技术方法:(1)倾向评分匹配(propensity score matching, PSM):在实习医生个体层面进行1:1最近邻匹配(卡钳值为logit倾向评分标准差的0.2倍),以控制混杂偏倚;(2)配对分层广义估计方程(pair-stratified generalized estimating equation, GEE):以匹配对编号为聚类变量,采用可交换相关结构,处理同一实习医生多次决策的层级数据结构;(3)E值计算:评估未测量混杂因素对结果的潜在影响;(4)亚组分析与Benjamini-Hochberg错误发现率(false discovery rate, FDR)校正。临床决策数据来自科室数据库,病例涵盖8种常见急腹症;病情严重程度和表现典型性由两名不知分组情况的急诊主治医师独立评估(Cohen's κ系数分别为0.82和0.78)。终点指标为主要终点为诊断准确性(实习医生初步印象与最终确诊一致),次要终点包括诊断时间、漏诊率、误诊率和治疗方案调整率。

**研究结果**

**研究人群与基线特征**

共有72名急诊实习医生纳入分析,贡献720项临床决策(每人10项)。其中教科书组27人(37.5%),AI辅助组21人(29.2%),混合组24人(33.3%)。匹配前,混合组基线考核成绩最高(76.5 ± 9.9),AI辅助组居中(73.7 ± 7.0),教科书组最低(68.2 ± 11.4),组间差异具有统计学意义(ANOVA p = 0.011,Kruskal-Wallis p = 0.023)。AI工具使用情况包括通义千问(26.7%)、Claude(26.7%)、ChatGPT(22.2%)、文心一言(20.0%)和DeepSeek(4.4%)。

**主要终点**

三组诊断准确性差异显著:教科书组为73.0%(197/270),AI辅助组为82.4%(173/210),混合组为87.1%(209/240),总体χ2检验显著(χ2 = 16.81,df = 2,p < 0.001)。未校正分析显示,混合学习的正确诊断几率最高(粗OR = 2.50,95% CI: 1.57–3.97,p < 0.001),其次为AI辅助学习(粗OR = 1.73,95% CI: 1.11–2.70,p = 0.015)。

**倾向评分匹配分析**

AI辅助与教科书比较:匹配后形成11对(22人,220项决策)。AI辅助组准确性为77.3%,教科书组为70.9%(差异6.4个百分点)。配对分层GEE分析得出adjusted OR = 1.38(95% CI: 0.67–2.83,p = 0.379)。混合与教科书比较:匹配后形成13对(26人,260项决策)。混合组准确性为88.5%,教科书组为76.2%(差异12.3个百分点)。配对分层GEE分析得出adjusted OR = 2.84(95% CI: 1.27–6.36,p = 0.011)。

**敏感性分析**

多变量逻辑回归(校正全部协变量)得出AI辅助对比教科书的adjusted OR = 1.68(95% CI: 0.99–2.85,p = 0.053),混合对比教科书的adjusted OR = 3.21(95% CI: 1.87–5.51,p < 0.001)。考虑医生聚类效应的GEE分析结果一致:AI辅助对比教科书adjusted OR = 1.69(95% CI: 1.04–2.73,p = 0.033),混合对比教科书adjusted OR = 3.10(95% CI: 1.85–5.18,p < 0.001)。E值分析显示,混合学习点估计的E值为5.88,提示结果对未测量混杂具有较强稳健性。

**亚组分析**

按病种分层时,最大绝对获益见于胃穿孔(AI/混合组71.9% vs. 教科书组39.5%,OR = 3.92,95% CI: 1.68–9.15,p = 0.002)和异位妊娠(AI/混合组57.9% vs. 教科书组37.0%,OR = 2.34,95% CI: 0.91–5.99,p = 0.077)。AI辅助和混合学习对阑尾炎、尿石症和胆囊炎的获益最小(各组准确性均>90%)。按严重程度分层,重症病例中AI/混合组获益显著(OR = 4.92,95% CI: 2.08–11.64,p < 0.001),中度病例也有获益(OR = 2.04,95% CI: 1.26–3.31,p = 0.004),轻度病例无显著差异。按表现典型性分层,非典型表现中获益显著(OR = 3.85,95% CI: 2.08–7.14,p < 0.001),典型表现获益较小且未达显著(OR = 1.51,95% CI: 0.93–2.46,p = 0.093)。有无影像学检查情况下的获益幅度相似(无影像OR = 2.58,有影像OR = 1.76)。

**次要终点**

三组诊断时间差异显著(Kruskal-Wallis p < 0.001)。教科书组诊断时间最长(16.1 ± 5.1分钟),混合组居中(14.9 ± 4.9分钟),AI辅助组最短(14.2 ± 4.6分钟)。GEE模型确认:AI辅助学习使诊断时间缩短2.01分钟(p < 0.001),混合学习缩短1.19分钟(p = 0.015)。混合组漏诊率最低(16/240,6.7%),AI辅助组为14.3%(30/210),教科书组为13.7%(37/270)。误诊率呈类似模式:教科书组13.3%(36/270),AI辅助组3.3%(7/210),混合组6.2%(15/240)。

**讨论与结论总结**

本研究表明,AI辅助和混合学习均与高于教科书学习的诊断准确性相关,其中混合学习的效果最强,尤其在重症和非典型病例中。结果在倾向评分匹配、多变量回归和GEE分析中保持一致。临床上,准确性14个百分点的提升意味着采用混合学习方式每评估7名患者,相比纯教科书学习可多做出1例正确诊断。对于异位妊娠、胃穿孔等延迟识别后果严重的急症,这一获益具有重要临床意义。既往研究多聚焦LLM的独立性能而非受训者实际轮转中的使用方式;本研究将AI整合学习置于真实临床工作流程中进行考察,拓展了该领域文献。混合学习的优势可能与其提供的灵活性有关,自我决定理论认为让受训者自主选择学习方式可支持其自主性,AI工具改善诊断结果可增强其胜任感,而维持传统资源接触则有助于保持与整体临床课程的衔接。本研究存在局限:学习方式由自我报告定义,存在回忆偏倚和期望偏倚;非随机设计限制了因果推断;单中心研究可能限制外推性。研究结论为:AI辅助和混合学习对急性腹部疾病的诊断准确性均优于教科书学习,其中混合策略效果最强,尤其针对重症和非典型病例。这些发现提示,AI工具在急诊培训中最有价值的应用方式是作为既有教育资源的补充而非替代,整合式而非排他式的学习方式更有助于临床推理能力的培养。该论文发表于《Frontiers in Public Health》。
相关新闻
生物通微信公众号
微信
新浪微博

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号