评估ChatGPT作为肾病学培训中血液透析决策的教育决策支持工具的潜力

《Frontiers in Medicine》:Evaluating the potential of ChatGPT as an educational decision-support tool for hemodialysis decision-making in nephrology training

【字体: 时间:2026年08月14日 来源:Frontiers in Medicine 3.6

编辑推荐:

  摘要 背景:本研究旨在评估ChatGPT从真实肾病学咨询记录中识别血液透析(Hemodialysis, HD)指征的能力,并将其建议与真实世界临床决策及肾病学专家共识进行比较。 方法:本探索性观察性研究纳入了来自一家三级大学医院常规住院患者诊疗的22

  
摘要

背景:本研究旨在评估ChatGPT从真实肾病学咨询记录中识别血液透析(Hemodialysis, HD)指征的能力,并将其建议与真实世界临床决策及肾病学专家共识进行比较。
方法:本探索性观察性研究纳入了来自一家三级大学医院常规住院患者诊疗的22份匿名化肾病学咨询记录。每份记录均由ChatGPT 5.4使用标准化零样本提示(zero-shot prompt)独立评估。同一组记录由三位盲法评估的资深学术肾病学家独立审阅。这些肾病学家中的多数投票共识被定义为主要参考标准。由肾病学住院医师记录的真实世界决策作为次要比较对象。使用Cohen's kappa系数评估一致性,并使用Fleiss' kappa评估肾病学家之间的评分者间信度。
结果:专家共识将22例病例中的8例(40.9%)归类为需要血液透析,13例(59.1%)归类为不需要。肾病学家之间的评分者间一致性极佳(Fleiss' κ = 0.814, p < 0.001)。ChatGPT与真实世界临床决策在22例中一致18例(81.8%;κ = 0.633, p = 0.003),而ChatGPT与专家共识在22例中一致15例(68.2%;κ = 0.374, p = 0.069)。专家共识与真实世界临床决策在22例中一致17例(77.3%;κ = 0.553, p = 0.007)。在专家定义的9例HD病例中,ChatGPT在7例中达成一致,并在4例中显示出精确的指征层面一致性。在ChatGPT和真实世界临床决策均归类为HD的10例病例中,在4例中观察到精确的指征层面一致性。差异在涉及代谢性酸中毒、容量超负荷和少尿/无尿的病例中最为常见。
结论:这些探索性发现表明,与资深肾病学家的判断相比,ChatGPT可能与肾病学住院医师的决策更为一致。观察到的差异可能反映了临床发现被解释并整合到整体临床背景中的方式差异。尽管ChatGPT不能替代专家临床判断,但它作为受训者的教育工具具有潜力,可促进对血液透析指征的系统性评估和结构化临床推理。需要更大规模、前瞻性、多中心研究来证实这些发现,并评估ChatGPT在肾病学培训中的教育影响。
### 论文解读:评估ChatGPT在肾病学培训中辅助血液透析决策的潜力

#### 研究背景与问题

在急性肾损伤(Acute Kidney Injury, AKI)患者中,启动血液透析(Hemodialysis, HD)的决策是一个复杂过程,需要整合实验室检查结果、血流动力学状态、代谢紊乱情况、合并症及临床判断。在三级医院和大学医院中,这一决策并非由单一医生做出,而是通过一个涉及内科住院医师、肾病学住院医师和资深学术肾病学家的层级化会诊流程产生。这种层级化临床培训模式是毕业后医学教育的基石,使内科住院医师能在监督下通过决策培养临床推理能力。然而,日益增长的患者数量、时间限制以及培训经验的差异,激发了对人工智能(Artificial Intelligence, AI)决策支持工具的兴趣,这些工具有望在会诊过程中辅助内科住院医师。

大型语言模型(Large Language Models, LLMs),如ChatGPT,已在多种医学知识和临床推理任务中展现出具有前景的性能,但其在真实世界肾病学会诊工作流程中的潜在角色仍 largely unexplored。特别是,ChatGPT能否准确从肾病学会诊记录中识别血液透析指征,并复现日常临床实践中与透析相关的决策,目前尚不清楚。尽管近期研究报告ChatGPT在识别AKI中需要透析的患者时表现出高灵敏度,但关于其基于真实世界会诊记录生成二元HD决策(是/否)并识别特定透析指征的证据仍然有限。此外,直接将这些输出与基于KDIGO(Kidney Disease: Improving Global Outcomes)指南的建议、盲法专家肾病学家的评估以及实际临床决策进行比较的研究极为匮乏。

#### 研究目的

本研究旨在评估ChatGPT能否复现日常临床实践中的透析相关决策,并评估其建议与专家肾病学家共识的一致性程度,从而为LLMs在临床实用性及其在专科培训项目中作为教育支持工具的潜在价值提供见解。

#### 主要关键技术方法

本研究是一项回顾性探索性观察性研究,在一家三级大学医院进行,纳入了22份来自常规住院患者诊疗的匿名化肾病学会诊记录。主要技术方法包括:1)**ChatGPT评估**:使用标准化零样本提示(zero-shot prompt)独立评估每份会诊记录,要求其根据KDIGO建议及国际公认的HD指征做出二元决策(是/否)并列出具体指征。2)**专家共识构建**:由三位盲法评估的资深学术肾病学家独立审阅同一组记录,以多数投票共识作为主要参考标准。3)**统计分析**:使用Cohen's kappa系数评估ChatGPT与专家共识及真实世界决策之间的一致性,并使用Fleiss' kappa评估肾病学家之间的评分者间信度。样本队列来源为土耳其Akdeniz大学医院。

#### 核心研究结果

**1. 专家肾病学家评估**
通过分析22例匿名化肾病学会诊记录,三位资深肾病学家之间的完全一致率高达86.4%(19/22例),Fleiss' kappa系数为0.814(p < 0.001),表明评分者间信度极佳。专家共识将9例(40.9%)归类为需要HD,13例(59.1%)归类为不需要HD。

**2. ChatGPT与专家共识及真实世界临床决策的一致性**
ChatGPT与真实世界临床决策(由肾病学住院医师做出的决策)在81.8%的病例中达成一致(κ = 0.633, p = 0.003),显示出中等程度的一致性。相比之下,ChatGPT与专家共识的一致性较低,为68.2%(κ = 0.374, p = 0.069),且未达到统计学显著性。专家共识与真实世界临床决策之间的一致性为77.3%(κ = 0.553, p = 0.007)。这些结果表明,ChatGPT的决策模式更接近于肾病学住院医师,而非资深专家。

**3. 案例层面血液透析指征的符合情况**
在专家共识定义的9例HD病例中,ChatGPT在7例中达成一致,其中4例显示出精确的指征层面一致性。在ChatGPT和真实世界决策均归类为HD的10例病例中,4例在指征层面完全一致。差异分析显示,ChatGPT将5例专家共识定义为非HD的病例错误地归类为HD,这些假阳性结果主要与代谢性酸中毒、少尿/无尿和容量超负荷/肺水肿相关。反之,ChatGPT将2例专家共识定义的HD病例错误地归类为非HD,漏掉了的专家指征包括容量超负荷/肺水肿和少尿/无尿。

#### 讨论与结论

**讨论总结**
本研究探讨了ChatGPT在真实世界肾病学会诊中识别HD指征的能力,发现其与肾病学住院医师的决策(中等程度一致性)比与资深专家的共识(较低一致性)更为一致。这一差异可能反映了临床经验和决策方法上的区别:住院医师倾向于依赖明确的文档化发现和基于指南的推理,这与ChatGPT基于静态文本信息的输出方式相似;而资深专家则依赖多年积累的经验、模式识别和临床直觉来解读复杂或不典型的临床表现。不一致性在代谢性酸中毒、容量超负荷和少尿/无尿的病例中尤为突出。例如,ChatGPT倾向于将乳腺酸中毒直接视为透析指征,而资深专家则更关注其潜在可逆性及对初始治疗的反应;类似地,ChatGPT将容量超负荷体征直接解读为透析指征,而专家则倾向于在继续药物治疗和评估利尿剂反应后再做决定。这表明ChatGPT的推理受限于静态临床发现,而资深专家还整合了治疗反应、疾病轨迹和床旁经验。这些发现强调了当前生成式AI在时间敏感临床情境中的根本局限性,但同时也提示ChatGPT作为一种受监督的教育工具在技能培训中具有潜力,它可能促使受训者系统地回顾透析指征并反思其临床决策。

**研究结论翻译**
在这项初步研究中,当评估用于HD指征的真实世界肾病学会诊记录时,ChatGPT与肾病学住院医师的决策显示出中等程度的一致性,但与资深学术肾病学家共识的一致性较低。差异在涉及代谢性酸中毒、容量超负荷和少尿/无尿的病例中最为明显,在这些病例中,专家决策整合了会诊记录所记录信息之外的临床背景、治疗反应和疾病轨迹。本研究的一个关键优势在于,同时使用了来自HD和非HD病例的真实世界肾病学会诊记录,并结合了主要专家参考标准、与真实世界临床决策的比较以及指征层面分析,从而能够对ChatGPT的临床推理进行比以往肾病学研究更详细的评估。这些发现表明,ChatGPT不应被视为专家临床判断的替代品。然而,这些初步发现表明,ChatGPT在肾病学培训期间支持决策方面具有潜力。尽管这些会诊记录反映了真实世界实践,但未来的会诊记录可能因考虑到潜在的LLM集成而进一步标准化。更结构化的临床摘要可以提高AI生成输出的质量和一致性。未来研究应评估AI系统是否能够整合到实时会诊过程中,并在传统的医学教育层级内支持受监督的决策。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号