
-
生物通官微
陪你抓住生命科技
跳动的脉搏
大型语言模型生成长住院期出院摘要的临床评估:质量、安全性及附带发现报告的比较研究
《npj Digital Medicine》:Clinician-centered evaluation of large language model-generated discharge summaries for longer hospitalizations
【字体: 大 中 小 】 时间:2026年10月04日 来源:npj Digital Medicine 18.0
编辑推荐:
摘要尽管大型语言模型(LLMs)在出院摘要生成方面展现了前景,但其在较长住院期间的表现研究仍相对不足。既往对LLM生成出院摘要的评估多针对较短住院天数,且很少涉及接诊医生的关注重点或附带发现的报告情况。我们针对60例住院时长为7至21天的内科住院病例,比较了LLM生成与人工撰
尽管大型语言模型(LLMs)在出院摘要生成方面展现了前景,但其在较长住院期间的表现研究仍相对不足。既往对LLM生成出院摘要的评估多针对较短住院天数,且很少涉及接诊医生的关注重点或附带发现的报告情况。我们针对60例住院时长为7至21天的内科住院病例,比较了LLM生成与人工撰写的出院摘要,并由住院医和全科医生(PCPs)进行配对评估。临床医师评审员在95%的病例中更偏好LLM生成的摘要,并对其质量、可读性、事实性和完整性给予更高评分。全科医生认为LLM生成的摘要更有利于理解和向患者传达住院治疗情况并提供后续护理。LLM生成的摘要在事实性错误和临床相关遗漏方面的临床医师标注较少,这主要是由于遗漏较少所致,且与人工撰写的摘要相比,在预估危害潜力或可能性方面无显著差异。与住院医相比,全科医生标注了更多的遗漏并赋予更高的危害可能性。在LLM识别的31项影像学附带发现中,93.5%被评为事实正确,87.1%被评为适合报告。在这项回顾性临床医师评估中,LLM为较长且复杂的住院病例生成的摘要获得了更有利的评价,标注的遗漏也少于人工撰写的摘要,在预估危害潜力或可能性方面无显著差异。