
-
生物通官微
陪你抓住生命科技
跳动的脉搏
多中心研究揭示初级临床医生检测GPT-4o医疗幻觉能力严重不足,暴露技术验证与真实临床应用的重大差距
《npj Digital Medicine》:A multicenter assessment of human oversight of generative AI outputs in simulated clinical decision making
【字体: 大 中 小 】 时间:2026年09月25日 来源:npj Digital Medicine 18.0
编辑推荐:
摘要生成式人工智能,尤其是大型语言模型(LLMs),正日益被探索应用于选定的临床任务,包括临床文档编写、患者沟通和决策支持;然而,其直接用于临床决策的日常应用仍然有限。然而,安全部署的一个核心障碍是医疗幻觉问题。当前的保障措施依赖"临床医生在回路中"模式,该模式假设临床医生能
生成式人工智能,尤其是大型语言模型(LLMs),正日益被探索应用于选定的临床任务,包括临床文档编写、患者沟通和决策支持;然而,其直接用于临床决策的日常应用仍然有限。然而,安全部署的一个核心障碍是医疗幻觉问题。当前的保障措施依赖"临床医生在回路中"模式,该模式假设临床医生能够可靠地识别和纠正这些幻觉。这一假设在临床实践中是否真正成立值得更多的实证关注,尤其是在初级临床医生中。在这项多中心横断面研究中,我们系统检测并分类了GPT-4o在多种临床场景中生成的幻觉。我们还定量评估了初级临床医生在不同临床类别和风险等级下的实际识别能力。结果显示,仅有15.8%的幻觉被识别,13.1%的临床医生在所有场景中未能检测到任何幻觉。值得注意的是,检测率并未随着临床风险增加而提高,幻觉检测的变异性主要来自临床医生之间的差异,而非场景之间的差异。我们的研究结果揭示了技术验证与真实临床应用之间的重大差距。这些结果表明,未来的临床应用将需要精心设计、结构化的人机协作工作流程,以及分级临床认证路径,以确保患者安全。