
-
生物通官微
陪你抓住生命科技
跳动的脉搏
基于GPT-5 的医疗人工智能系统诊断性能评估:优势、局限与优化建议
《npj Digital Medicine》:The complexity paradox of generalist AI agents in medicine: exploring GPT-5 for real-world multimodal medical diagnosis
【字体: 大 中 小 】 时间:2026年10月10日 来源:npj Digital Medicine 18.0
编辑推荐:
摘要新一代的医疗人工智能系统结合了语言理解、网络数据检索和多步推理功能,在技术评估中作为潜在的诊断辅助工具展现出了越来越大的潜力。然而,这些系统在实际诊断中的性能、可解释性和可靠性仍有待明确。我们对基于GPT-5的十种模型在161例经临床医生验证的真实案例进行了系统的定量分析,评
新一代的医疗人工智能系统结合了语言理解、网络数据检索和多步推理功能,在技术评估中作为潜在的诊断辅助工具展现出了越来越大的潜力。然而,这些系统在实际诊断中的性能、可解释性和可靠性仍有待明确。我们对基于GPT-5的十种模型在161例经临床医生验证的真实案例进行了系统的定量分析,评估了这些模型在诊断准确性、推理质量、数据检索准确性以及对于低质量输入的鲁棒性等方面的表现。研究发现这些人工智能系统存在一些显著 limitation,包括对图像的误解、不稳定的网络搜索行为(有时会导致性能下降),以及在这些系统的工作流程中缺乏足够的透明度。不过,这些模型也展现出一些优势,如有效利用患者病史、清晰的逐步推理过程、合理的鉴别诊断思路、通过明确推理提高诊断的特异性,以及能够有效地检索相关证据。为了支持临床应用和未来模型的发展,我们建议优先考虑那些优化了推理能力的模型,改进信息检索机制以实现自我反思和错误纠正,加强视觉与文本之间的整合,并制定关于图像质量和清晰度的实用标准。总体而言,可靠的多模态诊断性能更多依赖于透明的推理过程和高质量的数据输入,而非依赖于复杂的算法流程或大量数据检索。在证据整合和视觉推理方面仍然存在的显著缺陷,是阻碍这些系统安全、常规临床应用的主要障碍。