
-
生物通官微
陪你抓住生命科技
跳动的脉搏
未来的医生:ChatGPT-4、ChatGPT-4 Omni与Gemini 2.0 Flash在男性病学领域的竞争
《BMC Urology》:The doctors of the future: the competition of ChatGPT-4, ChatGPT-4 omni, and Gemini 2.0 Flash in andrology
【字体: 大 中 小 】 时间:2026年07月08日 来源:BMC Urology 2.3
编辑推荐:
摘要研究目的大型语言模型在医学研究以及临床决策支持工具中的应用越来越广泛。本研究旨在比较大型语言模型在回答男性科相关问题时的响应准确性和可靠性。材料与方法根据欧洲泌尿协会2024年男性科指南,制定了70道关于诊断、治疗及一般信息的题目。这些题目被提交给三种大型语言模型,即Chat
大型语言模型在医学研究以及临床决策支持工具中的应用越来越广泛。本研究旨在比较大型语言模型在回答男性科相关问题时的响应准确性和可靠性。
根据欧洲泌尿协会2024年男性科指南,制定了70道关于诊断、治疗及一般信息的题目。这些题目被提交给三种大型语言模型,即ChatGPT-4、ChatGPT-4o和Google Gemini 2.0 Flash。由三名资深泌尿科医生使用四分制评分标准对模型的响应进行独立评估:总得分大于9分表示响应良好,6≤总得分≤9分表示响应一般,总得分小于6分则表示响应较差。此外,还评估了这些模型的自我修正能力,并分析了重新评估后响应准确性的变化情况。
在诊断和治疗类别中,ChatGPT-4o获得了最高的总得分(p<0.001)。Google Gemini 2.0 Flash生成的响应内容最长,但准确性最低。经过自我修正后,ChatGPT-4o的改进幅度最大(Cohen’s d=-1.214,p<0.01)。Fleiss’ kappa系数介于0.61到0.80之间,表明各位泌尿科医生之间的评估结果具有较高的一致性。
ChatGPT-4o是处理男性科相关问题最可靠的模型,其提供的响应与当前临床指南高度一致。模型的自我修正能力提升了响应的准确性,这说明大型语言模型中的错误识别机制还有进一步优化的空间。不过,在临床实践中安全应用人工智能辅助系统仍需专家的监督。
大型语言模型在医学研究以及临床决策支持工具中的应用越来越广泛。本研究旨在比较大型语言模型在回答男性科相关问题时的响应准确性和可靠性。
根据欧洲泌尿协会2024年男性科指南,制定了70道关于诊断、治疗及一般信息的题目。这些题目被提交给三种大型语言模型,即ChatGPT-4、ChatGPT-4o和Google Gemini 2.0 Flash。由三名资深泌尿科医生使用四分制评分标准对模型的响应进行独立评估:总得分大于9分表示响应良好,6≤总得分≤9分表示响应一般,总得分小于6分则表示响应较差。此外,还评估了这些模型的自我修正能力,并分析了重新评估后响应准确性的变化情况。
在诊断和治疗类别中,ChatGPT-4o获得了最高的总得分(p<0.001)。Google Gemini 2.0 Flash生成的响应内容最长,但准确性最低。经过自我修正后,ChatGPT-4o的改进幅度最大(Cohen’s d=-1.214,p<0.01)。Fleiss’ kappa系数介于0.61到0.80之间,表明各位泌尿科医生之间的评估结果具有较高的一致性。
ChatGPT-4o是处理男性科相关问题最可靠的模型,其提供的响应与当前临床指南高度一致。模型的自我修正能力提升了响应的准确性,这说明大型语言模型中的错误识别机制还有进一步优化的空间。不过,在临床实践中安全应用人工智能辅助系统仍需专家的监督。