
-
生物通官微
陪你抓住生命科技
跳动的脉搏
对ChatGPT-4o与ChatGPT-5.1在基于临床医生记录的文本进行自动LUTS评分方面的对比评估
《BMC Urology》:Comparative evaluation of ChatGPT-4o and ChatGPT-5.1 for automated LUTS scoring from clinician-documented narratives
【字体: 大 中 小 】 时间:2026年08月11日 来源:BMC Urology 2.3
编辑推荐:
摘要背景下尿路症状(LUTS)通常通过国际前列腺症状评分(IPSS)和过度活跃膀胱症状评分(OABSS)等经过验证的工具来量化。然而,在常规门诊实践中,并不总是使用结构化的问卷,临床医生往往依赖文字描述。尽管生成式大型语言模型在临床自然语言处理方面展现出潜力,但其在不同版本模型中
下尿路症状(LUTS)通常通过国际前列腺症状评分(IPSS)和过度活跃膀胱症状评分(OABSS)等经过验证的工具来量化。然而,在常规门诊实践中,并不总是使用结构化的问卷,临床医生往往依赖文字描述。尽管生成式大型语言模型在临床自然语言处理方面展现出潜力,但其在不同版本模型中的自动症状评分性能稳定性仍不明确。为此,我们对比了ChatGPT-4o和ChatGPT-5.1在自动LUTS评分方面的性能差异。
这项基于先前报道的门诊患者群体的回顾性二次分析,旨在评估ChatGPT-4o和ChatGPT-5.1从临床医生记录的文字描述中估算LUTS相关评分的能力。从电子病历中提取的文本格式症状描述会通过相同的提示直接输入到两个模型中。真实的IPSS和OABSS总分则来自已完成的问卷调查。预测性能通过平均绝对误差(MAE)、均方根误差(RMSE)、类内相关系数(ICC)以及斯皮尔曼相关系数来评估。对于临床意义显著的LUTS(IPSS≥8)和过度活跃膀胱(OAB;OABSS≥3且紧迫感评分≥2),则通过准确率、科恩卡帕值(κ)以及受试者工作特征曲线下面积(AUC)来进行评价。该分析涵盖了原始研究群体中的91名患者。
在91名患者(平均年龄71.9±10.3岁,58.2%为男性)中,49人完成了IPSS评分,78人完成了OABSS评分。在IPSS评分预测方面,ChatGPT-4o的MAE/RMSE分别为4.88/6.34,ChatGPT-5.1的相应数值为4.92/7.01,两者之间没有显著差异。在OABSS评分预测方面,两者的MAE/RMSE分别为1.88/2.76和2.03/2.93,同样不存在显著差异。IPSS评分的一致性处于中等水平(ICC为0.561–0.509),而OABSS评分的一致性更高(ICC为0.704–0.658)。两种情况的分类准确率均超过0.85,ROC分析也显示不同版本模型的区分能力相当。
ChatGPT-4o和ChatGPT-5.1在从非结构化的临床文字描述中估算LUTS相关症状评分方面表现相近,且性能处于中等水平。这些结果表明,生成式AI模型可作为辅助工具用于自动症状量化,并说明在实际泌尿科诊疗中,不同版本模型的性能具有相对稳定性。
下尿路症状(LUTS)通常通过国际前列腺症状评分(IPSS)和过度活跃膀胱症状评分(OABSS)等经过验证的工具来量化。然而,在常规门诊实践中,并不总是使用结构化的问卷,临床医生往往依赖文字描述。尽管生成式大型语言模型在临床自然语言处理方面展现出潜力,但其在不同版本模型中的自动症状评分性能稳定性仍不明确。为此,我们对比了ChatGPT-4o和ChatGPT-5.1在自动LUTS评分方面的性能差异。
这项基于先前报道的门诊患者群体的回顾性二次分析,旨在评估ChatGPT-4o和ChatGPT-5.1从临床医生记录的文字描述中估算LUTS相关评分的能力。从电子病历中提取的文本格式症状描述会通过相同的提示直接输入到两个模型中。真实的IPSS和OABSS总分则来自已完成的问卷调查。预测性能通过平均绝对误差(MAE)、均方根误差(RMSE)、类内相关系数(ICC)以及斯皮尔曼相关系数来评估。对于临床意义显著的LUTS(IPSS≥8)和过度活跃膀胱(OAB;OABSS≥3且紧迫感评分≥2),则通过准确率、科恩卡帕值(κ)以及受试者工作特征曲线下面积(AUC)来进行评价。该分析涵盖了原始研究群体中的91名患者。
在91名患者(平均年龄71.9±10.3岁,58.2%为男性)中,49人完成了IPSS评分,78人完成了OABSS评分。在IPSS评分预测方面,ChatGPT-4o的MAE/RMSE分别为4.88/6.34,ChatGPT-5.1的相应数值为4.92/7.01,两者之间没有显著差异。在OABSS评分预测方面,两者的MAE/RMSE分别为1.88/2.76和2.03/2.93,同样不存在显著差异。IPSS评分的一致性处于中等水平(ICC为0.561–0.509),而OABSS评分的一致性更高(ICC为0.704–0.658)。两种情况的分类准确率均超过0.85,ROC分析也显示不同版本模型的区分能力相当。
ChatGPT-4o和ChatGPT-5.1在从非结构化的临床文字描述中估算LUTS相关症状评分方面表现相近,且性能处于中等水平。这些结果表明,生成式AI模型可作为辅助工具用于自动症状量化,并说明在实际泌尿科诊疗中,不同版本模型的性能具有相对稳定性。