
-
生物通官微
陪你抓住生命科技
跳动的脉搏
基于角色分层提示的大语言模型神经解剖学答题表现评估:尖峰板贝叶斯广义线性混合模型分析
《Scientific Reports》:Modeling hierarchical response accuracy of large language models using a Bayesian generalized linear mixed model
【字体: 大 中 小 】 时间:2026年09月24日 来源:Scientific Reports 4.9
编辑推荐:
摘要大语言模型(LLMs)在自然语言处理领域表现出强劲的性能。在神经解剖学领域,其跨分层数据结构(回答嵌套于问题中)的响应准确性尚未得到研究。评估这些模型在不同认知需求下的表现对于将它们有效整合到医学教育中至关重要。共回顾了来自土耳其医学专科考试(2013–2021 年)的
大语言模型(LLMs)在自然语言处理领域表现出强劲的性能。在神经解剖学领域,其跨分层数据结构(回答嵌套于问题中)的响应准确性尚未得到研究。评估这些模型在不同认知需求下的表现对于将它们有效整合到医学教育中至关重要。共回顾了来自土耳其医学专科考试(2013–2021 年)的 183 道神经解剖学题目,通过排除 7 道基于图表的题目,获得了 176 道单一正确答案的题目。每道题目被重新表述为代表三个基于角色的提示级别的提示词:医学生、近期毕业医生和博士级专家。这三个大语言模型的响应被评分为正确或错误。使用贝叶斯广义线性混合模型(GLMM)对数据进行分析,对随机截距采用混合先验,并将模型类型、提示级别及其交互作用作为固定效应。问题级别截距的分布高度偏斜,显示出所有大语言模型在所有提示级别下均回答正确的题目的天花板效应(176 道题中的 141 道,80.1%)。为了解决这一过度的‘1'值现象,对随机截距指定了尖峰板先验,将天花板成分(尖峰)与可变难度成分(板)分离开来。使用 Python 中的 CmdStan 进行蒙特卡洛采样以获得后验估计。ChatGPT-4o 和 Microsoft Copilot 的总体准确率高于 Google Gemini,其中 ChatGPT-4o 在所有提示级别上的表现最佳。与标准模型规格相比,尖峰板模型显示出更好的样本外预测性能(ΔELPD-WAIC = 22.64)。后验全局尖峰概率(\(\:\varphi\:\)=0.706,95% HDI [0.516, 0.826])表明,141 道题目(80.1%)被分配给天花板成分,而其余 35 道题目(19.9%)显示出项目难度的真实变异性。板成分的问题级别随机截距标准差(\(\:{\sigma\:}_{question}\)=2.158,95% HDI [1.289, 3.312])反映了非天花板神经解剖学题目在基线易度之间的显著项目间变异性。采用尖峰板先验分布实现的贝叶斯 GLMM 方法对数据进行了建模,其中回答嵌套于问题之中,体现了分层结构。通过将问题级别的随机截距分解为代表天花板和可变难度的独立成分来解决天花板效应,从而提供了性能变异性估计。在非天花板题目中获得了大语言模型性能的项目间变异性。仅靠基于角色的提示差异化不足以在模型准确率上产生系统性差异。