
-
生物通官微
陪你抓住生命科技
跳动的脉搏
在线糖尿病精确医学课程的单组前后评估及经人工验证的大语言模型辅助开放式回答评分方法
《npj Digital Medicine》:Human-validated LLM-assisted assessment of a large-scale online precision medicine course in diabetes
【字体: 大 中 小 】 时间:2026年10月11日 来源:npj Digital Medicine 18.0
编辑推荐:
摘要精确医学越来越依赖多模态数据和人工智能,这催生了对可扩展的教育和评估的需求。我们开发了一个在线糖尿病精确医学课程,并对完成该课程的435名学习者进行了知识、信心以及基于评分标准的开放式回答的观测性单组前后评估。由于对开放式回答进行人工评分耗时且易受变异性和人为判断的影响,
精确医学越来越依赖多模态数据和人工智能,这催生了对可扩展的教育和评估的需求。我们开发了一个在线糖尿病精确医学课程,并对完成该课程的435名学习者进行了知识、信心以及基于评分标准的开放式回答的观测性单组前后评估。由于对开放式回答进行人工评分耗时且易受变异性和人为判断的影响,我们开发了一种经人工验证的大型语言模型(LLM)辅助评分工作流程。知识得分、信心得分和开放式回答得分分别提高了30.0个百分点、1.32分和0.39分(所有p?<?0.001)。在通过LLM辅助工作流程评估的4350份回答中,仅有12份(0.3%)需要人工复核。在一个分层抽取的300份回答验证样本中,最终LLM共识评分与最终人工评分相比,达到了75.3%的完全一致率、99.3%的相邻一致率和0.7%的重大分歧(LLM一致率为74.0%;人工一致率为65.7%)。完成课程与知识、信心和开放式回答得分的提高相关联,同时研究结果也支持经人工验证的LLM辅助评估作为评估开放式回答的可扩展方法。