基于ChatGPT生成药剂学课程总结性考核试题的学生表现、认知与Bloom分类学水平评价研究

《Pharmacy》:The Use of ChatGPT to Write Assessment Questions

【字体: 大 中 小 】 时间:2026年09月25日 来源:Pharmacy 2.2

编辑推荐:

  专业术语翻译(摘要部分) 已有研究提出,ChatGPT可用于编写考核试题。本研究旨在评估学生药剂师(student pharmacists)在总结性考核(summative assessments)中回答ChatGPT生成试题的学业表现,探讨学生对使用Chat

  
专业术语翻译(摘要部分) 已有研究提出,ChatGPT可用于编写考核试题。本研究旨在评估学生药剂师(student pharmacists)在总结性考核(summative assessments)中回答ChatGPT生成试题的学业表现,探讨学生对使用ChatGPT编写考核试题的认知,并刻画试题的Bloom分类学(Bloom’s taxonomy)水平。研究人员使用ChatGPT生成与课堂目标(lecture objectives)一致的考核试题。经内容专家筛选后,ChatGPT生成试题被用于2024年和2025年药剂学I(Pharmaceutics I)与药剂学II(Pharmaceutics II)两门课程的全部考试。一项面向学生药剂师的问卷调查了他们对使用人工智能(artificial intelligence, AI)生成考核试题的认知。共91名学生参与研究(应答率为93%)。两门课程合计,学生完成了约100道ChatGPT生成试题的评分。在2024年和2025年,药剂学I课程中,ChatGPT生成试题的平均正确率高于教师生成试题;而在药剂学II课程中,ChatGPT生成试题的正确率较低。多数学生认为,教师不应使用ChatGPT生成大部分(≥50%)或全部考核试题。学生对20道考核试题(ChatGPT生成与教师生成各占一半)来源的辨别平均成功率为53%。AI工具CompetencyGenie?将ChatGPT生成试题大多归类为修订版Bloom分类学(revised Bloom’s taxonomy)的“记忆(Remember)”和“理解(Understand)”水平。学生在两个水平的ChatGPT生成试题上的表现相近。研究结论为:ChatGPT能够生成可用于药剂学课程总结性考核的试题。
论文解读文章
一、研究背景与问题
生成式人工智能(generative artificial intelligence, AI)的快速发展正日益影响教育的多个层面,药学教育亦不例外。编写清晰、能够反映学习成果并测量特定知识水平或能力的考核试题是教育工作者的重要任务,但这一过程耗时费力,且需要持续更新以适应课程内容变化并保障试题安全性。已有研究提出,ChatGPT等常见AI聊天机器人可用于编写考核试题,以简化流程并节省时间。然而,关于ChatGPT生成试题可用性的系统信息仍然不足。现有文献多聚焦于形成性考核(formative assessments)中ChatGPT生成试题的使用,仅有极少数研究涉及总结性考核(summative assessments)。此外,药学教育领域缺乏关于ChatGPT生成试题Bloom分类学水平、学生辨别试题来源能力以及学生对教师使用ChatGPT编写试题态度的报道。为弥补上述文献空白,本研究旨在评估:(1)学生在总结性考核中回答ChatGPT生成试题的学业表现;(2)学生辨别ChatGPT与教师生成试题的能力及其对使用ChatGPT生成考核试题的认知;(3)ChatGPT生成试题的Bloom分类学水平及相应学生表现。
二、研究内容与结论
研究人员在South College药学院(South College School of Pharmacy)的药剂学I与药剂学II两门课程中,使用ChatGPT-3.5(2023年12月至2024年5月)及ChatGPT-4o(2024年9月至2025年3月)生成考核试题。所有试题均依据课堂目标(lecture objectives)通过统一提示词生成,并经内容专家按多项标准筛选后用于两门课程共11次考试。2024年与2025年两个学生队列共91人参与研究(应答率93%)。研究结果显示:在药剂学I课程中,两个年份ChatGPT生成试题的平均正确率均高于教师生成试题;而在药剂学II课程中,ChatGPT生成试题的正确率较低。两门课程合并后,ChatGPT生成试题的正确率显著低于教师生成试题,但差异幅度仅1%–2%,不具有显著教育意义。多数学生(2024年95%,2025年79%)认为教师应限制使用ChatGPT生成少于50%或不使用其生成考核试题,且2025年学生对AI生成试题的接受度显著高于2024年。学生对20道试题(ChatGPT与教师生成各10道)来源辨别的平均成功率为53%,经统计检验与随机水平等效。AI工具CompetencyGenie?将至少96%的ChatGPT生成试题归类为修订版Bloom分类学的“记忆(Remember)”和“理解(Understand)”水平,与课程主任(Course Director)的判定一致。学生在“记忆”与“理解”水平ChatGPT生成试题上的表现无显著差异。研究结论为:ChatGPT经内容专家审核与筛选后生成的试题可用于药剂学课程总结性考核。
三、主要关键技术方法
本研究采用的主要方法包括:使用ChatGPT-3.5和ChatGPT-4o生成多项选择题(multiple-choice questions),提示词为“请编写二十道五个选项的多项选择题并提供正确答案”后接课堂目标;试题经内容专家按与课堂目标一致性、科学准确性、清晰度、术语一致性、格式合规性、单一正确答案、无无意提示及预期难度等标准筛选,约75%试题未经修改直接使用;通过ExamSoft平台进行试题标记与成绩数据收集;设计并实施问卷调查以收集学生人口学信息、对教师使用ChatGPT编写试题的认知及辨别试题来源的能力,问卷经四名药学教师反馈修改并在七名非参与学生中预测试;使用CompetencyGenie?(ExamSoft与Enflux合作开发的AI工具)为试题分配修订版Bloom分类学水平;统计方法包括配对t检验(paired t-test)、双单侧等价检验(two one-sided tests for equivalence)、Fisher精确检验(Fisher’s Exact Test)及Holm-?idák校正。研究样本来自South College药学院2024年(n=43)与2025年(n=48)两个在校学生队列,线上路径学生被排除以避免混杂。
四、研究结果
4.1 学生人口学信息
两个学生队列的应答率与人口学信息显示,最常见的年龄组为18–24岁,多数学生自我认同为女性并持有学士学位。
4.2 学生学业表现
通过ExamSoft标记与成绩分析发现:在2024年和2025年,药剂学I课程中ChatGPT生成试题的平均正确率高于教师生成试题,而药剂学II课程中ChatGPT生成试题的正确率较低。教师生成试题在药剂学II课程中的学生表现高于药剂学I课程。2024年,ChatGPT生成试题在药剂学I课程中的学生表现高于药剂学II课程。两门课程合并后,ChatGPT生成试题的正确率显著低于教师生成试题,但差异仅1%–2%。
4.3 学生认知
问卷调查显示,2024年、2025年及合并队列中,分别有77%、71%和74%的学生选择“未注意到考试中部分试题可能由AI生成”。对于教师是否应使用ChatGPT生成考核试题,2024年95%和2025年79%的学生认为应限制使用ChatGPT生成少于50%或不使用其生成试题,且两个队列的应答存在显著关联(p < 0.05)。学生对20道试题来源辨别的平均正确率在2024年、2025年及合并队列分别为55%±11%、52%±12%和53%±11%,统计检验表明其辨别能力与随机水平等效。
4.4 Bloom分类学水平
课程主任将所有研究试题分配为修订版Bloom分类学的“记忆”和“理解”水平。CompetencyGenie?将至少96%的ChatGPT生成试题归类为“记忆”和“理解”水平,与课程主任判定一致。统计检验显示,在2024年药剂学I课程中,试题来源(ChatGPT或教师生成)与Bloom分类学水平存在显著关联(p < 0.05),CompetencyGenie?将14%的教师生成试题归类为“分析(Analyze)”水平,但课程主任不同意该判定。学生在“记忆”与“理解”水平的ChatGPT生成试题上的表现无显著差异;仅在2024年药剂学II课程的教师生成试题中,“记忆”与“理解”水平的学生表现存在显著差异(p < 0.05)。
五、讨论与结论
讨论部分指出,本研究的贡献在于首次报道了ChatGPT生成试题在总结性考核中的学生表现、学生辨别试题来源能力、学生对使用AI编写试题的认知以及ChatGPT生成试题Bloom分类学水平及其对应学生表现。学生表现差异在不同课程间存在,可能与课程内容性质、学习成果差异及ChatGPT平台版本变化有关。尽管部分统计比较达到显著性,但差异幅度较小,合并后仅1%–2%,不构成显著教育差异。学生对AI生成试题的接受度在2025年有所提高,可能与AI的日益普及和接受度增加有关。多数学生未注意到试题可能由AI生成,且辨别能力与随机水平等效,进一步支持了ChatGPT生成试题的潜在可用性。Bloom分类学分析显示,未在提示词中指定分类学水平时,ChatGPT默认生成较低水平(“记忆”和“理解”)试题,与既往医学教育研究一致。研究局限性包括:单一机构、样本量较小、主要使用ChatGPT-3.5、未上传课堂笔记、无法复现相同试题集、未进行详细心理测量学分析等。研究结论为:ChatGPT经内容专家审核与筛选后生成的试题可用于药剂学课程总结性考核。未来方向包括评估ChatGPT以外的其他AI平台、优化提示词工程、在更多药学及医疗相关课程中验证该实践,以及获取更多关于此类试题的项目分析信息。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号