《BMC Medical Education》:Can students identify AI? – A cross-sectional quantitative study about AI recognition in tablet-based MCQ assessment among fifth-year undergraduate medical students at Saarland University, Germany
编辑推荐:
背景:除人工智能(Artificial Intelligence, AI)生成的多项选择题(Multiple Choice Questions, MCQs)的技术可行性外,其在考核中的教育价值仍不明确。本研究旨在评估在考试情境下,学生能否区分AI-MCQs与国
背景:除人工智能(Artificial Intelligence, AI)生成的多项选择题(Multiple Choice Questions, MCQs)的技术可行性外,其在考核中的教育价值仍不明确。本研究旨在评估在考试情境下,学生能否区分AI-MCQs与国家执业考试(National Licensing Exam, NLE)题目,以及这些题目是否与课程一致。
方法:本横断面研究纳入119名五年级医学生,完成了家庭医学MCQ平板电脑考试。参与者回答了30道AI生成和30道NLE MCQ。AI题目基于数字学习材料,使用ChatGPT-4o和Gemini 1.5 Pro生成。专家接受了82%的题目,对保留题目进行少量编辑,并删除需要重大修改的题目。考试期间,学生被询问题目来源及每道题是否与课程一致。统计分析使用Jamovi 2.3.28.0进行。
结果:AI或NLE MCQ的正确归因无显著差异(t(29.6) = -1.24,p = 0.225;t(29.6) = 1.18,p = 0.246)。未发现题目难度与识别之间存在显著相关性(τb:p = 0.534)。干扰项分布在ChatGPT、Google Gemini和NLE之间无差异(χ2(2) = 2.61,p = 0.271,所有比较U p > 0.05)。AI与NLE题目之间的题目难度无显著差异;然而,探索性来源特异性分析显示ChatGPT、Google Gemini和NLE题目之间存在总体差异(χ2(2) = 6.71,p = 0.035),其中Google Gemini与NLE题目之间存在差异(p = 0.028)。学生感知的课程一致性在AI与NLE之间或ChatGPT、Google Gemini和NLE之间无显著差异。
结论:学生识别AI生成的MCQ与NLE MCQ之间无差异。较容易的MCQ通常被认为更符合课程。在结构化人工审核流程中,AI-MCQ可能为题目起草提供一种可行方法。
**论文解读:AI生成选择题在医学考试中的可识别性与教育价值**
医学教育中的考核设计长久以来面临资源密集的挑战。编写一道高质量的多项选择题(MCQ)可能需要高达24小时,成本介于1500至2500美元之间。随着大语言模型(LLM)在题目生成方面展现出技术可行性,一个重要问题随之而来:学生能否区分AI编写的题目与专家编写的题目?如果无法区分,又意味着什么?既往研究多聚焦于LLM生成MCQ的可行性及其心理测量学特性,较少关注学习者在真实考试环境中对题目来源的识别能力,也较少评估AI题目与课程目标的建构一致性。本研究正是基于这一缺口,在德国萨尔大学2024年夏季学期家庭医学(FM)期末真实考试中开展横断面研究,旨在回答三个问题:医学生能否区分AI生成与NLE题目?识别是否与题目难度相关?学生对题目课程一致性的感知如何?
研究人员共纳入119名五年级医学生,所有学生均参加了包含30道AI生成MCQ和30道国家执业考试(NLE)MCQ的平板电脑考试。AI题目由ChatGPT-4o和Gemini 1.5 Pro从课程数字材料中生成,经专家小组审核后保留30题用于考试。结果显示,学生对AI与NLE题目的正确识别率无显著差异,识别率均高于随机水平但不够完美;AI与NLE题目在难度、干扰项分布和学生感知课程一致性方面总体相当。研究还发现,学生感知的课程一致性与题目难度强相关:越容易的题目越被认为符合课程。该研究的意义在于,在真实高风险考试情境中为AI辅助出题提供了证据,表明在结构化人工审核流程下,AI-MCQ可能作为起草工具,释放教育资源,但必须保持人类监督以规避AI错误和潜在的专科偏见。
在关键技术方法上,研究人员采用了横断面设计,样本为德国萨尔大学家庭医学课程的119名五年级医学生。AI生成使用ChatGPT-4o和Gemini 1.5 Pro,输入全部混合式课程材料,生成以腹痛、发热感染、背痛为主题的MCQ,作者PV通过额外提示优化提问层级,并随机选择生成关键特征题。专家小组(SJ、SVW、JJ、FD)审核后接受81.8%的生成题目,保留的题目经少量编辑后纳入考试。考试中每道题后设置两个研究问题:来源归因和课程一致性感知。统计分析采用Jamovi 2.3.28.0,包括Welch's t检验、Mann-Whitney U检验、Kendall's tau-b、方差分析及混合效应模型等。
**Study population**:共119名五年级医学生参与,全部在册学生均参加,无排除。分析纳入39个归因单元(含60道MCQ),其中AI来源21个、NLE来源18个。
**Students’ recognition did not differ between AI and NLE**:描述性数据显示,AI题目的正确识别均值(M = 69.6,SD = 15.7)与NLE题目(M = 77.5,SD = 22.7)存在数值差异,但差异不显著(t(29.6) = -1.24,p = 0.225;混合效应模型OR = 1.43,95% CI 0.88–2.34,p = 0.147)。全部39个归因单元的平均正确识别率为63.9%(95% CI 58.6–69.2%),显著高于50%偶然水平(t(38) = 5.30,p < 0.001);混合效应模型估计正确识别概率为66.1%(95% CI 60.0–71.7%,z = 5.01,p < 0.001)。
**Recognition was not associated with item difficulty**:AI题目的难度中位数为0.760(IQR 0.280),NLE为0.930(IQR 0.172),两者差异不显著(U = 136,p = 0.134)。正确识别与题目难度之间无显著相关(τ
b = 0.071,p = 0.534),说明学生识别来源的能力不依赖于题目难易。
**Student-perceived curricular alignment did not differ between AI and NLE MCQs**:总体上,66%的学生评分认为题目与课程一致,34%认为不一致。AI题目的中位一致性评分为81.0(IQR 34.0),NLE为84.5(IQR 41.0);二元比较无显著差异(“一致”U = 188,p = 0.978;“不一致”U = 187,p = 0.966),混合效应模型同样未显示来源间差异(OR = 1.04,95% CI 0.385–2.81,p = 0.938)。
**Post-hoc exploratory analyses**:探索性分析显示,ChatGPT、Google Gemini和NLE三者之间的正确识别率无显著差异(ANOVA p = 0.443;混合效应模型χ
2(2) = 2.17,p = 0.338)。按两种分类方式划分的题目难度分布,在AI与NLE之间均无显著差异(10%分类χ
2(8) = 7.63,p = 0.470;20%分类χ
2(4) = 4.48,p = 0.345)。然而,来源特异性分析显示,三种来源的题目难度总体存在差异(χ
2(2) = 6.71,p = 0.035),其中Google Gemini题目显著难于NLE题目(p = 0.028),而ChatGPT与NLE之间无显著差异。题目难度与学生感知课程一致性强相关,较容易的题目更多被认为“一致”(ρ = 0.762,p < 0.001),较难的题目更多被认为“不一致”(ρ = -0.762,p < 0.001)。来源特异性课程一致性分析未发现ChatGPT、Google Gemini与NLE之间存在显著差异(χ
2(2) = 4.03,p = 0.134)。干扰项分布指数在三种来源间无显著差异(χ
2(2) = 2.61,p = 0.271),AI与NLE合并比较也无差异(U = 394,p = 0.529)。
在讨论部分,研究人员指出,尽管学生识别准确率高于偶然水平,但AI与NLE题目在可识别性上无差异;同时,学生考后自我报告“很容易识别AI题目”与实际识别表现存在明显差距,提示在课程中引入AI需谨慎。专家审核过程中18.2%的AI题目被淘汰,表明人工监督不可或缺;此外,还观察到AI生成内容存在低估家庭医学能力的专科偏见,例如干扰项中不合理地建议转诊腹部超声。在德国以MCQ为导向的评估体系中,AI辅助起草可显著节省出题时间,并将节省的资源用于形成性评价和反馈。研究优势包括真实考试环境嵌入、使用两种不同LLM、纳入关键特征题;局限性则包括单中心、单学科、单队列、每种来源的题目数量有限、既往接触NLE题目可能影响归因,以及难度与课程一致性之间的强关联可能限制解释。
研究结论翻译如下:在真实的高风险考试环境中,学生识别题目来源的准确率显著高于偶然水平,但识别能力中等,且AI生成与NLE题目之间无显著差异。用于题目质量控制的各项指标(难度指数、学生感知课程一致性、干扰项分布)在AI与NLE题目之间均无差异,提示AI-MCQ在考试情境中具有潜在可用性。研究结果建议在AI出题过程中保持人工监督,以减少AI错误并避免可能的专科偏见。AI辅助起草可能释放教育资源,从而将更多精力投入更广泛的课程改进与发展;同时,AI辅助起草还可与反馈生成相结合,提供更结构化的重复性形成性测试学习活动。