高风险考试中纸笔与计算机化评估:基于共同被试设计的模式可比性研究

《Frontiers in Psychology》:Paper- vs. computer-based assessment in high-stakes testing: a common-person investigation of mode comparability

【字体: 时间:2026年09月09日 来源:Frontiers in Psychology 3.8

编辑推荐:

  本研究考察了在土耳其实施的一项高风险外语考试的纸笔形式(YDS)与计算机化形式(e-YDS)之间的模式可比性。研究人员未将分析视为常规测验等值(test equating),而是将其构念为对施测模式改变是否使所测构念保持不变并使所得分数可比的一次检验。采用共同

  
本研究考察了在土耳其实施的一项高风险外语考试的纸笔形式(YDS)与计算机化形式(e-YDS)之间的模式可比性。研究人员未将分析视为常规测验等值(test equating),而是将其构念为对施测模式改变是否使所测构念保持不变并使所得分数可比的一次检验。采用共同被试设计(common-person design)和Rasch模型,通过单独标定结合均值/标准差转换以及同时标定(concurrent calibration),将六对试卷置于同一量尺上。对每一份试卷评估了模型-数据拟合与维度(通过四分相关条目间相关(tetrachoric inter-item correlations)和平行分析(parallel analysis)),并作为敏感性分析在有和没有剔除不一致被试的情况下检查了等值。计算了标定常数、等值均方根误差(RMSE)和配对平均差(Δ),并比较了跨试卷测验信息函数(test information functions)。在所有试卷对中,数据基本是单维的,并且充分拟合Rasch模型,纸笔和计算机化形式具有可比较的主导单一维度。虽然计算机化形式没有显示出比纸笔形式更强的次要维度,但该设计——由于条目和施测日期不同——无法分离出纯粹的模式效应。在有和没有被试剔除的情况下,等值常数和估计的模式差异几乎相同(模式差异 ≤ ~0.17 logits),并且单独标定和同时标定方法在条目参数层面几乎完全一致(r = 1.00)。计算机化形式产生了略高的能力估计,但共同被试的分布保持稳定。总体而言,结果在当前操作条件下提供了实际模式可比性的证据,同时研究人员明确指出了限定这一结论的混杂因素和假设。
本研究聚焦于高风险考试中不同施测模式之间的可比性问题。大型考试通常开发多个试卷版本以维护安全与公平,但等值(equating)预设不同版本测量同一构念且结构性质相同;而模式可比性(mode comparability)追问的则是施测媒介从纸笔转为计算机后,所测构念与分数解释是否保持不变。这两种问题在概念上必须区分。土耳其的YDS(外语考试)及其机考版本e-YDS是高利害考试,分数关涉研究生入学、学术晋升和公共服务语言要求,因此即使很小的模式相关偏差也可能产生实际后果,必须进行实证检验。

研究人员基于2024年土耳其?SYM(考生选择与安置中心)操作的YDS与e-YDS数据,采用共同被试设计(common-person design,以同一批考生作答两种形式作为锚定),将两次纸笔考试(YDS1、YDS2)与四次机考(e-YDS2、e-YDS4、e-YDS11、e-YDS12)组成六对试卷,共同被试人数为745至2464人。研究的主要方法包括:使用Rasch模型(一种单参数项目反应理论模型)分别估计条目难度与考生能力,通过均值/标准差(mean/sigma)转换进行单独标定,同时进行联合标定(concurrent calibration);用Infit和Outfit均方统计量评估模型拟合;用四分相关条目间相关矩阵的特征值及平行分析评估单维性;以剔除不一致被试作为敏感性分析;计算标定常数A、B,等值均方根误差(RMSE)和配对平均差Δ,并用自举置信区间与双单侧检验(TOST)对等价性作推断;比较跨试卷测验信息函数(TIF)。

结果方面,按照原文小标题依次总结。在“模型拟合与维度”中,所有形式的平均Infit和Outfit MNSQ均接近1.00,每条80题试卷仅有0至3个条目超出0.5–1.5的有效范围;第一特征值约为第二特征值的8.7–12.6倍,第一因子解释约32%–38%方差,第二因子仅约3%。Horn平行分析虽保留两个因子,但第二因子很小,与语言测验中语法、词汇、阅读等子部分结构一致。纸笔与机考形式的维度特征相当,说明机考形式没有表现出比纸笔形式更强的次要维度,支持Rasch模型所需的基本单维性。在“标定常数与等值差异”中,A系数在0.89到1.08之间,B系数在?0.20到0.09之间,等值RMSE为0.04到0.17 logits;四个纸笔—机考对的配对平均差Δ在?0.17到0.04 logits之间,负值说明机考形式平均能力估计略高;两个机考—机考对(RQ3、RQ4)则作为同模式下的形式间与场次间变异基准。在“剔除不一致被试的敏感性分析”中,用标准化残差绝对值大于2标记不一致被试,其占比为4.0%–5.8%;剔除后共同被试相关仅上升约0.02,而标定常数与模式差异基本不变(例如0.17与0.16 logits),因此主分析基于全样本,剔除结果作为稳健性检验。在“自举置信区间与等价性检验”中,对全共同被试进行2000次重采样所得95%置信区间较窄;配对平均差Δ的TOST检验在±0.5与±0.2 logits边缘下均支持四个跨模式对的等价性(所有p≤0.001)。±0.2 logits约等于量表中心的条件标准误,说明观察到的系统差异位于测量误差范围内,但研究者也谨慎指出,高风险考试中即使低于阈值的差异也可能影响特定决策分界点。在“单独标定与同时标定的一致性”中,联合标定的条目难度转换到参考量表后与单独标定结果几乎完全一致,条目参数相关r=1.00,RMSD为0.009–0.094 logits,说明两种估计路线能够恢复同一共同量尺。在“跨试卷测验信息”中,跨形式TIF显示两形式测量精度相似但不完全相同,峰值信息最多相差约1个信息单位,最大绝对差异为0.4–1.2个信息单位;精度相似本身并不直接等于分数等值。

在讨论部分,研究人员指出等值结果会受到样本量、群体能力差异、条目难度差异及共同元素比例的影响;本研究中共同被试比例较高且能力差异较小,因此误差指标较低。单独标定与联合标定在条目参数层面几乎完全一致,符合已有联合估计研究的发现。机考形式能力估计略高,研究人员认为这可能与e-YDS参加者的选择性有关,而非纯粹模式效应。0.5 logit“差异具有意义”的启发式阈值源自SAT背景,未必适用于80题180分钟的语言测验;实际观察到的配对平均差不超过约0.17 logits,约合量表中心3个原始分,比该阈值小一个数量级,对典型考生影响较小,但接近决策分界点的考生仍需留意。跨形式信息相似说明测量精度可比,但不表示分数可以直接互换。研究同时承认若干局限:两种形式没有共同条目,无法将模式效应与题目、时间、选择效应完全分离;考试间隔为15–76天,考生能力可能发生变化;e-YDS在有限城市提供,考生自我选择;人口学变量未匹配;界面特征未实验操控;未正式检验施测顺序效应;无法进行条目水平的跨模式DIF(项目功能差异)分析;数据仅来自2024年英语版本。因此结论被限定在当前操作条件下。

研究结论:总体而言,结果在当前操作条件下提供了实际模式可比性的证据,同时研究人员对限定这一结论的混杂因素和假设保持明确态度。
相关新闻
生物通微信公众号
微信
新浪微博

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号