《British Journal of Mathematical and Statistical Psychology》:Review of cognitive diagnostic models (CDMs): Recent methodological advancements for addressing practical challenges
编辑推荐:
认知诊断模型(Cognitive Diagnostic Models, CDMs)已成为提供个体认知技能掌握精细信息的重要工具。既往综述多聚焦于统计基础与深度学习进展,本研究则系统梳理近期旨在解决CDM跨场景应用瓶颈的方法论创新。研究人员重点归纳六大进展:1)
认知诊断模型(Cognitive Diagnostic Models, CDMs)已成为提供个体认知技能掌握精细信息的重要工具。既往综述多聚焦于统计基础与深度学习进展,本研究则系统梳理近期旨在解决CDM跨场景应用瓶颈的方法论创新。研究人员重点归纳六大进展:1)扩展模型以容纳多分类属性(polytomous attributes),实现熟练度的多级刻画;2)探索属性间关系,揭示学习轨迹以支持教学设计;3)发展计算策略加速参数估计,提升高维属性场景下的可扩展性;4)改进小样本情境下的估计精度,契合课堂评估需求;5)融合统计与机器学习方法优化Q矩阵(Q-matrix)的标定与估计;6)完善模型与项目拟合评价体系。上述进展共同增强了CDM的可解释性、效率与适用性,拓展了其在各类规模评估中的应用广度。本综述通过强调直面应用障碍的创新,弥补了现有研究的空白,并指出未来与深度学习及大语言模型融合的潜力。
《British Journal of Mathematical and Statistical Psychology》刊发的这篇综述针对认知诊断模型在传统教育测量向形成性评价范式转型中的核心需求展开。传统经典测验理论(CTT)和项目反应理论(IRT)仅能估计单维综合能力,难以解析题目作答背后的具体子技能结构,而受限潜类别模型(Restricted Latent Class Models, RLCMs)虽通过Q矩阵建立属性与题目的映射关系实现了精细化诊断,却在属性粒度、计算效率、小样本适应性及验证方法等方面存在应用瓶颈。为此,研究人员系统梳理了近年来的六大方法论突破,旨在为教育测评及其他领域提供更具操作性的诊断工具。该研究的重要意义在于明确了CDM从理论模型向实践工具转化的关键路径,为个性化学习与精准教学提供了方法论支撑。
研究采用文献概念综述法,通过筛选心理测量学核心期刊2020年后发表的、与建模、估计及验证主题相关的高代表性文献,排除了已被其他近期综述详细讨论的内容,聚焦于解决实际应用场景中痛点的方法论创新。关键技术方法包括:构建多分类属性的哑变量编码与累积编码框架以实现属性水平的灵活表征;应用正则化惩罚(如L1、对数惩罚)于混合比例以探索属性层级结构;开发矩阵运算优化、潜剖面空间压缩及两阶段估计算法以提升高维属性下的计算效率;引入限制性DINA模型(R-DINA)及贝叶斯收缩先验以解决小样本下的估计不稳定性;结合机器学习算法(如随机森林、前馈神经网络)与信号检测理论指标(如β指数)进行Q矩阵的精细化校准与估计;综合运用绝对与相对拟合指数、残差分析及新型卡方统计量进行模型与项目的全局及局部拟合检验。
研究结果部分,研究人员首先阐述了多分类属性建模的进展。通过对比有序类别属性编码(OCAC)、广义诊断模型(GDM)及饱和多分类CDM(sp-CDM)等不同框架,指出哑变量编码和累积编码能最大程度保留属性水平间的交互效应,且可将多分类属性等价转化为带线性约束的二分类属性向量,从而兼容既有二分类CDM的估计算法。其次,在属性关系发现方面,研究区分了验证式与探索式两类路径。验证式方法如层级DCM(HDCM)的似然比检验,而探索式方法则涵盖基于混合比例稀疏化的潜变量选择、纵向潜转变分析(LTA)中的转移概率正则化,以及新兴的因果发现(CD)算法与序次理论(OT)的混合框架,后者能有效识别属性间的弱因果关系与方向性。第三,关于高速估计,研究强调了矩阵运算优化对对数似然计算的关键作用,并通过惩罚混合比例、序贯Gibbs抽样(将复杂度从O(2K)降至O(K))以及分离θ参数更新与模型参数优化的两阶段算法,显著提升了高维场景下的计算效率。第四,针对小样本挑战,研究对比了非参数认知诊断方法(如基于加权差异最小化的聚类算法GNPC)与参数方法的优劣,指出限制性DINA模型及贝叶斯收缩先验能在降低估计方差与控制偏差间取得平衡,更适用于课堂级评估。第五,在Q矩阵标定与优化方面,研究总结了基于残差平方和(RSS)、广义判别指数(GDI)及β指数的验证方法,并介绍了利用因子分析、L1正则化EM算法及贝叶斯尖峰- slab先验进行Q矩阵估计的探索性方法,特别指出机器学习驱动的方法在平衡欠指定与过指定误差上优于传统统计指标。最后,在模型拟合评价部分,研究梳理了包括信息准则(AIC/BIC)、M2统计量、RMSEA、SRMSR在内的全局拟合指标,以及基于皮尔逊卡方、S-X2、G2、Wald检验、GDI、β指数及凸包分析的项目层面拟合方法,并针对多分类反应数据提出了边际拟合检验的新进展。
讨论部分,研究人员指出本综述与Zhang等(2023)及Wang等(2024)的综述形成互补,聚焦于消除应用障碍的创新点。未来研究方向包括:将项目与属性文本内容嵌入统一语义空间以构建内容先验Q矩阵,进而利用贝叶斯方法进行细化;探索深度认知诊断模型(deep-CDM)的分层架构以替代显式属性层级假设;进一步适配迫选(forced-choice)与建构性反应题型,并利用自然语言处理技术实现开放题的认知诊断。研究结论强调,近期的方法论进展通过增强建模灵活性、计算效率、小样本适用性、拟合评价及Q矩阵优化,使CDM成为大规模测试与课堂评估中更稳健的工具。融合深度学习、内容信息先验及生成式框架,将是未来实现诊断精度与个性化学习需求对齐的关键路径。