《Frontiers in Psychology》:A fractional differential equation model for student learning dynamics using anonymized learning analytics data
编辑推荐:
引言:学生学习是一个动态过程,既依赖当前投入,也依赖累积的学习经验。传统统计与机器学习方法往往忽略影响学习进程的时间记忆效应。研究人员利用匿名学习分析数据,构建了一个分数阶微分方程模型来表征学生学习动力学。方法:该框架使用公开的开放大学学习分析数据集(Open
引言:学生学习是一个动态过程,既依赖当前投入,也依赖累积的学习经验。传统统计与机器学习方法往往忽略影响学习进程的时间记忆效应。研究人员利用匿名学习分析数据,构建了一个分数阶微分方程模型来表征学生学习动力学。方法:该框架使用公开的开放大学学习分析数据集(Open University Learning Analytics Dataset, OULAD),从虚拟学习环境中的评估结果和交互记录构建连续时间变量。研究人员建立了Caputo分数阶微分方程以纳入记忆依赖的学习行为。基于经验数据估计模型参数,并采用L1有限差分格式获得数值解。通过预测精度、残差分析和敏感性分析评估模型性能。结果:模拟学习状态根据学生群体不同,从约0.52–0.58的初始值演化至0.66–0.78的稳态区间。该模型的均方误差约为0.004,决定系数约为0.88,表明预测与观察学习轨迹高度一致。残差较小且无偏,敏感性分析识别分数阶为控制长期学习行为最有影响的参数。讨论:结果表明,分数阶微分方程为记忆依赖学习过程建模提供了准确且可解释的框架。该方法通过学习投入模式和记忆相关学习特征,支持识别可能受益于及时教学干预的学生,为学习分析提供了实践洞见。
研究背景与问题:学生学习是受当前参与度和累积学习经验共同影响的动态过程。传统统计与机器学习方法多为静态或离散,难以刻画学习进程中的时间记忆效应;现有时间学习模型如贝叶斯知识追踪、深度知识追踪和循环神经网络等侧重预测性能,缺乏对记忆依赖学习机制的显式数学解释。同时,已有分数阶模型多为理论推导,缺乏大规模真实教育数据验证。为弥合数据驱动分析与理论建模之间的鸿沟,研究人员开发了基于匿名学习分析数据的分数阶微分方程模型,成果发表于《Frontiers in Psychology》。研究创新在于将离散交互与评估数据转化为连续时间变量,引入显式记忆项,并用公开数据完成参数校准与验证。
主要方法:以开放大学学习分析数据集(Open University Learning Analytics Dataset, OULAD)约32,000名学生为样本。将评估成绩与虚拟学习环境交互记录转换为连续时间变量,构造学习状态u(t)。模型采用Caputo分数阶导数(
CtD
α,一种可保持经典初值条件的分数阶微分算子)构成方程
CtD
αu(t)=βu(t)+γE
*(t)+δM(t)+S(x,t),以非线性最小二乘估计参数,并按时间顺序划分70%训练、15%验证、15%测试。用L
1有限差分格式(一种分数阶导数数值离散格式)求数值解;以均方误差(Mean Squared Error, MSE)、决定系数(coefficient of determination, R
2)、残差分析与敏感性分析评估模型。
结果如下。
3.1 学习行为与表现的描述性分析
通过约32,000名学生的交互与成绩数据描述性统计,发现参与度和成绩存在较大个体差异;归一化学习状态呈单峰分布,多数学生集中在0.50–0.75;日均参与度在课程初期上升、评估截止前出现峰值、后期下降;较高前教育水平和持续在学的学生通常具有更高参与度和表现。
3.2 分数阶学习模型的数值模拟
使用校准参数模拟后,学习状态从约0.52–0.58上升至0.66–0.78的稳态区间;高参与阶段增长更快,后期增速减缓并趋于饱和。模拟轨迹与观测轨迹在趋势和量级上高度一致。
3.3 记忆效应与分数阶动态分析
通过比较不同分数阶α的轨迹可知:α≈0.60时记忆效应强,轨迹更平滑、稳态值更高(约0.75–0.78);α≈0.75–0.80时与观测数据最吻合,稳态约0.70–0.74;α接近1.0时退化为近似无记忆经典系统,稳态较低(约0.66–0.70)且波动更明显。记忆增强使轨迹标准差从约0.12降至约0.07。
3.4 模型精度
模型预测与观测比较得到MSE≈0.004,R
2≈0.88;约91%的观测位于±10%偏差带内。残差均值≈0.002,标准差≈0.06,约94%残差位于±0.10内,Q-Q图显示近似正态,表明预测误差小且无系统偏差。
3.5 分数阶参数敏感性分析
分数阶α是最敏感参数,α变化使稳态学习状态在约0.62–0.80之间变动,总变幅约0.18;参与度系数γ主要影响学习进程速率;记忆系数δ提高稳定性,使学习状态标准差从约0.10降至0.06;内在学习系数β产生中等影响。
3.6 鲁棒性分析
改变预处理方案、初始状态、时间步长及对参数施加±10%扰动后,稳态学习状态保持在约0.69–0.73附近,最大偏差不超过约±0.03,说明模型稳定。另采用仅含评估成绩的替代学习状态定义重新标定,α从0.78变为0.76,MSE从0.0040升至0.0045,R
2从0.880降至0.867,主要结论保持不变。
讨论与局限:分数阶模型能捕捉经典方法无法表示的时间依赖与记忆效应,与语言习得等分数阶学习模型结果一致。与纯数据驱动模型相比,该框架兼具预测与解释能力,参数具有教育学含义。局限包括:仅基于OULAD单一数据集,外部效度待检验;模型未纳入动机、注意力、自我调节等认知心理因素;分数阶参数估计具有挑战性;数值离散存在近似误差;分数阶参数的解释仍需更多实证。未来方向包括纳入更多行为与心理变量、与贝叶斯知识追踪(Bayesian Knowledge Tracing, BKT)、深度知识追踪(Deep Knowledge Tracing, DKT)、长短期记忆网络(Long Short-Term Memory, LSTM)和门控循环单元(Gated Recurrent Unit, GRU)等模型系统比较、使用多课程纵向数据、开发高效数值算法并完善统计推断。
研究结论:研究人员开发了一个基于匿名学习分析数据的分数阶微分方程框架,以建模学生学习动力学。该研究表明,学习行为可有效表示为连续的、记忆依赖的过程,当前学习结果同时受到当前