强化学习个性化教学对专业英语教育中心理投入、自我调节学习与动机及表现的影响

《Frontiers in Psychology》:Reinforcement learning personalized instruction for psychological engagement self-regulated learning motivation and performance in professional English education

【字体: 时间:2026年08月11日 来源:Frontiers in Psychology 3.8

编辑推荐:

  自适应教育技术日益用于个性化学习路径。然而,关于强化学习(RL)个性化教学是否与专业英语教育中具有心理意义的学习结果相关的证据有限。研究人员在一项8周、16次课的专业英语项目中,对200名学习者比较了RL个性化教学路径与固定路径对照组。学生级数据包括基线特征、

  
自适应教育技术日益用于个性化学习路径。然而,关于强化学习(RL)个性化教学是否与专业英语教育中具有心理意义的学习结果相关的证据有限。研究人员在一项8周、16次课的专业英语项目中,对200名学习者比较了RL个性化教学路径与固定路径对照组。学生级数据包括基线特征、英语熟练度、心理投入、自我调节学习(SRL)、动机、用户体验与表现结果;会话级数据捕捉学习者状态、教学动作、策略类型、奖励值、难度、任务类别、正确率、反应时、任务完成、任务时长与即时投入过程分。两组在基线与英语熟练度上可比。RL个性化组在过程级学习活动上更高:奖励值更高、难度暴露更多、完成任务更多、任务时长更长、反应时更短、任务正确率更高、即时投入过程分更高。干预后结果同样有利于RL个性化组:心理投入、SRL、动机、用户体验、增益分与最终成就均更优。调整模型在控制基线英语熟练度与参与者级协变量后关联仍成立。由于未测基线心理投入、SRL与动机,心理结果被解释为调整后的干预后组间差异而非个体内提升。这些发现表明,当学习者状态估计、难度校准、反馈、专业任务相关性与自我调节支持被整合进学习设计时,RL个性化专业英语路径可支持具有心理响应性的自适应教学。
研究背景与问题提出
人工智能(Artificial Intelligence, AI)在教育技术中的角色已从自动测评与辅导扩展到个性化、预测、反馈生成、学习者建模与自适应学习设计。在语言教育尤其是专业英语教育(Professional English education)中,学习者在先验熟练度、任务弱项、沟通目标、动机与自我调节能力上存在显著异质性。现有个性化学习多依赖规则路径、静态画像或有限推荐,少有系统能基于行为反馈持续更新教学决策。强化学习(Reinforcement Learning, RL)具备动态个性化理论框架,可通过动作选择、状态观测、奖励反馈与策略更新实现任务排序、难度调整与路径个性化,但已有RL教育研究多聚焦技术优化与成绩预测,对心理投入(psychological engagement)、自我调节学习(Self-Regulated Learning, SRL)与动机等心理过程关注不足。因此,研究人员开展本研究,检验RL个性化路径是否在专业英语情境中同时关联心理投入、SRL、动机、用户体验与英语表现。
研究设计与样本队列
论文发表于《Frontiers in Psychology》。研究采用两臂平行组对照干预设计,于2025年9月15日至12月20日开展,干预期为10月1日至11月26日共8周16次结构化会话。200名成年学习者来自商务管理、工程、健康科学、社会科学、计算机科学等专业英语项目,按1:1计算机随机分配至RL个性化组(100人)与固定路径对照组(100人)。两组共用平台、内容库、日程与测评结构,唯一区别为任务选择规则:对照组走预设固定序列,实验组由约束型表格Q学习(tabular Q-learning)策略按学习者状态、先验表现、任务类别、难度与奖励反馈推送自适应推荐。基线仅测英语熟练度,未测心理基线,故心理结果为调整后组间差异解释。
主要关键技术方法
研究人员构建学习者状态估计器,用前序滚动正确率Ai,t-1、任务完成Ci,t-1、过程投入Ei,t-1与反应时效率Ti,t-1按权重0.50、0.20、0.15、0.15合成准备度Rit并离散为4态。奖励函数避开心理问卷,用任务正确率Acc、完成Comp、反应时效率RTE与难度契合DF按0.40、0.25、0.20、0.15加权得原始奖励RRit,线性重标至?1至+1。Q值更新采用Qt+1=Qt+α[rt+γmaxaQt(st+1,a)?Qt],学习率α=0.10、折扣γ=0.90,早期ε从0.30降至0.05的ε-greedy探索,后期转入情境策略精修。数据链为学生级200条与会话级3200条(200×16),用混合效应模型与调整线性模型分析。
研究结果
2.1 研究设计、场景与设计依据:两臂对照、1:1分配、16次会话、3200条会话记录,主要结果为干预后心理投入总分,次要为SRL、动机、后测分、增益分、任务正确率、最终成就与用户体验;因无法对学习者与教师盲法,组标签在清洗时编码以降低分析偏倚。
2.2 参与者、招募、分配与知情同意:自愿招募、完成基线熟练度测评并签匿名数据同意,排除未同意或缺失基线者,组间在人口学与先验英语分上可比。
2.3 数据集结构与链接:学生级含人口学、基线熟练度、心理与表现;会话级含状态、动作、策略、奖励、难度、类别、正确率、反应时、完成、时长、即时投入;以匿名ID关联,无延迟随访故仅分析即时后测。
2.4 专业英语项目与教学可比性:五类任务族(词汇、阅读、写作/邮件、口语/演示、案例沟通)两组同享;差异仅序列规则、动态难度1–5级、自适应反馈与自调提示,过程剂量作为指标而非等效假设。
2.5 强化学习个性化框架:含状态估计、复合动作(教法动作+任务类别+难度)、策略类型(0固定/1 ε-greedy Q/2情境精修)、奖励值、Q更新;明确状态估计不用后测问卷,奖励不含心理投入总分,即时投入仅作描述过程指标。
2.5.1 学习者状态估计:Rit=0.50A+0.20C+0.15E+0.15T,按<0.50/0.50–0.65/0.65–0.80/≥0.80离散为1–4态。
2.5.2 独立于投入的奖励函数:RRit=0.40Acc+0.25Comp+0.20RTE+0.15DF,Rewardit=2×RRit?1,范围?1至+1。
2.5.3 Q学习更新、探索与策略过渡:α=0.10,γ=0.90,ε由0.30降至0.05,低准备态限 remediation/reinforcement,高准备态开 difficulty/scenario/advanced,因仅16次会话视作约束自适应程序而非全收敛策略。
2.6 变量与测量工具:心理投入为认知/情绪/行为三维1–5 Likert均值(α=0.688,ω=0.829);SRL为goal/plan/monitor/revision四维均值(α=0.723,ω=0.828);动机为intrinsic/interest/usefulness三维均值(α=0.739,ω=0.852);用户体验含satisfaction/personalization/feedback quality(α=0.822,ω=0.902);基线熟练度四域均值α=0.952,ω=0.966。
2.7 结果定义:增益分=后测?前测;任务正确率=正确尝试/总尝试×100;最终成就按课程量规0–100。
2.8 数据管理:学生级200、会话级3200全完整,范围核查、公式重算、极端值仅越界删。
2.9 样本量与效能:每组100人可检d=0.40中等效应,会话级3200用含随机截距混合模型。
讨论与结论翻译
研究人员指出,RL个性化专业英语路径相较固定路径在过程级活动(更高奖励值、难度暴露、任务完成、任务时长、更短反应时、更高正确率与即时投入分)与干预后心理投入、SRL、动机、用户体验、增益分及最终成就上均占优,且在控基线熟练度与协变量后关联稳固。因缺心理基线,心理结果应解读为调整后组间差而非个体内改善。结论表明:当学习者状态估计、难度校准、反馈、专业任务相关性与自我调节支持被整合进学习设计时,RL个性化专业英语路径可支持具有心理响应性的自适应教学。该研究填补了RL教育应用中心理过程证据的空白,为专业英语情境中联合优化成绩与心理投入的自适应系统设计提供方法学范式,但因果仅限RL路径包(含反馈、难度、自调提示等协同特征)而非孤立Q算法效应,且普适性受8周、200人、无随访限制。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号