
-
生物通官微
陪你抓住生命科技
跳动的脉搏
基于深度强化学习的思想政治教育资源推荐系统
《Scientific Reports》:Deep reinforcement learning-based resource recommendation system for ideological and political education
【字体: 大 中 小 】 时间:2026年07月24日 来源:Scientific Reports 4.9
编辑推荐:
摘要在数字教育与人工智能技术不断发展的背景下,思想政治教育相关的应用场景(如高校教学、企业培训以及社区实践)对精准的资源推荐提出了越来越高的需求。然而,现有的大多数方法都依赖于静态算法,无法体现用户行为与资源特征之间的非线性关系,也无法满足多种场景下的个性化学习需求。因此,本研究
在数字教育与人工智能技术不断发展的背景下,思想政治教育相关的应用场景(如高校教学、企业培训以及社区实践)对精准的资源推荐提出了越来越高的需求。然而,现有的大多数方法都依赖于静态算法,无法体现用户行为与资源特征之间的非线性关系,也无法满足多种场景下的个性化学习需求。因此,本研究提出了一种基于软演员-评论家算法的思想政治教育资源推荐系统(软演员-评论家算法属于深度强化学习算法)。该系统将行为数据(如用户的浏览记录、学习时长和评分等)与资源特征相结合,通过状态-动作-奖励机制动态优化推荐策略,并引入折扣因子以平衡即时收益与长期收益,从而实现更智能的资源匹配。研究基于来自高校、企业和社区的三种类型的思想政治教育数据集进行了实验验证。结果表明,在高校数据集上,该算法的10次点击率为0.6025,10次标准化折现累积增益为0.381;在企业数据集上,相应指标分别为0.47和0.3715;在社区数据集上,10次点击率和10次标准化折现累积增益分别为0.5942和0.376。所有指标值均优于其他对比方法,包括线性上置信界算法、深度Q网络算法、动态图推荐算法、知识感知型协作图网络算法以及多通道超图卷积网络算法。该模型在大约400次训练后即可达到稳定收敛状态,平均奖励值为0.390;同时,在30天用户重复学习率等长期指标方面也表现优异。这些研究结果表明,基于软演员-评论家算法的深度强化学习方法能有效提升思想政治教育资源推荐的准确性、稳定性及动态适应性,同时也为多场景下思想政治教育的数字化发展提供了理论依据和实践参考。