具有方差缩减的分布式自适应Softmax策略梯度方法:全局收敛性分析
《Mathematics》:Distributed Adaptive Softmax Policy Gradient Method with Variance Reduction: A Global Convergence Analysis
【字体:
大
中
小
】
时间:2026年07月19日
来源:Mathematics 2.3
摘要
分布式策略梯度方法已成为多智能体强化学习中寻找最优策略的主流技术。然而,作为理论收敛性能最基本衡量标准的全局收敛性保证,在现有的分布式策略梯度方法中很少被使用。此外,现有方法的收敛行为对学习率的选择十分敏感,这导致了收敛速度较慢。为解决这一难题,我们提出了一种新的分布式自适应softmax策略梯度算法——DASPG,该算法将Adam型更新机制和方差降低技术引入传统的分布式策略梯度方法中。同时,我们还为DASPG建立了全局收敛性保证,即可以用的样本复杂度找到-最优策略,其样本效率与现有的主流集中式策略梯度方法相当。最后,我们通过实验结果证明了所提算法的有效性。
生物通微信公众号
生物通新浪微博
今日动态 |
人才市场 |
新技术专栏 |
中国科学人 |
云展台 |
BioHot |
云讲堂直播 |
会展中心 |
特价专栏 |
技术快讯 |
免费试用
版权所有 生物通
Copyright© eBiotrade.com, All Rights Reserved
联系信箱:
粤ICP备09063491号