
-
生物通官微
陪你抓住生命科技
跳动的脉搏
GridTradeRL:一种用于智能电网生产消费者网络中去中心化点对点能源交易的多智能体深度强化学习框架
《Scientific Reports》:GridTradeRL: a multi-agent deep reinforcement learning framework for decentralized peer-to-peer energy trading in smart grid prosumer networks
【字体: 大 中 小 】 时间:2026年07月24日 来源:Scientific Reports 4.9
编辑推荐:
摘要随着分布式光伏发电和蓄电池储能技术在配电网终端领域的广泛应用,传统被动用电户逐渐转变为主动的产消者,这暴露出单向从电网购电、向电网售电的结算模式的局限性。点对点能源交易有望在本地社区内部解决分时电价带来的买卖价差问题,但由于其去中心化、非静态且部分可观测的特性,传统手工设计的
随着分布式光伏发电和蓄电池储能技术在配电网终端领域的广泛应用,传统被动用电户逐渐转变为主动的产消者,这暴露出单向从电网购电、向电网售电的结算模式的局限性。点对点能源交易有望在本地社区内部解决分时电价带来的买卖价差问题,但由于其去中心化、非静态且部分可观测的特性,传统手工设计的控制策略难以有效应对复杂情况。本文提出了GridTradeRL,这是一种用于智能电网产消者网络中去中心化点对点能源交易的多智能体深度强化学习框架。我们将交易问题建模为在一个包含N个产消者的异构社区中的部分可观测随机博弈,并采用在集中训练、分散执行框架下的多智能体扩展版双延迟深度确定性策略梯度算法来求解该问题。每个智能体都作为独立决策者,仅依据本地观测数据选择电池调度和竞价强度等连续动作,而训练则由能够获取完整观测-动作数据的集中式评估器来协调。当地市场每小时通过统一价格的双边拍卖进行清算。在包含8个产消者且采用分时电价的模拟社区中,经过训练的策略使社区的每日电力支出相比无交易基准降低了42.7%,相比基于规则的启发式方法降低了24.2%,同时有18.3%的能源通过双边点对点交易进行传输。与其它已有的训练方法相比,该策略的性能比独立DDPG高29.7%,比MADDPG高10.4%,并且在不需要预测或披露产消者私人数据的情况下,其性能仅比完美预见性模型预测控制方法低11.5%。我们还证明了该算法在2000次训练轮次、五种不同初始条件的情况下仍具有收敛稳定性,分析了奖励函数参数对算法性能的影响,研究了算法对观测噪声和通信中断的鲁棒性,以及其在最多64个产消者社区中的扩展能力;同时证明,该算法的中点清算规则能够实现公平的剩余电量分配(基尼系数为0.039)。此外,我们还设计了一种仅需350次训练轮次即可达到97.8%收敛性能的快速配置,该配置在单核CPU上使用纯NumPy实现,无需任何GPU加速,仅需224秒即可完成训练,显示出该框架适用于在边缘设备上进行夜间重新训练。本文附有完整的源代码、训练好的策略以及交互式仿真界面。