今日动态 返回首页
会员注册 登录 生物通快讯免费订阅
  • 首页 今日动态 人才市场 新技术专栏 中国科学人 云展台
    BioHot
    • 定制我的BioHot
    • 进入我的BioHot
    • 进入我的集采
    • 肿瘤癌症研究
    • 免疫/基因/细胞疗法
    • 神经生物学
    • 健康与疾病
    • 衰老机制与长寿
    • 单细胞技术
    • 基因编辑-CRISPR
    • RNA研究
    • 肠道菌与人体微生态
    • 细胞代谢
    • AI生物信息学
    • COVID
    云讲堂直播 会展中心 特价专栏 技术快讯 免费试用

  • 生物通官微
    陪你抓住生命科技
    跳动的脉搏

生物通首页  >  今日动态  >  正文

GridTradeRL:一种用于智能电网生产消费者网络中去中心化点对点能源交易的多智能体深度强化学习框架

《Scientific Reports》:GridTradeRL: a multi-agent deep reinforcement learning framework for decentralized peer-to-peer energy trading in smart grid prosumer networks

【字体: 大 中 小 】 时间:2026年07月24日 来源:Scientific Reports 4.9

编辑推荐:

  摘要随着分布式光伏发电和蓄电池储能技术在配电网终端领域的广泛应用,传统被动用电户逐渐转变为主动的产消者,这暴露出单向从电网购电、向电网售电的结算模式的局限性。点对点能源交易有望在本地社区内部解决分时电价带来的买卖价差问题,但由于其去中心化、非静态且部分可观测的特性,传统手工设计的

  

摘要

随着分布式光伏发电和蓄电池储能技术在配电网终端领域的广泛应用,传统被动用电户逐渐转变为主动的产消者,这暴露出单向从电网购电、向电网售电的结算模式的局限性。点对点能源交易有望在本地社区内部解决分时电价带来的买卖价差问题,但由于其去中心化、非静态且部分可观测的特性,传统手工设计的控制策略难以有效应对复杂情况。本文提出了GridTradeRL,这是一种用于智能电网产消者网络中去中心化点对点能源交易的多智能体深度强化学习框架。我们将交易问题建模为在一个包含N个产消者的异构社区中的部分可观测随机博弈,并采用在集中训练、分散执行框架下的多智能体扩展版双延迟深度确定性策略梯度算法来求解该问题。每个智能体都作为独立决策者,仅依据本地观测数据选择电池调度和竞价强度等连续动作,而训练则由能够获取完整观测-动作数据的集中式评估器来协调。当地市场每小时通过统一价格的双边拍卖进行清算。在包含8个产消者且采用分时电价的模拟社区中,经过训练的策略使社区的每日电力支出相比无交易基准降低了42.7%,相比基于规则的启发式方法降低了24.2%,同时有18.3%的能源通过双边点对点交易进行传输。与其它已有的训练方法相比,该策略的性能比独立DDPG高29.7%,比MADDPG高10.4%,并且在不需要预测或披露产消者私人数据的情况下,其性能仅比完美预见性模型预测控制方法低11.5%。我们还证明了该算法在2000次训练轮次、五种不同初始条件的情况下仍具有收敛稳定性,分析了奖励函数参数对算法性能的影响,研究了算法对观测噪声和通信中断的鲁棒性,以及其在最多64个产消者社区中的扩展能力;同时证明,该算法的中点清算规则能够实现公平的剩余电量分配(基尼系数为0.039)。此外,我们还设计了一种仅需350次训练轮次即可达到97.8%收敛性能的快速配置,该配置在单核CPU上使用纯NumPy实现,无需任何GPU加速,仅需224秒即可完成训练,显示出该框架适用于在边缘设备上进行夜间重新训练。本文附有完整的源代码、训练好的策略以及交互式仿真界面。

相关新闻
生物通微信公众号
生物通新浪微博
微信
新浪微博
我要投稿
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热搜:光伏产消者|多智能体强化学习|分布式能源交易|双延迟策略梯度|公平清算机制|边缘设备部署

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号