基于电气先验知识的图注意力强化学习用于配电系统恢复

《Machines》:Graph Attention Reinforcement Learning with Electrical Prior Knowledge for Distribution System Restoration

【字体: 时间:2026年08月11日 来源:Machines 3.0

编辑推荐:

  配电系统恢复(DSR)因频繁的拓扑变化和复杂的节点相互作用而变得日益具有挑战性,尤其是在分布式能源(DER)高渗透率的系统中。现有的深度强化学习(DRL)方法在表示节点间关系以及融入领域先验知识方面仍存在局限性。因此,研究人员提出了一种基于图注意力的耦合感知强

  
配电系统恢复(DSR)因频繁的拓扑变化和复杂的节点相互作用而变得日益具有挑战性,尤其是在分布式能源(DER)高渗透率的系统中。现有的深度强化学习(DRL)方法在表示节点间关系以及融入领域先验知识方面仍存在局限性。因此,研究人员提出了一种基于图注意力的耦合感知强化学习方法。从非欧几里得空间视角出发,该方法利用配电功率传输因子(DPTF)量化节点间的电气耦合强度。所得耦合强度被嵌入图邻接矩阵的条目中,使模型能够捕捉由功率传输驱动的复杂节点相互作用。研究人员进一步开发了一种感知图注意力网络(AGAT),其中将带有先验知识的邻接矩阵作为注意力系数计算中的偏置项引入。这种设计引导GAT生成富含物理信息的差异化节点表示。基于提取的图特征,采用近端策略优化(PPO)来确定恢复决策。在IEEE 34节点系统上的案例研究表明,所提方法在训练收敛性、恢复功率和在线决策效率方面均优于基准算法,实现了快速有效的配电系统恢复。
**论文解读:基于电气先验知识的图注意力强化学习用于配电系统恢复**

**研究背景与问题**
配电系统作为电力系统与终端用户之间的关键接口,其可靠性直接影响居民生活、工业生产和公共服务。近年来,气候相关的极端事件日益频繁,导致配电系统故障呈现更加突发性和空间集中的特点。由于配电系统支路数量众多且开关设备地理分散,故障隔离和网络重构的延迟可能导致更广泛的负荷中断。因此,配电系统恢复(DSR)成为提升供电可靠性和系统韧性的重要技术措施。DSR的核心目标是根据故障位置、网络拓扑和可用开关状态快速确定合适的重构方案,从而通过备用路径或本地电源尽可能恢复停电区域。随着分布式能源(DER)在配电侧的持续集成,故障恢复的运行条件发生显著变化。这些可控资源能够在故障后支持本地负荷,从而提高配电网络恢复的灵活性。同时,DER渗透率的增加正逐步将传统的单电源辐射状配电网络转变为具有多个耦合电源的有源配电网络(ADN)。在恢复过程中,开关操作改变网络连通性,而DER的位置和容量重塑潮流传输路径,导致节点间相互作用更加复杂。因此,准确表征节点间的电气关系并利用此信息识别有效的供电恢复路径,已成为含DER配电网络DSR中的关键问题。

现有研究方面,早期基于精确数学模型的优化方法(如数学规划)虽能获得最优或接近最优的恢复解,但随着网络规模增长和DER渗透率提高,其可扩展性、计算可处理性及实时决策适用性越来越受限。启发式和元启发式算法提供了更灵活的方式,但常对搜索过程敏感且可能收敛到局部最优。近年来,深度强化学习(DRL)方法受到广泛关注,其不依赖精确数学模型,通过与环境交互学习最优策略,训练后可实现毫秒级自主实时决策。然而,现有DRL方法大多将电网状态视为扁平向量输入全连接网络,忽略了配电网络的拓扑结构和空间特性。少量图神经网络方法虽引入图结构,但仅使用简单二元邻接矩阵描述物理连接,无法表征节点间由功率传输驱动的电气耦合强度。因此,如何将电气先验知识有效融入图强化学习框架,提升智能体对复杂运行状态的感知能力和恢复决策性能,成为亟待解决的问题。

**研究内容与结论**
针对上述问题,研究人员提出了一种基于图感知的强化学习(GARL)方法,将电气先验知识嵌入DSR决策过程。具体而言,引入配电功率传输因子(DPTF)增强图结构中节点耦合的表征,使智能体能够在极端故障场景下识别更有效的恢复路径并做出改进决策。主要贡献包括:(1)从非欧几里得空间视角建模强耦合和弱耦合节点对,利用DPTF量化节点间耦合强度,并将其融入图构建,使模型能够捕捉系统的空间结构及电气物理特性,理解复杂功率传输驱动的节点相互作用如何影响恢复决策。(2)在强化学习框架中集成感知图注意力网络(AGAT)用于节点特征提取和聚合,将富含先验知识的邻接矩阵作为注意力得分计算中的偏置项,引导节点权重的自适应优化,从而生成富含物理信息的差异化节点表示。(3)采用近端策略优化(PPO)框架进行DSR,结合PPO的稳定策略更新能力与配电系统的耦合图表示,使策略显式利用节点交互信息,提升智能体的训练效率和复杂故障场景下的在线恢复性能。在修改后的IEEE 34节点系统上进行的案例研究表明,所提方法在训练收敛性、恢复功率和在线决策效率方面均优于基准算法(DQN、PPO、GRL、MILP),实现了快速有效的配电系统恢复。该论文发表在《Machines》期刊。

**主要技术方法**
研究人员采用的关键技术方法包括:(1)配电功率传输因子(DPTF)计算:基于当前网络拓扑和支路参数构建节点导纳矩阵,通过稀疏LU分解求解节点阻抗矩阵,进而计算每个支路对节点功率注入扰动的响应强度,并聚合得到节点间耦合强度,最后进行归一化和稀疏化处理。(2)感知图注意力网络(AGAT):将基于DPTF的节点耦合强度作为邻接矩阵元素,取代传统二元连接矩阵;在注意力系数计算中引入该邻接矩阵作为可学习偏置项,引导网络关注强耦合节点对,并通过多头注意力机制增强表达能力。(3)近端策略优化(PPO)算法:基于演员-评论家框架,采用裁剪概率比和优势函数更新策略,确保策略更新的稳定性;演员网络输出开关动作概率分布,评论家网络估计状态价值。测试系统为修改后的IEEE 34节点系统,其中包含3个构网型DER和1个跟网型DER,负荷数据来自OpenDSS年负荷曲线,故障场景随机生成(故障线比例20%-50%)。

**研究结果**
**3.1 实验设置**:在IEEE 34节点系统上验证,总负荷1.769 MW,DER容量分别为200 kW、144 kW、146 kW和96 kW。计算平台为NVIDIA Quadro P4000 GPU、3.40 GHz CPU、32 GB RAM,算法基于Python 3.8、PyTorch 1.12.1、OpenAI Gym 0.21.0,MILP模型使用Gurobi 11.0求解。训练环境基于OpenDSS进行潮流计算,随机生成大量故障场景,负荷数据随机采样,测试阶段改变DER位置以评估泛化能力。超参数设置:AGAT为单层4头注意力,隐藏维度32,输出128维;PPO演员网络4层(128,256,256,128),评论家网络2层(256,256),学习率0.0003,折扣因子0.99,裁剪比0.2,批大小64,展开长度176,并行环境数12。

**3.2 训练性能**:比较DQN、PPO、GRL和GARL在IEEE 34节点系统上的训练曲线(5种随机种子)。GARL方法平均奖励上升最快,最终收敛奖励最高(0.645),标准差最小,表明训练稳定性最优。DQN和PPO因使用向量化状态表示,忽略网络拓扑,训练效率低;GRL引入GAT有所改善,但仍无法区分节点间功率传输影响强度;GARL通过DPTF耦合强度提供明确的功率相关指导,使智能体更高效地识别关键供电路径和强耦合节点。

**3.3 恢复性能**:
**3.3.1 典型线路故障场景测试**:在三种代表性故障场景下比较各方法,GARL的恢复功率与MILP接近,且在所有RL方法中最高。在场景1中,DQN错误闭合故障开关;场景3中,PPO错误闭合故障开关,表明忽视拓扑和节点功率相关性导致不合理操作。GARL通过动作屏蔽机制避免此类错误。在场景2(严重故障)中,GARL恢复功率超过600 kW,显著高于其他RL算法。电压分布显示,除场景3中孤岛区域因DER容量限制出现电压越限外,其余节点电压均维持在0.9-1.1 p.u.范围内。

**3.3.2 复合故障场景测试**:在场景4(关键DER退出)、场景5(恒功率负荷比例增加至50%)、场景6(DER渗透率降至20%)中,GARL在所有场景下恢复功率最高,且电压越限率为0%,表明其具有较强的泛化能力和鲁棒性。

**3.4 电气先验知识对模型性能的影响**:
**3.4.1 稀疏化阈值的影响**:比较不同阈值(0, 0.05, 0.10, 0.15, 0.20)下的性能。当阈值为0.10时,模型恢复功率最高,图连通性适中。过大或过小的阈值导致图结构过稀或过密,降低恢复性能。
**3.4.2 注意力偏置项的消融研究**:比较三种设置(不引入偏置、固定偏置、可学习偏置)。可学习偏置设置下恢复功率最高,电压越限率最低,表明自适应偏置机制帮助演员网络更准确地识别有效供电路径和DER支持区域,提高模型适应性和恢复性能。

**3.5 训练与在线决策的计算效率**:GARL所需训练步数最少(约0.11小时收敛),训练时间最短;在线决策时间保持在毫秒级(优于MILP的0.9645秒),满足实时性要求。

**讨论与结论**
**讨论部分总结**:该研究提出的GARL方法通过将电气先验知识嵌入图强化学习框架,显著提升了智能体在含高渗透率DER配电系统恢复中的决策性能。在IEEE 34节点系统上的验证表明,该方法在训练收敛性、恢复功率和在线决策效率方面均优于现有RL方法。稀疏化阈值和注意力偏置参数的消融研究进一步显示,电气耦合信息应适当保留,且其影响应自适应调整,以改进模型整体性能。此外,该方法展现了强计算效率,在保持毫秒级决策速度的同时实现最快训练收敛,满足在线恢复决策的实时性要求。然而,该方法仅在IEEE 34节点系统上验证,未来需在更大规模不同拓扑配电系统上评估跨网络泛化能力;同时,恢复过程中的严格安全保证仍有限,未来可引入安全层、实时潮流验证或先进约束强化学习方法进一步提升恢复策略的可靠性。

**研究结论部分翻译**:本文提出了一种用于含高渗透率DER配电系统恢复的GARL方法。通过将电气先验知识融入图强化学习框架,所提方法改善了智能体的恢复决策性能。该方法在修改后的IEEE 34节点系统上得到验证,主要发现总结如下:所提方法在训练期间获得最高的收敛奖励。在测试阶段,面对未见过的极端故障场景,其恢复性能显著优于其他强化学习算法,在测试的IEEE 34节点系统和所考虑的运行条件范围内展现出良好的适应性和鲁棒性。关于稀疏化阈值和注意力偏置参数的消融研究进一步表明,应适当保留电气耦合信息,并自适应调整其影响,以改善模型整体性能。此外,所提方法具有强计算效率,它在保持毫秒级决策速度的同时实现了最快的训练收敛,满足了在线恢复决策的实时性要求。本工作也存在若干局限性。所提方法仅已在IEEE 34节点系统上验证。未来工作将评估其在具有不同网络拓扑的更大配电系统上的跨网络泛化能力。此外,恢复过程中的严格安全保证仍有限。未来研究可引入安全层、实时潮流验证或先进的约束强化学习方法,以进一步提高恢复策略的可靠性。
相关新闻
生物通微信公众号
微信
新浪微博

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号