基于半监督松弛的替代学习用于交流最优潮流

《Engineering Applications of Artificial Intelligence》:Alternative learning with semi-supervised relaxation for alternating-current optimal power flow

【字体: 时间:2026年09月09日 来源:Engineering Applications of Artificial Intelligence 9.0

编辑推荐:

   ## 摘要 向更大规模、更具动态特性的电力系统转型,催生了能够快速提供大规模网络高效计算解的交流最优潮流(AC-OPF)方法的需求。传统AC-OPF求解器可能对于高频运行决策而言过于缓慢,而现有的基于学习的方法往往在标签需求、约束满足与可扩展性之间面临权衡。本文提出了一种名

  

## 摘要

向更大规模、更具动态特性的电力系统转型,催生了能够快速提供大规模网络高效计算解的交流最优潮流(AC-OPF)方法的需求。传统AC-OPF求解器可能对于高频运行决策而言过于缓慢,而现有的基于学习的方法往往在标签需求、约束满足与可扩展性之间面临权衡。本文提出了一种名为AltOPF的机器学习(ML)框架,该框架交替执行两种更新:一种是基于辅助热极限松弛AC-OPF表述的有监督更新,另一种是针对原始非凸AC-OPF问题的嵌入约束的无监督更新。两个阶段更新同一个紧凑神经网络,并采用增广拉格朗日乘子自适应地强调持续存在的约束违反。此外,我们开发了一种可选的交流潮流投影,以改善预测结果的物理一致性。在理想化收敛分析中,我们证明了相应的随机次梯度方法具有遍历收敛性至Clarke平稳点。本文考虑固定网络拓扑下的基础AC-OPF问题;拓扑变化和潮流分析不在研究范围之内。AltOPF在162节点、300节点和1354节点基准系统以及韩国电力交易所(KPX)真实的4492节点网络上进行了评估。在分布内测试集上,相对于MATPOWER参考解,其成本差异低于1%,约束满足率超过99%,优于六个已建立的基线方法。原始神经网络前向传播仅需微秒级推理时间,而紧凑架构在相同批设置下将检查点大小减少75%,峰值GPU显存减少约40%。这些结果表明,AltOPF为大规模固定拓扑系统中快速AC-OPF候选解生成提供了一种标签和资源高效的方法。

## 引言

电力系统是发电、输电和配电的基础设施,确保电能可靠地输送至终端用户。这些网络的高效运行需要求解交流最优潮流(AC-OPF)问题,这是一个旨在确定发电资源最优调度方案同时满足关键运行约束的数学优化框架,包括功率平衡、电压限值和输电线路容量等约束。

AC-OPF的建模与求解方法一直以运行可靠性、经济效率以及对电网物理与监管约束的遵守为指导。传统上,数值优化技术,特别是非线性规划(NLP)和内部点法,由于其能够处理问题固有的非凸性,成为主要的计算方法。然而,随着电力系统规模扩大和可再生能源接入比例增加,实时AC-OPF的计算负担显著增加,限制了其在安全、经济和灵活运行中的实用性,并推动了对更高效求解方法的研究。

尽管AC-OPF至关重要,但由于其非凸性质以及现代电力系统的高维特性,求解仍面临巨大计算挑战。传统AC-OPF求解器依赖数学规划技术,主要使用单核CPU,虽然能有效处理凸优化,但在AC-OPF的非凸性和实时应用的可扩展性方面存在困难。为加速计算,多核CPU和GPU已被用于利用数值求解器中的大规模并行性,取得了显著加速效果(Shin等人,2024;Kim和Kim,2022)。尽管GPU加速AC-OPF展现了显著的速度提升,但现有的GPU求解器仍然缺乏实时应用所需的数值稳定性和鲁棒性。例如,在本文作者的近期研究中,采用两种替代算法(提升方法和混合KKT方法)的GPU求解器在29个实例中有1个未能收敛(Pacaud等人,2024年表1),而CPU求解器在所有实例上均成功收敛。这凸显了在实用场景中确保基于GPU的AC-OPF求解器可靠性和鲁棒性的进一步研究需求。此外,即使GPU求解器在大规模实例上显著快于CPU求解器,它们本质上仍基于相同的数学规划技术,如内部点法。这意味着复杂的数值运算,如符号分析、矩阵分解和三角求解,必须在求解器内完成,因此可实现的速度提升受到这些运算计算复杂度的限制。例如,Pacaud等人(2024)中的GPU求解器即使在最大的70000节点实例上最多也只能实现10倍的加速。

基于机器学习(ML)的方法提供了一种替代方案,通过前馈神经网络(NN)评估替代大部分在线数值优化。这种直接映射可以显著减少在线计算,因为它避免了重复的分解和迭代求解过程。计算成本则转移至离线训练阶段,这可能需要进行昂贵的标签数据标注和大量资源消耗。因此,实现可靠的约束满足并将训练过程扩展到大型网络仍然是核心挑战。

近期的研究探索了电力系统的基础模型范式以及大规模AC-OPF代理学习(Hamann等人,2024;Jin等人,2026)。面向拓扑和基于图的方法也得到了发展,以改善可扩展性、可迁移性以及适应网络变化的能力(Yang等人,2024;Arowolo和Cremer,2025;Deihim等人,2024;Li等人,2025;Hu等人,2026;Owerko等人,2024)。其他工作则专注于运行安全、潮流处理、可行性感知学习和显式生成满足约束解的机制(Wu等人,2024;Piloto等人,2024;Pham和Li,2024;Ma等人,2026;Nguyen和Donti,2026;Ajeyemi等人,2026)。基于物理和优化的辅助方法以及最新的基准数据集,进一步解决了数据驱动松弛、分解、求解器加速以及在负荷、发电和拓扑变化下的鲁棒性问题(Tian等人,2026;Jang等人,2026;Wang和Srikantha,2026;Rajaei等人,2025;Rivera Him等人,2026)。

有监督学习(SL)方法利用数值求解器生成的数据集学习从系统状态到近最优控制动作的直接映射。例如,Fioretto等人(2020)将深度神经网络(DNN)与拉格朗日对偶方法结合,以促进物理和工程约束的满足;而Park等人(2023)使用主成分分析(PCA)通过紧凑表示提高可扩展性。面向拓扑的方法,包括图神经网络,也已被探索以加速AC-OPF并改善对拓扑变化的适应性(Liu等人,2022;Song等人,2026;Pasini等人,2026;Zhu等人,2026)。这些方法主要改善拓扑表示和跨网络配置的可迁移性。相比之下,AltOPF关注固定拓扑下的训练过程,交替执行基于P2的有监督学习和嵌入约束的基于P1的无监督学习。约束感知的SL方法还可能结合优化结构,如隐式二次约束二次规划(QCQP)模块和面向可行性的损失函数,但仍然依赖求解器生成的标签(Zeng等人,2024)。尽管SL模型可以在训练分布内实现高精度,但其在未见过的运行条件下的性能可能会下降。标签生成成本也很高,因为为大型网络求解大量AC-OPF实例可能需要数天时间(Babaeinejadsarookolaee等人,2019)。AC-OPF的非凸性进一步增加了训练难度,因为同一输入可能存在多个解。

相比之下,无监督学习(UL)通过利用未标注运行数据上的基于物理的目标函数来减少或消除对预计算真实解的依赖。例如,Chen等人(2023)中的端到端学习-修复架构使用可微修复层在不依赖标注解的情况下改善可行性。针对AC-OPF,Kim和Kim(2024)以及Song等人(2026)通过方程嵌入和隐式微分等机制嵌入了潮流方程和最优条件。类似地,Park和Van Hentenryck(2023)提出了一种自监督原始-对偶框架,模拟增广拉格朗日方法,联合训练原始网络和对偶网络。然而,包含迭代求解器或隐式层的UL方法可能引入训练不稳定性、牛顿-拉夫逊(NR)不收敛以及非平凡的代价差异(Kim和Kim,2024;Chen等人,2023;Park和Van Hentenryck,2023)。

因此,SL和UL具有互补的局限性。SL受限于标签可用性和分布泛化能力,而UL可能在可行性、经济精度和稳定优化方面面临困难。半监督学习(SSL)将有限的已标注OPF解与丰富的未标注电网状态相结合。近期AC-OPF的例子包括基于Kron约简的零注入节点后处理(Huang等人,2024)以及利用快速解耦潮流(FDPF)隐式层的基于物理的训练(Chen等人,2025)。SSL也已被应用于相关任务,包括事件分类(Yang等人,2022)、暂态稳定性评估(Zhu等人,2021)和安全分析(Liu等人,2019)。然而,现有的SSL方法通常在原OPF空间中学习,并未将紧凑表示与作为训练课程使用的辅助松弛表述相结合。尽管松弛OPF表述在经典优化中已相当成熟,但将其作为OPF学习的课程问题仍有待深入探索(Park等人,2023;Fioretto等人,2020;Liu等人,2022;Babaeinejadsarookolaee等人,2019;Kim和Kim,2024;Chen等人,2023;Zeng等人,2024;Park和Van Hentenryck,2023;Huang等人,2024;Chen等人,2025;Yang等人,2022;Zhu等人,2021;Liu等人,2019)。表1总结了相关方法的机制和主要局限性。

现有的有监督AC-OPF模型需要大量由求解器生成的标签,而无监督和基于物理的方法可能遭遇训练不稳定、非平凡的代价差异或运行约束违反。尽管半监督方法通过结合已标注和未标注运行状态减少了标签依赖,但它们通常在原始AC-OPF表述上训练两个组件(Huang等人,2024;Chen等人,2025;Pareek等人,2025)。为解决这些局限性,我们提出AltOPF,在先前会议论文(Hien等人,2025)的基础上进行了扩展,通过一个辅助热极限松弛AC-OPF表述作为临时的有监督学习课程。利用一个共享的紧凑交叉编码器网络,基于辅助表述标签的有监督更新与针对完整原始AC-OPF问题的嵌入约束的无监督更新交替进行。一旦辅助监督不再提供足够的改进,便停止该阶段,剩余训练仅专注于原始表述。

此过程与标准的多任务学习不同,后者最优化目标的加权组合(Jia等人,2026),因为两种损失使用不同的数据源并以顺序而非联合的方式优化。它也与安全学习流水线不同(Wang等人,2025),后者仍然主要依赖标签,并通过正则化或后处理围绕有监督回归施加约束。在AltOPF中,未标注运行点通过重复的UL更新提供直接的可行性信号。据我们所知,这是第一个将原始和松弛AC-OPF表述分配给不同学习阶段并作为课程交替执行,且带有动态更新拉格朗日乘子的SSL框架。因此,主要贡献在于松弛引导的交替课程以及随后专注于原始问题的训练,而不仅仅是将已标注数据、未标注数据和约束惩罚简单地组合在一起。

本文的主要贡献总结如下:

第一,我们提出了AltOPF,一种机器学习框架,交替执行针对辅助热极限松弛AC-OPF表述(记为P2)的有监督更新和针对原始AC-OPF表述(记为P1)的嵌入约束的无监督更新。两个阶段更新同一个紧凑交叉编码器网络,使得有限的求解器生成标签可以与丰富的未标注运行状态相结合。一旦辅助监督不再提供足够的改进,基于P2的阶段将被移除,训练仅继续进行于P1上。

第二,学习目标采用了一种基于违反的增广拉格朗日对偶(VALD)机制,其动态更新的乘子为持续存在的约束违反分配更大权重。理想化收敛分析证明了相应的交替随机次梯度方法具有遍历收敛性至Clarke平稳点。

第三,在162节点、300节点和1354节点基准系统以及韩国4492节点系统上的实验将AltOPF与六个已建立的基线方法进行了比较。在标准分布内测试集上,AltOPF实现了超过99%的约束满足率和相对于MATPOWER参考解低于1%的代价差异。与已发表的一种宽全连接配置相比,其紧凑架构将检查点大小减少75%,峰值GPU显存减少约40%。原始神经网络前向传播还提供微秒级推理,在韩国4492节点系统上约为20μs。

第四,我们开发并评估了一种可选的交流潮流投影,通过网络方程细化AltOPF的原始预测。评估包括分布内和更具挑战性的分布外(OOD)运行条件,在后者中原始预测表现出降低的约束满足率。该投影减少了相应的违反和代价差异,之后可将投影后的解与完整的AC-OPF约束集合进行筛选,并将未解决的案例传递给传统AC-OPF求解器。

本研究考虑固定网络拓扑下的基础AC-OPF问题;拓扑变化和潮流分析(包括N-1潮流分析)不在研究范围之内。

本文其余部分的组织如下:第2节阐述了原始的交流最优潮流(AC-OPF)问题以及所提出的基于违例的增广拉格朗日学习目标。第3节介绍了紧凑的交叉编码器架构。第4节给出了辅助的热极限松弛模型以及交替半监督学习流程。第5节提供了收敛性分析。第6节描述了实验设置并报告了数值结果。第7节讨论了局限性以及实际部署中的注意事项。最后,第8节对本文进行了总结,并概述了未来的研究方向。表2总结了全文中使用的主要符号和缩写。

## 各节摘要

### AC-OPF模型

设$\mathcal{N}$、$\mathcal{N}_g$、$\mathcal{N}_d$和$\mathcal{E}$分别表示节点集合、发电机节点集合、负荷节点集合以及有向输电线路集合。令$\mathcal{N}_0 = \mathcal{N} \setminus (\mathcal{N}_g \cup \mathcal{N}_d)$表示零注入节点集合,并令$r \in \mathcal{N}_g$表示参考节点。每条线路$(i, j) \in \mathcal{E}$具有指定的热限额$\overline{S}_{ij}$。对于每个节点$i$,有功负荷和无功负荷$P_{d_i}$和$Q_{d_i}$是给定AC-OPF实例中的固定参数。为了符号的完备性,当$i \notin \mathcal{N}_g$时,$P_{g_i} = Q_{g_i} = 0$;当$i \notin \mathcal{N}_d$时,$P_{d_i} = Q_{d_i} = 0$。

### P1的约束感知无监督学习

在P1的无监督学习(UL)任务中,损失函数定义为:

$$\mathcal{L}_{UL} = \sum_{i \in \mathcal{N}_g} C_i(\hat{P}_{g_i}) + \sum_{\ell \in \mathcal{U}_{\text{ineq}}} \left[ \lambda_{UL,\ell} \cdot \text{R}(\hat{y}_\ell) + \frac{\rho}{2} \| \text{R}(\hat{y}_\ell) \|^2 \right] + \sum_{\ell \in \mathcal{U}_{\text{eq}}} \left[ \mu_{UL,\ell} \cdot \text{H}(\hat{y}_\ell) + \frac{\rho}{2} \| \text{H}(\hat{y}_\ell) \|^2 \right]$$

其中,$\hat{y}$表示从神经网络输出获得的完整物理量向量。具体而言,神经网络直接预测电压幅值$\hat{V}$和相位角$\hat{\theta}$,而其余物理量则通过交流网络方程进行重构。集合$\mathcal{U}_{\text{ineq}}$包含与不等式约束相关的物理量,包括$i \in \mathcal{N}_g$时的$\hat{P}_{g_i}$和$\hat{Q}_{g_i}$。

### AltOPF的交替学习

本节介绍了所提出的半监督学习(SSL)框架,该框架将原始AC-OPF问题P1及其辅助的热极限松弛模型P2集成在一起。这两个模型分别分配到不同的学习阶段,并更新同一个神经网络。P2的有标签解提供了一种辅助的监督学习信号,而嵌入约束的无监督学习阶段则优化完整的P1模型。由于P2是通过从P1中移除热极限约束而获得的,因此……

### 收敛性分析

本节分析了交替学习阶段中,所提出的交替随机次梯度方法的理想化随机版本。该分析考虑了每个内循环更新过程中乘子变量保持不变的情况,并研究了公式(50)中的混合目标函数,该目标函数结合了监督损失和嵌入约束的无监督损失。由于这两种损失函数均包含绝对值项和铰链型违例项,因此它们通常是非凸且非光滑的。因此,稳定性是……

### 性能评估

我们在162节点、300节点、1354节点和4492节点系统上评估了AltOPF,其中包括一个真实的韩国电力系统。

### 局限性

AltOPF存在三个主要局限性。首先,与其他直接映射方法一样,它产生的潮流残差比数学规划求解器更大——数学规划求解器能够实现近乎精确的数值可行性——也比隐式层方法产生的残差更大,后者显式求解了部分物理方程。如表11所示,残差主要集中在功率平衡方程和零注入方程中。其均值很小,但仍存在一些上尾误差。可选的投影$\mathcal{P}_{PF}$……

### 结论

本文提出了AltOPF,一个用于交流最优潮流的半监督学习框架,该框架将原始问题和辅助的热极限松弛问题分别分配到不同的学习阶段。在成本较低的辅助标签上进行监督更新,与在原始模型上进行的嵌入约束无监督更新交替进行,通过共享的紧凑网络实现。当辅助阶段不再能改善训练效果时即停止使用。在162节点、300节点和1354节点的基准系统以及……

### CRediT作者贡献声明

Hien Thanh Doan:撰写——原稿,方法论,调查研究,概念构思。Keunju Song:撰写——审阅与编辑,可视化,软件,概念构思。Sungho Shin:撰写——审阅与编辑,调查研究,形式化分析,概念构思。Kibaek Kim:撰写——审阅与编辑,调查研究,形式化分析,概念构思。Youngmin Choi:撰写——审阅与编辑,资源,数据整理。Hongseok Kim:撰写——审阅与编辑,项目管理,……

### 利益冲突声明

作者声明不存在已知的可能影响本文所述工作的竞争性经济利益或个人关系。

### 致谢

本工作得到了韩国国家研究基金会(NRF)在拨款RS-2025-02215243下的资助,以及韩国能源技术评价与规划院(KETEP)在拨款RS-2026-25527712下的资助。本材料基于美国能源部科学办公室(合同编号DE-AC02-06CH11357)资助的工作。

**作者信息:**
Hien Thanh Doan | Keunju Song | Sungho Shin | Kibaek Kim | Youngmin Choi | Hongseok Kim
韩国首尔,松岗大学电子工程系
相关新闻
生物通微信公众号
微信
新浪微博

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号