《Energies》:Method for Generating Labeled Sample Sets for Power System Load Flow Relationship Learning
编辑推荐:
在利用机器学习算法构建电力系统潮流映射关系时,确保映射模型计算精度和泛化性能的基本前提是能够预先且高效地提供规模适当、分布合理且高质量的标记样本集。本文中,潮流样本集的质量具体由三个并发属性定义:物理一致性(满足基尔霍夫定律(Kirchhoff’s laws)
在利用机器学习算法构建电力系统潮流映射关系时,确保映射模型计算精度和泛化性能的基本前提是能够预先且高效地提供规模适当、分布合理且高质量的标记样本集。本文中,潮流样本集的质量具体由三个并发属性定义:物理一致性(满足基尔霍夫定律(Kirchhoff’s laws)和欧姆定律(Ohm’s law))、运行状态空间的代表性覆盖以及样本间低冗余度。目前,在线和离线潮流样本技术均无法高效提供大规模、高质量的这种潮流样本集。为此,研究人员提出了一种集成电网物理模型的潮流样本集生成方法。该方法包括:非迭代式高速生成大规模潮流样本的技术;大型电网潮流样本的分区生成与多区域拼接技术;以及潮流样本集生产的容量需求与质量技术指标设计。分析结果表明,所提方法能够根据实际需求高效生成适当容量的高质量潮流样本集。在IEEE 9节点和39节点系统上的案例研究表明,生成10万个样本时,该方法分别比全网牛顿-拉夫逊法(Newton–Raphson method)快约19倍和32倍,且电压带容量设计在同等边界条件覆盖下仅需均匀采样所需样本的约12.6%,同时学习误差相当。
**论文解读文章**
**1. 研究背景与问题**
现代电网的规模巨大、行为模式复杂且运行状态多样,构建具有高计算精度和强泛化能力的下一代智能电力系统面临重大挑战。当前,电力系统领域主要采用基于特定数据集的学习算法来实现目标功能,但仍处于弱人工智能范畴,通常局限于通过数据学习发现隐式映射关系。然而,该领域对于人工智能应用所需训练样本集的必要数量和质量缺乏系统性考虑。机器学习文献中关于数据集蒸馏和浓缩的研究强调了高质量、代表性样本的关键重要性:一个紧凑、信息密集的子集可以匹配更大原始数据集的性能。但与无结构文本不同,潮流样本受显式物理定律约束,并位于结构化运行流形上,因此信息密集的样本可从物理原理中先验获知——即接近负荷和电压稳定极限的样本——而非通过数据驱动算法发现。潮流样本源自具有真实物理相关性的运行场景,这些场景的多样性内在地包含了一个高质量的潮流样本数据集。样本数量随电网节点规模呈指数增长,需要实施适当的技术措施进行控制。样本质量必须基于对物理定律和约束的遵守,同时代表电网运行的数据空间。
获取潮流样本的方法主要分为计算生成和测量采集两类。传统方法采用牛顿法或PQ分解等迭代算法求解潮流方程,收敛后得到单个样本,但存在显著的不收敛率,导致大规模潮流样本集生成效率低下。当前主流方法遵循“典型运行条件+数据偏置驱动+潮流程序计算”框架,先生成大量候选数据集,再通过潮流程序计算并收集收敛结果作为标记样本。此类方法生成的样本集容量通常为数千或数万个。为确保样本质量,必须考虑常规或最优潮流计算中的收敛问题,排除不收敛子集。对36节点系统的统计表明,负荷超过典型值170%时多数情况难以收敛,超过270%时收敛率低于10%。对于更大电网,10次迭代内收敛的解少于50%。这些发现强调了电网规模、数据偏置幅度和潮流程序收敛率对现有方案的负面影响。低质量潮流样本会加剧学习算法对更多数据的需求,形成恶性循环,导致高成本低效率问题持续存在。
此外,基于现有主流方法生成的潮流样本数据集,因电网拓扑和参数变化而适用性显著降低。特定拓扑结构和参数条件下生成的数据集,在遇到新拓扑和参数变化时,训练的潮流映射模型泛化能力严重下降,需部分或完全更新数据集并重新训练模型。研究表明,在拓扑结构频繁变化的场景中,潮流数据集容量迅速增加,迭代计算负荷呈指数增长。总之,现有解决方案在应对大规模电网、复杂行为和多样化运行状态时,面临高效生成标记潮流样本集和构建高泛化能力潮流映射关系模型的瓶颈。为解决此问题,国际上已出现两个相关方向:物理信息学习和图神经网络学习,将控制方程或电网拓扑直接嵌入学习模型;以及面向数据驱动电力系统应用的高效数据集创建方法,减少但对大规模迭代生成数据集的依赖。
**2. 研究内容与结论**
针对上述问题,本文聚焦于构建电力系统潮流映射模型时对高质量标记潮流样本集的需求,研究大规模、容量适当、分布合理且品质优良的样本集生产方法。主要贡献包括:提出一种融合物理定律的非迭代高速潮流样本生成方法;开发了考虑训练样本空间分布的质量评估与容量设计方法;提出网络分区的潮流样本集生成方法及全网训练样本的拼接技术。关键技术包括:结合物理定律验证的节点电压标记技术;非迭代潮流状态样本生成技术;相邻电网潮流样本集合并技术;基于电流向量分布的潮流样本集质量评估技术。
在IEEE 9节点和39节点系统上的案例研究显示,非迭代生成方法在10万个样本规模下,分别比全网牛顿-拉夫逊法快约19倍和32倍,内存波动和处理器占用分别约为后者的63%和66%(9节点)及54%(39节点)。电压带容量设计方法在同等边界条件覆盖下,所需样本仅为均匀采样的12.6%,且学习误差处于同一数量级(平均绝对百分比误差MAPE约0.004)。研究还验证了分区拼接机制能有效适应大规模电网,避免不收敛问题,并支持分布式计算。该论文发表在《Energies》期刊。
**3. 主要关键技术与方法**
研究人员主要采用了以下关键技术方法:非迭代潮流样本生成技术,基于节点电流注入与阻抗矩阵的线性关系直接计算电压和功率,无需迭代;分区生成与多子网样本拼接技术,利用标签传播算法对电网进行电气距离分区,在各子网内独立生成样本后通过边界电流匹配进行拼接;电压带采样密度设计方法,根据节点电压偏离标称值的程度将运行空间分为正常、警告和越限三个电压带,分别设置低、中、高采样密度以优化样本分布;基于融合聚类算法的样本质量评估与定向扩容方法,结合逆噪声邻域网格聚类和聚类集成,从准确性、代表性和冗余度三个维度评估样本质量,并根据评估结果进行定向样本补充。样本来源包括IEEE标准测试系统(9节点和39节点)生成的仿真样本以及模拟的测量样本(在收敛潮流状态上叠加测量噪声)。
**4. 研究结果**
**4.1 单线网络电力数据线性化样本生成方法案例**
在IEEE 9节点系统上,研究人员利用所提子网生成方法生成了10万个潮流样本,并与基于牛顿-拉夫逊法的MATPOWER平台在相同计算条件下进行对比。结果表明,所提方法比传统迭代算法快约19倍,内存资源波动约为牛顿法的63%,处理器资源占用约为66%。由于非迭代线性电流输入生成方式避免了不收敛无效样本,随着电网规模增长,效率优势更加明显。
**4.2 多子网分区与拼接样本生成机制**
在IEEE 39节点系统上,通过标签传播算法将系统分为三个子区,各子区规模均衡。研究人员展示了分区拼接样本生成过程:首先用受控电压源替换子区1的PV节点,通过线性计算获得子区1样本集及边界节点信息;然后根据联络线信息确定子区2边界节点功率,替换PV节点后线性计算获得匹配子区1的样本;最后类似处理子区3。拼接后的样本唯一、不重复,且无潮流收敛问题。与全网牛顿-拉夫逊法相比,分区拼接机制快约32倍,内存波动和处理器占用均为后者的约54%。
**4.3 含样本质量评估的测量样本定向扩容实例**
基于分区结果,学习任务需要约1万个有效样本,但仅有2000个模拟测量样本可用。通过融合聚类定向扩容机制:第一步,2000个测量样本经质量评估(准确性、代表性、冗余度),采用率87%,获得约1740个可用样本。第二步,用所提方法生成8000个样本(耗时10.15秒,采用率93%,获得7440个可用样本),而基于牛顿法的潮流计算生成同样数量需382.7秒,采用率仅73%(获得5186个可用样本),速度慢约37倍且产量低。第三步,补充生成1000个样本(耗时1.54秒,采用率89%,获得890个可用样本),最终总样本数约10070个,满足要求。这表明所提方法能快速融合现有测试样本并在线生成高质量电力样本,具备良好的质量评估、参数反馈和自我更新机制。
**4.4 潮流样本容量与数据分布设计**
以IEEE 39节点为例,研究人员首先识别各子区弱节点(通过电压-无功灵敏度),然后以子区2的节点12为例分析其P-V曲线,确定三个电压带的密度系数(正常带低、越限带高)。扩展到所有子区后,得到密度系数和样本容量设计:全网设计需2968个样本,而基于牛顿法的均匀采样在同等边界条件覆盖下需约23592个样本,所提设计仅需约12.6%的样本。为验证样本减少效果,研究人员在相同Bi-LSTM(双向长短期记忆网络)模型上进行了对比训练:使用带设计样本集(2968个)和牛顿均匀采样基线集(23592个)分别训练,并在独立测试集(1500个样本)上评估。结果表明,基线集误差略低(MAE 3.32×10
-3 vs 3.87×10
-3),但带设计集在仅使用12.6%样本和约八分之一训练成本的情况下,误差仍处于同一量级(MAE差距在17%以内)。因此,带设计以较小精度牺牲换取了数量级的样本和训练负担降低。
**5. 讨论与结论**
研究人员在讨论部分总结了所提方法避免了传统潮流计算带来的样本不收敛、高维计算缓慢以及对网络拓扑变化适应性差等问题。通过非迭代单子网快速生成和分区拼接机制,高效生成大规模电网潮流样本。样本容量与质量的设计评估机制极大提高了样本集质量,在保持效果的同时减少了训练样本数量和硬件需求。基于融合聚类算法的样本质量评估系统实现了测量样本的质量验证和混合样本集的扩容机制,显著提升了面向深度学习的潮流样本生成效率,并改善了多源样本兼容性,为AI算法在大规模电网中的应用奠定了坚实基础。研究假设网络拓扑和阻抗矩阵已知,且每个样本为静态时间切片,未来可扩展至未知参数或强动态场景。定量结果总结:IEEE 9节点和39节点系统上,非迭代生成速度分别提升约19倍和32倍;电压带容量设计仅需均匀采样样本量的12.6%,学习误差在同一量级(MAE 3.87×10
-3 vs 3.32×10
-3,差距17%以内)。与相关工作相比,所提方法完全去除了迭代标记步骤,并确保物理一致性;与物理信息学习和图神经网络方法相比,本文将物理原理嵌入数据生成和质量控制阶段,提供了显式的基于物理的样本价值度量。
**结论翻译:**
本文提出的用于机器学习的标记潮流样本集生成方法,避免了潮流计算带来的主要问题,如样本不收敛、高维计算缓慢以及对网络拓扑变化适应性差。提出了分布式潮流样本生成和多子网样本拼接机制。通过利用单子网的非迭代快速生产,高效生成大规模电网的大量潮流样本。提出了潮流样本容量和质量的评估与设计机制,极大地提高了潮流样本集的质量,并在保持一定效果的同时减少了训练所需样本数量和硬件需求。基于融合聚类算法的样本质量评估系统,实现了测量样本的质量验证和混合潮流样本集的扩容机制。这极大地提高了面向电力系统深度学习的潮流样本集生成效率,并改善了多源样本的兼容性,为AI算法在大规模电网中的应用奠定了坚实基础。定量而言,在IEEE 9节点和39节点系统上,非迭代生成在10万个样本时分别比全网牛顿-拉夫逊法快约19倍和32倍,内存波动约63%,CPU占用约66%;电压带容量设计在同等边界覆盖下仅需均匀采样体积的12.6%,且学习误差处于同一数量级(表7:MAE 3.87×10
-3对比3.32×10
-3,差距在17%以内)。与相关工作相比,基于模型的增强和消息传递图神经网络泛化方法仍依赖迭代潮流计算来标记候选样本,而所提方法完全去除了迭代标记步骤,并通过构造保证物理一致性。相对于将物理嵌入学习模型的物理信息学习和图神经网络方法,以及通过凸限制采样可行空间的基于优化的数据集创建方法,本工作将物理原理嵌入数据生成和质量控制阶段,提供了显式的、基于物理的样本价值度量,这是纯数据驱动增强所不具备的。