面向配电网数据质量提升的基于大语言模型的自动超参数优化方法
《Applied Energy》:LLM-based automated hyperparameter optimization method for data quality improvement of distribution networks
【字体:
大
中
小
】
时间:2026年09月09日
来源:Applied Energy 12.2
编辑推荐:
**摘要**
随着变流器型资源(IBRs)越来越多地接入电力系统,如可再生能源和电动汽车,设备与系统之间的电力系统数据交互频率呈指数级增长。由此,分布式IBRs之间的复杂通信和持续的平台集成导致严重的数据质量问题,包括数据丢失和时间戳错位。这种数据质量退化严重削弱了网络的可
**摘要**
随着变流器型资源(IBRs)越来越多地接入电力系统,如可再生能源和电动汽车,设备与系统之间的电力系统数据交互频率呈指数级增长。由此,分布式IBRs之间的复杂通信和持续的平台集成导致严重的数据质量问题,包括数据丢失和时间戳错位。这种数据质量退化严重削弱了网络的可观性,威胁了现代电力系统的可靠运行。为应对这些问题,各种人工智能算法被迅速采用以提升数据质量。然而,其性能高度依赖于超参数的选择,这阻碍了跨场景的泛化能力,并导致数据质量提升方法性能不稳定。本文提出了一种基于大语言模型(LLM)的配电网数据质量提升自动化超参数优化方法,将LLM集成到超参数优化过程中。该方法通过整合优化历史和代码上下文,构建了一种语义全局感知机制,能够实现智能的探索性跳跃并绕过局部最优解。为识别并替换LLM提供的超参数建议,提出了一种基于抽象语法树(AST)的动态超参数替换方法。在算法执行前,AST对超参数的类型和基本物理可行性进行校验,防止物理无效的超参数进入算法。基于中国北方某些地区的实际配电网数据,使用多种数据质量提升算法对所提方法进行了测试。实验结果通过数据质量评分进行评估,结果表明该方法实现了10–20%的数据质量评分提升。
**引言**
随着全球能源结构的持续转型,电力系统正在经历一场以可再生能源高比例接入为标志的根本性变革,包括分布式光伏、风电和电动汽车[1],[2]。然而,这些变流器型资源(IBRs)的大规模采用显著增加了数据量,并在不同的设备供应商、异构协议和多个管理平台之间引入了复杂的通信挑战[3]。此外,可再生能源设备的复杂运行条件往往导致严重的数据质量退化,包括缺失值和时间戳错位,从根本上威胁了系统的可观性和可控性[4]。这些问题给现代电网带来了显著的随机性和波动性。因此,确保卓越的数据质量已成为保障整体能源安全和维持电力系统可靠运行的关键前提[5]。
为有效应对具有这些复杂特征的数据问题,人工智能,尤其是机器学习和深度学习,已迅速成为主流解决方案[6]。通过捕捉复杂的底层关联,这些数据驱动型算法在电力系统关键领域的数据质量提升方面展现出显著潜力[7]。文献[8]采用基于图神经网络(GNN)的方法实现异常和入侵检测;[9]引入基于视觉Transformer(ViT)的深度学习架构来识别微型同步相量测量单元(PMU)高频数据中的异常。此外,[10]采用结合孤立森林和局部异常概率(LoOP)的算法解决数据漂移问题;[11]将基于去噪自编码器(DAE)的生成模型应用于智能电表数据的时序重建。
然而,随着分布式光伏的快速增长[12],异构数据量呈指数级增长,不同区域配电网的数据特征差异日益增大。如图1所示,不同的区域因素,如变化的太阳辐射、多样的用电模式和异构的网络拓扑[13],导致了高度碎片化的运行场景。
采用静态参数配置的数据质量提升方法通常无法跨不同运行场景泛化,导致这些方法需要大量重复的优化工作以适应各种完全不同的应用环境,显著增加了应用成本[14]。
从根本上说,这种缺乏跨场景适应性的原因在于更深层的数学瓶颈。传统静态方法在跨场景应用中的根本局限由域漂移驱动。由于不同区域配电网的底层时空特征差异显著,运行数据的联合概率分布发生偏移。根据优化中的"没有免费午餐"定理[15],没有单一的静态超参数配置能在所有不同的数据分布上普遍实现最优性能。因此,传统算法本质上缺乏数学可迁移性。面对新的运行条件时,这些方法由于无法在数学上适应偏移后的数据流形而不进行大量重训练,导致性能严重退化[16]。这意味着需要在不同运行条件下进行定制的超参数优化[17]。
为解决这一问题,近期研究中探索了多种超参数优化方法。例如,[18]利用网格搜索对基于PMU数据的自适应故障类型分类集成机器学习模型进行微调;[19]应用贝叶斯优化优化IoT智能电网能效预测模型。此外,启发式算法也被广泛采用。遗传算法(GA)被用于全局优化智能电网异常和欺诈检测模型的超参数[20];粒子群优化(PSO)被用于迭代调整混合神经网络以实现高精度负荷预测[21]。
然而,随着系统复杂度和多尺度数据量的持续增长,传统超参数优化方法的瓶颈日益凸显。
超参数优化过程非常耗时、低效且难以规模化。传统方法高度依赖专家知识来手动定义超参数优化的性能搜索范围[22]。图2展示了两位专家在优化同一异常检测算法超参数后获得的结果差异。显然,基于专家手动设置参数选择范围的超参数优化方法高度依赖于专家的主观经验[23],不同专家可能对超参数权重持有不同观点,导致不同的超参数优化结果。
从根本上说,传统超参数优化方法的主要局限在于过度依赖人类直觉来设置搜索范围。由于现代算法的超参数空间通常是高维且严格非凸的,准确定义最优边界从根本上超出了人类的认知约束[24]。如果专家定义的数值范围过窄,真实的全局最优解会被排除在搜索过程之外,迫使优化算法过早收敛并停滞在局部最优解[16]。反之,手动设置过宽的性能搜索范围会导致计算成本急剧增加。
除了依赖专家知识外,传统超参数优化完全缺乏语义逻辑,只能进行盲目探索。传统算法本质上充当零阶黑盒优化器[25],它们严格将目标模型视为数学函数,依赖数值反馈循环来迭代调整数值。因此,传统优化器完全不了解算法代码背后的物理含义或语义逻辑,它们仅仅将这些当作抽象的浮点数。
此外,这种缺乏语义感知严重限制了传统方法逃离局部最优的能力。当在高维空间中停滞于次优区域时,其逃逸机制在数学上是盲目的,如图3所示。它们被迫依赖无方向性的随机操作,如高斯变异或随机游走,来扰动当前状态[26],而这些随机扰动缺乏逻辑推理或方向感知能力。
然而,大量关于黑盒优化方法的研究表明,这些数学上盲目的零阶随机扰动缺乏逻辑推理和方向感知能力,限制了传统算法在复杂非凸景观中高效逃离深层局部最优的能力[27]。
相比之下,近期研究已证明LLM可以充当强大的上下文感知优化器[28],[33]。通过利用对特定算法代码上下文的深度语义理解,而非作为纯粹的数值黑盒优化器,LLM能够解释超参数的物理含义并评估历史性能趋势。这种语义全局感知使LLM能够推断出有前景的搜索方向并执行非局部跳跃,有效绕过使传统启发式方法瘫痪的局部最优陷阱[28]。
面对这些问题和挑战,传统超参数优化方法的有效性并不令人满意。同时,新兴的大语言模型(LLM)由于其强大的模式识别、知识泛化和上下文推理能力,在众多领域应用中展现出广阔潜力[29],[30]。LLM正逐渐被集成到关键领域,包括算法优化、决策支持和状态估计,在超参数优化等领域开辟了新途径[31],[32]。文献[33]提出了通过提示优化(OPRO)方法,使用PaLM 2-L和GPT-3.5作为优化器。此外,[34]引入语言模型粒子群优化(LMPSO)以降低计算需求,但它缺乏结构保障,使其无法直接优化算法代码而不会触发语法无效的执行失败。在电力和能源系统领域,[35]利用生成式预训练Transformer-4(GPT-4)的强泛化能力进行锂离子电池(LIB)健康状态(SOH)估计,但它纯粹聚焦于直接状态预测而非优化底层数据驱动算法。文献[36]引入PowerGraph-LLM用于最优潮流计算,但其对大规模云端部署的依赖从根本上与现代电力系统对严格隐私和本地执行的矛盾需求不兼容。
尽管LLM应用具有重大潜在价值,但电力系统的独特特性对其实际部署施加了严格约束。具体而言,现代电网需要严格的数据保密性以保护高度敏感的时空信息,同时需要具备实时处理能力来管理动态波动。因此,电力公司严格优先考虑安全、隐私保护和轻量级功能模式,而非传统的开放云端解决方案。
LLM提供两种主要部署模式,其中云端部署虽然借助强大的服务器算力,但其固有的网络延迟和带宽限制使其无法满足电力系统的实时要求。相反,轻量级本地模型减少了电力系统数据对外部云服务器的暴露,提供低延迟和适中的硬件需求,使其适合在网络内的边缘部署。
表1描述了多种LLM的硬件要求及是否支持本地部署,汇总了各自官方技术报告中的部署共识[37],[38],[39]。综合考虑部署成本和本地部署支持情况,DeepSeek 7B是一个轻量级开源模型,具有较低的随机存取内存(RAM)和图形处理单元(GPU)需求,非常适合边缘部署。因此,本文方法选择DeepSeek 7B作为LLM。
电力系统中的数据流路径因部署模式而异,相关安全风险也相应不同。图4展示了LLM用于电力系统应用时本地部署与云端部署的数据流和安全风险对比。在云端部署模式下,电力系统数据需要在本地运行环境之外传输,增加了数据传输过程中的数据泄露和网络攻击风险。由于电力系统对保密性的严格要求,本地部署通常更符合电力系统实际运行需求。
然而,本地部署并不能完全消除安全风险。电力系统中的边缘设备可能仍然暴露在网络物理攻击、未授权访问和节点被攻陷后的提示提取风险中。因此,LLM辅助电力系统应用的数据安全不仅取决于模型是否本地部署,还取决于暴露给模型交互过程的信息内容,以及输入数据是否在使用前已通过安全验证用于优化或决策支持。
尽管传统超参数优化方法被广泛使用,但它们本质上作为零阶黑盒优化器运行。这些传统方法主要依赖适应度函数或概率模型来引导搜索,需要手动指定性能搜索范围,且忽视了算法代码的语义逻辑。因此,它们容易陷入局部最优,且从数学角度难以适应电力系统的碎片化运行场景。
此外,在将先进优化方法应用于电力系统时,许多现有的超参数优化框架仍然依赖大规模云端部署。这种部署模式可能在数据传输或模型交互过程中暴露敏感的电力系统信息,与现代电力系统严格的保密要求相冲突。
此外,现有的 LLM 辅助优化研究很少明确界定电力系统数据处理与 LLM 交互之间的边界,这使得难以评估优化过程中敏感电力系统信息是否存在泄露风险。总之,解决传统优化方法的局限性并克服现代电网的部署和数据暴露约束仍然是一个关键挑战。为了解决这些关键空白,本文提出了一种基于本地部署 LLM 的自动超参数优化方法。该方法采用开源且支持本地部署的 DeepSeek 大语言模型,以支持本地执行并降低外部云传输带来的泄露风险。所提出的方法独特地将提示推理与抽象语法树(AST)相结合以优化超参数。AST 充当一种强制性的结构保障措施,精确地将文本推理转化为可执行的算法代码,从而确保运行的稳定性和代码的完整性。本文的主要贡献总结如下:
•LLM 的创新应用:为实现数据质量改进方法的自动超参数优化,提出了一种基于 LLM 的配电网数据质量改进自动超参数优化新方法。与传统方法不同,该方法结合了 LLM 生成的超参数建议与 AST 解析,以实现动态超参数优化。AST 不仅能够定位和替换目标超参数节点,还在执行前进行类型和物理可行性检查。这使得用户能够轻松理解具体的超参数优化过程,同时实现自动化的超参数优化。
•数据质量评估系统:为了准确评估数据质量并确保超参数优化能真正提升算法在特定场景下的性能,开发了一套整合准确性、一致性、完整性和时效性四个维度的评估系统。采用 CRITIC 方法评估数据质量并自动生成数据质量评分。这使得能够对数据质量进行合理评估,避免主观臆断。
•基于 LLM 的框架:基于所提出的方法和评估系统开发了一套框架。该框架能够实现不同运营场景下数据质量改进算法的自动超参数优化。因此,部署的算法可以自适应地实现针对特定目标场景的卓越性能。此外,该框架将电力系统数据处理与基于 LLM 的超参数优化分离,确保详细的测量数据不会直接包含在 LLM 提示词中。
•跨场景泛化能力:基于中国北部几个不同地区配电系统的实际数据,采用了几种典型的数据质量改进方法来验证所提出的方法和框架。实验结果表明,本文提出的方法能够自动优化任意数据质量改进算法的超参数,并在所有场景中实现更优的性能。
本文其余部分结构如下:第 2 节介绍基于 LLM 的配电网数据质量改进自动超参数优化方法的基本原理,第 3 节介绍该方法的框架,第 4 节为案例研究,第 5 节为讨论与结论。
章节摘要
所提出方法的原理
本节将介绍所提出方法的基本原理,该方法将数据质量改进中的超参数优化从人工试错提升为自动化、可解释的过程。它使算法能够通过客观的四维系统优化超参数并评估改进效果。为了应对 LLM 常见的建议错误或不稳定风险,引入了保障机制。
所提出方法的框架
本节介绍了用于提高配电网数据质量的基于 LLM 的自动超参数优化方法的框架。图 9 所示的框架详细说明了该方法的流程步骤和输出。
图 9 展示了基于 LLM 的数据质量改进自动超参数优化方法的框架。数据质量评分在 LLM 外部计算,LLM 仅接收代码上下文、超参数值、历史评分及趋势
案例研究
为了验证所提出方法的可行性和通用性,本文选取了河南和河北电力系统中部分节点的功率和电压数据作为模型的训练和测试数据集。配电系统的区域拓扑结构如图 10 所示。
案例研究中使用的数据集被视为经过网络安全筛选后输入所提出框架的原始测量数据。因此,本文所考虑的数据质量问题指的是
讨论与结论
本文提出了一种基于 LLM 的配电网数据质量改进自动超参数优化方法,该方法包括运行初始算法以获得初始数据质量评分和超参数。基于 LLM 提供的建议,利用 AST 识别候选超参数节点,检查其类型和物理可行性,并仅替换可行的超参数。随后,运行修改后的算法以获得新的数据质量评分。
CRediT 作者贡献声明
Yujie Zhao:撰写 - 原稿、软件、方法论、调查、数据管理、概念化。
Kaiqi Sun:监督、方法论、资金获取、概念化。
Wei Qiu:撰写 - 审阅和编辑、资源、形式分析、数据管理。
Mingyang Li:可视化、验证、软件。
Yuanyuan Sun:资源、数据管理。
Ke-Jun Li:监督、项目管理。
利益冲突声明
作者声明他们没有已知的竞争性财务利益或个人关系,这些利益或关系可能会影响本论文中报告的工作。
致谢
本工作由中国国家自然科学基金(52677123)和中国山东省自然科学基金(ZR2025QB46, ZR2026MS0731)共同资助。
Yujie Zhao|Kaiqi Sun|Wei Qiu|Mingyang Li|Yuanyuan Sun|Ke-Jun Li
中国 250000 济南 山东大学电气工程学院
生物通微信公众号
生物通新浪微博
今日动态 |
人才市场 |
新技术专栏 |
中国科学人 |
云展台 |
BioHot |
云讲堂直播 |
会展中心 |
特价专栏 |
技术快讯 |
免费试用
版权所有 生物通
Copyright© eBiotrade.com, All Rights Reserved
联系信箱:
粤ICP备09063491号