一种面向市场的强化学习发电扩展规划框架,用于重构电力系统中的长期安全性和投资效率

《Results in Engineering》:A Novel Market-Oriented Reinforcement Learning Generation Expansion Planning Framework for Long-Term Security and Investment Efficiency in Restructured Power Systems

【字体: 时间:2026年08月14日 来源:Results in Engineering 9.4

编辑推荐:

  摘要:发电扩展规划(GEP)在重构电力市场中因非线性投资决策、市场不确定性、可靠性要求以及大规模规划范围带来的计算复杂性而日益具有挑战性。传统的数学优化和元启发式技术,在解决长期市场导向发电扩展规划(MOGEP)问题时,常常遭遇早熟收敛、探索能力有限或过高的计

  
摘要:发电扩展规划(GEP)在重构电力市场中因非线性投资决策、市场不确定性、可靠性要求以及大规模规划范围带来的计算复杂性而日益具有挑战性。传统的数学优化和元启发式技术,在解决长期市场导向发电扩展规划(MOGEP)问题时,常常遭遇早熟收敛、探索能力有限或过高的计算负担。为应对这些挑战,本文提出了一种新颖的强化学习-蜜獾算法(RL-HBA)框架,用于在经济、可靠性和网络安全约束下解决多阶段MOGEP问题。该框架将强化学习与蜜獾算法的探索和利用机制相结合,以自适应地引导搜索过程并提高收敛稳定性。研究人员引入了一种基于等效能量函数(EEF)的概率可靠性评估,在优化循环中评估负荷损失概率(LOLP)、预期缺供电量(EENS)和负荷损失期望(LOLE),同时保持高计算效率。此外,研究人员将数学模型扩展至包含基于直流潮流的输电网约束,包括节点功率平衡、输电线路热极限、电压角约束和参考母线条件,从而提高了规划模型的工程真实性。该框架在6年、12年和24年规划范围上进行了评估,并与粒子群优化(PSO)、乌鸦搜索算法(CSA)、阿基拉优化器(AO)和秃鹰搜索(BES)进行了比较。仿真结果表明,RL-HBA在满足系统安全约束的同时,始终实现最低的总规划成本、更快的收敛、更低的解变异性和改进的可靠性。与序贯蒙特卡洛模拟的验证确认,基于EEF的可靠性评估达到了工程级精度,且计算时间减少了95%以上。这些结果表明,所提出的RL-HBA框架为长期市场导向发电扩展规划提供了一种有效、可扩展且计算高效的决策支持工具,并为未来整合可再生能源资源、储能系统、碳约束规划和下一代可持续电力系统提供了灵活的基础。
论文解读文章

**研究背景、问题与意义**
随着全球电力系统重构——以放松管制、竞争加剧和多样化发电技术整合为特征——发电扩展规划(GEP)已从集中式、监管驱动的工程任务演变为多维挑战,需同时兼顾经济可行性、技术可靠性、环境约束和长期政策目标。在重构电力市场中,市场导向发电扩展规划(MOGEP)成为确定最优发电技术组合的核心框架,但面临非线性投资决策、市场不确定性、可靠性要求及大规模规划范围带来的计算复杂性。传统数学优化和元启发式技术(如混合整数线性规划、遗传算法、粒子群优化等)在解决长期MOGEP问题时,常出现早熟收敛、探索能力有限或计算负担过重等问题。此外,现有方法在评估概率可靠性指标(如预期缺供电量EENS)时计算成本高昂,且难以同时处理高维搜索空间、可行性保证和探索-利用平衡。为此,本文提出了一种强化学习-蜜獾算法(RL-HBA)框架,旨在高效求解多阶段MOGEP问题,在降低长期总成本的同时满足系统安全约束。该论文发表在《Results in Engineering》。

**主要关键技术方法**
研究人员采用了以下关键方法:(1)**强化学习-蜜獾算法(RL-HBA)框架**:将Q学习-inspired机制与蜜獾算法(HBA)的挖掘模式(全局探索)和蜂蜜模式(局部开发)相结合,通过动态模式转换参数自适应调整搜索策略;(2)**等效能量函数(EEF)**:用于概率可靠性评估,通过卷积运算快速计算负荷损失概率(LOLP)、预期缺供电量(EENS)和负荷损失期望(LOLE),避免序贯蒙特卡洛模拟的高计算成本;(3)**直流潮流约束**:扩展数学模型以包含节点功率平衡、线路热极限、电压角约束和参考母线条件,提高工程真实性;(4)**算法增强机制**:包括虚拟映射过程(VMP)降低搜索空间维度、惩罚函数确保可行性、以及改进的智能初始种群生成(MIIPG)以加速收敛。测试系统基于一个包含15台现有机组和5种技术(油、液化天然气、煤、两种核电站)的复杂重构电力系统,在6年、12年和24年规划范围上验证。

**研究结果**
- **Case 1(6年短期规划)**:RL-HBA与PSO均达到最佳总成本1.24×10?美元,但RL-HBA的标准差和误差显著更低,表明其收敛稳定性更高。在技术组合方面,RL-HBA通过向高容量、低可变成本机组(LNG和核电)倾斜,实现了更高的投资效率,而CSA在第二阶段过度投资燃油机组导致经济性较差。可靠性方面,RL-HBA在第三阶段将LOLP控制在0.008899,未过度“过度安全化”,维持了成本-可靠性平衡。
- **Case 2(12年中期规划)**:RL-HBA的中位成本为1.370×101?美元,显著低于CSA(1.430×101?)、AO(1.445×101?)和PSO(1.415×101?),且四分位距最小。技术组合演化显示,HBA在第二阶段部署4台LNG机组,后期转向核电,实现了多样化的燃料组合。可靠性分析表明,HBA在第四年达到LOLP=0.001543并维持稳定,而其他算法波动较大。
- **Case 3(24年长期规划)**:RL-HBA的最佳成本为23.706×101?美元,比PSO降低约3.4%,比CSA降低4.2%。在收敛性方面,HBA在200次迭代内达到约2.38×101?美元,而其他算法仅收敛到101?数量级,表明HBA实现了四个数量级的投资效率提升。LOLP对数尺度图显示,HBA在第十二年达到极低LOLP,维持了最高系统安全水平。
- **计算效率与可靠性验证**:在IEEE 39节点、118节点和大型系统上,RL-HBA的求解时间均低于MILP、随机规划、DQN、PPO和SAC,且内存需求更低。例如,在30年大型规划中,RL-HBA仅需172.8分钟,而MILP需528.4分钟。EEF与序贯蒙特卡洛模拟的对比显示,LOLP、EENS和LOLE的相对误差均低于2.44%,且计算时间减少95.5%,验证了EEF的工程级精度。

**总结与讨论**
讨论部分指出,RL-HBA的性能改进源于强化学习与蜜獾算法的互补:RL逐步学习有效投资策略,HBA高效探索全局搜索空间并防止早熟收敛。该框架实现了投资经济性与系统可靠性的平衡,降低生命周期成本的同时维持了备用裕度。收敛分析表明,RL-HBA在较少迭代次数内达到稳定目标值,且变异性低,适合处理高维混合整数问题。敏感性分析证实,在需求增长、燃料价格和可靠性要求变化下,RL-HBA仍保持优越性。与MILP、随机规划、遗传算法和深度强化学习方法(DQN、PPO、SAC)相比,RL-HBA在解质量、计算效率和可扩展性之间取得了有效折中。研究结论翻译如下:**结论**:本文提出了一种新的RL-HBA框架,用于解决重构电力市场中的GEP问题。通过虚拟映射过程(VMP)、惩罚函数(PFA)和改进的智能初始种群生成(MIIPG),将RL与蜜獾算法的探索和利用能力相结合,有效应对了长期发电扩展规划的高维、非线性和约束特性。与常规优化方法不同,RL增强的搜索机制根据搜索状态动态调整优化策略,实现了更快的收敛、更好的解空间探索和全局优化性能。综合仿真结果表明,所提出的RL-HBA框架在投资规划质量、收敛行为和计算效率方面始终优于常规优化算法。通过将停电相关成本纳入优化目标,该框架在完全满足备用容量和系统可靠性要求的同时,实现了高达5.16%的投资成本降低。敏感性分析进一步证实了该框架在不同规划假设下的鲁棒性,显示出稳定的收敛特性和可靠性能。这些结果表明,该方法在不增加计算复杂性的情况下,有效平衡了投资经济性与系统可靠性,使其非常适合实际大规模发电扩展规划应用。从工程角度看,该框架提供了一个计算高效的决策支持工具,能够帮助公用事业公司、独立系统运营商和政策制定者在日益竞争的电力市场条件下识别经济最优的发电投资策略。RL-HBA框架的自适应学习能力使其能够高效处理多技术、长规划范围和不断变化的市场条件等复杂规划环境,从而增强了长期扩展规划的实用性和适用性。
相关新闻
生物通微信公众号
微信
新浪微博

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号