《Solar Compass》:Explainable AI in solar PV forecasting: A systematic review of models, explainers, and physical drivers
编辑推荐:
太阳能光伏(PV)预测支持电网安全运行,然而先进的机器学习模型因其决策过程不透明而难以获得信任。本项遵循PRISMA 2020指南的系统性综述考察了太阳能预测中的可解释人工智能(XAI)。在检索到的951条记录中,173条符合严格资格标准,要求同时具备定量预测
太阳能光伏(PV)预测支持电网安全运行,然而先进的机器学习模型因其决策过程不透明而难以获得信任。本项遵循PRISMA 2020指南的系统性综述考察了太阳能预测中的可解释人工智能(XAI)。在检索到的951条记录中,173条符合严格资格标准,要求同时具备定量预测评估和明确的解释输出。对决定性筛选规则(该规则排除了299条仅将注意力机制作为架构组件的记录)的敏感性分析支持了其精确性,且对75条被排除记录的双重独立复核未发现错误排除。长短期记忆(LSTM)模型占主导地位(48项研究),其次为Transformer(39项)和主要用于图像临近预报的卷积神经网络(CNN,32项)。SHAP在解释器中占优(69项研究),其次为特征重要性和置换方法(39项)、注意力可视化(31项)及LIME(14项),其中47项研究结合了多种方法。按质量分层综合显示这些排序具有稳健性,在114项高质量研究中排序保持不变。辐照度在各目标中排名第一,而时间编码和环境温度是稳定的次要贡献因素。湿度、风和云量代理随季节和气候带变化,使得全局排序具有条件性。预测时域具有重要影响,较长时域使用表格化天气数据和事后归因,超短时域则使用天空图像。跨研究基准比较仍然脆弱,对解释保真度、稳定性和运行时间的定量评估十分罕见。对主导解释器的批判性评估记录了计算成本、不稳定性、对相关输入的敏感性及未经验证的忠实性,同时存在可复现性缺口,仅有1.7%的研究同时发布了代码和数据。
**1. 引言**
1.1 背景与现状:太阳能光伏(PV)发电是增长最快的电力来源之一,国际能源署(IEA)预测到2030年太阳能光伏将占据新增电力装机容量的最大份额。然而,PV输出与辐照度变率、云场、气溶胶和局地天气状况紧密耦合,使得准确预测成为核心运营需求。数据驱动学习已成为主导方法,在对比研究中通常优于物理和统计基线。长短期记忆(LSTM)网络、卷积神经网络(CNN)和基于注意力的Transformer模型被广泛应用,但模型深度增加导致可解释性下降,形成制约采用的权衡。
1.2 与其他综述的比较:近期综述主要关注生成式AI、深度学习精度或混合物理学习方法,可解释性通常作为次要主题而非综合目标。本综述遵循PRISMA 2020,将可解释性视为实证证据,系统审计XAI使用和解释报告情况。
1.3 面向太阳能光伏预测的机器学习:传统机器学习模型如支持向量回归(SVR)和随机森林仍常见,梯度提升方法在表格数据上表现强劲。深度学习改进了时空表征学习,LSTM和BiLSTM用于序列预测,CNN处理天空图像和卫星输入,混合CNN-LSTM设计实现端到端时空学习。Transformer模型自2023年后采用率急剧上升。
1.4 可解释人工智能(XAI):XAI方法通常分为事前(ante-hoc)与事后(post-hoc)、局部与全局、模型无关与模型特定。事后特征归因最为常见,SHAP用于生成加性特征贡献,LIME用于局部替代解释,置换特征重要性(PFI)用于简单排序。注意力权重看似具有解释性,但并不自动忠实,因此本综述将注意力作为架构与作为解释严格区分。
1.5 动机与差距分析:尽管出版物增长迅速,XAI用于PV预测的证据分散且报告实践不一致。许多XAI提及仍属愿景性,对保真度、稳定性和计算成本的评估有限。
1.6 目标与研究问题:本系统综述旨在识别、评估和综合应用于基于机器学习的太阳能光伏发电预测的XAI文献,回答六个研究问题(RQ1-RQ6),涵盖模型架构、XAI技术、特征重要性、预测时域、地理覆盖和挑战方向。
1.7 本综述的贡献:包括PRISMA 2020指导的系统综述、注意力架构筛选规则及其敏感性分析、双轴分类法、聚合特征重要性共识、10项质量评估框架、跨研究证据综合、主导XAI技术批判性评估及研究路线图。
1.8 论文组织结构:第2节描述方法学流程,第3节报告结果,第4节讨论启示与局限性,第5节总结与未来方向。
**2. 方法学**
2.1 综述方法框架:遵循结构化证据映射工作流,将可解释性视为具有可解释输出的已实施分析而非模型标签。框架包括检索、去重、标题与摘要筛选、全文验证、标准化提取、质量评估和综合七个阶段。
2.2 目标变量定义与统一:将太阳辐照度(W/m2)、太阳辐射(MJ/m2或kWh/m2)、PV功率输出(W、kW、MW)和PV能量(kWh)作为独立目标类别,避免跨类别比较。
2.3 资格标准:定义六项纳入标准(IC1-IC6)和七项排除标准(EC1-EC7)。关键标准包括实际实施XAI方法、使用ML/DL预测模型、同行评审、2016-2026年发表窗口、英文全文和定量性能指标报告。
2.4 搜索策略:围绕可解释性、基于学习的预测和太阳能目标三个概念域构建检索式,适应各数据库语法要求。Scopus、Web of Science、IEEE Xplore和ScienceDirect共返回951条记录。
2.5 研究选择过程:五阶段流程包括识别(951条)、去重(移除334条重复,剩617条)、标题与摘要筛选(排除399条+34条手工审查)、全文审查(排除11条,剩173条)和滚雪球式追踪(最终仍为173条)。
2.6 注意力筛选规则(EC2)的敏感性分析:三部分分析包括排除集构成审计(299条均未提及公认解释技术)、随机样本独立复核(75条中零错误排除,Wilson 95%置信区间0-4.9%)和具体边界示例。结论是EC2规则保持了综述对已实施和已报告解释的关注。
2.7 数据提取:使用包含15个字段(D1-D15)的预定义提取表,涵盖文献计量信息、模型与XAI细节、数据集、时域、输入和报告指标。两遍提取流程确保内部一致性。
2.8 质量评估:10项质量检查表(Q1-Q10),每项评分是(1分)、部分(0.5分)或否(0分),满分10分。高质量研究得分8.0-10.0,中质量6.5-7.5,低质量低于6.5。质量评估用于证据加权而非排除。
2.9 数据综合与分析方法:鉴于异质性,不进行形式化荟萃分析,而是结合定性叙述综合、文献计量分析和分类学分类。指标统一遵循固定优先级规则,仅在分母明确定义时使用归一化误差。
**3. 结果**
3.1 研究选择与语料库概述:951条记录经去重(334条)和筛选后,173项研究纳入定性综合。最常见排除原因是EC2(注意力仅作为架构),占299篇(48.5%)。文献计量显示2024-2025两年占全部语料库67%。地理上中国占31.8%,其次为印度和韩国。质量评估平均分7.97,114项(65.9%)为高质量。质量分层综合显示主要排序在高质量子集中保持不变。
3.2 ML/DL架构全景:LSTM及递归架构最常用(48项研究),如LSTM-SHAP框架[70]和GA-BiLSTM[72]。CNN出现于32项研究,用于结构化气象时间序列和天空/卫星图像。Transformer模型出现于39项研究,Temporal Fusion Transformer具有内置变量选择网络。树集成模型(随机森林36项、XGBoost 27项)与TreeSHAP天然兼容。新兴架构包括物理信息神经网络(PINN)、Kolmogorov-Arnold网络(KAN)和生成式AI框架。前馈神经网络(45项)和经典统计/模糊逻辑模型也被使用。
3.3 XAI技术分析:SHAP是最常用技术(69项研究),用于主动特征选择、运行控制和网络安全。特征重要性和PFI用于39项研究,验证物理关系并优化数据管道。LIME用于14项研究,提供局部故障排除叙述。注意力可视化(31项)、内在可解释模型(14项)、敏感性分析(9项)、显著性图(7项)、PDP/ICE(6项)和基于梯度的方法(3项)也被使用。47项(27%)研究采用多种XAI技术。对主导XAI技术的批判性评估记录了计算复杂度、解释不稳定性、对相关输入的敏感性和忠实性问题。
3.4 输入特征分析与预测时域:XAI分析共识显示太阳能辐照度(GHI、DNI、DHI)是几乎所有研究中最重要预测因子,温度为第二重要变量,湿度第三。时间和循环编码是稳定次要驱动因素。特征排序随季节和气候带变化。预测时域方面,短期(1-24小时)最密集(41项显式评估),主要使用事后归因方法;超短期(<1小时)依赖天空图像和视觉Grad-CAM/显著性方法;日前(24小时)依赖NWP数据和卫星图像;中长期采用SHAP和PFI进行结构敏感性分析。
3.5 性能评估与基准比较:研究采用异质指标(RMSE 138项、MAE 127项、R2 84项、MAPE 46项、nRMSE 29项),R2范围从0.46到0.999。单位差异大且常省略明确归一化基础,使跨研究比较不可靠。最显著方法学缺口是定量XAI评估指标稀缺,仅少数研究测量解释保真度、稳定性或运行时间。
3.6 跨研究证据综合:分级综合显示辐照度首要性、时间和循环编码重要性、温度作为一致性次要驱动因素等发现具有强一致性。次驱动因素的条件性和解释评估稀缺性由多项独立高质量研究支持。新兴级发现仅基于1-2项研究。
**4. 讨论**
4.1 主要结论:XAI用于太阳能预测快速发展,SHAP是最常用解释器,解释趋于突出辐照度、时间编码和温度。定量评估不常见,以人为中心的验证罕见。这些结论经质量分层后保持稳定。
4.2 研究空白与未来方向:六个空白包括超越事后解释单一文化向内在设计转变、严格的XAI评估框架、分布式能源资源实时部署、气候分层和时空分析、人机回环验证与LLM集成、因果和处方性前沿。
4.3 可复现性缺口及其后果:仅1.7%的研究完全公开代码和数据,该缺口均匀分布于各质量层级。后果包括性能声明无法独立验证、解释输出无法重现、夸大表面新颖性、削弱领域自身透明度论证。
4.4 局限性:搜索限于英文和四个数据库,EC2敏感性分析仅重新筛选25%随机样本,质量评分采用单一评审团队共识程序,跨目标比较受限于异质单位和归一化基础。
**5. 结论**
本PRISMA系统综述从951条记录中筛选出173项研究,分离了注意力仅用于提升精度与注意力作为解释的边界(排除299篇)。质量分层综合显示主要排序在114项高质量研究中保持不变。文献增长迅速,SHAP是主要解释器(69项研究),解释集中于物理上合理的驱动因素。然而,跨研究基准比较脆弱,解释质量很少被测量,可复现性基础设施不完善,以人为中心的验证缺失。未来需要目标统一、标准化定量XAI评估、更多内在可解释或物理信息设计,以及因果推理和处方性反事实分析。