PINN-GNN混合神经网络用于数据中心精确PUE预测

《Mathematics》:PINN-GNN Hybrid Neural Networks for Precise PUE Prediction in Data Centers

【字体: 时间:2026年08月11日 来源:Mathematics 2.3

编辑推荐:

  准确的能效预测是绿色计算和低碳6G基础设施的基础。由于数据中心的高能量密度和复杂的设备交互,它们代表了一个具有挑战性的测试平台。现有方法要么忽略物理定律,要么无法捕获异构设备之间的空间依赖性。为了解决这些局限性,研究人员提出了一种混合框架,将物理信息神经网络(

  
准确的能效预测是绿色计算和低碳6G基础设施的基础。由于数据中心的高能量密度和复杂的设备交互,它们代表了一个具有挑战性的测试平台。现有方法要么忽略物理定律,要么无法捕获异构设备之间的空间依赖性。为了解决这些局限性,研究人员提出了一种混合框架,将物理信息神经网络(Physics-Informed Neural Networks,PINNs)与图神经网络(Graph Neural Networks,GNNs)集成,用于电能使用效率(Power Usage Effectiveness,PUE)预测。开发了两种算法变体:物理分解PINN-GNN(Physically Decomposed PINN-GNN,PDPG)和统一端到端PINN-GNN(Unified End-to-End PINN-GNN,UEPG)。从实际能源和热原理导出的物理正则化约束被嵌入到模型训练中,以提高预测结果的物理合理性。在实际数据中心数据集上验证,所提出的方法在主流基线上实现了卓越的准确性和鲁棒性,为冷却和资源管理提供了可靠支持。
**论文解读:基于PINN-GNN混合神经网络的数据中心PUE精确预测**

### 研究背景与问题
随着数字服务快速增长,计算基础设施的能效优化成为绿色计算和低碳6G网络的关键。数据中心因高设备密度、异构设备类型及复杂热耦合,成为能效预测的典型挑战场景。行业标准指标——电能使用效率(Power Usage Effectiveness,PUE)虽能反映整体效率,但受操作和环境变化影响难以精确预测。现有方法分为两类:基于物理的方法(如计算流体动力学模拟)虽遵循物理定律,但计算成本高,无法实时预测;数据驱动方法(如机器学习、深度学习)虽能学习传感器特征到PUE的映射,但常忽略物理知识,产生不符合物理规律的预测(如IT负载上升时冷却功率下降),且泛化能力差。近期研究探索了深度学习架构,但仍存在两个关键空白:纯数据驱动方法忽略设备间空间依赖性(如热源与冷却单元的热耦合);现有混合方法未同时利用图结构建模设备关系。因此,研究人员提出一种结合物理信息神经网络(PINNs)与图神经网络(GNNs)的混合框架,旨在联合建模设备级空间依赖并强制物理一致性,提升PUE预测精度和泛化能力。

### 研究内容与结论
研究人员在《Mathematics》期刊上发表论文,提出了一种基于PINN-GNN混合架构的高精度PUE预测方法。该方法开发了两种互补算法变体:物理分解PINN-GNN(PDPG)和统一端到端PINN-GNN(UEPG)。通过将能量平衡约束和热演化约束作为软正则化项嵌入损失函数,确保预测结果物理合理。在来自贵州和呼和浩特两个生产数据中心集群(2018-2024年,共30,037个有效样本)的真实数据集上验证,PDPG和UEPG均优于纯GNN和CLDNN等主流基线,其中PDPG的均方误差(MSE)最低(4.79×10-6),比UEPG低约四倍,比纯GNN低约7.2倍,比CLDNN低约7.7倍。消融实验证实了每个物理约束和GNN组件的贡献,跨站点和跨时间测试表明模型具有良好的泛化能力。该研究为数据中心冷却和资源管理提供了可靠的预测基础,并有望推广至其他网络场景,助力绿色低碳6G网络发展。

### 关键技术方法(不超过250字)
研究人员采用的主要技术方法包括:(1)图注意力网络(Graph Attention Network,GAT)编码器,通过三层多头部注意力机制捕获设备间空间依赖关系;(2)设备级功率预测模块,采用类型级参数共享的多层感知机(MLP)将节点表示映射为设备能耗预测;(3)温度预测模块,通过浅层MLP(ELU激活)输出传感器位置温度,用于热演化约束;(4)物理约束损失函数,包含能量平衡约束(基于室外温度的冷却与IT功率比例残差)和热演化约束(基于图拉普拉斯算子的热扩散方程残差)。样本来源:两个生产数据中心集群(贵州和呼和浩特)的实时监控平台,涵盖2018-2024年数据,包含冷通道温度/湿度、室外温度、机架利用率等特征,共30,037个样本,按时间顺序70%训练、15%验证、15%测试。

### 研究结果

#### 4.2 预测性能
通过对比PDPG、UEPG、纯GNN和CLDNN在测试集上的PUE预测误差,研究人员发现所有方法均能捕捉PUE的季节性趋势(夏季高、冬季低),但PDPG和UEPG的曲线更贴近实测值,波动更小。定量结果表明,PDPG的MSE最低(4.79×10-6),UEPG为1.84×10-5,纯GNN为3.44×10-5,CLDNN为3.68×10-5。PDPG相比纯GNN降低了86.1%的MSE,且95%置信区间无重叠,配对t检验p<0.01,统计显著。收敛曲线显示PDPG在约6个epoch后达到稳态,损失约1×10-5;UEPG收敛稍慢但震荡更小。累积分布函数(CDF)曲线表明PDPG在低误差区间累积概率最高,验证了其最优预测精度。

#### 4.3 消融研究
通过系统移除各组件,研究人员评估了每个部分的贡献。移除能量平衡约束或热演化约束均导致MSE上升,其中热约束影响更大;同时移除两者(纯GNN)使MSE显著增加至3.44×10-5。将GAT替换为GCN或随机图结构后,MSE分别升至2.85×10-5和3.22×10-5,表明注意力机制和物理邻接矩阵的重要性。MLP基线(无GNN)达到最大误差(1.52×10-4)。这些结果证实,两个物理约束提供互补信息,且图表示学习与物理正则化协同作用,共同提升预测性能。

#### 4.4 泛化性和鲁棒性分析
跨站点测试(在贵州集群训练,呼和浩特测试)中,PDPG的MSE为6.2×10-5,仍低于CLDNN的站点内MSE(3.68×10-5),表明物理约束帮助模型泛化至不同气候条件。跨时间测试(2018-2020年训练,2021-2022年测试)中,PDPG的MSE为5.5×10-5,说明模型学习了底层物理关系而非记忆季节模式。超参数敏感性分析表明,能量平衡权重λ1在0.05-0.5范围、热演化权重λ2在0.5-2.0范围内模型稳定,当前值(λ1=0.1,λ2=1.0)位于稳定区域且性能接近最优。

### 总结与结论
研究人员总结指出,所提出的PINN-GNN混合框架通过集成能量平衡和热演化约束,有效解决了现有方法在空间拓扑建模和物理约束方面的不足。PDPG采用固定物理聚合公式,优于UEPG的可学习聚合,表明当物理关系明确时,嵌入先验知识比数据驱动学习更有效。模型在跨站点和跨时间设置下的竞争力验证了物理约束有助于捕获可迁移的物理原理。研究结论翻译如下:本文针对能效预测作为网络优化的基础计算方法,提出了一种通用的PINN-GNN混合框架,以数据中心为代表性验证场景,但方法可推广至多种网络系统。所提出的架构将能量平衡和热演化约束集成到GNN学习过程中,开发了PDPG(先预测设备级功耗再计算PUE)和UEPG(端到端直接映射)两种方案。实验表明,模型在准确性和鲁棒性方面优于主流基线。高精度PUE预测为面向网络的能源管理任务提供了可靠的计算基础。例如,当预测PUE超过预设阈值时,操作员或自动化控制器可主动调整冷却设定点或重新分配工作负载,使PUE恢复到高效范围。未来工作将扩展至云边计算基础设施和无线通信网络,并探索与智能调度策略的集成,实现闭环优化,助力绿色低碳6G网络发展。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号