基于Transformer和站点注意机制的自适应时空模式融合算法在PM2.5预测中的应用

《Journal of Atmospheric and Solar-Terrestrial Physics》:Adaptive spatial–temporal pattern fusion for PM2.5 prediction based on transformer and station attention

【字体: 时间:2026年09月09日 来源:Journal of Atmospheric and Solar-Terrestrial Physics 2.2

编辑推荐:

  •引入了一个带有多头注意力的Transformer模块,用于捕捉不同时间步长之间的长距离时间依赖性,从而有效模拟PM2.5浓度的复杂时间演变模式。•设计了一个Station-Attention模块来识别关键监测站并表征空间异质性,增强了模型学习空间变化污染物分布的能力。•开发了一

  
  • 引入了一个带有多头注意力的Transformer模块,用于捕捉不同时间步长之间的长距离时间依赖性,从而有效模拟PM2.5浓度的复杂时间演变模式。
  • 设计了一个Station-Attention模块来识别关键监测站并表征空间异质性,增强了模型学习空间变化污染物分布的能力。
  • 开发了一种具有可学习标量权重的自适应融合机制,以动态平衡时间和空间模块的输出,实现时空表示的灵活互补集成。

引言

空气污染是指大气中某些物质的存在浓度达到有害水平,包括气体、颗粒物和生物分子。它对人类健康、生态系统和更广泛的环境构成重大风险。主要空气污染物包括CO2、PM2.5、SO2和CO。空气污染的影响是多方面的,主要影响人类健康、生态系统和气候(Liu等人,2025年)。根据世界卫生组织(WHO)2022年发布的数据,环境和家庭空气污染每年共同导致全球约670万人过早死亡(Wang等人,2023年)。这使得空气污染成为继高血压、吸烟和高血糖之后的第四大全球死亡风险因素。因此,使用数值模型和人工智能技术准确预测未来的污染物浓度已成为应对这一全球挑战的前沿策略和关键工具。
现有的空气质量预测方法大致可以分为三类:数值模型、传统统计方法和深度学习方法(Li等人,2024年)。数值模型基于物理和化学机制,具有很好的可解释性(Bernacki和Scherer,2025年)。然而,这些方法高度依赖初始条件和计算资源,并且在模拟复杂非线性过程方面存在局限性(G. Zhao等人,2026年)。
传统统计方法,如历史平均值(HA)(Li等人,2017年)和向量自回归(VAR)(Sims,1980年),被广泛用作简单而有效的基线方法。尽管它们在稳定环境中的表现相当不错,但它们捕捉非线性动态和复杂时空依赖性的能力有限。
近年来,深度学习方法逐渐成为主流。早期方法如DCRNN(Li等人,2017年)和STGCN(Yu等人,2017年)利用图神经网络来模拟空间依赖性,而GMAN(Zheng等人,2020年)和GTS(Wu等人,2020年)进一步增强了动态时空相关性的学习。更先进的模型,包括AirFormer(Liang等人,2023年)、PM25GNN(Wang等人,2020年)和MGSFormer(Yu等人,2025年),采用了基于Transformer的架构来更好地捕捉长距离依赖性。此外,连续时间模型如Latent-ODE(Lechner等人,2020年)和ODE-LSTM(Rubanova等人,2019年)为模拟不规则时间动态提供了新的视角。在这些发展的基础上,AirPhyNet(Hettige等人,2024年)将物理知识与深度学习相结合,以在复杂环境条件下提高预测的鲁棒性。然而,现有的深度学习模型仍然存在两个核心局限性:
(1) 对时空动态的建模不足。大多数模型无法充分捕捉监测站之间的动态交互或污染过程中的空间异质性。
(2) 时空特征融合的刚性。结合了空间和时间注意力机制的模型缺乏根据数据特征动态调整时空权重的能力,这使得它们难以适应不同污染场景下主导因素的差异。
为了解决这些挑战,本研究对AirPhyNet模型进行了关键改进,并提出了一个将注意力机制与自适应策略结合的空气质量预测框架。在AirPhyNet的物理方程约束基础上,所提出的模型加入了Station-Attention模块和Transformer模块,以改进多个监测站之间的时空动态表示。此外,还设计了一种自适应融合策略,将空间注意力机制对关键地理位置的关注与Transformer的复杂时间模式建模能力动态整合起来。这种机制能够根据数据特征动态调整时空权重,从而解决原始模型在捕捉长距离依赖性、模拟非线性交互以及适应多样化污染场景方面的局限性。
本研究的主要贡献总结如下:
(2) 开发了一种站点注意力机制,用于动态学习监测站之间的相关性强度,并适应性地关注对目标区域有显著影响的关键站点。这种方法有效地解决了基于固定图结构的空间模型在表示动态污染传输过程方面的局限性。
(3) 提出了一个统一的时空预测框架,其中从时间和空间注意力路径中提取的特征通过自适应融合策略有效整合。这种设计实现了空间和时间信息贡献之间的动态平衡。

部分摘录

空气质量预测模型

近年来,基于深度学习的空气质量预测方法取得了实质性进展。早期的研究主要依赖于传统的时间序列模型,如ARIMA(Box等人,2015年)和Prophet(Taylor和Letham,2018年);然而,这些方法在处理复杂时空依赖性方面能力有限。随着深度学习技术的进步,研究人员越来越多地采用结合卷积的混合架构

方法论

在Hettige等人(2024年)提出的AirPhyNet空气质量预测模型的基础上,本研究解决了其在复杂时空动态下的预测准确性和鲁棒性方面的局限性。为此,在时间和空间维度上引入了关键改进,以更有效地捕捉时间和空间之间的相互依赖性,从而开发了ST-AirNet模型。所提出模型的整体架构如图1所示。

数据描述

我们使用在中国首都北京和深圳收集的实际空气质量数据集来评估我们模型的性能。1北京的数据集包含35个主要监测站,数据覆盖从2017年1月1日到2018年5月30日的范围;深圳的数据集包含11个监测站,数据覆盖从2014年5月1日到2015年4月30日的范围。这两个数据集

结论和未来工作

本研究提出了ST-AirNet,这是一个基于自适应时空融合建模的PM2.5预测框架。通过解耦时间和空间依赖性并通过可学习的融合机制进行整合,该模型有效捕捉了长距离时间动态和空间异质性。结果表明,动态平衡时间积累效应和空间传输过程对于准确模拟空气污染演变至关重要。

CRediT作者贡献声明

黄国彦:撰写——审阅与编辑、方法论、概念化。李俊浩:撰写——原始稿件、验证、软件、方法论。何洪 Dou:撰写——审阅与编辑、调查。彭静怡:可视化、验证、软件。赵国宇:资源、项目管理、资金获取。

利益冲突声明

作者声明他们没有已知的会影响到本文所报告工作的竞争性财务利益或个人关系。
黄国彦|李俊浩|何洪 Dou|彭静怡|赵国宇
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号