《Environmetrics》:Gradient-Boosted Mixture Regression Models for Postprocessing Ensemble Weather Forecasts
编辑推荐:
现今的天气预报基于由数值天气预报(numerical weather prediction, NWP)模型多次运行所产生的集合预报(ensemble forecasts)。然而,此类预报通常存在未校准(miscalibrated)和/或偏差(biased)问题
现今的天气预报基于由数值天气预报(numerical weather prediction, NWP)模型多次运行所产生的集合预报(ensemble forecasts)。然而,此类预报通常存在未校准(miscalibrated)和/或偏差(biased)问题,因此需要统计后处理。非齐次回归模型,如集合模型输出统计(ensemble model output statistics, EMOS),常用于修正这些预报。这类模型大多基于单峰参数分布,虽能改善预报但无法实现完全校准。为解决该问题,研究人员提出了一种混合回归模型,其中每个可交换组(exchangeable group)的集合预报仅对应一个混合分量(mixture component)与混合权重(mixture weight),称为模型输出统计混合模型(mixture of model output statistics, MIXMOS)。为消除站点特异性效应并使用更长训练数据,响应变量与集合预报均采用标准化异常(standardized anomalies),即标准化异常模型输出统计混合模型(MIXSAMOS)。由于精心选择的协变量(covariates,如不同气象变量)可提升模型表现,研究人员引入了面向混合回归模型的非循环梯度提升(non-cyclic gradient-boosting, GB)算法。进而将 MIXSAMOS 扩展为 MIXSAMOS-GB,可实现自动变量选择。该新型混合回归模型在德国 2 m 地表温度预报的案例研究中,显著优于现有前沿后处理模型。
《Environmetrics》刊发的该研究以集合数值天气预报(numerical weather prediction, NWP)预报存在系统偏差与欠离散(underdispersion)问题为背景。传统集合模型输出统计(ensemble model output statistics, EMOS)与标准化异常模型输出统计(standardized anomaly model output statistics, SAMOS)多采用单峰参数分布,难以刻画原始集合的多模性、偏度与峰度,且难以从大量气象变量中自动选变量。研究人员因此提出模型输出统计混合模型(mixture of model output statistics, MIXMOS),并将响应与预报转为标准化异常得到 MIXSAMOS;进一步引入非循环梯度提升(non-cyclic gradient-boosting, GB)算法,提出 MIXSAMOS-GB,实现所有分布参数与混合权重(mixture weights)协变量依赖及自动变量选择。研究结论为:MIXSAMOS 较 SAMOS 略有提升,MIXSAMOS-GB 能显著优于 SAMOS-GB、SAMOS 与非参数分位数回归森林(quantile regression forest, QRF),并为各分布参数提供可解释的变量选择结果;该工作填补了集合后处理中无支持自动协变量选择的混合回归模型这一空白,具有重要意义。
作者开展研究用到的主要关键技术方法包括:使用德国 280 个 SYNOP 站点的 2 m 地表温度观测与 ECMWF 提供的 50 个扰动集合加 1 个控制预报、8 类气象变量数据;以标准化异常去除季节效应并扩充静态训练数据;构建可交换组分对应的混合回归框架,使每组集合对应一个混合分量;采用非循环 GB 算法以对数分数(logarithmic score, LogS)或连续排名概率分数(continuous ranked probability score, CRPS)为损失进行系数更新与交叉验证;以 SAMOS、SAMOS-GB、QRF 为基准,用概率积分变换(probability integral transform, PIT)、可靠性指数(reliability index, RI)、CRPS、LogS、MAE、RMSE 与 Diebold–Mariano 检验评估。
研究结果
6.1 General Results(总体结果):研究人员通过对全站点测试集评估发现,所有后处理模型均改善原始集合校准;SAMOS(-GB) 略欠自信且尾部未校准,MIXSAMOS(-GB) 因分布灵活性校准最优,甚至略优于非参数 QRF。表格汇总显示 MIXSAMOS-GB 的 CRPS、LogS、MAE 最低,RMSE 与 QRF 相当;MIXSAMOS(-GB) 覆盖略超 96.15% 名义值,宽度大于 SAMOS(-GB) 但因双分量独立尺度而更分散。站点级 CRPSS 显示 MIXSAMOS 较 SAMOS 中位改进约 1.6%,MIXSAMOS-GB 较 SAMOS-GB 约 3.0%,且分别在 86.4%、46.07% 站点显著;MIXSAMOS-GB 在 62% 站点 CRPS 最低,南方多站 QRF 更优。特征重要性表明 t2m 集合均值最重要,其次为控制预报与季节正弦余弦项,湿度、云量、风相关变量进入前十。
6.2 Station Specific Results(单站结果):以 Dillingen/Donau–Fristingen 站为例,研究人员展示原始集合、SAMOS(-GB) 与 MIXSAMOS(-GB) 的预测概率密度函数(probability density function, PDF)。MIXSAMOS 左偏以匹配原始集合偏度,第二组分尺度仅含截距故更宽;MIXSAMOS-GB 可呈现双模并给更接近观测的组分更大混合权重。参数轨迹显示第二组位置参数常低估观测,骤冷日中第二组反而更接近实测,MIXSAMOS-GB 会大幅提高该组权重以修正误差。
讨论与结论翻译:研究人员讨论指出,MIXSAMOS(-GB) 借助比 SAMOS(-GB) 更灵活的分布形式降低由分布设定偏差造成的误校准;非循环 GB 能从大量标准化异常气象变量中自动筛选协变量,缓解多重共线性和过拟合。结论部分表明,MIXSAMOS 在单峰假定之外引入可交换组对应的多分量结构,MIXSAMOS-GB 进一步结合非循环 GB,在德国 2 m 地表温度后处理中取得更优校准与更低风险分数;该框架已植入 R 包 mixnhreg,可为业务气象服务提供更可解释、可追踪且分布灵活的统计后处理方案。