《Journal of Hydrology: Regional Studies》:Parsimonious climatic and physiographic controls explain the spatial variability of the Budyko parameter
编辑推荐:
研究区域为美国本土(CONUS)的532个受人为干扰最小的集水区。研究焦点:Budyko框架(Budyko framework)提供了长期水-能量划分的表征。然而,其实际应用依赖于参数ω的可靠估计,而ω的主导控制因子在不同区域仍不一致地被识别。在此,研究人员探
研究区域为美国本土(CONUS)的532个受人为干扰最小的集水区。研究焦点:Budyko框架(Budyko framework)提供了长期水-能量划分的表征。然而,其实际应用依赖于参数ω的可靠估计,而ω的主导控制因子在不同区域仍不一致地被识别。在此,研究人员探究一组最小的气候和自然地理变量能否解释ω在不同水文气候多样集水区间的空间变异性。研究人员应用基于机器学习的变量选择框架来识别不可或缺的控制因子,并评估水文气候异质性对预测因子选择的影响。新的水文见解:结果表明,仅四个变量——降水中的降雪量占比(frac snow)、干旱指数(aridity index)、降水季节指数(precipitation seasonality index)和复合地形指数(CTI)——足以解释ω在CONUS范围内的大部分空间变异性,而植被指数的作用相对较小。研究人员进一步表明,当预测因子选择仅依赖基于相关性的方法时,水文气候异质性可能掩盖对ω主导控制因子的识别。利用所选出的四个控制因子,研究人员分别建立了随机森林(RF)模型和多元线性回归(MLR)模型。两者在独立测试流域均取得了良好性能(RF:R2 = 0.80,RMSE = 0.227;MLR:R2 = 0.616,RMSE = 0.315),且均显著优于两种现有的ω参数化方案(Li模型:R2 = ?0.784,RMSE = 0.679;Bai模型:R2 = ?0.099,RMSE = 0.533)。当将估计的ω代入Fu-Budyko方程(Fu–Budyko equation)后,其能够高精度地再现年径流变异性(R2 = 0.94,RMSE = 98.52 mm)。这些发现表明,ω的大尺度变异性大部分可由一小套水文气候和自然地理控制因子解释,为Budyko框架在无资料和资料稀缺区域的应用提供了具有物理可解释性和简约性的基础。
**1. 引言(Introduction)**
理解集水区尺度的长期水量平衡,即降水如何在蒸散发和径流之间划分,是水文学的一个基础问题。Budyko框架(Budyko framework)以简约的方式表征这种划分,将其概念化为水(降水)和能量(潜在蒸散发PET)竞争的结果。尽管概念简单,但该框架为水-能量划分提供了物理基础的理论基线,在不同气候和景观下表现稳健。Budyko框架在当前复杂模型时代仍保留着不可或缺的价值,它作为一个统一的诊断基准,无需大量参数化即可在大量集水区中进行比较分析。其数据需求极小——仅需降水的长期平均值、潜在蒸散发和径流——使其特别适用于约束模型输出、诊断水文变化以及在资料稀缺区域评估水资源。因此,Budyko框架在评估环境影响、预测水资源可用性以及为水文分析提供物理可解释的约束方面持续发挥核心作用。
在众多单参数Budyko解析形式中,Fu-Budyko形式(Fu–Budyko formulation)应用最为广泛。该形式中,Budyko曲线的形状由单一参数ω控制,该参数决定了给定气候条件下降水在蒸散发和径流之间的划分。ω不仅是一个数学拟合系数,更是一个集水区集成参数,反映了气候变异性和地表特征对长期水平衡的综合影响。早期应用隐含假设所有流域具有统一的曲线(固定ω),但后续研究表明ω存在显著的空间变异性且具有流域特异性,这促使研究者用可测量的集水区属性来解释ω。大量经验与过程研究将ω与植被、积雪过程、气候干旱度和景观属性联系起来,强调其作为集水区特征和水文气候影响综合描述符的作用。尽管ω常被解释为反映超越一阶干旱约束的次要控制,但Budyko框架的发展表明其也可与长期气候干旱度耦合。因此,ω应被视为反映地表特性和水文气候条件对长期水-能量划分综合影响的集水区集成描述符。然而,ω仍常被当作从长期径流观测中校准的参数,其控制因子在不同区域和研究中仍不一致地被识别,这限制了Budyko框架在无资料流域和网格化分析中的应用。
大量研究致力于解释和参数化ω,但对其空间变异性的主导控制因子仍未完全解决。前人研究将ω与气候、植被、积雪、土壤和自然地理属性等多种因素关联,但识别的控制因子常因区域和数据集而异。造成这种不一致的关键原因在于候选预测因子常基于经验假设先验选择,随后通过成对相关性、统计显著性检验或线性方法筛选。这类方法识别ω主导控制因子的能力尚不确定,尤其当预测因子与ω的关系在不同水文气候区变化或预测因子含有重叠信息时。例如,前人研究报告了不同区域和气候类型下的植被-ω关系对比,积雪相关控制因子也存在类似的不一致性。因此,很难确定哪些因子对解释ω的空间变异性真正重要且不可或缺。
近期研究越来越多地采用机器学习(machine-learning, ML)方法参数化ω,以捕捉ω与多种气候和自然地理属性之间的非线性关系。这些方法相比传统回归模型提高了预测精度。然而,现有基于ML的参数化主要强调预测性能,常以模型简约性和物理可解释性为代价。在许多研究中,基于数据可用性或物理直觉先验性地纳入大量气候、植被、地形、土壤和人为相关变量,然后通常在模型训练后评估预测因子重要性。尽管此类分析能识别对模型技能有贡献的变量,但不能直接确定个别预测因子是否不可或缺、其信息是否可由其他相关变量代表,或是否能用更小、更可解释的预测因子集达到可比性能。因此,仅凭预测精度不足以建立稳健且简约的ω参数化。
基于上述空白,本研究旨在识别控制ω在多种水文气候集水区间空间变异性的主导因子。利用CAMELS数据集的532个集水区,研究人员评估了广泛的气候、积雪、植被、土壤和自然地理属性,并采用基于机器学习的框架识别真正不可或缺的解释ω变异性的预测因子。研究发现,四个气候和自然地理变量能解释ω大部分大尺度空间变异性,同时达到与基于完整候选预测因子模型相当的预测性能。由此得到的ω参数化可高精度重现年径流,接近由径流观测直接校准的集水区特定ω值的结果。这些发现为理解长期水-能量划分的控制因子提供了新见解,并支持发展简约且物理可解释的ω参数化方案。
**2. 数据与方法(Data and methods)**
**2.1 研究区域与数据集**
本研究基于CAMELS(Catchment Attributes and MEteorology for Large-sample Studies)数据集,该数据集提供了CONUS(contiguous United States)范围内671个集水区的长期水文-气象时间序列和综合集水区属性。这些集水区的排水面积约4 km
2至25,000 km
2,旨在最小化水库调节和灌溉等人类影响,覆盖了广泛的水文气候条件。研究人员提取了USGS(United States Geological Survey)的日径流观测数据以及与估计Budyko模型参数ω相关的集水区属性。日降水数据取自PRISM(Parameter-elevation Regressions on Independent Slopes Model)数据集,空间分辨率约4 km。潜在蒸散发(PET)数据取自gridMET数据集,使用FAO-56 Penman-Monteith方法计算。所有日数据被汇总为1981-2014年期间的年度值,并按面积加权至集水区尺度。为确保水量平衡的物理一致性,应用了质量控制过滤(如排除年径流小于5 mm的年份、负实际蒸散发年份以及实际蒸散发超过PET的年份),并仅保留至少20个连续有效年记录的集水区。过滤后,保留了532个集水区用于后续分析。
**2.2 Budyko框架与ω估计**
本研究采用Fu-Budyko形式(Fu–Budyko formulation),公式为E/P = 1 + PET/P - [1 + (PET/P)
ω]
1/ω,其中E为实际蒸散发,P为降水,PET为潜在蒸散发,参数ω为唯一经验参数。基于长期水平衡假设E = P - R(R为径流),公式可改写为R/P = [1 + (PET/P)
ω]
1/ω - PET/P。ω通过年度拟合法(annual-fit approach)校准,即最小化观测的年度R/P与公式预测值之间的均方误差(MSE)。另一种方法(气候平均拟合法)得到几乎相同的ω估计(R
2≈0.99),因此采用年度拟合法以利用年际变异性。
**2.3 集水区属性与候选预测因子**
基于前人研究和Budyko框架的物理解释,初始选择了12个集水区属性作为候选预测因子,涵盖六类:气候条件(干旱指数AI、PET均值)、水文气候季节性(降水季节指数、降水季节性时间等)、积雪过程(降雪量占比frac snow)、地形(复合地形指数CTI)、植被(归一化差异植被指数NDVI)以及土壤/地质属性(土壤深度、黏土含量等)。这些变量旨在捕捉可能影响ω空间变异性的主要过程。候选预测因子间的成对相关分析显示中度相关但无严重多重共线性(最大绝对相关系数0.78)。
**2.4 基于机器学习的变量选择**
为克服现有ω参数化研究的局限性(如依赖相关方法和缺乏稳健性评估),研究人员采用了基于机器学习的变量选择策略,明确平衡模型性能和选择稳定性。具体实施了随机森林(RF)后向特征消除程序:从包含所有12个候选属性的模型开始,随机将532个集水区分为20组独立的训练-测试划分(80%训练,20%验证);每次移除一个变量,评估模型性能变化;定义双重标准(平均性能退化不超过5%的RMSE增加和0.02的R
2降低,且在至少75%的划分中同时满足阈值);迭代消除直到无变量可移除。该程序确保保留的变量不仅在平均条件下具有预测能力,而且在不同数据分区中稳健。
**2.5 用于比较的ω参数化模型**
变量选择后,构建了四个ω参数化模型:基于关键控制因子的RF模型、多元线性回归(MLR)模型(对ω施加对数变换以保证ω≥1)、以及两个前人经验公式——Li模型(基于植被覆盖率VCI)和Bai模型(基于CTI、NDVI、农田面积比RFL和季节指数SI)。RF模型通过5折交叉验证网格搜索优化超参数,并在独立测试集(107个集水区)上评估。
**3. 结果(Results)**
**3.1 观测ω的空间分布**
基于年度拟合法估计的ω在532个集水区的空间分布显示,ω并非随机分布,而是大致与主要水文气候梯度(如干旱指数)对应。ω较低(通常1-2)的区域趋向于更湿润和高海拔地区,意味着降水更多转化为径流;ω较高的区域通常与更干燥、低海拔条件相关,蒸散发占降水比例更大。
**3.2 关键控制因子的识别**
RF后向特征消除过程表明,当预测因子数降至四个以下时,模型性能急剧下降。最终保留的四个关键变量为:降雪量占比(frac snow)、干旱指数(aridity index)、降水季节指数(seasonality index)和复合地形指数(CTI)。从物理角度看:降雪量占比反映积雪过程对能量划分的影响;干旱指数表征长期水-能量平衡;季节指数捕捉降水的年内分布;CTI控制土壤水分再分布和径流汇聚。其他变量(如植被指数和土壤属性)未被保留,并不意味着它们不重要,而是其解释信息可能已嵌入保留变量中。
**3.3 变量选择策略对ω参数化的影响**
基于四个关键控制因子的RF模型在测试集上达到R
2=0.80,RMSE=0.227,与使用所有12个属性的RF模型性能相当(R
2=0.81,RMSE=0.226),表明简约变量集可有效估计ω的空间变异性。相比之下,基于特征重要性排名选取的前四个变量(CTI、PET、高频降水频率、frac snow)的RF模型性能明显较差(R
2=0.68,RMSE=0.283),突出了后向消除方法在平衡性能和选择稳健性方面的优势。
**3.4 不同ω参数化模型的评估**
四个参数化模型在独立测试集上比较:RF模型表现最佳(R
2=0.80,RMSE=0.227),其次为MLR模型(R
2=0.616,RMSE=0.315,表达式为ω=1+exp(0.065+0.1043×CTI?0.9623×frac snow?0.5722×aridity index?0.2267×seasonality index))。Li模型和Bai模型性能显著较差(R
2分别为?0.784和?0.099,RMSE分别为0.679和0.533),表明它们在CONUS集水区中的可迁移性有限。Li模型在ω较小时表现尚可,但高估较小ω;Bai模型则倾向于高估。对比表明,本研究的RF和MLR参数化提供了更稳健和可迁移的ω表示。
**3.5 径流模拟的适用性**
将四种参数化模型拟合的ω代入Fu-Budyko方程模拟年径流。RF模型模拟结果与观测值最吻合(R
2=0.94,RMSE=98.52 mm),接近使用观测校准ω的基准模拟(R
2=0.96,RMSE=78.50 mm)。MLR模型表现次之(R
2=0.91,RMSE=121.54 mm),而Li模型和Bai模型分别出现系统性高估和低估偏差。结果表明,本研究的参数化方案可近似达到观测校准水平,无需长期径流记录。
**4. 讨论(Discussions)**
**4.1 ω关键控制因子的物理解释**
后向特征消除程序一致保留了四个关键预测因子:frac snow、aridity index、seasonality index和CTI。其中,降雪量占比对模型性能影响最大,与近期大样本研究一致。frac snow与ω呈负相关,即高降雪占比的集水区倾向于将更多降水转化为径流,物理上归因于融雪快速释放导致土壤饱和及高反照率减少蒸发能量。干旱指数作为第二重要预测因子,ω随气候干燥度增加而增大(即干旱指数减小),反映了长期水文气候条件对集水区功能的塑造。降水季节指数的影响呈水文气候区依赖性:在极湿润和干旱/半干旱区呈负相关,在干亚湿润和中等湿润区呈正相关,表明季风节效应具有条件性而非普适性。CTI与ω正相关,较高CTI值(平坦地形、大汇水面积)促进水分滞留和蒸发,抑制径流生成。总体而言,ω受气候-景观联合控制结构支配,且这些预测因子在不同数据划分下始终保持不可或缺,强化了其根本作用。
**4.2 基于相关性筛选可能失效的原因**
许多水文研究中,预测因子选择前常进行相关性筛选(保留与目标变量相关性强的变量)。然而,当空间和水文气候异质性存在时,相关性筛选可能引入系统偏差。以季节指数为例,其与ω的总体Pearson相关在全部集水区中很弱,但在按干旱度分层分析中展现出符号反转:极湿润和干旱/半干旱区为负相关,干亚湿润和中等湿润区为正相关。这些相反趋势在总体样本中相互抵消,削弱了相关性。类似地,NDVI与ω的总体相关性弱,但分层分析显示在干旱到中等湿润区为正相关,极湿润区变弱且不显著。植被效应在不同干旱度环境下方向和幅度变化,使整体样本中响应抵消。因此,相关性系数可能掩盖物理上有意义的关系。基于机器学习的筛选框架能容纳非线性、交互作用和条件依赖性,为识别ω在异质性下的主导控制因子提供了更稳健的基础。
**5. 结论(Concluding remarks)**
本研究发现,降雪量占比、干旱指数、降水季节指数和复合地形指数这四个变量足以解释CONUS范围内ω的大部分大尺度空间变异性。基于这些因子的RF和MLR模型性能优异,且显著优于现有参数化方案。当纳入Fu-Budyko方程后,可高精度再现年径流变异性(R
2=0.94,RMSE=98.52 mm),接近观测校准水平。研究同时表明水文气候异质性能强烈影响候选预测因子的表观重要性,仅基于相关性筛选可能忽视物理上有意义的控制。研究局限性包括:Budyko框架假设长期陆地水储量变化可忽略、降水/PET/径流数据的不确定性、以及分析基于受最小干扰集水区(人类活动影响未知)。尽管如此,本研究的简约参数化方案为无资料和资料稀缺区域提供了实用途径,未来应测试其在不同气候区和人类扰动水平下的稳健性,并探索尺度扩展应用。