理解数据匮乏地区水文模型率定中的数据充分性与时序信息有效性
《Journal of Hydrology》:Understanding data sufficiency and temporal informativeness for hydrological model calibration in data scarce regions
【字体:
大
中
小
】
时间:2026年09月14日
来源:Journal of Hydrology 7.3
编辑推荐:
• 仅使用1个月的流量数据即可在约20%的流域中实现稳健的参数率定,这些流域大多为非积雪流域。
• 积雪流域需要6至12个月才能达到基准性能,约占25%–44%的情况。
• 在稀疏数据率定条件下,KGE指标优于NSE,但随着数据量增加,两者差距缩小。
• CART(分类回归树
• 仅使用1个月的流量数据即可在约20%的流域中实现稳健的参数率定,这些流域大多为非积雪流域。
• 积雪流域需要6至12个月才能达到基准性能,约占25%–44%的情况。
• 在稀疏数据率定条件下,KGE指标优于NSE,但随着数据量增加,两者差距缩小。
• CART(分类回归树)和符号回归可用于预测数据充足性并确定最佳率定时机。
**引言**
水文模型是对流域中水的储存、转化和转移过程进行简化的数学表征(Beven, 2001; Wagener et al., 2001)。通过概念化水文循环及其组分通量,基于过程的模型将输入的气象驱动力转化为径流量,代表流域的综合水文响应(Bl?schl et al., 2011; Guniganti et al., 2024; Uhe et al., 2021)。这些模型被广泛应用于洪水预报、水资源管理和气候变化评估等领域(Malla and Arya, 2025; Rudraswamy et al., 2023)。模型在特定应用中的可靠性和稳健性取决于多个方面和主观决策,如输入数据、模型率定和评价指标等(Chen et al., 2023; Melsen et al., 2019)。率定确保模型参数能够真实地表征水文过程,并捕捉流域中的水文动态。率定质量 critically 依赖于观测径流记录的可获得性和可靠性(Abbaspour et al., 2017)。尽管建议使用较长记录进行模型率定(Jiang et al., 2024; Yapo et al., 1996),但在数据稀疏、不连续或仅短期可得的地区,这往往不切实际(Bl?schl et al., 2019)。
尽管观测技术近年来取得了显著进步,仍有大量流域面临地面观测严重匮乏的问题,被视为"无资料流域"(Guo et al., 2021),这限制了制定科学水资源管理决策的能力,也使无资料流域径流预报(PUB)成为水文领域的核心挑战(Hrachowitz et al., 2013)。在PUB框架下,基于过程的水文模型被广泛用于通过区域化方法将参数从无资料流域的有资料流域进行迁移,从而预测径流。由于实际水文工作者通常没有持续流量监测的预算和时间(Levin et al., 2023),仅使用稀疏的、基于点的流量数据率定基于过程的模型已成为无资料流域中区域化方法的可行替代方案(Georgievová et al., 2023; Huang et al., 2020a)。然而,在不同水文气候条件下,率定数据长度与模型可靠性之间的权衡仍然缺乏定量刻画。虽然传统率定框架通常强调数据量,但新兴证据表明,信息含量而非数据体积决定了模型能否得到良好率定(Park et al., 2025; Pool and Seibert, 2021; Staudinger et al., 2025; Wright et al., 2018)。
Sorooshian et al.(1983)最早对此问题提出了基础性观点,其结论认为一年的数据足以实现有效率定。此后,许多研究者也使用不连续或短期水文数据集(通常不足一年)对来自异质性气候区的流域进行了率定研究,验证了这一结论(Kim and Kaluarachchi, 2009; Perrin et al., 2007; Seibert and Beven, 2009; Tada and Beven, 2012)。例如,Perrin et al.(2007)对美国12个流域的两个概念模型进行了率定,证明从总计39年数据中随机选取约350个日径流观测值即可实现稳健的参数估计。类似地,Seibert and Beven(2009)和Kim and Kaluarachchi(2009)表明,一小部分具有信息量的径流值可以再现使用较长数据集所获得的模型行为,进一步印证了率定数据的信息含量可能比其数量更为重要。
Singh & Bárdossy(2012)提出了关键事件识别(ICE)算法来识别时间序列中的关键事件。使用连续7–8年记录中不足10%的数据(约200个点)进行率定,可达到与全数据相当的精度,但该方法在单个流域之外的适用性仍不确定。类似地,少数研究(Pool and Seibert, 2021; Seibert and Beven, 2009; Seibert and McDonnell, 2015)表明,在关键水文条件下选取的10至16个径流值(如峰值流量事件及其随后的消退阶段),可以捕捉较长连续记录中的大部分信息。虽然这些研究为数据高效率定提供了令人信服的案例证据,但它们大多局限于单个或少量流域,对空间变异性或控制数据需求的流域特征方面的认识有限。Staudinger et al.(2025)使用学习曲线来了解模型在三个流域中如何从有限的流量数据中学习,他们证明学习曲线在样本量达到500个点后趋于平稳。
虽然上述研究者考虑了不连续数据用于率定,但很少有研究强调率定数据的时间连续性和季节代表性。Melsen et al.(2014)得出结论,Rietholzbach流域率定的最低数据需求至少需要一个水文季节(约五个月)才能实现稳定率定,且湿润季节由于信息含量更高而产生更好的结果。类似地,Sun et al.(2017)评估了从一个月到一年的率定期,发现在湿润流域中,仅使用一个月的流量观测数据进行率定仍可获得与更长期率定相当的模型性能。表1对以往研究进行了综合总结。总体而言,这些研究表明,被认为足以进行率定的数据量在不同模型框架、流域类型和率定策略之间差异很大。报告的需求从少数战略性选取的观测值到数年的连续记录不等,表明率定数据充足性既受模型结构的影响,也受流域特定水文特征的影响。
尽管取得了显著进展,但对率定数据充足性的理解仍存在一个关键空白。以往研究使用了广泛的模型、率定策略和流域样本(表1),但通常局限于气候或地貌条件相对均匀的少量流域,并在较短的验证期进行评估。这些局限性限制了流域对率定敏感性的控制因素以及不同率定期时间信息量的认识能够被推广的程度。最关键的是,此前没有任何研究明确利用可解释的、基于属性的算法来预测稀疏数据率定条件下的性能损失,或根据流域特征先验地估算最佳率定月份。在大数据水文学时代(Addor et al., 2017; Fowler et al., 2021),这一空白尤为局限,因为大数据水文学提供了跨越数百个流域、涵盖多样水文气候格局来检验和预测率定充分性的机会。
为弥补这一空白,本研究开发并测试了一个先验预测框架,该框架在一致的模型框架内,直接从静态流域属性估算率定持续时间和时机需求。我们在涵盖多样气候和地貌格局的671个CAMELS-US流域中采用HBV-TEC(Hydrologiska Byr?ns Vattenbalansavdelning)模型。在所有流域中使用单一模型结构使我们能够隔离率定持续时间和时机的影响,排除模型结构差异的干扰。模型系统性地使用从一个月到一年的流量记录进行率定,随后进行数十年跨度的验证以评估率定性能的持久性。具体而言,本研究探讨三个相互关联的问题:(1) 稀疏率定数据的持续时间如何影响长期径流可靠性?(2) 流域属性在多大程度上能解释率定敏感性的空间变异?(3) 能否基于物理和气候特征预测最具信息量的率定月份?为解决这些问题,我们采用了一个两阶段分析框架,将基于过程的水文推理与数据驱动方法相结合。首先,使用分类回归树(CART)揭示流域描述子与模型行为之间的层次关系。这些模型被用于(i)预测性能下降的幅度,(ii)确定最佳率定期。其次,采用符号回归推导解析表达式,将随时间变化的气象输入与静态属性联系起来,以识别最佳率定期。研究结果为有资料和无资料流域的数据高效率定提供了一个可迁移的框架,将关注点从"多少数据才够"转变为"何时、何地的短期率定仍能保持可靠"。
**数据**
本研究使用了来自美国本土671个流域的数据,数据来源于大样本研究的流域属性与气象数据集(CAMELS-US)(https://ral.ucar.edu/solutions/products/camels)。这些流域的集水区面积从4到25,000 km2不等,被归类为人类影响极小的流域,以确保径流反映自然水文行为。该数据集纳入了日尺度气象驱动数据,包括降水、最高温度和最低……
**模拟设置**
本研究旨在评估稀疏流量记录是否足以率定概念水文模型而不大幅损失预测性能。为解决这一问题,我们基于CAMELS-US数据集开发了一套系统性的模拟框架,该数据集提供了美国本土671个流域在1980–2014年间的日尺度水文气象记录和流域属性。径流模拟使用HBV-TEC模型进行,该模型……
**性能下降的计算与最佳率定月份的识别**
如第3节所述,模型率定在七个不同的滚动窗口长度(1–12个月)下进行,以评估有限的流量信息如何影响HBV-TEC模型的率定。为了量化相对于基准模型,随着率定数据减少性能下降的程度,按照公式(1)、(2)、(3)计算了NSE的下降值(ΔNSE)。首先,对于给定的率定月份m和流域C,计算所有可用年份(y = 1982–2013)的NSE中位数……
**率定数据长度对模型性能的影响**
通过检查按照ΔNSE分布的流域分布,评估了率定数据长度对模型性能的影响,其中HBV-TEC模型分别使用不同长度的流量数据(1、2、3、4、6、12个月以及缺失60%数据的12个月)进行率定。基准和稀疏数据率定情景下模型性能(以NSE衡量)的空间分布见图S3,为不同率定条件下模型绝对技能提供了参考……
**讨论**
本研究考察了在水文模型率定仅有稀疏流量数据可用时,能否保持可靠。使用HBV-TEC模型对来自CAMELS-US数据集的美国671个流域进行了研究,我们评估了随着率定窗口从一年缩短至一个月,率定效果如何变化。这一动机源于运营水文领域中数据匮乏日益严峻的挑战,源于不完整的测站记录和运营径流测站的显著减少……
**结论**
本研究开发并测试了一个先验预测框架,将基于过程的率定实验与可解释的数据驱动方法(CART和符号回归)相结合,直接从静态流域属性估算一个流域需要多少率定数据以及何时这些数据最具信息量。使用来自CAMELS-US数据集的671个流域和单一一致应用的概念模型(HBV-TEC),我们系统地评估了率定性能……
**CRediT作者贡献声明**
Velpuri Manikanta:撰写——初稿,可视化,软件,调查,正式分析,数据管理,概念化。Surya Kiran Guniganti:撰写——审阅与编辑,方法论,调查,概念化。Daneti Arun Sourya:撰写——审阅与编辑,资源,正式分析,概念化。Rathinasamy Maheswaran:概念化,正式分析,方法论,监督,撰写——审阅与编辑。
**未引用参考文献**
Flasch et al., 2014; Viglione and Parajka, 2020; Wu et al., 2021。
**利益冲突声明**
作者声明不存在可能影响本文所报告工作的已知竞争性经济利益或个人关系。
Velpuri Manikanta | Surya Kiran Guniganti | Daneti Arun Sourya | Rathinasamy Maheswaran
生物通微信公众号
生物通新浪微博
今日动态 |
人才市场 |
新技术专栏 |
中国科学人 |
云展台 |
BioHot |
云讲堂直播 |
会展中心 |
特价专栏 |
技术快讯 |
免费试用
版权所有 生物通
Copyright© eBiotrade.com, All Rights Reserved
联系信箱:
粤ICP备09063491号