基于物理与机器学习地下水模型在可持续含水层管理中的比较:艾米利亚-罗马涅(意大利)区域研究

《Journal of Hydrology: Regional Studies》:Comparison of physics-based and machine learning groundwater models for sustainable aquifer management: A regional study in Emilia-Romagna (Italy)

【字体: 时间:2026年07月30日 来源:Journal of Hydrology: Regional Studies 4.7

编辑推荐:

  研究区域:艾米利亚-罗马涅(Emilia-Romagna)地区东北部约7000 km2的区域。地下水储存在一个复杂的多层含水层系统中。研究焦点:研究人员实施了一个MODFLOW 6数值地下水流动模型和一个随机森林(Random Forest)算法,以比较基于物

  
研究区域:艾米利亚-罗马涅(Emilia-Romagna)地区东北部约7000 km2的区域。地下水储存在一个复杂的多层含水层系统中。研究焦点:研究人员实施了一个MODFLOW 6数值地下水流动模型和一个随机森林(Random Forest)算法,以比较基于物理的方法和机器学习方法在同一研究区域模拟和预测历史及未来地下水水头(groundwater head)值的性能。通过情景分析评估区域多层含水层系统对气候和人为应力变化的响应。该区域的新水文认识:MODFLOW 6模型和随机森林算法产生了一致的结果,尽管随机森林通常更为乐观,并预测降水变化和抽水变化对区域含水层系统的影响较低。两种模型均表明,未来降水减少与地下水开采增加相结合将对浅层和深层含水层产生负面影响。相反,减少抽水可以部分抵消降水的减少,使某些区域的地下水水头得以恢复。分析还识别出对扰动最敏感的区域,在这些区域,降水变化和开采变化导致地下水水头下降幅度最大。结果强调了整合基于物理方法和机器学习方法以更好地解释结果并提高模型性能的优势。这种方法加强了校准过程和情景分析,鉴于地下水建模在水资源管理和政策决策中日益增长的相关性,它提供了宝贵的贡献。
**论文解读:基于物理与机器学习地下水模型在可持续含水层管理中的比较——以意大利艾米利亚-罗马涅区域研究为例**

**研究背景与问题**
地下水是干旱和易干旱地区饮用水、农业、工业及生态系统稳定的关键淡水资源。欧洲地下水管理受到《水框架指令》和《地下水指令》的约束,旨在维持水质和水量状态。随着全球变暖导致干旱事件频发且加剧,地下水开采压力增大,含水层系统可能需要较长的恢复时间。在气候变化背景下,平衡淡水需求与可用性日益困难,可持续管理策略如限制开采、增强补给和监测水位至关重要。地下水建模是理解含水层现状、预测未来水位变化的关键工具。传统基于物理的模型(如MODFLOW)依赖达西定律等物理方程,而机器学习方法(如随机森林)则通过数据驱动算法捕捉非线性关系。近年来,两种方法的比较研究逐渐增多,但针对复杂多层含水层系统的区域尺度综合对比仍显不足。本研究旨在通过对比基于物理的MODFLOW模型和随机森林算法,评估两者在模拟和预测历史及未来地下水水头方面的性能,并分析区域含水层系统对气候和人为应力变化的响应,为可持续地下水管理提供科学依据。

**研究内容与结论**
研究人员在意大利东北部艾米利亚-罗马涅地区约7000 km2的区域,构建了MODFLOW 6数值地下水流动模型和随机森林算法,模拟了2002-2018年的历史地下水水头,并设计了2019-2030年的情景分析(包括参考情景、降水减少、降水减少+抽水增加、降水减少+抽水减少)。结果表明,两种模型均显示未来降水减少和抽水增加将导致浅层和深层含水层地下水水头下降,而减少抽水可部分抵消降水减少的影响,使部分区域水头恢复。随机森林在历史拟合中精度更高(RMSE分别为2.49 m和3.28 m,对比MODFLOW的6.52 m和10.70 m),但在极端情景外推时可能更保守。两种模型在南部区域出现最大差异,该区域也是水头下降最敏感区。研究强调整合物理模型与机器学习方法可提高模型性能,为区域水资源管理和政策制定提供重要支持。该论文发表在《Journal of Hydrology: Regional Studies》。

**关键技术方法**
研究人员主要采用了两种关键技术方法:(1)基于物理的MODFLOW 6数值地下水流动模型,水平分辨率1 km2,垂直分为35层,采用瞬态模拟,输入参数包括水文地质参数(水力传导率、孔隙度等)、地下水开采量(来自Arpae的2002-2017年多级数据)、分布式补给(基于日降水与温度数据,通过Turc公式计算实际蒸散发)以及河流边界条件(来自区域数据库)。(2)随机森林算法,基于R语言实现,以地下水水头异常值(相对于2010-2015年均值的偏差)为预测目标,输入变量包括监测井坐标、水文地质参数、地形、气候变量(降水、温度、潜在蒸散发)、土地覆盖系数、地下水开采量及时间变量。数据来源包括艾米利亚-罗马涅区域监测网络(127个监测井,其中103个浅层、24个深层)及区域公开数据集。模型训练采用2010-2015年数据,测试期为2016-2018年,并进行了空间交叉验证(200次随机分区)。情景分析模拟了2019-2030年期间降水减少(基于波隆那1813年以来历史干旱统计)和抽水变化(±20%)的组合情景。

**研究结果**

**3.1 历史地下水水头模拟**
通过对比2010-2018年模拟与观测的地下水水头异常值,随机森林算法在浅层和深层监测井均优于MODFLOW模型:随机森林的RMSE分别为1.56 m和1.89 m,而MODFLOW分别为6.52 m和10.70 m。随机森林的残差分布更集中(均值接近零,标准差约1.5-1.9 m),而MODFLOW残差较大且分散(标准差达6.4-10.7 m)。变量重要性分析表明,对于浅层含水层,地面高程、潜在蒸散发、地下水开采量和降水是最重要变量;对于深层含水层,开采量、监测井X坐标、降水和水平距离河体距离最重要。

**3.1.1 随机森林空间外推能力**
通过200次随机分区(90%训练,10%测试)的空间交叉验证,随机森林对浅层和深层监测井的平均RMSE分别为2.02 m和2.60 m,略低于时间测试期的RMSE(2.49 m和3.28 m),表明模型具有良好的空间泛化能力,但时间外推更具挑战性。

**3.2 未来地下水水头预测**
情景分析结果显示,在降水减少情景(情景1)下,两种模型均预测研究区地下水水头下降,南部区域下降最显著。在降水减少叠加抽水增加情景(情景2)下,水头进一步下降,MODFLOW预测平均下降0.35 m,随机森林仅0.02 m。在降水减少但抽水减少情景(情景3)下,约60%的监测点(MODFLOW)和66%的监测点(随机森林)出现水头回升,但中南部区域仍有下降。两种模型在南部区域预测差异最大,随机森林普遍预测更乐观(水头更高)。

**讨论与结论**
**讨论总结**:在预情景模拟期,随机森林在历史拟合中表现更优,其累积变量(降水、抽水、潜在蒸散发)采用局部空间尺度而非区域尺度,能更好捕捉空间异质性。浅层井数据更多(103 vs 24),因此随机森林对浅层精度更高。两种模型在南部丘陵区域误差均较大,可能与地形复杂性和河流-含水层相互作用未能完全表征有关。变量重要性分析验证了模型物理合理性,如降水、抽水对浅层和深层的关键作用。在情景分析中,两种模型趋势一致,但随机森林对极端情景的预测更保守(如抽水增加时水头下降幅度更小),这可能源于其训练数据未包含类似极端条件,导致外推能力不足。此外,随机森林预测仅限监测点位置,无法全区域推广,且输入变量未包含河流水位等动态因素,可能影响准确性。
**结论翻译**:本研究聚焦于实施数值地下水流动模型和随机森林算法,以模拟意大利东北部艾米利亚-罗马涅地区部分多层含水层系统的历史、当前和未来地下水水头分布。目的是比较基于物理的方法和机器学习方法在同一研究区域再现历史地下水水头值和预测未来条件的性能。为模拟未来条件,首先定义了一个参考情景,其中所有时间依赖输入参数在季节尺度上保持恒定,使用校准期最后五年的平均值。然后,扰动参考条件以评估自然和人为压力源对区域含水层系统的综合影响。校准后,两种模型在预测地下水水头异常方面能力有限,尽管在预测相应时间序列值时表现满意。这很可能是因为地下水水头均值的季节性变异性相对有限。对于异常值和原始水头值,随机森林算法比MODFLOW模型提供了更准确的估计——这是预期结果,因为机器学习模型被优化以拟合训练数据,并且在有更多信息可用时性能更好,如本研究所示。然而,机器学习缺乏物理可解释性可能限制对潜在水文地质过程的理解。此外,缺乏物理基础可能阻碍算法将结果推广到新条件的能力,这在设计气候变化适应策略时至关重要。尽管如此,在情景分析中,随机森林算法提供了与MODFLOW模型预测一致且合理的结果。此外,随机森林校准中选定的输入变量(降水、潜在蒸散发、地下水开采量)及其聚合尺度在物理上是一致的。这表明随机森林算法捕获了关键含水层系统动态。值得注意的是,情景分析中改变的降水和地下水开采量是随机森林校准中最相关的特征之一。MODFLOW模型和随机森林算法提供了一致的结果,尽管随机森林通常更乐观,并预测降水和抽水变化对区域含水层系统的影响较低。根据两种模型,区域含水层系统预计将遭受未来降水减少和地下水开采增加对浅层和深层含水层的后果。相反,减少抽水可以部分抵消较低降水的影响,导致某些区域地下水水头恢复。研究区西南部是对扰动最脆弱的区域,因为这里降水和地下水开采变化的影响导致最大地下水水头下降。多种因素可以解释这一点,包括空间离散化、边界条件邻近性和附近河流。该区域也显示了MODFLOW模型和随机森林算法之间的最大差异,引入了额外的不确定性。随机森林算法可以为不同变量在最终地下水水头分布估计中的相对重要性提供有价值的见解。这些见解可以支持数值模型的解释并指导可能的改进,例如通过改进空间表示或最有影响变量的参数化。尽管不是正式的敏感性分析,但来自随机森林算法的变量重要性评估起到了类似作用,因为它突出了哪些输入对模拟的地下水响应具有最强控制。例如,随机森林中潜在蒸散发和降水的重要性支持了MODFLOW模型中定义分布式补给的方法,该方法本质上依赖于相同的数据。MODFLOW模型作为评估随机森林算法预测合理性的稳健基准。鉴于机器学习算法常常难以外推超出其训练数据,将其输出与基于物理模型的输出进行比较有助于阐明此类方法的局限性。这种比较还提出了调整机器学习预测的可能方法,由于其更简单的实现和较低的数据需求,对于将地下水建模扩展到无法支持物理模型实施的区域特别有价值。这些证据强调了整合基于物理和机器学习技术的好处,以增强对其结果的理解并提高模型性能。校准和情景分析阶段都将受益于这种方法,鉴于地下水建模的重要性及其在未来水资源管理和政策制定中日益关键的作用,这是一个重要的贡献。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号