《Frontiers in Water》:Calibration and validation strategies of SWAT+ for streamflow simulation: a systematic review
摘要
有效的SWAT+(Soil and Water Assessment Tool Plus)水文建模需要严格的校准与验证。然而,实现高模型性能在很大程度上取决于从众多可用选项中恰当选择和应用合适的策略。本系统综述评估并识别了SWAT+建模研究中最有效的数据源、校准工具与软件以及方法论途径。研究团队从Scopus、Web of Science(WOS)和SWAT+文献数据库中收集了2017年至2025年间发表的80篇SWAT+研究论文。研究遵循PRISMA指南进行筛选。在数据稀缺区域,卫星反演和再分析产品,如气候危害组红外降水站数据(CHIRPS)、气候预报系统再分析(CFSR)和ERA5,在适当偏差校正的前提下,为稀疏的地面站点网络提供了实用替代方案。此外,采用动态维度搜索(DDS)算法的SWAT+ Toolbox因其可获取性和集成优化算法而成为应用最广泛的校准软件。综述进一步表明,将自动优化与后续人工细化相结合的混合校准方法能够持续改进参数化。此外,利用实际蒸散发(ETa)或土壤湿度进行多站点和多变量校准可减少异质流域中的参数等效性。然而,本综述揭示,尽管这些先进策略具有明显优势,其应用仍不充分。虽然纳什-萨特克利夫效率(NSE)仍为主导目标函数,但克林-古普塔效率(KGE)因其对模拟偏差的优越处理能力而日益受到青睐。统计基准显示,文献中日尺度模拟的NSE中位数为0.65,月尺度模拟为0.68。本综述为研究人员提供了方法论框架,以优先采用先进校准策略,确保可持续水资源管理的稳健且可复现的水文模拟。
系统综述注册:https://osf.io/mdkbq
1 引言
准确的水文过程建模对于可持续水资源管理和土地利用与气候变化条件下的政策制定至关重要。水文模型对于量化水量平衡组分以及评估土地利用和气候变化对流域水文的空间和时间影响至关重要。在这些模型中,SWAT在过去几十年中已在全球范围内广泛应用。该模型经过改进以更好地模拟复杂水文过程,从而开发出全面修订版本SWAT+。SWAT+模型包含多项关键改进,包括更好地区分高地地区和洪泛区、更灵活的模型配置、动态水库运行以及可自定义的含水层边界,从而能够更精确地模拟复杂水文过程。这些改进使该模型成为多样化应用中最全面的工具之一。
该模型已应用于多样化的地理和气候环境,校准和验证等关键建模程序确保模拟的水文过程准确反映观测到的流域行为。校准是调整最敏感参数值以更好地使模型适应当地条件的过程,而验证是将模型结果与独立数据进行比较而不修改先前调整参数的过程。有效的校准和验证对于减少模型不确定性并增强其对当前和未来条件模拟能力的信心至关重要。
越来越多的SWAT+水文模拟研究依赖于多样化的数据源、校准和验证工具以及校准策略,这些均对模型精度产生强烈影响。这些研究使用了不同来源和不同分辨率的DEM、土地利用/土地覆盖(LULC)和土壤数据集。尽管径流数据仍是SWAT+校准中使用最广泛的输入,一些研究已纳入多个变量以更好地表征水文过程。校准方法也差异很大,从全自动算法到人工试错方法和混合技术。
本系统综述的动机源于SWAT+在水文建模中日益增长的应用。作为SWAT的更新和更先进版本,SWAT+已被广泛采用;然而,尚无综合综述专门审视径流模拟的校准和验证策略,而这支撑着其他SWAT+建模应用。因此,本研究旨在:(1)系统识别主要和替代输入数据源、校准数据集、校准和验证软件/工具以及校准方法的最新进展;(2)为未来SWAT+应用提供结构化建议,以提高可复现性并减少模型不确定性。
2 方法论
2.1 数据库与检索策略
本系统综述按照PRISMA 2020指南进行,以确保全面透明的方法论并评估研究质量。文献检索在两个主要文献数据库中进行,包括Scopus、WOS和SWAT模型文献数据库,这些数据库因其在环境科学和水文学中的全球覆盖范围和科学可信度而被选中。对于Scopus和WOS,检索关键词使用布尔运算符、截断和短语匹配系统开发,以优化敏感性和特异性。最终检索字符串为("Soil and Water Assessment Tool plus" OR "SWAT+*" OR "SWAT plus" OR "Revised version of SWAT")AND("Streamflow" OR "surface runoff" OR "hydrology" OR "water flow")AND("modeling" OR "simulation" OR "model performance" OR "calibration" OR "validation" OR "parameter estimation" OR "uncertainty analysis")。
文献检索覆盖2017年至2025年期间,以与SWAT+的初始发布和后续采用保持一致。仅纳入以英文发表的同行评审原创研究论文,排除早期访问文章。为确保相关研究的全面覆盖,还从SWAT+文献数据库中手动提取了SWAT+记录。
2.2 纳入和排除标准及数据提取
本综述专门关注使用SWAT+的水文模拟研究,以评估模型校准和验证策略。纳入使用径流数据校准和验证SWAT+模型的同行评审原创研究论文,即使包含额外分析。排除以下文章:(1)关注旧版SWAT模型,(2)使用耦合SWAT+模型,或(3)未进行校准和验证。
综述方案(包括预定义的纳入和排除标准及数据提取框架)已在开放科学框架上前瞻性注册。全文筛选由通讯作者(B. F. A.)和合著者(R. A.)根据预定义的资格标准进行。关于研究资格的任何分歧均通过作者间讨论解决。
从Scopus、Web of Science和SWAT文献数据库共检索到227篇文章。记录导出至Zotero,自动移除92篇重复文献。剩余136项研究由通讯作者根据预定义资格标准进行标题和摘要筛选及全文评估。其中,35篇文章在标题和摘要筛选中因与综述目标不相关而被排除。最终,101项研究接受全文审查,21项因纳入和排除标准被排除并说明理由。最终,本系统综述纳入80项研究并提取数据。
为确保方法论严谨性和可复现性,所有纳入研究均使用结构化检查清单进行质量评估。评估显示,研究清楚记录了径流数据源、正式校准程序、独立验证以及多个模型性能指标的使用。然而,在方法论可复现性方面识别出少量报告缺口,特别是HRU定义阈值的明确报告和ETa计算方法。所有纳入研究的累计质量得分均高于70%,为本综合提供了可靠的方法论证据基础。
从每项符合条件的研究中系统提取数据,以捕获关键的文献计量、地理和方法论信息。文献计量细节包括作者、发表年份、国家和总研究区域覆盖范围。对于模型配置,提取了地理空间输入的来源和空间分辨率,包括DEM、LULC、土壤图和气候数据集。为支持可复现性,HRU阈值和ETa估算方程作为质量评估标准的一部分进行记录。还记录了校准数据源,以确定研究是否仅依赖径流或包含额外变量。提取了时间信息,包括校准时间步长(日或月)、预热期以及校准和验证时长。最后,汇编了校准软件、优化算法、目标函数和报告的性能指标的详细信息。
对于包含多个流域、校准情景、算法或性能指标的研究,每个独立建模案例被视为独立单元进行分析,而非单一文章级观测。因此,图表中报告的频率代表建模案例数量,更准确地描绘了所审查研究中的方法论模式。提取的数据使用Excel和R进行分析,以生成描述性统计、评估发表趋势并制作地理分布图。PRISMA流程图使用Biblioshiny生成并借助AI组织。
3 结果与讨论
3.1 纳入研究的发表趋势与地理分布
为考察SWAT+在径流模拟中应用的演变,进行了2017年至2025年发表趋势的时间分析。在SWAT+发布后的最初几年,发表的研究数量仍然有限,早期应用主要集中在模型开发、测试和模型开发者的田间尺度评估。从2021年起,发表产出显著增加,表明更广泛的水文建模社区逐步采用SWAT+。
发表的地理分布表明,埃塞俄比亚、中国和美国贡献了最多的SWAT+径流模拟研究。其他地区也开展了额外的SWAT+径流研究,包括印度Beas流域、智利Longaví流域、尼泊尔Karnali河流域、摩洛哥中部、意大利地中海流域以及菲律宾,凸显了该模型的全球适用性。这种分布可能反映了多种因素的组合,包括水文建模方面强大的研究能力、国家对流域管理和水资源研究的投资、长期水文气象监测数据的可用性,以及应对水安全和气候变化适应日益增长的努力。
3.2 数据输入及其对SWAT+模型性能的影响
SWAT+模拟的可靠性和准确性从根本上取决于输入数据集的质量和空间分辨率,特别是DEM、LULC、土壤和气候数据。这些数据源的选择不仅影响流域的物理表征,还决定后续模型校准的成功。
3.2.1 数字高程模型
DEM分辨率对径流模拟的影响被发现具有强烈的尺度依赖性。在所审查的研究中,30 m SRTM DEM是最常采用的高程数据集,其次是90 m SRTM和30 m ASTER GDEM。在小型和地形复杂的流域中,更精细分辨率的DEM改善了排水网络、坡度梯度、水流路径和流域边界的表征。相比之下,在较大或相对平坦的流域中,高分辨率DEM的优势通常不太明显,因为局部地形变异性对径流产生的影响减弱。多项研究还报告,30 m SRTM DEM比30 m ASTER GDEM产生更可靠的河网划分,主要因为其较低的垂直误差和减少的地形伪影。此外,SRTM 30 m相对于较粗的90 m数据集的普遍使用表明需要更精细的地形表征以捕捉水文异质性。
相反,在大河流域进行的研究报告,使用极高分辨率DEM对径流性能的改善有限。在这些空间尺度上,径流动态主要受气候强迫和流域特征控制,而非细尺度地形变异性。因此,水文条件化数据集(如90 m MERIT DEM)在显著降低计算需求的同时提供了令人满意的模型性能。这些发现表明,DEM分辨率本身并不决定SWAT+性能;相反,其影响取决于流域尺度、地形复杂性和所表征的水文过程。
3.2.2 土壤和土地利用/土地覆盖数据
LULC和土壤数据集定义了HRU的空间异质性,因此强烈影响SWAT+中水文过程的表征。所审查的研究采用了各种国家和全球LULC及土壤数据集,空间分辨率各异。然而,相对较少的研究系统评估了替代数据集对模型性能的影响,表明输入数据选择的影响仍未得到充分量化。
研究表明,LULC数据集对SWAT+性能的影响主要取决于流域异质性而非仅空间分辨率。在小型和破碎化流域中,高分辨率LULC数据集通过保留细尺度景观变异性持续改善HRU划分,从而更真实地模拟径流产生和蒸散发。然而,这些优势在较大流域中减弱,因为空间聚合效应允许较粗产品实现相当的预测性能,同时大幅降低计算需求。值得注意的是,不同高分辨率源之间的选择可能产生系统性差异;例如,FORM 10 m数据集已被证明在特定径流模拟中优于ESA 10 m。
静态与多时期LULC数据集的选择是减少长期模拟中参数不确定性的关键策略。虽然静态图通常被认为在气候为主要驱动因素时足够,但利用动态数据集使模型能够机制性地解释城市化或森林砍伐等土地利用转变。这种时间一致性确保CN2动态反映流域不断演变的物理现实,防止模型过度依赖气候强迫来解释实际上由地表变化引起的趋势。
土壤数据集观察到类似模式。大多数纳入研究在可用时采用国家土壤数据库,而其他研究依赖全球产品,如协调世界土壤数据库(HWSD)和FAO/UNESCO世界土壤图。高分辨率土壤数据集通常增强土壤质地和水力特性空间变异性的表征,导致更真实的HRU参数化并可能减少结构不确定性。相比之下,粗分辨率全球土壤数据集在校准后通常实现令人满意的径流性能,但在表征内部水文过程(如实际蒸散发和地下水补给)方面效果较差,因为空间异质性丧失和参数等效性增加。
3.2.3 气候数据
超过一半的所审查研究使用地面气象站数据作为SWAT+模拟的气候输入。然而,这些数据集通常缺乏捕捉局部降雨变异性所需的空间覆盖,特别是在复杂地形和数据稀缺区域。因此,网格化气候产品(如CHIRPS、CFSR和ERA5)在SWAT+应用中的使用有所增加,因为它们提供空间和时间一致的气象信息。类似地,Kassaye等人(2024a)在埃塞俄比亚Baro河流域使用偏差校正的CMIP6气候数据,证明了全球气候模型输出在数据稀缺区域未来水文预测中的实用性。同样,Tumsa等人(2022)使用具有时间序列校准方法的SWAT+量化了埃塞俄比亚Guder流域LULC对水量平衡的影响,报告校准期间NSE值为0.70–0.79,验证期间为0.86。这些产品在地面观测有限的地方可作为有用替代方案,尽管其性能应在应用前进行评估和偏差校正。例如,降水输入的准确性是模型复制物理降雨-径流转换能力的基本控制因素。
比较研究表明,网格化气候数据集的性能在不同区域、气候条件和方法论框架间差异显著。在埃塞俄比亚上Danakil流域,CHIRPS与观测降雨的一致性最强(R2 = 0.853),优于CFSR(R2 = 0.688)和ERA5(R2 = 0.494)。类似地,在马达加斯加,CHIRPS在12个流域中比CFSR产生更好的径流模拟,在五个流域实现满意性能(NSE > 0.45),而CFSR为三个流域。然而,在马来西亚Kelantan河流域,APHRODITE在月径流模拟中表现最佳(NSE = 0.61–0.71;R2 = 0.74–0.76),而CHIRPS在验证期间表现不佳(NSE = ?0.27),ERA5-Land性能有限(校准NSE = 0.45;验证NSE = 0.30),NASA POWER实现中等技能(校准NSE = 0.65;验证NSE = 0.45)。
类似地,Eini等人(2022)报告PERSIANN-CDR在波兰流域实现NSE值范围为0.32至0.68,而PERSIANN-CCS表现出明显较低的性能(NSE = ?0.11至0.41),强调产品内显著变异性。Kardhana等人(2025)进一步证明,原始GSMaP降水导致不令人满意的径流模拟(NSE < 0.20);然而,偏差校正后,模型性能显著改善,达到NSE > 0.60并接近使用地面观测获得的性能。增加进一步复杂性的是,Tapas等人(2025)表明GPM IMERG在GLUE校准下实现最高效率(NSE = 0.50;KGE = 0.68),而ERA5和GridMET在使用DDS校准时表现最佳,表明气候数据集的适用性也受校准方法影响。
3.3 校准与验证软件/工具
SWAT+的校准和验证可使用人工、自动或结合专家判断与优化算法的混合方法进行。多个软件包可用于支持敏感性分析、参数优化和模型评估,包括SWAT+ Toolbox、SWATplus-CUP和IPEAT+。最近,R和Python中的编程接口通过实现可复现工作流、并行计算和与先进优化算法的集成扩展了校准能力。
SWAT+ Toolbox是所审查研究中最常应用的开源校准平台,最常与DDS算法结合使用。SWAT+ Toolbox的额外应用包括埃塞俄比亚Baro河流域的研究,证明其在数据稀缺区域的广泛采用。Bihonegn和Gebeyehu Awoke(2025)进一步评估了埃塞俄比亚上青尼罗河流域的时空产沙量变异性,补充了其在上Awash流域的早期工作。DDS非常适合高维优化问题,因为它高效探索大参数空间同时减少计算需求。比较评估表明,SWAT+ Toolbox与DDS结合可实现稳健的校准和验证性能。例如,Cecconello等人(2025)报告月校准统计NSE = 0.69和KGE = 0.78,以及日验证统计NSE = 0.74和KGE = 0.78,在评估条件下优于R-SWAT(SUFI-2)。类似地,Harifidy等人(2024)发现SWAT+ Toolbox(DDS)比使用LHS的R-SWAT产生更稳定和一致的自动校准结果。
另一个SWAT+校准软件是SWATplus-CUP,它是SWAT-CUP的扩展,支持校准和不确定性分析。它集成了顺序参数估计(SPE,前身为SUFI-2)和粒子群优化(PSO)等优化算法。SWATplus-CUP专门设计用于应对SWAT+径流模拟的高参数化需求。尽管在所审查研究中使用有限,但这并不表明校准能力较低,因为软件采用也受许可要求、计算资源和用户熟悉度影响。
IPEAT+是专为SWAT+开发的免费校准和不确定性分析平台。它结合概率参数估计和不确定性分析方法来评估参数敏感性和预测不确定性。该工具在文献中应用有限,可能由于其较高的计算需求和更成熟工具(如SWAT+ Toolbox和SWATplus-CUP)的主导地位。
除专用校准软件外,越来越多的研究采用基于R和Python的编程工作流。R-SWAT是带图形用户界面(GUI)的开源R工具,而SWATplusR、SWATrunR和SWATdoctR等包支持基于脚本的工作流,用于自动化模型执行和参数优化。特别是,SWATrunR使用户能够开发针对特定建模目标定制的校准工作流。其他研究采用通用框架,如FME包用于敏感性分析和不确定性量化,而SPOTPY已通过Python优化工作流用于SWAT+敏感性分析和校准。总的来说,这些研究表明向灵活、基于脚本的校准环境转变的趋势日益增长,促进定制化和可复现的SWAT+工作流。
PEST是广泛用于环境模型参数估计和不确定性分析的模型无关优化框架。在所审查文献中,其应用于SWAT+仍然有限,但展示了其作为替代校准框架的潜力。Alp等人(2022)评估了PEST内实现的三种优化算法——Levenberg Marquardt(LM)、洗牌复形进化(SCE)和协方差矩阵自适应进化策略(CMAES),发现SCE和CMAES算法优于LM,校准NSE值为0.56,验证为0.38。类似地,Tapas等人(2025)报告校准性能随优化算法和降水数据集而变化,GLUE与GPM IMERG结合时产生最高效率(NSE = 0.50,KGE = 0.68),而DDS与ERA5和GridMET降水时表现稍好。相比之下,LHS持续产生较低的模型效率。这些发现表明校准性能不仅取决于优化算法,还取决于其与降水强迫和流域特征的相互作用。
除校准软件的选择外,多项研究采用混合校准策略,将自动优化与后续人工细化相结合以进一步提高模型性能。虽然这种方法可通过纳入水文专业知识增强校准精度,但如果人工调整未充分记录,也可能引入主观性并降低可复现性。因此,研究人员应明确报告人工调整的参数、其校准范围以及用于终止细化过程的标准,以确保透明度、可复现性和科学严谨性。
3.4 校准与验证策略
适当校准策略的选择主要由流域尺度、空间异质性和建模研究目标决定。在小流域中,校准通常侧重于准确复现不同流量状态,特别是低流量和基流动态。相比之下,大型和水文异质性流域需要额外的空间约束,通过多站点和多变量校准更好地表征内部流域过程。此外,Smit等人(2024)使用水文土壤学见解改进校准,而Sharma等人(2024)使用SWAT+评估排水水管理应用。
径流是SWAT+校准使用的主要观测变量。然而,在大型流域仅使用出口径流校准模型可能产生可接受的统计性能,但未能充分表征内部流域过程。此外,Yulianti等人(2025)证明同位素数据在牧区流域中使用SWAT+改善水量平衡模拟的附加价值,而Julich等人(2022)评估了半干旱流域过度放牧对水通量的影响。这一局限性反映了参数等效性问题,即多个参数集产生相似的出口水文过程线,尽管内部水文过程表征不真实。因此,纳入多个水文站的观测和互补水文变量为模型参数化提供更强约束。
尽管径流唯一校准广泛使用,相对较少的研究采用多变量校准,将径流与蒸散发、卫星反演土壤湿度或水文指数相结合。这种方法为水文循环的不同组分提供独立约束,从而改善模型真实性并减少与内部流域过程相关的不确定性,特别是在大型和空间异质性流域中。遥感反演和再分析产品日益增长的可用性促进了这些互补数据集的使用,特别是在地面观测有限或不可用的数据稀缺区域。
尽管有这些优势,多变量校准也带来方法论挑战。整合遥感和再分析数据集需要仔细考虑数据不确定性以及观测产品与模型模拟之间的潜在不一致性,这可能影响参数估计和校准性能。
3.5 校准与验证方法
除校准软件和变量的选择外,所审查研究采用了几种校准和验证方法以改善模型性能并更好地表征流域过程。一种广泛采用的方法是多站点校准,其中模型参数使用多个水文站的观测同时优化,而非仅在流域出口。这一策略更好地捕捉降雨、土壤和LULC的空间异质性,同时通过在多个位置约束参数值减少参数等效性。虽然对大型和异质流域特别有益,多站点校准也增加校准复杂性。此外,类似地,一些研究使用动态LULC数据集采用多时期校准,以更好地表征与土地利用变化和气候变率相关的长期水文变化。
另一个重要方面是校准时间尺度,涉及月或日增量。比较SWAT+研究表明,月尺度校准持续产生比日校准更高的性能指标。这反映了时间聚合的平滑效应,减少了短期径流变异性并补偿了降雨时间和径流产生的差异,导致NSE、KGE和R2值高于日校准。相反,日校准对于洪水预测和峰值流量分析仍然必不可少,因为它避免了聚合中固有的时间误差掩盖。因此,几项近期研究采用分层校准策略,其中月校准后进行日细化,在改善日水文过程线动态模拟的同时保持长期水量平衡。
另一个重要考虑因素是校准和验证数据集的时间排序。大多数所审查研究遵循传统做法,使用较早的径流记录校准SWAT+,并使用较近期的观测验证模型,以评估时间独立条件下的预测性能。然而,几项近期研究优先考虑数据质量而非时间顺序,使用较近期、更高质量的数据集进行校准。这并不意味着较近期的观测本质上更优。相反,校准数据集应根据数据完整性、一致性和测量可靠性进行选择,因为这些特征直接影响参数估计。
3.6 目标函数
目标函数是用于量化模型校准期间模拟与观测水文变量(如径流、蒸散发和泥沙)之间一致性的统计指标。由于目标函数指导参数优化,其选择直接影响校准结果和SWAT+模拟的可靠性。在所审查研究中,NSE是最常用的目标函数,其次是KGE,而相对较少的研究同时采用多个目标函数。
NSE在所审查研究中的主导地位反映了其作为水文模型校准标准目标函数的长期作用。然而,综合也凸显了其固有局限性。由于NSE基于平方残差,它不成比例地强调高流量事件,使模型性能强烈依赖峰值流量模拟,同时降低对低流量条件和季节性基流动态的敏感性。因此,令人满意的NSE值不一定保证流域过程或水量平衡的准确表征,特别是在以间歇性径流和强烈季节性变率为特征的流域中。
相比之下,KGE因其通过相关性、偏差和变异性同时评估模型性能而日益受到关注,使研究人员能够区分模型缺陷是源于时间误差、系统性偏差还是流量变异性表征不当。所审查研究中观察到的KGE采用增加因此反映了从纯粹统计拟合优度评估向更面向过程的 hydrological 模型性能评估的更广泛转变。
对所审查文献的分析进一步揭示,目标函数的选择应反映流域的主导水文特征和建模目标,而非依赖通用标准。以间歇性径流和显著季节性变率为特征的流域日益采用KGE或对数NSE以改善低流量动态和水量平衡过程的表征。相反,针对多个水文过程(如径流和蒸散发)的研究更频繁地采用多变量或多目标校准策略,结合互补目标函数以约束流域响应的不同组分。
总体而言,互补目标函数使用增加表明SWAT+中从单目标向多目标校准框架的逐渐转变。这些方法不是最大化单一拟合优度统计量,而是寻求改善参数可辨识性、减少等效性并增强多个水文过程的表征,从而改善SWAT+模拟的物理真实性、稳健性和可转移性。
NSE = 1 ? ∑i=1n(Yiobs ? Yisim)2 / ∑i=1n(Yiobs ? Yobsmean)2 (1)
KGE = 1 ? √[(r ? 1)2 + (α ? 1)2 + (β ? 1)2] (2)
其中n为观测数量,Yiobs为时间i的观测径流,Yisim为时间i的模拟径流,r为模拟与观测值之间的线性相关系数,α为模拟与观测值相对变异性的度量,β为平均模拟流量与平均观测流量的比值。
3.7 模型性能评估指标
在SWAT建模中,统计指标用作目标函数以在校准期间优化模型参数,随后使用独立数据集在验证期间评估模拟精度。在所审查研究中,NSE是最常报告的性能指标(92.5%),其次是PBIAS(80%)、R2(57.5%)和KGE(38.8%),而RSR、RMSE、MSE、MAE和相关系数(r)使用较少。最常见的指标组合是NSE、R2和PBIAS(占研究的25%);其次是NSE、R2、PBIAS和RSR(10%)、NSE、PBIAS、KGE和RSR(6.5%),以及其他几种组合,每种出现在不到5%的所审查研究中。约四分之一的研究采用独特的性能指标组合,包括NSElnQ、MSE、MAE、r、bR2和SPAEF,以评估模型性能的特定方面。此外,7.5%的研究补充使用KGE,6.3%的研究用KGE替代NSE,通常与PBIAS和R2结合使用。
由于每个性能指标评估模型行为的不同方面,没有单一指标足以评估整体模型可靠性。PBIAS量化体积误差,因此对于评估水量平衡精度至关重要,而R2测量观测值与模拟值之间线性关联的强度,而不指示模拟是否无偏。KGE通过同时评估相关性、偏差和变异性补充这些指标,而NSE在评估模拟与观测径流之间的总体一致性方面仍然有用。
基于所审查研究综合的证据,没有单一性能指标适用于所有建模目标。相反,应根据主导水文过程和模拟目的选择互补指标。表4总结了不同SWAT+应用建议的最低性能指标集。这些建议源自本综述中呈现的集体证据和文献中建立的水文评估指南。
3.8 SWAT+模型径流模拟的总体性能
为更好地理解SWAT+模型在纳入研究中的总体性能,使用综合统计摘要分析了常用性能指标(NSE、KGE、R2、PBIAS和RSR)的值,包括最小值、四分位数1(Q1,第25百分位)、四分位数2(Q2,中位数或第50百分位)、四分位数3(Q3,第75百分位)和最大值。分析分别在日尺度和月尺度校准和验证期间进行。由于汇编研究代表高度异质的建模条件,包括水文气候、流域面积、流量调节、监测密度和校准期长度的差异,合并统计应解释为一般性能基准而非直接模型比较。NSE、R2和KGE的较高值表示更好性能,而RSR和绝对PBIAS的较低值表示更好性能。
日校准期间,NSE值范围为0.38至0.89,中位数为0.65(Q1 = 0.56,Q3 = 0.76),表明50%的研究实现NSE值高于0.65,对应良好性能。前25%的研究实现NSE > 0.76,凸显高校准性能。0.22的四分位距表明各研究日模拟精度的中等变异性。其他性能指标观察到类似模式。KGE值范围为0.49至0.91(中位数 = 0.72)。R2值范围为0.4至0.90(中位数 = 0.67),表明观测与模拟径流之间的强一致性。RSR(0.4–0.77,中位数 = 0.58)表明与NSE值一致的中等残差。校准期间至少一半研究的绝对PBIAS中位数为8%,表明低系统性偏差。
日验证期间,NSE(中位数 = 0.65)、KGE(中位数 = 0.65)和R2(中位数 = 0.70)确认了所审查研究中模型的可靠性。RSR值(中位数 = 0.6)表明中等残差,而绝对PBIAS值(中位数 = 10%)表明50%的研究在验证期间显示低于10%的系统性偏差。这些结果表明SWAT+在日时间尺度上可靠运行,尽管研究间的变异性表明对校准数据、方法论方法和流域特征的敏感性。
月校准期间,各研究报告的NSE值范围为?0.38至0.92,中位数为0.68(Q1 = 0.56,Q3 = 0.82),表明50%的研究实现良好至非常好的模型性能(NSE > 0.65)。KGE值范围为0.48至0.95(中位数 = 0.71),R2值范围为0.3至0.97(中位数 = 0.74),表明一半研究实现观测与模拟径流之间良好至非常好的相关性。RSR中位数为0.57,表明50%的研究报告RSR值低于此阈值,提示相对较低残差。类似地,绝对PBIAS中位数为13.7%,表明一半研究表现出相对较低的系统性偏差。
月验证期间,超过50%的研究报告NSE和KGE值高于0.65,表明良好至非常好的模型性能。然而,一项研究报告负NSE值(?5.21),表明在数据可用性有限或复杂水文过程条件下模型性能不佳。R2中位数 = 0.73,约50%的研究确认验证期间观测与模拟径流之间的强相关性。RSR和绝对PBIAS值汇总于表5。总体而言,综合结果表明SWAT+在日尺度和月尺度上均表现出可靠的径流模拟性能,但性能因数据条件、校准策略和流域特征而异。