解决滑坡易发性模型变异性的敏感性分析工作流

《Quaternary Research》:Sensitivity analysis workflow to address landslide susceptibility model variability

【字体: 时间:2026年08月11日 来源:Quaternary Research 2.3

编辑推荐:

  当代滑坡易发性建模通常采用机器学习(ML)方法和算法。这些建模方法通常以滑坡编目为主要组成部分,并辅以条件因子选择方法。尽管模型结果可能对输入数据的变异性敏感,但由此产生的影响很少被详细研究。研究人员利用基于逻辑回归(LR)的易发性方法,评估模型结果对滑坡编目

  
当代滑坡易发性建模通常采用机器学习(ML)方法和算法。这些建模方法通常以滑坡编目为主要组成部分,并辅以条件因子选择方法。尽管模型结果可能对输入数据的变异性敏感,但由此产生的影响很少被详细研究。研究人员利用基于逻辑回归(LR)的易发性方法,评估模型结果对滑坡编目规模的敏感性。使用包含1054个滑坡的编目,以50个滑坡为增量(至最大可能值1050)评估样本量,对每个样本量生成1000个随机编目子集(即蒙特卡洛模拟),以量化因随机训练和保留集选择引起的模型性能变异。对使用这些模型结果生成的易发性图输出进行初步目视检查,发现存在极端过度预测。虚假模型表明模型准确性与现实性之间存在虚假相关性。为解决这一问题,敏感性分析工作流采用性能指标校正因子和更严格的特征选择,以促进一致、现实且可复现的模型。本文提出的工作流量化了模型变异性,并评估了易发性图对输入变化的敏感性。
**论文解读:滑坡易发性模型变异性的敏感性分析工作流**

**研究背景与问题**

滑坡易发性建模旨在预测滑坡在景观中的发生概率,是地质灾害风险评估与土地利用规划的重要工具。当代滑坡易发性建模普遍采用机器学习(ML)方法,如逻辑回归(LR)、随机森林、朴素贝叶斯(NB)和支持向量机(SVM)等算法。这些方法通常依赖滑坡编目作为主要训练数据,并通过条件因子(如坡度、坡向、曲率等)进行空间预测。然而,模型结果对输入数据的变异性高度敏感,尤其是滑坡编目的大小、样本选择方式以及训练/验证集的划分,可能导致模型性能波动显著。尽管已有研究指出输入数据的重要性,但绝大多数滑坡易发性研究缺乏对数据变异性的系统量化分析,导致模型结果的可重复性、可比性和可迁移性受限。此外,常用的性能指标如受试者工作特征曲线(ROC)下面积(AUC)可能因数据波动而产生虚假的高性能,掩盖不切实际或不可解释的预测结果。因此,亟需一种标准化工作流来量化输入数据变异对模型输出的影响,并筛选出稳定、现实且可复现的模型结果。

**研究目标与假设**

研究人员提出假设:滑坡编目数据本身的选择和规模会显著影响模型性能及易发性图的准确性和外观。若假设成立,则模型在不同区域间的迁移性以及在同一区域内的一致性将无法保证,且对工作流改进(如添加特征选择)的统计显著性也无法评估。为此,本研究开发了一种敏感性分析工作流,首先通过评估编目数据变异来建立模型变异性的基线(即与易发性模型AUC结果相关的不确定性),并据此建立可量化的指标,以评估添加特征是否对模型性能有实际改进。

**研究方法与关键技术**

研究采用美国肯塔基州马戈芬县(Magoffin County)的滑坡编目(n=1054),该编目基于1.5米分辨率LIDAR数据解译生成。研究主要技术方法包括:

1. **蒙特卡洛模拟**:以50个滑坡为增量(从50至1050),每个样本量生成1000个随机子集,模拟输入数据变异。
2. **机器学习算法比较**:对LR、SVM、NB和袋装树(BT)四种常用算法进行性能对比,最终选择LR作为工作流的核心模型。
3. **秩相关特征选择**:基于Pearson相关系数(ρ)的共线性矩阵,通过迭代剔除高相关特征,设定组内平均绝对相关系数(μgroup)和标准差(σgroup)阈值(本研究选取σgroup=0.2),以保留最少但有效的特征。
4. **AUC校正因子**:基于模型输出概率分布与理想正态分布(均值为0.5,标准差为0.15)的偏离程度,计算校正因子,得到校正后AUC(cAUC),用于过滤“罕见逻辑回归事件”(即虚假模型)。
5. **特征添加测试**:在完整编目上添加地形湿度指数(TWI)作为额外特征,验证工作流对特征改进的评估能力。

所有模拟在MATLAB中并行化执行,使用fitmnr、fitcnb、fitcsvm、TreeBagger和corr等函数,地理数据处理和制图在Esri ArcPro中完成。

**研究结果**

**模型方法变化**
四种算法的平均AUC随滑坡数量增加均出现先上升后平台的现象,在约300个滑坡后趋于稳定。LR和SVM的AUC曲线几乎重叠,NB和BT初始AUC较高但增幅有限。这表明模型性能对数据量的敏感性不依赖特定算法,而源自数据本身。

**特征选择**
当采用宽松的σgroup阈值(1.0)时,保留了25个特征中的23个,导致模型不稳定并频繁出现虚假逻辑回归事件。通过步长0.1的阈值测试,发现σgroup=0.2时cAUC最高且最稳定,此时仅保留6个特征:平均坡向、曲率和、最小高程、高程标准差、平面曲率标准差和坡度标准差。与先前研究(Crawford等,2021)的BT解析方法(保留12个特征)相比,本研究方法更简洁且可解释。

**模拟结果**
使用σgroup=1.0(保留23个特征)的1000次迭代模拟,未校正AUC分布显示强模型性能,但cAUC分布呈现大量离群值,表明绝大多数迭代产生无效地图。而σgroup=0.2(保留6个特征)的模拟中,平均cAUC在200个滑坡后迅速稳定在约0.55,离群值在350个滑坡后进入中等性能区间。这表明严格特征解析显著提高了模型稳定性和地图现实性。

**逻辑回归地图结果**
对比最大AUC和最大cAUC的地图(图10、11),未解析模型(ρ=1.0)即使AUC值高,其易发性图也呈现极端且不合理的空间分布(如大面积高概率区)。而严格解析模型(ρ=0.2)在500个滑坡后,最大cAUC和平均cAUC地图视觉上高度一致,且概率分布接近正态,表明模型结果稳定且现实。

**与附加特征比较**
在完整编目(1054个滑坡)中添加TWI后,需将σgroup阈值手动提高至0.3以避免TWI被剔除。结果显示,添加TWI使AUC提高2%,但cAUC降低5%,且地图中高概率区域面积显著增加,概率分布呈双峰,导致空间对比过于尖锐,降低了地图实用性。这表明常见特征可能仅提高AUC而降低地图现实性,工作流能够有效识别此类特征。

**讨论与结论**

**讨论**
研究证实了滑坡编目规模超过300个后,增加数据量对AUC提升无统计显著性,与已有研究一致。模型性能的平台效应可能源于数据空间自相关范围的限制。特征选择方面,严格的共线性解析显著减少虚假模型,但可能因特征类型受限(仅DEM衍生)而需要权衡。AUC校正因子有效过滤了极端概率分布,但选择正态分布作为基准存在主观性,未来可探索其他分布(如偏态分布)。此外,工作流提供的基线变异(约10%)表明,许多已发表的单次模型结果可能不可复现,需通过随机种子报告或蒙特卡洛模拟来增强可靠性。

**结论**
本研究提出了一种量化并校正输入数据变异对滑坡易发性模型影响的工作流。基于蒙特卡洛敏感性分析,结合秩相关特征选择和AUC校正因子,该工作流能够筛选出稳定、现实且可复现的模型结果。研究强调单纯追求性能指标(如AUC)可能产生虚假模型,而cAUC作为综合指标可有效识别实用地图。该工作流为不同建模改进(如算法选择、超参数调整、特征添加)提供了可比较的噪声基线,有助于推动滑坡易发性建模的标准化和可靠化。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号