模式相似性学习用于空间自适应土壤有机碳制图

《Journal of Geovisualization and Spatial Analysis》:Pattern Similarity Learning for Spatially Adaptive Soil Organic Carbon Mapping

【字体: 时间:2026年07月19日 来源:Journal of Geovisualization and Spatial Analysis 6.8

编辑推荐:

  从稀疏空间观测中预测连续环境变量仍然具有挑战性,因为全局机器学习模型可以捕捉非线性关系,但通常适应局部空间异质性的能力有限,而现有的基于相似性的方法仍主要依赖加权平均预测。本研究提出了模式相似性学习(Pattern Similarity Learning, P

  
从稀疏空间观测中预测连续环境变量仍然具有挑战性,因为全局机器学习模型可以捕捉非线性关系,但通常适应局部空间异质性的能力有限,而现有的基于相似性的方法仍主要依赖加权平均预测。本研究提出了模式相似性学习(Pattern Similarity Learning, PSL),该模型利用模式相似性作为空间自适应指标来指导局部非线性预测。PSL首先用三个模式导出指标增强原始环境协变量:地理复杂度(geocomplexity)、正向异常值强度(positive outlier strength)和负向异常值强度(negative outlier strength)。这些指标描述局部异质性和局部异常性,使得每个协变量既能携带其原始值,又能携带其局部空间背景。对于每个目标位置,PSL随后测量协变量空间相似性以识别相关训练样本,并使用模式增强特征拟合相似性加权局部随机森林(Random Forest, RF)。在美国本土(conterminous United States, CONUS)的土壤有机碳(soil organic carbon, SOC)预测案例中,五折空间交叉验证显示,PSL在六个模型中取得了最佳总体汇总性能。与随机森林相比,PSL将R2提高了0.017(7.11%),将均方根误差(RMSE)降低了0.017(1.14%),并将平均绝对误差(MAE)降低了0.012(1.69%)。这些结果表明,利用模式相似性将局部空间背景、样本相关性和非线性学习联系起来,可以改善连续环境预测的空间适应性。
**研究背景与问题**
空间预测面临挑战:稀疏观测数据下,连续环境变量预测需兼顾全局非线性与局部空间异质性。现有方法分三类:经典地统计学(如普通克里金、回归克里金)利用空间自相关,但假设空间依赖稳定且需预设形式;全局机器学习(如随机森林, Random Forest, RF)可捕捉非线性关系,却将训练样本视为独立,难以适应局部环境条件;基于相似性的方法(如相似性加权平均, Geographical Optimal Similarity, GOS)依赖加权平均,无法表示复杂非线性关系。这些方法未能整合空间模式特征、协变量空间相似性搜索与局部非线性集成学习,因此研究人员提出模式相似性学习(Pattern Similarity Learning, PSL),旨在通过模式相似性作为空间自适应指标,引导局部非线性预测,提升空间适应性。该研究发表于《Journal of Geovisualization and Spatial Analysis》。

**研究内容与结论**
研究人员提出PSL模型,将模式相似性、局部空间特征和局部随机森林集成。在美国本土(conterminous United States, CONUS)使用7,940个土壤有机碳(soil organic carbon, SOC)观测点(来自USDA NCSS土壤表征数据库,0–30 cm层),进行五折空间交叉验证,与线性模型(LM)、RF、GOS、相似性地理加权回归(SGWR)和模式相似性加权平均(PS)对比。PSL取得最高总体精度:R2=0.256,RMSE=1.468,MAE=0.699,相比RF提升R2 0.017(7.11%),降低RMSE 0.017(1.14%),降低MAE 0.012(1.69%)。PSL残差空间自相关低于RF等模型,绝对残差中位数和四分位距最小。敏感性分析表明PSL对候选池比例参数(κ)和邻域大小(m)敏感度低,性能稳定。PSL提供了一种空间自适应方法,但计算成本较高。

**主要关键技术方法**(不超过250字)
PSL模型包含三个核心步骤:
1) 空间模式特征构建:对每个原始协变量,基于12近邻计算地理复杂度(geocomplexity, 式1–2)及正/负异常值强度(式3–4),形成4n维模式增强特征向量(n为原始协变量数,本研究中n=10,即40维)。
2) 基于相似性的候选池构建:在原始协变量空间使用乘积高斯核(式6,带宽h=1.0)计算相似性,保留前70%最相似训练样本作为候选池。
3) 相似性加权局部随机森林:对每个预测位置,在候选池上用模式增强特征和相似性权重训练随机森林(100棵树),预测为各树均值。
样本来源:美国农业部(USDA)国家合作土壤调查(NCSS)土壤表征数据库,提取CONUS区域0–30 cm层SOC观测点,共7,940个。

**研究结果**
**交叉验证预测精度**(Cross-Validation Prediction Accuracy)
通过五折空间交叉验证,PSL在六个模型中取得最高R2(0.256)和最低RMSE(1.468)、MAE(0.699)。相比RF,PSL在五折中平均提升R2 0.017、降低RMSE 0.017、降低MAE 0.012,但折叠级差异未达95%置信水平统计显著。LM、SGWR、GOS和PS精度较低,表明简单加权平均不足以捕捉SOC变异。

**空间预测与残差模式**(Spatial Prediction and Residual Patterns)
通过残差空间分布图(图8)和绝对残差分布小提琴图(图9),PSL残差空间分散性更高,中位数绝对残差(0.428)和四分位距(0.612)均为最小,RF次之(中位数0.449,IQR 0.636)。全局莫兰指数(Moran's I)检验显示,SGWR残差自相关最低(0.0734),PSL次之(0.0837),RF为0.1000,表明PSL较RF更有效降低局部偏差。预测SOC空间分布(图10)显示PSL与RF在局部存在差异,但两者均存在范围压缩(低估高值、高估低值)。

**κ和m参数敏感性分析**(Sensitivity Analysis of κ and m Parameters)
通过改变候选池比例κ(0.05–1.00)和邻域大小m(4–52),PSL性能变化小:R2主要在0.224–0.256之间,RMSE和MAE分别在1.470–1.500和0.692–0.702范围内。κ≈0.50–0.80时R2较高,m=12时平衡精度与稳定性,最终选定κ=0.70、m=12。

**讨论与结论**
讨论部分指出,PSL相比PS(R2提升0.190)在于用局部随机森林替代加权平均,相比RF则源于模式特征提供局部空间上下文,以及相似性引导的局部训练减少样本异质性。PSL残差空间分散性表明其部分降低了局部建模偏差。局限性包括:计算成本高(每预测点独立拟合随机森林,复杂度约M{O(Nn)+O(BκNlog(κN))},M预测点数,N训练样本数,B树数,n协变量数);SOC变异受缺失协变量、测量不确定性、尺度不匹配等约束,绝对R2不高。未来可通过并行化、减少候选池或加入残差校正(如普通克里金)改进。

**结论**(翻译原文)
本研究提出了模式相似性学习(Pattern Similarity Learning, PSL)用于预测连续空间变量。PSL以地理复杂度、正异常值强度和负异常值强度扩展原始解释变量,并将基于相似性的样本选择与局部随机森林学习相结合。利用7,940个SOC观测点进行五折空间交叉验证,PSL在比较模型中取得了最佳总体性能。然而,其对经过调优的RF基线的改进并不显著,且折叠级未达到统计显著性。PSL还相对于RF及其他几个基线降低了残差空间自相关。总体而言,PSL为连续环境预测提供了一种潜在有用的空间自适应方法,尽管其计算成本仍然较高。未来工作应聚焦于提升效率并引入残差校正或相关扩展。
相关新闻
生物通微信公众号
微信
新浪微博

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号