《Computers and Electronics in Agriculture》:Computational approaches for modelling soil water repellency: A comprehensive review
编辑推荐:
本文综述了土壤斥水性(SWR)建模的计算方法。它提供了这些技术的分类以进行深入分析。它综合了用于SWR预测的统计、机器学习及深度学习方法。它收集了土壤、气候、遥感和田间尺度SWR评估的管理数据。它分析了特征提取、时空建模和性能指标。
本文综述了土壤斥水性(SWR)建模的计算方法。它提供了这些技术的分类以进行深入分析。它综合了用于SWR预测的统计、机器学习及深度学习方法。它收集了土壤、气候、遥感和田间尺度SWR评估的管理数据。它分析了特征提取、时空建模和性能指标。
1. 引言(Introduction)
该部分阐述了土壤斥水性(SWR)的定义、影响及在农业系统中的重要性,指出SWR由疏水有机化合物导致,常见于砂质和粗质地土壤。SWR受土壤性质(如有机碳(OC)、质地、pH、阳离子交换容量(CEC))、气候因素(降雨、温度、蒸发蒸腾、干湿循环)、植被和管理实践(耕作、轮作、残茬保留、润湿剂、黏土改良)的交互作用控制。传统测量方法(乙醇液滴摩尔浓度(MED)和水滴入渗时间(WDPT))劳动密集且难以连续监测。数字农业、遥感和计算建模(包括机器学习(ML)、深度学习(DL)和迁移学习)提供了新机遇。本文旨在综述计算SWR建模方法,整合多源数据,并关注可解释人工智能(如Shapley加法解释(SHAP)和局部可解释模型无关解释(LIME))。论文结构安排如下:第2节综述相关调查和文献选择策略;第3节介绍数据收集和准备;第4节回顾特征工程、计算建模和评估指标;第5节综合主要挑战、研究空白和未来方向;第6节总结。
2. 相关调查和论文选择策略(Related surveys and paper selection strategy)
2.1 相关调查
该小节回顾了现有SWR综述,涵盖形成机制、控制因素、测量技术、水文影响和农业后果。早期研究聚焦物理化学机制,后续关注对入渗、优先流、径流、土壤侵蚀和作物建立的影响。传统评估方法(WDPT和MED)仍被广泛接受。近期研究引入数字土壤制图、遥感、近端传感和环境监测,并采用统计分析、ML、DL和混合人工智能方法。但现有综述缺乏对计算方法的系统评估,特别是针对田间尺度SWR预测的统计模型、ML算法、DL架构和迁移学习技术的综合比较。本文旨在填补此空白。
2.2 论文选择策略
该小节描述了文献检索策略,遵循PRISMA 2020框架以提高透明度和可重复性。检索数据库包括Google Scholar、Scopus、Web of Science、IEEE Xplore等,使用关键词组合如“土壤斥水性”、“非润湿性土壤”、“人工智能”、“深度学习”、“机器学习”、“统计分析”等。检索覆盖2010年前至2026年3月,共检索到1586条记录,经筛选后158篇论文被选入详细综述。由于研究在数据集、目标变量、尺度、验证策略和性能指标上差异较大,未进行正式荟萃分析,而是采用结构化定量综合。图2显示了相关出版物的年度分布,呈现上升趋势。
3. 数据收集和准备(Data collection and preparation)
3.1 用于SWR时空建模的数据获取
该小节提出了将异构数据源组织为人工智能就绪数据的框架,包括地面测量(MED和WDPT,辅以土壤水分、温度、GPS、实验室性质)、遥感(卫星和无人机影像提供植被指数、光谱特征)、近端传感(光谱学估计OC和质地)、气候数据(降雨、温度、蒸发蒸腾、前期降雨指数)以及管理数据(作物类型、轮作、耕作、润湿剂、黏土改良)。文献表明,结合这些数据源为时空SWR建模提供了坚实基础。公共数据集总结于附录A。
3.2 数据集映射和准备
该小节介绍了结构化数据集组织以支持可重复的时空建模工作流。图4展示了人工智能驱动的SWR预测模型分类法,包括数据源、特征类型、人工智能模型、验证策略和应用。数据集准备包括数据清洗(去除重复、处理缺失值、标准化单位、验证坐标)、空间协调(统一坐标参考系统)和时间协调(链接SWR观测与气候、土壤水分、植被动态)。集成后形成分析就绪结构,结合目标变量、动态预测因子、静态土壤属性、地形属性和管理信息。特征工程包括时间聚合、交互项和空间概括。
4. 特征工程、建模和性能评估的计算方法(Computational methods for feature engineering, modelling, and performance evaluation)
4.1 特征提取
该小节综述了特征提取方法,将原始数据转换为预测因子。
4.1.1 纹理、空间和光谱特征
纹理分析(如灰度共生矩阵(GLCM))用于识别细尺度空间变异性。遥感研究中提取植被指数如归一化差值植被指数(NDVI)、绿色归一化差值植被指数(GNDVI)、归一化差值红边指数(NDRE)。可见和近红外(Vis-NIR)及中红外光谱可用于评估土壤性质如OC。但这些特征直接融入SWR预测框架仍有限。
4.1.2 时间和土壤衍生特征
时间特征包括前期降雨指数、累积降水、滞后土壤水分变量和季节性植被轨迹,对SWR非常重要。土壤衍生特征包括土壤质地、OC、pH、CEC。交互项和深度特定变量可改善表示。
4.1.3 特征缩放和选择
特征通常标准化或归一化,并通过相关性分析、特征重要性排序等进行选择。土壤质地、OC和土壤水分被一致识别为重要预测因子。
4.2 用于评估SWR的计算模型
该小节将建模方法分为四类:统计模型、ML、DL和迁移学习。
4.2.1 统计模型
统计模型用于量化SWR与控制因素的关系。回归分析识别出OC、黏粒含量、土壤水分和疏水有机化合物为关键驱动因素,例如Harper和Gilkes的多元模型解释了SWR变异的63%(R
2=0.63)。其他方法包括方差分析(ANOVA)、地统计学、结构方程模型(SEM)等。统计方法因其可解释性仍作为基准。
4.2.2 机器学习模型
树集成算法如随机森林(RF)和梯度提升(GB)在土壤和环境建模中广泛应用,能处理高维数据和多重共线性。ML在SWR应用中相对有限,例如Gomes等人使用分位数随机森林(QRF)预测SWR,R
2=0.58,但仅生成静态空间预测。ML模型面临数据稀疏、过拟合、缺乏标准化数据集和可解释性等问题。
4.2.3 深度学习模型
DL模型如卷积神经网络(CNN)在遥感数据分析中表现出潜力,但需要大量标记数据。循环神经网络(RNN)如长短期记忆(LSTM)适用于时间序列,但SWR中长期数据稀缺。混合架构如CNN-LSTM可联合建模空间和时间变异性,但增加复杂性和计算成本。深度学习模型的黑箱性质限制了可解释性。
4.2.4 迁移学习模型
迁移学习通过从相关领域转移知识解决标签数据稀缺问题。在遥感中,预训练CNN可微调用于作物分类等,但存在领域不匹配问题。迁移学习在SWR中应用极少,主要因为缺乏标注数据集和领域差异。
4.2.5 计算建模方法的比较分析
没有单一方法在所有SWR应用中一致最优。统计模型可解释性强但非线性能力有限;ML预测性能好但可解释性差;DL能捕捉复杂模式但数据需求大;迁移学习有潜力但应用有限。未来进展可能来自混合集成框架。
4.2.6 回顾SWR研究的主题综合
该小节将文献分为六组进行主题综合:直接SWR评估和预测、SWR机制和水文过程、管理和改良研究、遥感/数字土壤制图/近端传感、ML和DL应用、相关土壤水分和水文建模研究。研究显示从传统点测量向集成计算框架的转变,但仍存在数据集有限、时间分析薄弱、模型可迁移性差等问题。
4.3 性能评估指标
4.3.1 基于回归的评估指标
包括均方根误差(RMSE)、平均绝对误差(MAE)、决定系数(R
2)、平均偏差误差(MBE)等。
4.3.2 基于分类的评估指标
包括精确率、召回率、F1分数、混淆矩阵、受试者工作特征曲线(ROC)和曲线下面积(AUC)等。
4.3.3 时空和实践考虑
空间验证评估跨区域的可迁移性,时间验证评估跨季节的鲁棒性。残差映射和不确定性可视化用于识别误差模式。
4.3.4 性能评估结果
综合使用回归和分类指标可全面评估预测性能,并考虑是否支持农事决策。
4.3.5 时空建模方法
地统计方法如地理加权回归(GWR)和时空克里金法用于表征空间和时间依赖性。DL方法如CNN和LSTM用于提取空间特征和时间依赖性。时间交叉验证和滚动预测框架用于评估模型性能。
5. 研究空白、挑战和未来方向(Research gaps, challenges and future directions)
5.1 计算SWR建模的主要进展
文献展示了从早期现场观测和统计分析向数字土壤制图、遥感、ML和DL的演进。遥感数据集整合是重要进展,ML算法如RF、XGBoost、支持向量机(SVM)和人工神经网络(ANN)表现良好。可解释人工智能(SHAP、LIME)提高了模型透明度。但向完全集成时空人工智能框架的过渡仍有限。
5.2 新兴研究趋势
多数研究关注空间表征,较少研究时间动态。数据集通常小且特定于地点,可迁移性未经测试。WDPT和MED测试未标准化。许多研究仅分析部分控制因素,缺乏多源数据集成。
5.3 矛盾与未解决的问题
土壤OC是SWR最强预测因子之一,但关系强度因研究而异。无单一变量能充分解释所有环境下的SWR。SWR从复杂交互作用中涌现。遥感指标与SWR测量的直接联系尚不充分。
5.4 持续挑战
数据可用性受限,地面测量劳动密集且时空稀疏。数据集成面临分辨率、频率、协议和质量差异。高维数据增加过拟合风险,黑箱模型降低透明度。可解释人工智能在SWR中应用有限。实际部署不足,缺乏可操作决策支持工具。
5.5 未来研究机会
优先发展多站点、多季节数据集以提高模型鲁棒性。多源数据融合(光学、SAR、高光谱、UAV、近端传感)可改善预测。迁移学习和基础模型方法可解决数据稀缺。混合框架结合物理知识与ML。强调可解释人工智能、不确定性量化和面向种植者的决策支持系统。
6. 结论(Conclusion)
本文综述了当前SWR建模的计算方法,包括统计分析、ML、DL、迁移学习、遥感和数字土壤制图。SWR受多种因素交互影响,遥感与人工智能的发展提高了