《Precision Agriculture》:Assessing deep learning models for regional wheat yield prediction using Sentinel?2 and environmental data
编辑推荐:
目的:准确且及时的小麦产量预测对于实施精准农业管理与保障粮食安全至关重要。由于目前整合多源数据与深度学习的大规模区域研究仍较有限,本研究旨在提出一种结合Sentinel?2与环境数据的深度学习框架,用于西班牙中部大规模田块尺度的小麦产量预测。方法:基于西班牙中
目的:准确且及时的小麦产量预测对于实施精准农业管理与保障粮食安全至关重要。由于目前整合多源数据与深度学习的大规模区域研究仍较有限,本研究旨在提出一种结合Sentinel?2与环境数据的深度学习框架,用于西班牙中部大规模田块尺度的小麦产量预测。方法:基于西班牙中部2022–2023两个生长季的小麦产量数据,研究人员评估了Transformer模型的潜力,并将其性能与偏最小二乘回归(Partial Least Squares Regression,PLSR)、K近邻回归(K?Nearest Neighbors Regression,KNN)和深度神经网络(Deep Neural Networks,DNN)进行比较。此外,研究人员评估了环境变量相对于光谱特征的相对重要性,并考察单一与组合物候期如何影响预测精度。结果:在整合所有物候期与多源输入时,Transformer取得了最高精度(R2 = 0.93,RMSE = 200 kg/ha),优于DNN(R2 = 0.91,RMSE = 225 kg/ha)、KNN(R2 = 0.88,RMSE = 257 kg/ha)和PLSR(R2 = 0.77,RMSE = 358 kg/ha)。使用环境变量的模型表现优于仅基于光谱数据的模型。此外,组合分蘖期与抽穗期在精度与时效性之间取得平衡,Transformer在此情形下达到R2 = 0.91,RMSE = 230 kg/ha。结论:本研究证明了Transformer模型性能的提升,并强调了整合多源环境数据与物候信息对于稳健作物产量预测的关键重要性。影响:本研究提出了一种数据驱动的精准农业框架,结合Sentinel?2与环境数据实现准确、生长季早期的 wheat yield forecasting,在精准农业中具有相关应用价值。
研究背景方面,小麦是全球最重要的主粮作物之一,其产量对经济稳定与粮食安全具有显著影响。在西班牙中部所在的地中海盆地等地区,降雨不规律且不足,叠加高温与热浪,使得小麦产量呈现高度变异。气候变化进一步加剧了这一局面。因此,在精准农业框架下开发准确且及时的田块尺度小麦产量预测模型,对于更好指导管理实践十分关键。在当前气候不确定性下,精准有效管理作物并保障其最优表现尤为重要。遥感因覆盖范围广、光谱与时间分辨率不断提升,已成为农业监测与产量预测的重要工具。现有产量估算研究多聚焦于遥感影像衍生的光谱特征,然而环境变量往往与产量表现具有更强关系,因其直接影响不同物候期的关键生理过程,是水分平衡、碳固定与热量积累驱动产量形成的核心因素,而光谱信息可评估植物对环境变化的响应,两者结合有助于提升产量模型的预测能力。近年来,机器学习尤其是深度学习(Deep Learning,DL)与遥感、环境数据融合,为提高小麦产量预测的精度与稳健性提供了新途径。其中,Transformer模型相较于卷积神经网络(Convolutional Neural Networks,CNNs)与循环神经网络(Recurrent Neural Networks,RNNs),凭借注意力机制可并行捕获长期时间依赖与大尺度空间依赖,在农业遥感中展现出优势。传统机器学习在较小数据集上有效,而深度学习在大数据集上通常精度更高,更适合评估数千个农田,且对时间序列数据更具处理能力。早期季节产量预测因输入数据有限更具挑战,但若能基于部分季节信息获得足够准确的预测,将大幅提升产量预测的实际价值。目前大规模区域整合多源数据与深度学习的研究仍有限,因此该研究旨在提出相关框架,评估环境与Sentinel?2多光谱数据对西班牙中部田块尺度小麦产量估算的重要性,识别对产量变异解释力最强的数据源,评估传统机器学习与深度学习模型的优劣,并探讨早期季节产量预测可行性及关键观测窗口。
为开展研究,研究人员使用的主要关键技术方法包括:研究区为西班牙中部Castilla y León的冬小麦种植区,田间产量数据来自西班牙农业渔业与食品部2022与2023年生长季的年度作物面积与产量调查,采用分层抽样获取700 m × 700 m地理参考段内田块微数据,数据集按田块级别随机划分为训练集70%与验证集30%。Sentinel?2多光谱数据采用Level?2A地表反射率产品,计算归一化植被指数(Normalized Difference Vegetation Index,NDVI)、增强植被指数(Enhanced Vegetation Index,EVI)、差值植被指数(Difference Vegetation Index,DVI)与绿色叶绿素指数(Green Chlorophyll Index,GCI)作为光谱特征,依据生长积温(Growing Degree Days,GDD)确定分蘖期、抽穗期与成熟期三个关键物候期的时间窗口。环境变量包括地表温度(Land Surface Temperature,LST)取自Landsat 8 Level?2,气温(Air Temperature,AT)与土壤湿度(Soil Moisture,SM)取自ERA5?L再分析数据集,降水(Precipitation,PPT)取自CHIRPS PENTAD数据集,所有数据在Google Earth Engine(GEE)平台进行空间对齐与田块级别均值聚合。预测模型包括PLSR、KNN、DNN与Transformer,其中DNN为三层隐藏层结构[128–128–64],Transformer含2层编码器与4头注意力机制,输入按物候期构造为时序序列并加入可学习位置编码,输出经平均池化与多层感知机(Multi?Layer Perceptron,MLP)回归头得到产量估计。采用SHAP(Shapley Additive Explanations)框架解释特征贡献,评价指标为决定系数(coefficient of determination,R2)、均方根误差(Root Mean Square Error,RMSE)与平均绝对百分比误差(Mean Average Percentage Error,MAPE)。
研究结果部分保留小标题并说明如下:
Effects of input data sources on prediction accuracy:研究人员比较四种模型在使用光谱变量、环境变量及其组合下的预测精度,发现仅用光谱特征性能最弱,Transformer的R2为0.54–0.78,RMSE为351–521 kg/ha;而环境变量显著提升性能,Transformer的R2增至0.84–0.92,RMSE降至206–281 kg/ha;光谱与环境变量结合可进一步提升但增幅有限。所有模型均显示环境变量在产量预测中起主导作用,光谱信息可一定程度增强性能。
Comparison of prediction accuracy across models:在结合环境与光学输入下,Transformer在大多数物候情景中精度最高,全季时达R2= 0.93、RMSE = 200 kg/ha,分蘖+抽穗期达R2= 0.91、RMSE = 230 kg/ha;DNN次之,KNN再次,PLSR最低。仅在分蘖期Transformer与DNN无显著差异,其余阶段Transformer均优于其他模型。
Prediction accuracy across phenological stages:以Transformer为例,分蘖期精度最低(R2= 0.85,RMSE = 292 kg/ha),抽穗期提高(R2= 0.88,RMSE = 261 kg/ha),成熟期略降(R2= 0.87,RMSE = 271 kg/ha),分蘖+抽穗期明显提升(R2= 0.91,RMSE = 230 kg/ha),抽穗+成熟期亦较好(R2= 0.90,RMSE = 236 kg/ha),全季最佳(R2= 0.93,RMSE = 200 kg/ha)。其余模型趋势相同但精度较低。
Interpretability analysis of the transformer model:研究人员对表现最佳的Transformer采用SHAP解释,发现抽穗期变量贡献最大(38.1%),其次成熟期(34.0%),分蘖期最低(27.9%)。环境变量平均SHAP值(3.09)高于光谱变量(1.50)。分蘖期光谱变量更关键,短波红外波段B11贡献最高(SHAP = 3.64),其后为PPT(2.38)、B2(2.32)、AT(2.08);抽穗期环境因素主导,AT最高(6.57),PPT次之(5.10),其后为B11(4.00)与B12(2.70);成熟期温度相关变量主导,AT最高(5.01),LST次之(4.32),其后为GCI(2.75)与NDVI(2.34)。植被指数中GCI与NDVI在成熟期贡献最大,且在成熟期高于早期阶段。
讨论部分总结如下:针对环境变量与光谱特征重要性问题,研究发现仅用光谱信息与植被指数精度较低,环境变量在各物候期均优于光谱输入,两者结合可进一步提升。光谱数据存在饱和效应限制大尺度时序预测可靠性,而环境变量更直接表征生长条件,对解释产量变异具有更强因果关联与稳健性,但在监测作物出苗与发育方面仍具价值,可反映冠层光合、氮状况、叶绿素含量及对病虫害胁迫响应,且可体现环境对生长的影响。Transformer从光谱数据获益最少,可能因其注意力机制高效捕获环境变量时序依赖,降低光谱信息相对贡献。B11对应短波红外区对冠层含水量敏感,在地中海缺水环境中与产量相关性强。多源数据整合可提升精度与稳健性。针对模型比较问题,PLSR因线性局限难以捕捉多源数据复杂交互,精度低于其余模型;DNN在分蘖期与Transformer相近,其余阶段Transformer更优,尤其在多阶段组合或全季数据中Transformer的R2超0.90、RMSE降至200 kg/ha,得益于自注意力动态赋权处理时序数据的能力。研究在Transformer变量拼接与序列长度方面存在一定局限,且验证集与训练集同区域同两年可能使精度偏乐观。针对关键生长期问题,精度在分蘖期最低、抽穗期最高、成熟期略降,多阶段组合显著提升。B11、PPT与温度在早中期SHAP值高,B11敏感植株水分状况,PPT与温度控制气孔导度,高温缺水致气孔关闭限制CO2扩散削弱光合效率而影响产量形成。AT在分蘖期为正向贡献,在后期抽穗与成熟期为负向,PPT各期均正向,凸显水分持续需求。抽穗期为生物量快速积累与库容决定产量关键期,因此温湿成为主导驱动因子。成熟期光谱一致性受物候微小差异影响。全季整合反映从分蘖至成熟的动态轨迹与阶段间累积交互效应,可为季中精准管理与可持续产量优化提供依据。
结论部分翻译如下:在西班牙地中海条件下,使用两季田块尺度小麦产量数据集,Transformer模型总体优于PLSR、KNN与DNN。在所评估模型中,使用全季数据时Transformer达到最高精度(R2= 0.93,RMSE = 200 kg/ha),依次为DNN、KNN与PLSR。重要的是,组合分蘖期与抽穗期也提供了可靠的早期季节预测(R2= 0.91),有望在收获前为精准农业管理提供及时支持。在输入特征中,环境变量(温度、降水与土壤湿度)被证明比单独光谱数据更稳健,而其整合进一步增强了性能,尤其是在使用与地中海中部西班牙小麦水分状况相关的短波红外Sentinel?2波段来评估产量变异时。
需要我帮你把这篇解读浓缩成一份适合汇报用的精简版摘要吗?