基于特征优化与Stacking集成学习的冬小麦氮含量高光谱反演

《Frontiers in Plant Science》:Hyperspectral inversion of winter wheat nitrogen content based on feature optimization and stacking ensemble learning

【字体: 时间:2026年09月02日 来源:Frontiers in Plant Science 5.9

编辑推荐:

  快速无损的作物氮素监测是精准施肥和养分质量平衡管理的核心支柱,其需要实时吸收数据以平衡肥料投入、作物需求与环境氮损失。然而,高光谱数据冗余、背景噪声和黑盒机器学习模型限制了反演的泛化性能与可解释性,阻碍了田块尺度质量平衡管理。研究利用拔节至灌浆期冬小麦冠层高光

  
快速无损的作物氮素监测是精准施肥和养分质量平衡管理的核心支柱,其需要实时吸收数据以平衡肥料投入、作物需求与环境氮损失。然而,高光谱数据冗余、背景噪声和黑盒机器学习模型限制了反演的泛化性能与可解释性,阻碍了田块尺度质量平衡管理。研究利用拔节至灌浆期冬小麦冠层高光谱数据,构建了预处理、特征选择与模型架构三层递进框架,系统评估了2种预处理、5种特征选择与5种建模方案,并通过基于SHAP(SHapley Additive exPlanations)的分析揭示波段贡献背后的生理机制。主要发现如下:(1)一阶导数(First Derivative, FD)变换实现了氮信号的选择性增强。通过去除间接耦合混杂信号,所有模型的测试集R2由Savitzky–Golay(SG)全谱输入下的0.57–0.73提升至0.71–0.76。(2)特征选择带来的精度增益显著大于模型优化,并识别出清晰的特征-模型适配规律。具体而言,LASSO(Least Absolute Shrinkage and Selection Operator)筛选出的稀疏高纯度特征与GPR(Gaussian Process Regression)核函数的相似性度量机制高度契合。(3)FD–LASSO–Stacking集成方案实现了最优反演性能,测试集R2为0.875,均方根误差(Root Mean Squared Error, RMSE)为0.281%,剩余预测偏差(Residual Prediction Deviation, RPD)为2.834。该模型在跨生育期反演中亦取得R2为0.781的良好表现,一定程度上验证了其泛化能力与稳定性。(4)SHAP分析量化了各算法筛选特征的贡献层级,并识别出跨算法共同核心波段,包括757 nm红边和939 nm近红外波段,验证了模型决策的生物学合理性。本研究不仅实现了冬小麦氮素的高精度反演,还从特征-模型兼容性与模型可解释性角度深化了对高光谱反演的机理认识,为轻量化传感器波段设计、田间精准氮素诊断及基于质量平衡的氮素管理提供了理论与技术支撑。
基于特征优化与Stacking集成学习的冬小麦氮含量高光谱反演——论文解读

一、研究背景与意义

氮素是调控冬小麦光合生产、冠层建成以及籽粒产量与品质形成的主要限制因子,基于质量平衡的养分管理已成为协调集约化种植体系中作物生产力与环境保护的核心框架。实时、准确、无损地监测作物氮素状态,是实施变量施肥、提高氮素利用效率(Nitrogen Use Efficiency, NUE)、减少农业面源污染以及实现田块尺度质量平衡氮管理的关键技术前提。高光谱遥感因其能够在可见光(Visible, Vis)、近红外(Near-Infrared, NIR)和短波红外(Short-Wave Infrared, SWIR)区间连续刻画作物冠层和叶片精细光谱响应,成为作物氮素状态无损诊断的重要工具。然而,现有研究在以下三方面仍存在明显不足。其一,光谱预处理研究多从精度提升角度验证效果,缺乏对一阶导数(First Derivative, FD)变换在导数域选择性增强氮素直接生理响应、解耦水分和干物质间接混杂信号的内在调控机制的系统的理论阐释。其二,大多数特征选择研究仅在单一模型下验证筛选性能,缺乏在统一实验框架下对多种主流算法所产生特征子集的结构差异进行系统比较,更缺少对“特征子集结构特征”与“模型归纳偏置”之间适应规律的定量分析。其三,基于机器学习的反演普遍存在“黑盒”问题,模型决策的生理基础与波段贡献机制难以解释,限制了反演结果的可信度与工程化应用。针对上述问题,本研究基于河南省焦作市冬小麦田间试验,以拔节至灌浆期冬小麦叶片为研究对象,构建了融合光谱预处理、特征选择与模型架构的三层递进反演框架,旨在识别高精度且可解释的冬小麦叶片氮浓度反演方案,为高光谱精准监测、轻量化传感器波段选择和田块尺度质量平衡氮管理提供支撑。

二、主要技术方法

研究人员在河南焦作市精准农业示范基地(35°8′23″ N,113°15′4″ E)开展田间试验,供试品种为焦麦8号、中麦175和中麦578,共设置48个小区,依据DB41/T 2862-2025标准设计4个氮素供应水平(N0、N1、N2、N3,分别为0、195、390、585 kg N·ha?1)。采用SVC HR-1024i便携式地物光谱仪采集拔节期、孕穗期、开花期和灌浆期4个关键生育期冠层高光谱数据(350–2500 nm),同步采集叶片样品经杜马斯燃烧法测定氮含量,共获得192个样本。数据处理流程包括:Savitzky–Golay(SG)平滑与一阶导数(FD)变换两种预处理方式;Pearson相关分析初筛结合CARS、GA、LASSO、VIP、UVE五种特征选择算法;构建随机森林(Random Forest, RF)、支持向量回归(Support Vector Regression, SVR)、极端梯度提升(eXtreme Gradient Boosting, XGBoost)、高斯过程回归(Gaussian Process Regression, GPR)四个基学习器及以RidgeCV为元学习器的两层Stacking集成模型,并采用SHAP(SHapley Additive exPlanations)进行可解释性分析。

三、研究结果

3.1 数据集统计特征与光谱响应分析

氮含量统计与正态性检验表明,各处理与生育期的叶氮含量均值和中位数接近,分布呈对称形态,Shapiro–Wilk检验p值为0.1461,不拒绝正态分布原假设。SG平滑后的高光谱在680–750 nm红边拐点、750–900 nm近红外反射平台及1450 nm和1940 nm强水吸收谷处保留了精细光谱特征。原始光谱与叶氮含量呈现“三高区三低区”的波段差异化相关模式,可见光-红边-近红外区(350–900 nm)相关系数普遍高于0.5,红边区峰值约0.62;短波红外区(1100–1800 nm和1950–2400 nm)的高相关主要来源于氮与水分、纤维素和生物量的间接生理耦合,构成混杂信号干扰。FD变换后,400–1100 nm区间出现密集尖锐高相关峰,1200–1300 nm近红外远端出现全谱最强孤立峰(r=0.65–0.70),而1300 nm以远短波红外区相关信号显著衰减,证实FD能够选择性增强氮素直接响应、剥离间接耦合信号。

3.2 特征选择结果

经Pearson相关系数预筛选(r>0.5)并剔除高度共线特征后,五种特征选择算法筛选出的敏感波段既存在一致性也存在差异。544 nm、554 nm、678–679 nm、757 nm、916 nm、939 nm、1130 nm、1191 nm和1262 nm等波段被多个算法共同选中,主要集中在可见光和近红外典型敏感区域。各算法保留波段数量差异明显:CARS(Competitive Adaptive Reweighted Sampling)选择波段最多且覆盖最广,UVE(Uninformative Variable Elimination)保留波段最少、压缩程度最高,GA(Genetic Algorithm)、LASSO和VIP(Variable Importance in Projection)居中。

3.3 模型性能对比

SG光谱输入下,各模型训练集与测试集差异明显,XGBoost训练集R2接近1.000而测试集仅0.666,GPR测试集R2最低(0.572),Stacking集成模型表现最优(测试集R2=0.727,RMSE=0.416%)。FD变换后所有模型测试集R2普遍提升至0.71–0.76,RF取得最高测试精度(R2=0.766),GPR改善最为显著,XGBoost过拟合程度亦明显收窄。

不同特征子集下的模型适应性呈现分化规律:UVE子集下Stacking表现最优(R2=0.736),SHAP分析显示939 nm、757 nm和1130 nm为核心贡献波段,合计贡献53.15%,近红外波段贡献达86.67%;VIP子集与XGBoost高度兼容(R2=0.808),757 nm红边单波段贡献25.16%;GA子集下Stacking最优(R2=0.771),757 nm、939 nm、1262 nm和695 nm为核心波段,可见光与红边合计贡献61.38%;CARS子集下各模型表现最均衡,Stacking取得R2=0.822,1262 nm单波段贡献21.55%,且首次引入蓝光敏感波段实现全谱段覆盖;LASSO子集下GPR取得R2=0.871,Stacking进一步提升至R2=0.875、RMSE=0.281%、RPD=2.834,SHAP显示757 nm贡献19.92%,与1262 nm、939 nm、1130 nm共同构成核心主导波段,各谱区贡献分布均衡。值得注意的是,RF在LASSO子集上R2降至0.667,说明过于稀疏的特征子集削弱了RF赖以维持性能的变量多样性。

3.4 基于最优模型的跨生育期反演

采用LASSO-Stacking模型进行跨生育期反演,依次将四个生育期中的一个作为测试集、其余三个作为训练集进行迭代建模。灌浆期取得最高精度,R2为0.781,验证了模型在跨生育期场景下的一定适用性与泛化能力。

四、讨论与结论

讨论部分围绕三个方面展开:在信号层面,FD变换通过去除低频干扰、放大红边斜率变化、剥离短波红外慢变化耦合信号三重效应实现对光谱信号的选择性调控;在特征-模型兼容性层面,各算法因筛选机制不同而产生结构差异显著的特征子集,特征结构与模型归纳偏置的匹配程度直接决定了反演精度——GPR与LASSO高纯度低冗余特征高度契合,XGBoost与VIP投影重要度逻辑一致,CARS因覆盖均衡而具有最强跨模型迁移性;在三层协同与可解释性层面,FD-LASSO-Stacking方案构造成精度提升链:SG全谱Stacking(R2=0.727)→ FD全谱Stacking(R2=0.761,+4.7%)→ FD-LASSO Stacking(R2=0.875,+15.0%),特征选择阶段贡献最大,表明高光谱反演中“选对特征”比“选对模型”更为关键。SHAP分析将模型决策转化为具有生理意义的波段贡献层级,757 nm红边-近红外过渡带为跨算法核心波段,近红外结构-生理区贡献占比超过60%(UVE子集下高达86.67%),为特征选择提供了生理基础而非纯统计依据。研究亦指出数据时空代表性、尺度上推和机理解耦三方面局限。结论部分总结如下:基于焦作试验点拔节至灌浆期四种氮素梯度下三个冬小麦品种的田间冠层高光谱与叶片氮含量数据,本研究构建了光谱预处理、特征筛选与Stacking集成建模的三层递进反演框架,并结合SHAP可解释性分析系统量化了2种预处理、5种特征筛选和5种建模方案的联合效应,阐明了模型决策的生理基础。预处理层面,FD通过消除低频噪声、放大红边特征和解耦短波红外混合信号实现对光谱信号的选择性调控,将模型测试集R2提升至0.71–0.76并有效缓解过拟合。特征筛选层面,特征选择的优化效果显著强于模型结构调整,且存在明确适配规律:LASSO与GPR适配、VIP适配XGBoost、CARS泛化性最佳,UVE因有效光谱信息损失而表现欠佳。优化的FD-LASSO-Stacking集成模型取得最优反演性能(R2=0.875,RMSE=0.281%,RPD=2.834),较全谱模型精度提升15.0%。机理层面,SHAP分析识别出757 nm和939 nm为冬小麦叶片氮反演核心响应波段,证实了模型决策的生物学合理性;CARS保留的稳定波段为便携式多光谱传感器开发提供了科学参考。该框架通过实现作物氮素状态的准确实时监测,为冬小麦质量平衡氮管理提供了关键技术支撑,有助于精准肥料投入、氮素利用效率提升和集约化小麦生产体系中农业面源污染的削减。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号