《Smart Agricultural Technology》:Improving the prediction of water stress related traits in open-field tomato using multivariate models and variable importance-based indices
编辑推荐:
植物水分胁迫水平的评估应是精准灌溉管理的重要组成部分,一种良好且快速的方法在植物表型分析中十分有用。对此有多种选择,但其有效性因作物种类和环境而异。显然,露地应用面临最大困难。本研究旨在测试大量基于高光谱反射率数据(325-1075 nm)的植被指数(VIs)
植物水分胁迫水平的评估应是精准灌溉管理的重要组成部分,一种良好且快速的方法在植物表型分析中十分有用。对此有多种选择,但其有效性因作物种类和环境而异。显然,露地应用面临最大困难。本研究旨在测试大量基于高光谱反射率数据(325-1075 nm)的植被指数(VIs)和多变量模型,评估它们与叶片气孔导度、相对含水量(RWC)、以及详细的叶绿素和类胡萝卜素组分之间的相关性和预测能力。上述变量的数据是在三个连续生长季中,于不同供水量制度下栽培的加工番茄中收集的,以提供具有不同水分胁迫水平的数据。然后,研究人员根据Index DataBase (IDB Project, indexdatabas.de) 中收集的公式,测试了226个VIs与测量变量的关系。研究人员还根据机器学习(ML)算法中最重要的变量开发了新的VIs,并针对番茄水分胁迫评估进行了定制。研究人员使用标准正态变量(SNV)及其与Savitzky-Golay一阶导数(SGder)的组合对光谱进行预处理,并测试了主成分回归(PCR)、偏最小二乘回归(PLSR)、弹性网络(ENET)、支持向量回归(SVR)、随机森林(RF)和极端梯度提升(XGB)算法。新开发的指数在除β-胡萝卜素外的所有情况下均优于现有公式。为RWC估算开发的指数最可靠,即986 nm和701 nm波长处反射率的差值。ENET和SVR算法根据预处理方法产生了最佳模型。根据变量重要性分析,蓝光、近红外(NIR)和绿光区域在所有模型中最为重要。具有最佳指标的模型是为叶绿素a开发的(R2=0.82, nRMSE=11%, RPIQ=2.41),其次是RWC(R2=0.72, nRMSE=14%, RPIQ=2.53)。
**论文解读:基于多变量模型与变量重要性指数的露地番茄水分胁迫相关性状预测改进**
**1. 研究背景、问题与意义**
在气候变化背景下,水资源短缺对农业生产构成严重威胁。精准灌溉管理依赖于对植物水分状况的准确、快速评估。然而,传统的植物水分监测方法,如测量气孔导度、叶片水势或叶绿素含量,通常是劳动密集、耗时且昂贵的,难以在野外大规模应用。尽管遥感技术,特别是植被指数(VIs)的应用为植物水分监测提供了新途径,但其有效性在不同作物种类和环境条件下差异显著,尤其是在露地条件下,受光照、大气等因素干扰,实施难度更大。此外,现有VIs的普适性有限,针对特定作物、特定环境(如露地番茄)的水分胁迫监测,需要开发更精准、更可靠的指标和方法。因此,本研究旨在系统评估大量现有VIs和多种机器学习(ML)模型在预测露地番茄水分胁迫相关生理参数(如气孔导度、相对含水量、叶绿素和类胡萝卜素组分)方面的能力,并基于模型变量重要性开发新的VIs,以期为露地番茄精准灌溉提供更有效的监测工具。该研究发表在《Smart Agricultural Technology》。
**2. 主要关键技术方法**
1. **高光谱数据采集与预处理**:使用ASD FieldSpec HandHeld 2便携式高光谱地物光谱仪(325-1075 nm)获取叶片反射率数据,并应用标准正态变量(SNV)和Savitzky-Golay一阶导数(SGder)组合进行预处理。
2. **多变量建模**:构建并比较了六种机器学习回归模型,包括主成分回归(PCR)、偏最小二乘回归(PLSR)、弹性网络(ENET)、支持向量回归(SVR)、随机森林(RF)和极端梯度提升(XGB)。样本来源为匈牙利农业与生命科学大学园艺培训基地的露地番茄试验田。
3. **变量重要性分析与新指数开发**:基于各模型内计算出的变量重要性(如回归系数、置换重要性等),筛选出对预测目标最关键的波长。然后,利用这些关键波长,通过自动生成归一化差值(ND)、简单比值(SR)等多种公式,开发出针对番茄水分胁迫评估的新VIs。
**3. 研究结果**
* **Vegetation indices (Existing VIs)**
在评估的226个现有VIs中,与各测量变量的相关性总体上较弱。与SPAD相关性最高的是Maccioni指数(R
2=0.48),与气孔导度相关性最高的是PRI528/587(R
2=0.17),与相对含水量(RWC)相关性最高的是Difference 800/550(R
2=0.54),与叶绿素a相关性最高的是MCARI/OSAVI750(R
2=0.53)。这些结果表明,现有VIs在预测露地番茄水分胁迫相关性状时存在局限性。
* **Multivariate analysis (Multivariate Models)**
* **Raw spectra**: ENET模型在多数情况下表现最佳,但在预测叶黄素时RF模型最优,预测RWC时SVR模型最优。外部验证集上,叶绿素a的预测模型表现最佳(R
2=0.79, nRMSE=11%, RPIQ=2.29),而叶黄素的预测模型最差(R
2=0.55)。
* **SNV spectra**: 预处理后,SVR模型在预测气孔导度和β-胡萝卜素时表现最佳,其他变量仍由ENET模型最优。叶绿素a的预测模型获得了最高的R
2(0.81)和RPD(2.29),而RWC的预测模型获得了最高的RPIQ(2.53)。
* **SGder+SNV spectra**: 在此预处理下,SVR模型在预测叶绿素a时表现最佳(R
2=0.82, nRMSE=11%, RPIQ=2.35),而RWC的预测模型仍由ENET算法最优(R
2=0.72, nRMSE=14%, RPIQ=2.47)。总体而言,两种预处理均能提升模型性能,选择哪种预处理取决于目标变量和算法。
* **Variable importance analysis**
变量重要性分析揭示了不同模型和预处理方法下关键波长的差异。对于RWC预测,近红外(NIR)范围内的波长(如966-1020 nm)最为重要。对于叶绿素a预测,蓝光、绿光和近红外区域均贡献显著。对于气孔导度预测,关键波长范围则因预处理方法而异,从蓝-绿光(原始光谱)到红-橙光(SNV)再到更宽的可见-NIR范围(SGder+SNV)。
* **Vegetation indices derived from the variable importance evaluation**
基于变量重要性开发的新VIs,在预测除β-胡萝卜素外的所有变量时,其相关性均优于现有VIs。其中,针对RWC预测开发的新差值指数(R986nm - R701nm,基于RF算法)表现最佳(R
2=0.61)。在外部验证集上,新VIs在6个案例中的R
2值超过了相应多元模型,特别是在叶绿素b的预测上。最常用的新指数公式是TCARI(转换叶绿素吸收反射率指数),最常用的光谱区域是NIR。
**4. 讨论与结论总结**
**讨论部分**:研究指出,叶片光谱信息随生长季和发育阶段而变化,而本研究采用的分层抽样(stratified split)方法有效解决了这一问题,确保了模型在时间上的代表性。研究结果进一步证实了生长环境和品种对植物水分胁迫响应的显著影响,这解释了为何在不同研究中,特定VIs(如PRI、NDVI)表现不一。新开发的VIs优于现有VIs,但多数情况下仍不及ML模型,表明ML模型能更有效地捕捉复杂光谱信息。SVR和ENET算法在本研究中表现最佳,这与文献中它们在叶绿素和水分含量预测中的有效性一致。蓝光、NIR和绿光是预测模型中最主要的波长区域,这与叶绿素的吸收和反射特性相符。对于RWC预测,NIR区域的重要性凸显,特别是新开发的RWC指数(R986nm - R701nm)结合了红边和NIR波长,这在现有数据库中未见报道。
**结论**:
尽管已有数百种VIs可用于植物监测,但本研究结果表明,针对特定任务(如监测露地番茄水分胁迫)改进VIs仍有空间。如果目标是缩小光谱范围以开发仅测量特定波长的设备,那么原始光谱和VIs的结果最具参考价值。新开发的指数在除β-胡萝卜素外的所有变量上都找到了更优的指标。在现有VIs中,气孔导度、叶绿素b和叶黄素与VIs的相关性较低,而叶片RWC与Difference800/550,叶绿素a与MCARI/OSAVI750的相关性较强,可用于相对比较,但不足以预测实际值。然而,针对RWC开发的新的差值指数(R986 nm - R701 nm)在完整数据集和外部数据集上均获得了R
2=0.61的结果,因此本研究提出该指数可作为番茄叶片水分含量指数。总体而言,多变量模型的表现优于现有或新开发的VIs。光谱预处理能产生比原始光谱更好的模型结果。当使用ENET算法时,基于SNV预处理的425-1025 nm叶片光谱能够为露地番茄叶片RWC(R
2=0.72, nRMSE=14%, RPIQ=2.53)和叶绿素a含量(R
2=0.82, nRMSE=11%, RPIQ=2.41)提供可靠的估算。对于类胡萝卜素组分,β-胡萝卜素的预测模型(R
2=0.73, nRMSE=11%, RPIQ=2.12)比叶黄素更可靠。ENET算法在SNV预处理下最有效,而SVR算法在SGder+SNV预处理下表现更优。当ML模型性能中等时(如叶绿素b),基于其重要变量开发的VIs可能超越模型本身的指标。