《Forestry: An International Journal of Forest Research》:Predicting forest inventory variables with remote sensing data: the role of number and locality of the training plots
编辑推荐:
国家森林调查(NFI, National Forest Inventory)的野外实测数据与源自遥感的辅助数据可用于建模森林调查变量。由于NFI观测通常覆盖大面积区域,建模所用训练数据常受可用样地数量与邻近程度限制。确定其合适阈值十分复杂且受多因素影响。研究人
国家森林调查(NFI, National Forest Inventory)的野外实测数据与源自遥感的辅助数据可用于建模森林调查变量。由于NFI观测通常覆盖大面积区域,建模所用训练数据常受可用样地数量与邻近程度限制。确定其合适阈值十分复杂且受多因素影响。研究人员在文中考察NFI样地的数量与局部性如何影响建模精度;其中局部性指训练样地到目标位置的空间邻近度,常被视为其代表性的代理指标。研究人员采用芬兰NFI数据,样地主要来自受管理的、以针叶树为主的寒带森林,利用Sentinel-2与机载激光扫描(ALS, Airborne Laser Scanning)数据建模地上蓄积量(growing stock volume)与优势木高(dominant height)。研究人员比较了不同训练样地数量下的预测误差,以及刻意排除某一半径内邻近样地时的建模结果。作为训练样地代表性特例,研究人员还评估基于ALS特征建立的模型是否可在生产区边界间迁移,即数据按相似质量标准但不同时段、不同扫描仪获取。结果表明,无论辅助数据如何,100个训练样地可视为最小偏好数量。局部性影响建模偏差,当排除半径扩大到50 km及以上时偏差增大;该偏差与模型适应局地条件的能力有关,导致区域高估与低估,但在全部验证数据的总体统计中仅轻微可见。ALS生产区间差异总体较小,但随调查变量变化,且首回波(first echo)特征比末回波(last echo)或全回波(all echoes)特征更明显。
论文《Predicting forest inventory variables with remote sensing data: the role of number and locality of the training plots》发表于《Forestry: An International Journal of Forest Research》。研究背景方面,国家森林调查(NFI, National Forest Inventory)依概率抽样设计评估大尺度森林资源,近年应用转向小空间单元及时效估计,模型推演(model-based inference)以遥感数据为辅助信息受到关注。现有问题是:NFI样地稀疏且为大区域无偏估计而设,小区域制图时邻近样地不足;遥感辅助数据分二维(2D)光学影像与三维(3D)ALS点云,后者跨航次因时段、季节、点密度、飞行参数和扫描仪差异降低一致性;训练数据代表性、时空对齐、定位误差与可接受时滞也影响精度;样地数量与局部性(locality,即到目标位置空间邻近度)如何系统影响误差尚缺乏细致研究。因此研究人员以芬兰寒带、以针叶树为主、受管理森林为对象,用NFI 2019—2023年林业用地样地、Sentinel-2 Level-2A影像与ALS数据,随机森林(RF, Random Forest)建模蓄积量与优势木高,量化训练样地数量(10、25、50、100、500)与排除半径(0、10、50、100 km)的影响,并检验相邻ALS生产区模型迁移性。
关键技术方法上,字段来自芬兰NFI 2019—2023年样地队列,经经营干扰剔除后保留24 437个样地;遥感端用Google Earth Engine合成无云Sentinel-2影像并算反射率与归一化差值指数(ND),ALS按首回波与末回波提取高度统计量、百分位数与固定高度比例等特征;以RF默认参数建模,对每个目标样地用最近邻样地训练并预测,各模型重复5次取平均;特征选择用VSURF算法再按皮尔逊相关≤0.8筛选;精度用相对均方根误差(RMSE%)与偏差(bias%)评价,相邻ALS生产区用配对t检验。
研究结果部分保留小标题如下。Errors of individual plots(单样地误差):研究人员发现RMSE%随训练样地数增加快速下降,10个样地误差最大,50—100个后趋稳;含ALS模型对总蓄积量与优势木高误差近乎比仅Sentinel-2(S2)模型减半;阔叶树蓄积在S2+ALS下最优;排除半径对总蓄积与优势木高RMSE影响小,对针叶、阔叶蓄积可达5—10个百分点,宽排除对ALS类模型影响更大。Errors associated with ALS production areas(ALS生产区相关误差):同生产区训练优于邻区,所有变量与回波类型差异均显著(P<0.001);首回波跨区RMSE差最大;同区模型在针叶蓄积略高估,邻区训练反而偏差更小,阔叶蓄积用首/全回波时邻区训练偏差明显增大;同区大误差多位于芬兰北部。Spatially interpolated bias(空间插值偏差):IDW插值显示整体bias低会掩盖区域极化;少样地+大排除半径在高蓄积区低估、低蓄积区高估;优势木高偏差全域低,阔叶蓄积偏差按排除半径分正/负区块;总体bias不变但区域偏差增强。
讨论部分总结:研究人员指出NFI样地本为大面积核心变量设计,小区域建模须在局部相似与特征空间覆盖间权衡;100个样地是结构变量精度与局部性平衡点,物种组分变量需更多样地;S2模型易正偏因固定像元难刻画寒带幼龄林与采伐迹地低值;阔叶组分近40%样地为零,RF向均值拉扯致正偏;跨ALS生产区误差小于预期,但首回波比末回波更易受航次间变化影响,合并多航次用末回波或全回波特征一致性更好;总结统计会掩盖局部偏差极化,训练数据代表性与局部性对小区域估计至关重要。
结论部分翻译:准确的基于模型的森林调查变量预测需要相关且具有代表性的辅助数据。结果支持既有发现,即三维点云特征比二维光学卫星数据更有效;但当地被变量同时受结构与光谱特征影响时,联合两类数据更有利。基于结果,100个野外样地可作为最小训练集规模,但当目标变量在总体中罕见时需更多样地。虽未给出选择样地的最大距离,但即使在较均质条件下,邻近性仍重要;代表性在超过10 km后渐降,在更复杂生态系统或生态过渡带更强。结果也强调非代表性训练数据易增偏差,且低估与高估在空间上聚团而非均匀,整体统计未必显现,凸显局部性在评估训练数据代表性中的重要性。
研究人员据此说明,该文为NFI结合遥感的小区域估计提供了训练样地数量与局部性的实操界限与偏差风险证据,对寒带受管理森林的模型推演和ALS多期数据融合具有方法学意义。