《Ecological Informatics》:Improving algal bloom monitoring in an agricultural estuarine reservoir using Sentinel-2 and synthetic oversampling
编辑推荐:
在小型富营养化水库中精确估算叶绿素a(Chl-a)仍然具有挑战性,因为光学复杂的水体条件和不平衡的野外数据集会降低模型性能,尤其是在高浓度时。研究人员开发了一种使用Sentinel-2、机器学习和合成过采样技术的小型水库Chl-a估算模型,以提升韩国南阳水库的
在小型富营养化水库中精确估算叶绿素a(Chl-a)仍然具有挑战性,因为光学复杂的水体条件和不平衡的野外数据集会降低模型性能,尤其是在高浓度时。研究人员开发了一种使用Sentinel-2、机器学习和合成过采样技术的小型水库Chl-a估算模型,以提升韩国南阳水库的估算性能。基于主成分分析(PCA)载荷,选择了来自Sentinel-2 MSI的五个反射率比值作为输入变量,并在原始和重采样数据集(合成少数类过采样技术[SMOTE]、自适应合成采样[ADASYN]、SMOTE-编辑最近邻[SMOTEENN]和SMOTE-Tomek链接[SMOTETomek])下,比较了六种回归算法,采用2类和3类重采样方案。在测试的配置中,使用3类SMOTEENN方案的梯度提升(GB)方法达到了最高的预测精度(R2 = 0.71,均方根误差[RMSE] = 25.53 mg/m3,百分比偏差[PBIAS] = -7.05%)。与在原始数据集上训练的模型相比,高浓度Chl-a范围的性能也有所提升。这些结果表明,合成过采样可以改善基于Sentinel-2的Chl-a估算,从而支持富营养化风险的管理。
**论文解读文章**
**研究背景与问题**
农业水库的富营养化和藻华是严重的水质问题,主要源于营养盐输入、季节性径流和有限的水交换导致浮游植物生物量快速增加。叶绿素a(Chl-a)作为藻类色素的关键指标,常用于评估营养状态和藻华强度。传统现场监测方法虽可靠,但耗时耗力且时空覆盖有限,亟需基于卫星的遥感手段实现高频、大范围的动态监测。Sentinel-2多光谱成像仪(MSI)提供高空间分辨率(10–60 m)、5天重访周期及红边波段(705 nm),在光学复杂的内陆水体中具有优势。然而,小型农业水库的Chl-a估算面临两大挑战:一是光学复杂性(有色溶解有机物[CDOM]、总悬浮物[TSS]和浊度干扰),二是野外数据集固有的结构不平衡——高浓度藻华事件稀少,导致机器学习模型偏向低浓度范围,在高风险高浓度区出现系统性低估。现有研究多关注算法优化,但针对数据不平衡的合成过采样技术在小型水库Chl-a回归模型中的应用尚未充分探索。因此,本研究旨在整合Sentinel-2波段比值与合成数据增强技术,以解决数据不平衡问题,提高全浓度范围的预测精度,支持富营养化风险管理。
**研究内容与结论**
研究人员以韩国南阳水库(Namyang Reservoir)为研究区,该水库是一个高度富营养化的农业河口水库,水质波动剧烈。通过2020–2023年间的484次现场采样(匹配Sentinel-2影像后保留229个有效样本),构建了Chl-a浓度数据集(范围2.85–459.45 mg/m
3,呈右偏分布)。研究采用主成分分析(PCA)从72个Sentinel-2 MSI波段比值中筛选出5个载荷最高的变量(B4/B6、B4/B8、B3/B6、B3/B7、B3/B8),作为输入特征。随后,比较了六种机器学习算法(偏最小二乘、随机森林[RF]、梯度提升[GB]、极端梯度提升[XGB]、支持向量机[SVM]、人工神经网络[ANN])在原始数据集和四种合成过采样技术(SMOTE、ADASYN、SMOTEENN、SMOTETomek)下的表现,分别采用2类和3类重采样方案。通过网格搜索进行超参数调优,并用独立测试集(20%)评估性能。
**主要关键技术方法**
研究采用的主要技术方法包括:基于PCA载荷的波段比值特征选择(保留物理可解释性);四种合成过采样技术(SMOTE通过插值生成少数类样本,ADASYN聚焦边界样本,SMOTEENN和SMOTETomek结合过采样与欠采样去除噪声/重叠样本);六种机器学习回归算法(以树集成模型为主);以及2类和3类浓度分层方案(基于数据统计百分位数定义阈值,避免传统生态阈值导致极端不平衡)。所有计算在Python 3.10环境中完成,使用scikit-learn、TensorFlow和imbalanced-learn库。
**研究结果**
**3.1 南阳水库野外采样数据分析**
通过2020年10月至2023年11月的484次采样(匹配后229个),Chl-a浓度范围为2.85–459.45 mg/m
3,夏季(7–8月)峰值显著(最高459.4 mg/m
3),冬季低于50 mg/m
3。数据集呈右偏分布,高浓度样本稀少,证实了数据不平衡问题。
**3.2 叶绿素a估算模型开发**
**3.2.1 输入变量选择**
PCA分析显示前几个主成分累积解释方差达90%。基于PC1的绝对载荷,选择B4/B6、B4/B8、B3/B6、B3/B7、B3/B8五个波段比值作为输入,兼顾光谱信息与物理意义。
**3.2.2 合成数据生成**
2类方案(阈值87.1 mg/m
3)生成91–92个高浓度样本,数据集增至270–275个;3类方案(阈值57.3和110.93 mg/m
3)生成中浓度52个和高浓度77个额外样本,数据集增至308–312个。混合方法(SMOTEENN、SMOTETomek)因移除噪声样本而总样本数略少,ADASYN在边界附近密集生成。
**3.2.3 机器学习结果**
54种模型组合中,基于原始数据集的最优XGB模型测试R
2=0.50,RMSE=36.90 mg/m
3,PBIAS=2.17%。应用合成过采样后模型性能显著提升:2类方案中,SMOTE-GB模型测试R
2=0.68,RMSE=28.41 mg/m
3,PBIAS=-20.49%;3类方案中,SMOTEENN-GB模型表现最佳(测试R
2=0.71,RMSE=25.53 mg/m
3,PBIAS=-7.05%)。在高浓度范围(>87.1 mg/m
3),原始XGB模型测试R
2=0.22,RMSE=57.74 mg/m
3,PBIAS=24.59%;而3类SMOTEENN-GB模型提升至R
2=0.84,RMSE=27.87 mg/m
3,PBIAS=12.45%,显著减轻了高浓度低估。
**3.3 叶绿素a的时空分布**
选择三组日期(2022年10月19日、11月8日、11月23日)评估模型的空间表现。3类SMOTEENN-GB模型在各级别均优于原始XGB模型:例如11月8日(藻华异质事件,均值105.85 mg/m
3),原始模型PBIAS=-26.35%,RMSE=63.91 mg/m
3;3类模型提升至PBIAS=-6.50%,RMSE=35.10 mg/m
3,R
2从0.57升至0.84。空间分布图显示3类模型能更准确地捕捉上游和支流的高浓度热点区域。
**讨论与结论**
**讨论部分总结**
讨论指出,所选五个波段比值(尤其B3/B8和B4/B6)有效捕捉了南阳水库受CDOM、TSS影响的复杂光学特征。合成过采样技术中,SMOTE系列方法(特别是3类SMOTEENN)通过更均匀分布训练数据,改善了中高浓度范围的表示,而ADASYN因边界集中效果较弱。树集成模型(RF、GB、XGB)在处理不平衡数据时表现优于其他算法。与经典波段比值算法(NDCI、两波段、三波段)相比,合成过采样GB模型显著提升精度。时空分布对比(与Jang等2024年的多元线性回归[MLR]结果)显示,3类SMOTEENN-GB模型预测的季节和空间模式一致,但动态范围更宽,能反映极端事件,而MLR产生平滑估计。局限性包括:高浓度区(>200 mg/m
3)仍有残余低估,可能源于光谱饱和、大气校正不确定性及CDOM/TSS干扰;未来需多站点验证、引入生态分类阈值(如营养状态指数)并比较水色专用大气校正处理器(如ACOLITE、C2RCC等)。
**结论部分翻译**
本研究通过整合Sentinel-2 MSI、机器学习和合成过采样技术,开发了Chl-a估算模型,以解决数据不平衡问题并提高小型农业水库的估算精度。PCA载荷分析选择了五个影响显著的Sentinel-2波段比值(B4/B6、B4/B8、B3/B6、B3/B7、B3/B8),从而在保留主要光谱信息的同时减少了输入变量数量。在评估的机器学习模型和采样方法组合中,3类SMOTEENN-GB模型取得了最佳独立测试性能(测试R
2=0.71,RMSE=25.53 mg/m
3,PBIAS=-7.05%),且相对于在原始不平衡数据集上训练的模型,改进了高浓度Chl-a预测。当应用于南阳水库时,该模型生成了具有时空分辨率的Chl-a估算值,揭示了反复出现的季节和空间模式。然而,极端浓度下的残余低估、大气校正不确定性以及缺乏多站点验证仍是重要局限性。总体而言,该方法为小型、营养敏感型农业水库的藻华监测和针对性水质管理提供了一种实用工具。