《Frontiers in Marine Science》:Plankton imager 10 monitoring in the southern North Sea: an open workflow for classification, morphometry and DwC-A publication
编辑推荐:
浮游生物是海洋食物网中的关键组成部分,且易受气候驱动变化的影响。其物候、分布和体型大小会影响生物碳泵及更高营养级的相互作用。浮游生物成像能够实现对群落组成和大小结构的高频观测,但用于处理、验证和发布大规模原位图像集的操作性工作流程仍然有限。本研究描述了Plan
浮游生物是海洋食物网中的关键组成部分,且易受气候驱动变化的影响。其物候、分布和体型大小会影响生物碳泵及更高营养级的相互作用。浮游生物成像能够实现对群落组成和大小结构的高频观测,但用于处理、验证和发布大规模原位图像集的操作性工作流程仍然有限。本研究描述了Plankton Imager 10(Pi-10)在“Simon Stevin”号研究船上的部署情况,并提出了一套用于Pi-10数据处理、分类、验证及基于标准发布的开放流程。研究展示了一个开放获取的数据处理流程,该流程结合了地理标记成像、深度学习分类和基于图像的度量方法,其适用性不局限于比利时北海南部海域。研究还提出了在Darwin Core档案(DwC-A)中记录Pi-10数据集的最佳实践。尽管该工作流程是针对Pi-10图像开发并验证的,但其设计为模块化框架,可适用于其他浮游生物成像传感器。
**研究背景与科学问题**
浮游生物是海洋食物网的关键组成部分,其物候、分布范围和体型大小随气候变化而发生改变,进而影响生物碳泵效率和更高营养级的相互作用。浮游生物的大小结构,从个体体长到群落层面的粒径谱,直接影响营养效率和捕食与被捕食动态关系。传统浮游生物监测主要依赖网采和人工显微镜检,这些方法劳动强度大、分辨率相对有限,且易受观察者主观偏差影响。虽然传统方法提供了宝贵的长期数据,但在捕捉对理解生态系统变化至关重要的精细形态、空间和时间格局方面存在不足。
近年来,自动化高分辨率成像技术迅速发展,但新成像技术仍面临诸多挑战,包括需要专家验证的训练数据、自动分类的不确定性、类别不平衡、仪器特异性偏差,以及分类器应用于新样本、新季节、新区域或新成像系统时模型性能下降等问题。比利时北海南部海域(BPNS)自2012年起基于ZooScan构建浮游动物时间序列,自2017年起基于FlowCam构建浮游植物时间序列,但这些系统均基于物理样本。Plankton Imager 10(Pi-10)由英国环境、渔业和水产养殖科学中心(Cefas)与Plankton Analytics联合开发,是一种独立的自动化线扫描成像系统,专为连续监测流通系统中的浮游生物和悬浮颗粒物而设计。与其他原位成像系统(如ISIIS)不同,Pi-10安装在船只或平台甲板上,通过连续供水系统对受控观测室中的水体颗粒进行成像,可在不干扰其他科研活动的情况下持续运行,适用于高浊度水域。然而,利用Pi-10采集的高通量图像数据目前尚缺乏成熟的操作性处理、验证和数据发布工作流程。为此,研究人员开展了本研究,旨在为浮游生物成像用户社区提供一套经过验证的、开放且可适应不同传感器的完整工作流程。
**研究内容与核心产出**
研究人员在“Simon Stevin”号研究船(R/V Simon Stevin)上部署了Pi-10系统,于2025年3月至2025年10月期间在北海南部海域累计运行32天,共获得226小时数据,分布在1,358个tar文件中(总计2.75 Tb),每个tar文件代表一个10分钟的时间片段。研究人员开发了一套完整的开放工作流程,主要包含六个核心组件:(1)用于Pi-10图像分类的卷积神经网络(CNN)模型,区域聚焦于BPNS,可适应其他成像传感器;(2)用于图像准备、选择和分类的Python脚本,可自动创建可用的输出产品;(3)用于验证模型分类所得感兴趣区域(ROIs)的R Shiny应用程序;(4)将注释数据集格式化为标准化Darwin Core档案(DwC-A)的R脚本;(5)一个包含240万张经CNN迭代分类并验证的北海南部图像数据集,附带同步采集的环境数据;(6)展示了该模块化流程如何处理来自ZooScan、FlowCam和VPR等其他浮游生物成像传感器图像的可行性。
**关键技术方法**
研究人员建立了一套从数据采集到公共数据发布的完整处理链条,主要涉及四个脚本:归档脚本、操作处理脚本(含CNN上游模型开发)、专家验证脚本和DwC-A出版脚本。训练集方面,研究人员采用了一个FAIR训练集,包含50,354个ROI图像,涵盖87个类别,该训练集最初于2023年在“Tridens”号和“Endeavor”号研究船上的渔业调查中采集,主要来自荷兰北海海域。研究人员对该训练集进行了四项改进:(1)手动验证了南北海2,412,153个ROIs,其中57,802个用于扩充原始训练集,其余用于评估模型性能;(2)排除了BPNS中不相关或罕见类群,并将类别数精简为35个分类单元,与OSPAR生命形式分类保持一致;(3)根据粒径分级和形态差异增加了子类别,将类别数从22个增加到30个;(4)利用基于颗粒形态特征的UMAP降维投影辅助类内结构识别和异常值检测。CNN模型架构采用EfficientNetV2B0,该模型基于iMagine项目中VLIZ开发的FlowCam浮游植物识别模型构建,在完全独立的测试集上,分类器实现了86.34%的Top-1准确率和97.12%的Top-3准确率。处理脚本对每个tar文件执行四项质量评估:气泡相对频率检测(超过40%阈值判定为低质量输入)、完整性检查(不满10分钟数据移至隔离目录)、提升因子计算(超过0.05阈值移至隔离目录待人工检查)、图像边缘灰度评估(检测微气泡过载)。验证阶段采用R Shiny注释工具,高置信度预测(>0.999且与次优预测差值>0.9)自动添加“_AI99”后缀,其余预测保留供人工验证。数据发布采用OBIS-ENV-DATA标准格式化为DwC-A档案,包含Event核心表、Occurrence扩展表和ExtendedMeasurementOrFact(eMoF)扩展表,上传至Marine Data Archive获取DOI标识。
**研究结果**
- **分类器性能**:CNN分类器的性能在不同分类单元间存在显著差异。五种类别(Noctiluca、diatom-setae、diatom-eccentric、echinoderm_echinopluteus和bubbles)在低置信度阈值下即可被正确识别,且误报率低,高召回率和高精确率并存,这些类别的预测可无需额外验证直接采用。另一些类别(如copepod-calanoida和detritus)在低置信度阈值下能够较好识别,但存在大量误报,即许多其他类群的个体被错误归入这些类别,导致高召回率但精确率极低,仅在较高置信度阈值下才能获得最佳F1分数。若不加以校正,可能导致桡足类丰度和生物量的高估。第三类(如Phaeocystis、Cnidaria)则模型识别效果较差,人工验证仍然是必要的。对于第一组类别,处理脚本可直接生成包含整合入DwC-A所需的全部信息的bio-metrics.csv输出文件。对于其他类别,自动化虽可减少人工标注工作量,但误分类风险,尤其是对关键生态指示物种的风险,使得持续性的专家验证仍不可或缺。
- **与更广泛浮游生物成像领域的关系**:Pi-10在浮游生物成像领域占有一个独特的位置,作为一种船载仪器,它专为连续、高频监测浮游生物群落而设计,不干扰CTD剖面或航行等其他研究活动。目前多种原位成像系统各具独特的获取策略,但一旦图像被分割为ROIs,其图像输出在结构上与Pi-10具有可比性。因此,本研究提出的端到端流程可适应其他浮游生物成像传感器,因为该流程仅需两个必要输入:包含ROIs的压缩tar文件和传感器特定的训练集与模型。该流程已在ZooScan、FlowCam和Video Plankton Recorder等传感器来源的数据集上进行了测试,压缩图像档案成功完成了流程处理,缺少EXIF信息和hits-and-misses信息等限制已通过将外部元数据表合并到流程中得到解决。
**讨论总结与结论**
讨论部分指出现有工作流程存在多方面的局限性。第一是模型性能的区域性和季节性特化问题:在某一浮游生物群落、成像设置或环境背景下训练的分类器,迁移到新区域、季节、仪器或分类组成时性能可能下降,当前分类器应被解释为针对比利时北海南部海域区域校准的模型。专家注释应被视为参考标签而非绝对真值,人工注释本质上受观察者偏差和注释者间差异影响。此外,基于图像的分类学分辨率受限于二维图像,许多浮游生物无法从二维图像中可靠区分。第二是专家验证的必要性问题:尽管自动分类减少了重复性人工工作,但训练、验证和性能评估仍依赖于高质量的分类学可靠参考标签,创建和维护这些标签数据集仍然耗时。虽然本研究提供了用于验证大数据量的用户界面,但现有云平台(如EcoTaxa)因上传体积限制(10Mb)而无法直接用于Pi-10的完整图像数据,处理约1Gb的10分钟数据片段时的可行替代方案需要仔细选择代表性图像子集以避免引入偏差。第三是生态指标应用尚待充分探索的问题:尽管Pi-10生成的标准化大小和形态测量超越了主要关注分类学检测的生物多样性工具,但图像衍生的形态测量仍可能受颗粒方向、图像分辨率、光学畸变、分割不确定性和边界部分物体等因素影响,特别是脆弱、细长、群体或形状不规则的浮游生物。形态测量结果应被解释为一致的基于图像的近似值。最后,Pi-10衍生的ROIs可贡献于生态指标计算,如桡足类平均大小和总丰度(CMSTA),并支持OSPAR质量状态报告等更广泛的评估框架。
研究结论表明,本研究记录了Plankton Imager 10(Pi-10)在“Simon Stevin”号船上操作性使用情况,提出了一套开放、可复现的端到端工作流程,涵盖高频浮游生物图像数据的处理、分类、验证和发布,并配套一个包含240万张验证图像的开放数据集。该流程将连续原位成像、CNN分类、专家验证、颗粒级形态测量和基于标准的发布相结合,展示了如何将大型图像集转化为FAIR(可发现、可访问、可互操作、可重用)且可重用的生物多样性数据集。通过将图像衍生的观测数据映射到采用OBIS-ENV-DATA标准的Darwin Core档案,该工作流程在新型浮游生物成像技术与既有生物多样性数据基础设施(如OBIS)之间架起了一座桥梁,促进了互操作性、长期保存和数据重用。尽管该流程针对北海南部开发并应用于Pi-10图像,但其模块化框架并非局限于单一仪器:该工作流程已在处理源自ZooScan、FlowCam和Video Plankton Recorder的基于ROI的图像档案中进行了测试,展示了其作为可适应处理框架的潜力。然而,这不应被解释为对Pi-10分类器的定量跨平台验证,更广泛地应用至其他传感器需要平台特定的预处理、模型重新训练、阈值校准和独立验证。该工作流程将图像采集、机器学习分类、专家验证、形态测量和FAIR数据发布整合于单一框架内,为自动化生态系统监测提供了实用基础,并有助于发展可互操作的、数据驱动的浮游生物观测系统,包括未来海洋生态系统的数字化表征和数字海洋孪生体系。