使用深度学习与大型语言模型的自动化海藻物种分类

《Scientific Reports》:Automated seaweed species classification using deep learning and large language models

【字体: 时间:2026年07月24日 来源:Scientific Reports 4.9

编辑推荐:

  海藻是海洋生态系统的基础组成部分,并在全球水产养殖中具有重要价值。准确高效地识别海藻物种对于生物多样性监测、生态研究和可持续管理至关重要。本研究评估了一种用于自动化海藻分类的双路径框架。首先,研究人员基于EfficientNet-B0架构实现了一个标准卷积神经

  
海藻是海洋生态系统的基础组成部分,并在全球水产养殖中具有重要价值。准确高效地识别海藻物种对于生物多样性监测、生态研究和可持续管理至关重要。本研究评估了一种用于自动化海藻分类的双路径框架。首先,研究人员基于EfficientNet-B0架构实现了一个标准卷积神经网络(CNN),并利用ImageNet的迁移学习。该模型在一个由800张原始野外图像(分层80/10/10分割)衍生出的增强数据集(共3440张图像)上训练,涵盖43种海藻物种。该CNN达到了89%的基线分类准确率。其次,研究人员提出了一项概念验证研究,使用视觉语言模型(VLM),具体为Claude 3.5 Sonnet,以探索分类学中的语义推理。该VLM的原始准确率为70%,通过人工在环(HITL)验证系统,在选定子集上进一步改进至有效准确率92%。虽然CNN提供了一种稳健且快速的分类工具,但VLM-HITL方法为验证疑难标本提供了一种可解释的语义替代方案。这项工作为开发可扩展的自动化海洋科学生物多样性监测工具做出了贡献。
**论文解读:基于深度学习和大型语言模型的自动化海藻物种分类研究**

**研究背景与问题**
海藻(海洋大型藻类)是沿海海洋生态系统的基础组成部分,对初级生产力与养分循环贡献显著。准确识别海藻物种是海洋生物多样性监测与保护的核心任务。传统方法依赖专家分类学家基于形态学分析,但该过程劳动密集且受限于专家资源稀缺。近年来,深度学习在生态监测中取得进展,但面临环境条件复杂、数据质量低、罕见物种识别难等挑战。同时,视觉语言模型(VLM)因其语义推理和零样本学习能力,为可解释的分类提供了新可能。然而,现有研究多聚焦于单一模型,缺乏对CNN高精度与VLM可解释性相结合的系统评估。为此,本研究提出双路径框架,旨在结合卷积神经网络(CNN)的高效分类与VLM的语义验证,并通过人工在环(HITL)机制提升可靠性,为可扩展的海洋生物多样性监测工具开发奠定基础。该论文发表在《Scientific Reports》。

**主要技术方法**
研究人员从埃及红海沿岸(赫尔格达、苏伊士湾、马萨阿拉姆)的野外调查中采集了800张原始图像,涵盖43种海藻物种(分属绿藻门、褐藻门、红藻门)。数据集通过旋转、翻转、亮度调整和缩放扩展至3440张,并采用分层抽样按80/10/10比例划分为训练、验证和测试集。CNN模型基于EfficientNet-B0架构,利用ImageNet预训练权重进行迁移学习,训练35个周期,采用两阶段微调策略。VLM方面,使用Claude 3.5 Sonnet(通过Anthropic API)进行结构化提示工程,设置温度参数为0、top-p为0.9,以约束输出至43个物种列表,并返回JSON格式的预测、置信度及推理理由。HITL系统设定置信度阈值<0.7时自动标记,由海洋分类学家进行专家复核与校正。模型通过Hugging Face Spaces部署为交互式网页应用。

**研究结果**
**CNN模型性能**:CNN在独立测试集上达到89%的整体准确率,宏平均F1分数为0.87,Top-5准确率为96%。混淆矩阵分析表明,大多数误分类发生在形态相似的同属物种之间(如马尾藻属物种之间,以及Padina pavonica与Padina boergesenii之间),而跨主要藻类门(绿藻、褐藻、红藻)的误分类极少。这表明模型在门和属水平上学习到稳健的高阶分类特征,但细粒度物种级区分仍是主要挑战。

**Claude AI VLM性能与HITL增强**:VLM在100张测试图像子集上达到70%的基线准确率,远超随机基线(约2.3%)。在HITL验证试验中,100张标记图像经专家复核后,92%的初始模型错误被成功纠正,使得VLM+HITL工作流在复核子集上的最终有效准确率达到约96%。这凸显了多模态AI与专家验证的互补优势,尤其适用于形态相似或种内变异高的物种。

**讨论与结论**
讨论部分指出,CNN的高准确率(89%)得益于精心策划的增强数据集和迁移学习,其性能与近期海藻分类研究(如EfficientNet模型约89.55%准确率)相当,但与基于Swin Transformer的鱼类分类(>98%)相比仍有提升空间,未来可引入Vision Transformer等先进架构。双路径框架整合了专用CNN与通用VLM,通过HITL连接,使得CNN实现高通量分类,VLM提供语义解释以支持专家验证。这种协作特别利于解决罕见或视觉模糊物种的“长尾问题”。VLM的推理能力符合可解释人工智能(XAI)目标,提升了透明度。与专注于实时检测的研究(如SFD-YOLO)不同,本框架强调细粒度分类与可解释性,更适合需要物种级准确性和专家验证的生物多样性监测。部署在Hugging Face Spaces的工具增强了可访问性,支持公民科学。

研究结论翻译如下:本研究提出了一种双路径框架,用于对43种海藻进行分类,基于EfficientNet-B0的CNN在精心策划和增强的数据集上训练,达到了89%的准确率。Claude 3.5 Sonnet视觉语言模型以70%的基线性能展示了初步的语义验证能力,而人工在环(HITL)框架提高了对挑战性案例的预测可靠性。总体而言,结果证明了高精度深度学习与可解释多模态AI在海洋生物多样性评估中的互补作用。未来工作应扩展数据集至更广泛的地理区域,并开发领域专用的视觉语言模型,以增强可扩展性并减少对人工分类验证的依赖。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号