置信度阈值:面向相机陷阱数据无标记野生动物种群建模自动化工作流的研究

《Ecology and Evolution》:Confidence Thresholds: Towards an Automated Workflow for Unmarked Wildlife Population Modelling With Camera Trap Data

【字体: 时间:2026年08月29日 来源:Ecology and Evolution 2.6

编辑推荐:

  尽管生态学家正在探索利用人工智能自动识别相机陷阱及其他遥感数据中的野生动物,但该方法尚未普遍应用于产出密度或丰度估计的工作流中,导致大量图像数据集未被充分分析。通过深度学习集成(deep learning ensemble)增强图像分类在野生动物研究中仍不常见

  
尽管生态学家正在探索利用人工智能自动识别相机陷阱及其他遥感数据中的野生动物,但该方法尚未普遍应用于产出密度或丰度估计的工作流中,导致大量图像数据集未被充分分析。通过深度学习集成(deep learning ensemble)增强图像分类在野生动物研究中仍不常见,且将其输出与种群建模协同衔接至自动化工作流中存在潜力。研究人员在澳大利亚塔斯马尼亚有袋类动物(Bennett氏沙袋鼠 Notamacropus rufogriseus 与塔斯马尼亚小沙袋鼠 Thylogale billardierii)案例中呈现可重复工作流。研究人员分析了一套无同期野外调查数据的既有相机陷阱数据集,使用易获取的计算机视觉算法训练深度学习集成以分类数据集中最常见动物类群,总体分类准确率达94%。经人工复核后,研究人员通过专为重复应用设计的全脚本化工作流将输出衔接至分层丰度估计过程,包括从空间代理变量派生协变量。研究人员随后测试以分类置信水平子集化原始(未核实)自动检测记录,以一系列自动生成版本替代已核实检测历史。研究发现置信水平0.75衍生的检测历史产生高度可比的丰度估计。分析表明正确识别空采样时刻比正确识别所有有检测时刻对估计过程更重要。以分类置信阈值子集化自动检测输出输入建模工作流以替代昂贵人工核实,代表高收益机会,值得深入探究。此外,该集成方法为研究低频调查区及栖息地中代表性不足动物的生态学者提供工具。
研究背景方面,生物多样性危机下保护管理依赖高效数据采集与及时种群估计,但相机陷阱(camera trap, CT)遥感数据量巨大,从采集到产出种群估计常存2至3年滞后,人工智能(artificial intelligence, AI)自动识别虽在物体检测中表现优越,却少被衔接至密度或丰度估计工作流。现有无标记(unmarked)种群模型如CT距离采样(CT-DS)与随机相遇模型(REM)需现场视场角与距离标记,既有数据集往往缺失此类信息;而基于重复采样的分层与混合模型(如unmarked R包中的Royle-Nichols潜在丰度模型)可推断潜在丰度,但人工核实成本极高。为此研究人员在澳大利亚塔斯马尼亚金岛Lavinia农业—保护生态交错带,利用既有鹿监测CT数据(216001张图像,33个有效位点,2022年10月至2023年3月),以两种有袋类(Bennett氏沙袋鼠与塔斯马尼亚小沙袋鼠)为案例,探究以分类置信阈值替代人工核实、实现端到端自动化的可行性。
关键技术方法上,研究人员从塔斯马尼亚多地鹿监测计划采集3854张标注图像(3094张含15类动物、760张空图),以迁移学习微调33个现成卷积神经网络(convolutional neural network, CNN)模型(YOLOv5各尺寸、Faster R-CNN、RetinaNet),组建43个深度学习集成并遴选由large与medium YOLOv5构成的集成处理全量数据;以非极大抑制(non-maximum suppression, NMS)聚合重叠框,产出带置信分数的检测。检测历史以7天为采样时刻、60分钟间隔判定独立观测,活动模式用overlap包计算重叠系数(OVL)。丰度估计采用unmarked包occuRN函数拟合Royle-Nichols潜在丰度混合模型,协变量由terra包从高程、坡度、距水距离、植被类型及气象代理提取,以AIC选模并做参数自助法拟合优度检验。置信阈值测试选取0.0、0.5、0.75、0.8四级,将未核实自动检测直接转为二值检测历史并重跑工作流,与人工黄金标准(DH-MR)比对。
研究结果部分,首先“自动检测输出与分析”显示集成总体分类准确率94%,精度位点均82%、召回率均54%;7周内产出2477条独立有袋类观测,活动呈双峰晨昏型,生态交错带东侧天然植被活动量(1070)高于西侧农田(630),OVL达89%,且西侧更多夜间活动、东侧黎明峰值更高。其次“潜在丰度估计”中最优模型斜率(slope)对丰度正向显著(β=0.347, p=0.037),植被类型效应最大但非显著,检测概率随调查努力(effort)增大(β=1.544)且最小温度上升而降;经验贝叶斯估计全域潜在丰度142只(95% CrI 63至254),平均位点4.93只。再次“分类置信水平阈值结果”表明DH@0.75丰度估计148只(95% CrI 71至314)与DH-MR的142只几乎一致,DH@0.8低估至117只,DH@0.5与0.0分别高估至181与241只;各阈值下二值标签匹配率均超85%,但DH@0.75与0.8假阳性极少(4与3)、精度达97%与98%,召回85%与83%;卡方检验显示正确判定空样本(真负例最大化、假正例最小化)比抓全检测对潜在丰度估计贡献更大。
讨论部分指出,该工作流以较小标注量获得高准确率,尤益于代表性不足物种与域适应场景;潜在丰度非绝对丰度,因有效样本面积难定,但可作时序比对基线。置信阈值0.75在集成精度72%、召回54%下仍复现人工核实估计,若跨域验证可行,则阈值子集化可省去人工核实环节。研究特定微调的YOLOv5集成虽非最前沿架构,但模型无关且可迁移至新框架;公开模型(SpeciesNet、MegaDetector、AWC135)仍须针对南半球特有类群微调,本研究提供可复用范式。集成计算开销仅较单medium YOLOv5多27%时间且不增内存,优于单F-RCNN101。
结论部分翻译:生态学家获取高质量监测数据的能力随遥感技术进步持续扩展,提炼深层生态洞察的机会空前,但受限于大数据的充分利用。未来生态学者须密切关注计算机科学发展,持续提升计算、建模与工作流能力。本研究朝全自动端到端野生动物检测与种群估计进程推进了增量一步。论文发表于《Ecology and Evolution》。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号