MMBs_TransNeXt:一种用于精准畜牧业猪行为识别的分层自适应特征学习模型

《Frontiers in Veterinary Science》:MMBs_TransNeXt: a hierarchical adaptive feature learning model for pig behavior recognition in precision livestock farming

【字体: 时间:2026年09月04日 来源:Frontiers in Veterinary Science 3.1

编辑推荐:

  摘要翻译: 准确识别猪行为在提升精准畜牧业的动物福利和管理效率方面发挥着关键作用。然而,现有方法通常受制于刚性特征融合策略、空间细节保留不足以及层级特征间交互较弱等问题,严重影响了复杂养殖场景下的识别性能。为解决这些挑战,研究人员提出了一种名为MMBs_T

  
摘要翻译:
准确识别猪行为在提升精准畜牧业的动物福利和管理效率方面发挥着关键作用。然而,现有方法通常受制于刚性特征融合策略、空间细节保留不足以及层级特征间交互较弱等问题,严重影响了复杂养殖场景下的识别性能。为解决这些挑战,研究人员提出了一种名为MMBs_TransNeXt的新型深度学习架构用于猪行为识别。该模型构建了统一的分层自适应特征学习框架,采用多阶段自适应特征融合(Multi-stage Adaptive Feature Fusion, MAFF)机制,自适应地整合不同网络阶段间的语义信息与细粒度信息;通过多尺度细节融合卷积(Multi-scale Detail Fusion Convolution, MDFC)增强细微行为特征的表示;并借助双向调制特征融合(Bidirectional Modulation Feature Fusion, BMFF)机制促进多层级特征间的有效信息交流与交互。在真实猪行为数据集上的大量实验验证表明,MMBs_TransNeXt取得了95.77%的准确率,达到当前最优性能,显著优于具有代表性的CNN和Transformer基线模型。该工作为现代精准养猪系统中的智能视觉监测和福利评估提供了坚实的技术基础。
论文解读文章:

**一、研究背景与问题**
精准畜牧业依赖对动物行为的客观量化分析,以评估福利状况并优化饲养管理。猪行为识别是其中的关键环节,传统人工观察存在主观性强、劳动密集等局限,而传感器技术虽能捕捉行为特征,但部署复杂且可能影响动物健康。近年来,基于卷积神经网络(CNN)和Transformer的深度学习方法虽取得进展,但在复杂养殖场景下仍面临三大核心问题:一是特征融合策略多为静态固定权重,缺乏数据自适应性,难以动态调整多尺度特征的贡献;二是深层网络在逐层下采样过程中丢失大量空间细节,导致细微行为特征(如头部运动、肢体变化)难以保留;三是不同层级特征之间的交互弱,浅层细节与深层语义未能有效互补。这些问题严重制约了模型对相似行为(如打斗与行走)的判别能力。为此,研究人员提出MMBs_TransNeXt模型,旨在通过分层自适应特征学习框架解决上述缺陷。

**二、研究内容与结论**
研究人员构建了包含多阶段自适应特征融合(MAFF)、多尺度细节融合卷积(MDFC)和双向调制特征融合(BMFF)三大核心机制的深度网络。MAFF在网络跨阶段层面动态学习各阶段特征图的权重,自适应融合浅层细节与深层语义;MDFC采用异构双分支结构(H×W维卷积分支与双尺度感受野卷积分支),分别增强局部细粒度特征提取和全局轮廓感知;BMFF通过自调制与交叉调制策略,利用聚合注意力(Aggregated Attention)、MDFC和卷积门控线性单元(CGLU)构建跨组件交互路径,强化多级特征间的信息流动。在真实猪行为数据集(包含饮水、采食、探索、打斗、行走、躺卧六类行为,共2775个视频片段)上的实验表明,MMBs_TransNeXt取得了95.77%的准确率、95.78%的精确率、95.59%的召回率和95.64%的F1分数,显著优于ViT、Swin Transformer、ConvNeXt、Efficient ViT、CNN-LSTM及TransNeXt等主流模型,同时参数量为15.6M,计算量为2.8G FLOPs,在精度与计算成本间取得良好平衡。该研究为精准养猪场景下的智能视觉监测与福利评价提供了可靠的技术方案。

**三、关键技术方法**
研究采用的主要方法包括:(1)构建多阶段自适应特征融合机制,通过Softmax激活的权重学习模块动态生成阶段自适应融合权重;(2)设计多尺度细节融合卷积模块,包含H×W维卷积分支与双尺度(3×3和7×7)感受野卷积分支,分别处理通道独立细节增强与多尺度结构信息提取;(3)提出双向调制特征融合机制,融合聚合注意力、MDFC与CGLU模块,通过Sigmoid生成的调制权重实现跨模块交叉调制和自调制;(4)使用sLSTM(Scalar Long Short-Term Memory)进行时序建模,对每段视频均匀采样24帧并调整为224×224像素;(5)数据集采集自中国山西省临汾市襄汾县农绿园农业有限公司养猪基地,时间为2022年8月12日至9月25日,共6栋猪舍,每栋10头6月龄猪,使用海康威视DS-2DE3Q120MY-T/GLSE摄像头以1920×1080分辨率、25 fps帧率记录视频,经筛选和专业人员标注形成六类行为数据集,按80:20比例在视频片段层级划分训练集与测试集。实验环境为NVIDIA TITAN Xp GPU,使用Adam优化器,初始学习率0.001,训练超过200个epoch。

**四、研究结果**
**4.1 不同模型对比**
MMBs_TransNeXt在准确率、损失、精确率、召回率和F1分数上均优于所有对比模型。相比ViT,准确率提升12.56个百分点,损失降低73.23%;相比Swin Transformer,准确率提升5.26个百分点;相比ConvNeXt,准确率提升3.25个百分点;相比Efficient ViT、CNN-LSTM和TransNeXt,准确率分别提升5.26、5.77和2.89个百分点。在六类行为中,模型对饮水、采食、探索、躺卧和行走的识别准确率均最高;打斗行为的准确率相对较低,主要归因于视频模糊等数据集局限。

**4.2 MAFF有效性评估**
以引入sLSTM模块的Swin Transformer、ConvNeXt和TransNeXt作为基线,加入MAFF后,三个模型的准确率分别提升0.14、0.25和0.27个百分点,损失分别降低1.01%、9.20%和19.66%。结果表明MAFF通过动态分配阶段权重,有效缓解了固定权重融合导致的特征刚性问题。

**4.3 MDFC有效性评估与结构优化**
以带MAFF的模型为基础,单独引入MDFC后,Ms_Swin Transformer、Ms_ConvNeXt和Ms_TransNeXt的准确率分别提升2.58、1.48和1.37个百分点,损失分别降低30.71%、39.58%和24.98%。与Mona模块相比,MDFC在损失优化上更具优势。进一步的分支组合消融实验表明,当H×W分支与双尺度分支中的3×3和7×7卷积核组合时,模型取得最佳性能(准确率95.62%,损失0.2326);而同时使用所有卷积核(3×3、5×5、7×7)会导致特征冗余和感受野重叠干扰,性能显著下降。

**4.4 BMFF有效性评估**
以已集成MDFC的三种模型为基线,加入BMFF后,MMs_Swin Transformer、MMs_ConvNeXt和MMs_TransNeXt的准确率分别提升0.20、0.20和0.15个百分点,损失分别降低12.61%、3.01%和1.07%。BMFF通过交叉调制与自调制协同作用,增强了跨层级特征交互,在各类基础架构上均带来稳定提升。

**4.5 消融实验**
以s_TransNeXt为基线,依次加入MAFF、MDFC、BMFF后,模型准确率从93.98%逐步提升至95.77%,损失从0.3860降至0.2301。其中MDFC贡献最大,准确率提升1.37个百分点;MAFF和BMFF分别贡献0.27和0.15个百分点。三种模块的协同作用实现了准确率与损失的同步优化。

**五、讨论与结论**
讨论部分指出,MAFF的动态权重分配增强了深层语义与浅层细节的互补性;MDFC的双分支异构设计有效抑制了跨通道干扰,同时保留局部细节与全局轮廓;BMFF的交叉调制使空间注意力引导多尺度特征加权,自调制通过CGLU门控控制信息流动,避免了调制干扰。三者结合尤其有利于打斗和行走等易混淆类别的识别。研究结论表明,MMBs_TransNeXt通过统一的分层自适应特征学习框架,解决了现有方法中特征融合刚性、空间细节丢失和跨层级交互弱等问题,在真实猪行为数据集上达到95.77%的准确率,表现优于主流CNN和Transformer模型。未来工作将扩展多场景数据集以增强跨环境泛化能力,并开发适用于边缘部署的轻量级版本。该研究为现代精准养猪系统的智能视觉监测、福利评估和精细化管理提供了坚实技术基础。
相关新闻
生物通微信公众号
微信
新浪微博

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号