《SoftwareX》:Deep learning framework for sow posture classification from depth images: Comparison with data transformation techniques, models, and cross-validation
编辑推荐:
在美国,仔猪断奶前死亡率(preweaning mortality, PWM)平均约为14–15%,其中母猪压死(sow overlaying)导致约三分之一的损失。本研究旨在开发并评估深度学习模型,利用深度图像(depth images)分类六种母猪姿态,以
在美国,仔猪断奶前死亡率(preweaning mortality, PWM)平均约为14–15%,其中母猪压死(sow overlaying)导致约三分之一的损失。本研究旨在开发并评估深度学习模型,利用深度图像(depth images)分类六种母猪姿态,以监测与压死风险相关的行为。研究人员使用Kinect V2?相机以10帧/分钟(frames min-1)的速率连续五天(分娩前2天至分娩后2天)采集俯视深度图像,从18头母猪获得26,506张训练图像,从12头母猪获得17,901张测试图像,并从3头位于斜角栏舍(diagonal stalls)的母猪额外获得4,697张图像用于外部验证。研究人员训练并评估了三种迁移学习架构(YOLO11m-cls、ResNet-50和Inception v3)在两种不同的深度数据变换图像(灰度图(grayscale)和Jet彩色映射图(Jet-colormap))上的表现。Jet彩色映射图始终优于灰度图,其中YOLO11m-cls达到了最高准确率(精确率(precision)=0.98,召回率(recall)=0.98,F1分数(F1)=0.98)。外部验证确认了在斜角栏舍中的稳健性能(F1=0.94),而跨栏舍设计和热灯配置的交叉验证表明了模型的强泛化能力。这些发现表明,深度成像结合深度学习为母猪姿态分类提供了一种可靠、非侵入性的方法。此类模型能够生成连续的行为数据流,以增进对姿态转换、栏舍设计的理解,并减少仔猪死亡率。
论文解读:深度图像与深度学习在母猪姿态分类中的应用
在美国,仔猪断奶前死亡率(preweaning mortality, PWM)平均高达14-15%,其中约三分之一的损失由母猪压死(sow overlaying)导致。连续准确的母猪姿态监测是揭示母性行为、降低压死风险的关键。然而,传统接触式传感器(如加速度计)需要人工操作,难以大规模应用;RGB相机则受光照变化影响。深度相机(depth camera)能提供不受光照影响的3D数据,但深度图像的数据变换方式对模型性能的影响尚未充分评估。此外,深度学习模型如卷积神经网络(Convolutional Neural Network, CNN)已被用于动物行为分析,但模型性能受图像质量、栏舍设计等因素制约,且随机数据分割无法保证模型对不同个体的泛化性。为此,Rahman等人(论文发表于《SoftwareX》)开展研究,旨在开发并评估深度学习模型分类六种母猪姿态,比较灰度图(grayscale)与Jet彩色映射图(Jet-colormap)两种深度图像变换的效果,并验证最佳模型在不同母猪、栏舍类型和热灯配置下的鲁棒性。
研究人员使用Kinect V2
?相机以10帧/分钟(frames min
-1)连续5天采集俯视深度图像,样本来源为美国肉用动物研究中心(USMARC)的18头母猪(训练集26,506张)和12头母猪(测试集17,901张),另从3头斜角栏舍母猪获取4,697张外部验证图像。主要技术方法包括:深度图像预处理(阈值化1500-2700 mm、最小最大归一化、反转),分别转换为灰度图(8-bit)和Jet彩色映射图;三种迁移学习模型:YOLO11m-cls(Ultralytics 8.3.36,输入480×480,batch 32,1000 epochs,学习率0.001)、ResNet-50(残差网络50层,ImageNet预训练,加512单元全连接层,ReLU激活,L2正则化0.05,Softmax输出)、Inception v3(一种卷积神经网络架构,类似全连接层设置,L2正则化0.001);训练在Holland计算中心(HCC)的NVIDIA Tesla V100 GPU上进行;采用块交叉验证(block cross-validation)按栏舍类型(传统栏舍TSL、扩展仔猪区栏舍ECSL、扩展母猪和仔猪区栏舍ESCSL)和热灯配置(1HL、2HL)分组训练测试;使用Grad-CAM(梯度加权类激活映射)进行模型可解释性分析。
研究结果如下:
(1)模型性能(Model Performance):在测试集上,Jet彩色映射图在所有模型中均优于灰度图。YOLO11m-cls的加权F1分数(F1-score)从灰度图的0.90提升至Jet图的0.98,ResNet-50从0.72提升至0.95,Inception v3从0.90提升至0.97。YOLO11m-cls推理时间稳定在4.1 ms/图像,优于其他模型。
(2)各类别性能与混淆矩阵(Per-class Performance and Confusion Matrix):YOLO11m-cls在六个姿态类别上均取得高F1分数(0.96-1.00),但跪姿(KNEEL)和胸卧(LS)分别有轻微混淆(F1=0.96和0.98)。ResNet-50对KNEEL过预测(精度0.64,召回0.97),Inception v3对KNEEL召回较低(0.83)。混淆矩阵显示,YOLO11m-cls误分类最少。
(3)块交叉验证(Block Cross-validation):YOLO11m-cls在ESCSL栏舍训练后测试TSL(F1=0.97)和ESCSL(F1=0.98)表现优异,但ECSL训练后所有测试集表现较差(F1=0.72-0.86),因ECSL中仔猪活动增加背景噪声。热灯配置方面,训练于2HL数据的模型在1HL和2HL测试中均获高F1(0.98和0.99),表明热灯配置不影响性能。
(4)模型可解释性(Model Interpretability):Grad-CAM热图显示,YOLO11m-cls分类时聚焦于母猪相关身体部位(如跪姿的前腿肩部、侧卧的躯干),而非背景栏舍结构。
(5)斜角栏舍泛化性(Generalizability for Diagonal Stall Type):在斜角栏舍测试中,模型加权F1=0.94,其中站立(STAND)和坐姿(SIT)F1≥0.98,侧卧(Lateral Lying)F1=0.94,但跪姿(F1=0.84)和胸卧(F1=0.82)因与过渡姿态混淆而表现较差。
讨论部分总结:深度图像相比RGB图像具有光照不变性,Jet彩色映射图通过增强对比度提升了模型区分能力。YOLO11m-cls因其高效架构(参数比YOLOv8m减少22%)适合实时边缘部署。