《SoftwareX》:Vision-Based Multi-Target Prediction for Cigar Tobacco Leaf Curing Monitoring: An IoT-Integrated Deep Learning Approach
编辑推荐:
传统控制雪茄烟叶调制环境的方法主要依赖熟练技师的经验知识。本研究提出了一种基于视觉的多目标预测方法,利用深度学习从调制过程中捕获的视觉信息推断环境条件、调制阶段和控制状态。研究人员设计并部署了一个全面的物联网(IoT)监测系统,在商业调制设施中分布传感器,作为
传统控制雪茄烟叶调制环境的方法主要依赖熟练技师的经验知识。本研究提出了一种基于视觉的多目标预测方法,利用深度学习从调制过程中捕获的视觉信息推断环境条件、调制阶段和控制状态。研究人员设计并部署了一个全面的物联网(IoT)监测系统,在商业调制设施中分布传感器,作为真实标注系统以生成高质量标注数据集。基于来自五个调制批次的1,003个样本,研究人员开发了一个基于ResNet-50的多任务学习模型,从单张图像输入预测20个环境参数(回归,均方根误差(RMSE):0.26–0.29)、8个二元控制状态(准确率:67.7%)和3个调制阶段类别(准确率:55.0%)。研究人员承认局限性,包括数据集规模相对较小、缺乏时序建模以及缺少基线比较,这些限制了当前结果的泛化性和实际部署准备度。所提出的系统证明了基于视觉的过程监测的可行性,并为智能调制辅助提供了基础,未来工作将聚焦于扩展数据集、时序建模和比较评估。研究人员将这项工作定位为计算机视觉用于过程内调制监测的初步探索,认识到性能特征仅代表起点而非可部署解决方案。
**1. 引言**
雪茄烟叶调制是烟草生产的关键阶段,直接影响最终产品的香气、燃烧特性和整体质量。该过程涉及复杂的生化转化,对环境条件(包括温度、湿度和空气成分)高度敏感。传统管理主要依赖熟练技师的经验知识,通过视觉检查和对烟叶的触觉评估进行主观判断。这种方法存在一致性、可扩展性和系统性优化工艺参数的固有限制。调制通常持续7到10天,包括五个不同阶段:萎凋、变黄、褐变、定色和干筋。每个阶段需要精确控制温湿度以实现烟叶内的最佳化学转化。依赖经验丰富的技师带来了操作挑战,如劳动力老龄化、知识传承困难以及人为判断的变异性。物联网(IoT)技术为通过连续高分辨率环境监测改变烟草加工提供了机遇。本研究部署了全面的IoT传感器网络作为真实标注基础设施,同步传感器与视觉观测以构建大规模标注数据集,用于训练深度学习模型。计算机视觉和卷积神经网络(CNN)在农业应用中显示出卓越能力。核心假设是不同调制阶段烟叶的视觉特征足以推断环境条件和过程状态,从而实现比直接集成传感器更实用的基于摄像头的监测方法。多任务学习(MTL)通过利用共享表示,在数据有限时减少过拟合风险。本研究是“基于物联网技术的雪茄烟叶调制与发酵工艺优化研究”项目的一部分,主要贡献包括:设计部署三层IoT架构作为真实标注系统;开发基于视觉的多目标深度学习模型;系统分析回归、二元分类和多类分类任务的预测性能;识别关键挑战并明确未来改进路线。
**2. 相关工作**
**2.1. 物联网在农业加工中的应用**
IoT技术在农业中迅速扩展,涵盖精准农业、牲畜监测和农产品加工。研究者开发了用于谷物干燥的IoT系统以实现节能,利用无线传感器网络监测水果干燥,并在烟草加工中提出用于烟叶调制室的无线传感器网络进行温湿度控制。这些研究展示了连续环境监测的价值,但均未集成计算机视觉进行过程内预测。
**2.2. 计算机视觉在农业中的应用**
计算机视觉在农业中不可或缺,应用范围从作物监测到质量检测。研究者开发了深度学习模型用于植物病害检测,准确率超过99%。对于烟草,计算机视觉已应用于叶质量分级、成熟度评估和缺陷检测。然而,这些应用聚焦于采后质量分级,而非调制过程中的实时预测。据研究人员所知,尚无先前工作将计算机视觉应用于预测烟草调制过程中的实时环境参数和调制阶段。
**2.3. 多任务学习在农业监测中的应用**
MTL使单一模型能同时预测多个相关目标。研究表明MTL可作为正则化器,通过强制共享表示降低过拟合风险。在农业应用中,MTL已应用于同时作物分类与病害检测,以及产量预测与生长阶段估计。本研究将该范式扩展到烟草调制监测,其中环境参数、调制阶段和控制状态通过底层生化过程相互关联。
**3. 材料与方法**
**3.1. 系统概述与物联网架构**
IoT监测系统采用分层三层架构,作为基于视觉预测模型的真实标注系统。IoT系统不直接作为模型输入,而是提供与视觉观测同步的准确参考测量值。当摄像头捕获图像时,共置传感器同时记录相应的环境参数和设备状态,形成训练数据集。训练后,模型可从图像单独预测环境条件和过程状态,实现无需广泛传感器部署的低成本监测。应用层包括智能调制应用、省级烟草生产管理平台和IoT中心;控制层包括调制室控制器,通过Modbus RTU/TCP协议采集数据并执行控制算法;设备层包括称重传感器(500 kg容量,±0.1%精度)、温湿度传感器、气体传感器(CO
2、NH
3、CO)、工业摄像头(500万像素,IP65防护等级)和致动器(风机、加湿器、加热器、风门)。
**3.2. 传感器部署与配置**
称重监测系统采用称重传感器、不锈钢挂杆和悬挂架结构(200–300 kg鲜烟叶容量),数据采集模块以1分钟间隔通过MQTT协议传输。视觉监测系统使用500万像素IP摄像头,配LED辅助照明(5500K,显色指数≥90),固定在2.5米高度、45度角,每30分钟捕获图像并与传感器读数同步。
**3.3. 数据集特征与预测目标定义**
数据集包含18个月内从五个商业调制批次收集的同步图像-传感器对。每个样本由一张图像和对应时间戳的传感器测量值组成。回归目标(20个连续参数)包括五个不同位置的温度(℃,范围30–75)、五个湿度(%,范围25–95)、三种气体浓度(CO
2、NH
3、CO,ppm)、两个称重值和三个派生水分含量指数(归一化0–1)。所有目标经最小-最大归一化至[0,1]。二元分类目标(8个状态)包括加热器、风机、加湿器的开关状态以及五个区域通风风门的开闭状态。多类分类目标(3个任务)包括调制阶段(8类:萎凋早期、萎凋晚期、变黄早期、变黄晚期、褐变、定色、干筋早期、干筋晚期)、位置(3类:上架、中架、下架)和批次(5类)。类别不平衡分析显示显著不平衡,采用类加权交叉熵损失函数(公式1)缓解。数据集按批次划分:四个批次(803样本)用于训练,一个保留批次(200样本)用于验证。图像预处理为224×224像素,按ImageNet均值和标准差归一化,数据增强包括随机水平翻转和随机旋转(±15度)。缺失数据处理在传感器故障时排除对应样本,仅对真实生成所用的时间序列传感器数据应用线性插值,约8%读数需插值。
**3.4. 多目标预测模型**
**3.4.1. 模型架构**
基于ResNet-50架构的多目标预测模型,输入单张图像(224×224×3),共享主干为ImageNet预训练的ResNet-50,提取2048维特征向量,后接两个全连接层(2048→512→256,ReLU激活,dropout率0.3)。回归头(256→128→20)预测20个连续环境参数,损失为均方误差(MSE)。二元分类头(256→64→8)预测8个控制状态,损失为二元交叉熵。分类头(256→64)后接三个独立头分别预测调制阶段(8类)、位置(3类)和批次(5类),损失为加权交叉熵。总损失组合公式(2):L
total = w
regL
reg + w
binL
bin + w
clsL
cls,权重分别为1.0、0.5、0.3。
**3.4.2. 训练配置**
使用fastai 2.7+框架,ResNet-50主干在前3个epoch冻结,后微调。优化器为AdamW,初始学习率主干1e-3、头部1e-2,采用one-cycle策略,最大学习率1e-2,最终除因子100。批量大小16,训练15个epoch,早停patience为3,正则化含dropout 0.3和权重衰减1e-4。
**4. 结果与讨论**
**4.1. 基线比较**
对比三种基线:单任务CNN(ST-CNN)、浅层CNN和VGG-16多任务模型。表2显示所提出的ResNet-50多任务模型在所有任务类型上优于基线,预训练ResNet-50主干提供更优特征提取,多任务学习相比单任务在二元分类准确率上提升6.5个百分点。这些比较验证了架构选择,但需更多基线评估(如基于LSTM的时序模型)。
**4.2. 训练过程分析**
模型训练15个epoch,总损失从0.892降至0.541(训练集)和从0.701降至0.598(验证集),最佳验证损失0.573在第11个epoch。类加权损失提高了少数类召回率,例如干筋晚期从31%提升至44%。
**4.3. 模型性能评估**
表3总结了保留验证批次的性能:回归RMSE 0.268,二元分类准确率67.7%,调制阶段(8类)准确率55.0%,位置(3类)准确率76.5%,总损失0.598。
**4.4. 详细性能分析**
**4.4.1. 回归任务性能**
回归头预测20个环境参数,验证集整体RMSE 0.268。温度预测误差最低(RMSE≈0.26),湿度预测误差稍高(RMSE≈0.30)归因于调制室内空间梯度。归一化RMSE对应物理单位约2-4℃温度预测误差,不足以替代直接传感器,但可在操作设置中提供冗余或交叉验证。
**4.4.2. 二元分类性能**
二元分类头准确率67.7%。逐类分析显示通风状态(风机和风门状态)预测更准确(75–80%),而加热状态(加热器和加湿器状态)预测较差(60–65%),反映通风引起的视觉变化更明显。32.3%的错误率是重大限制,工业实践中需人工验证,不建议用于自主控制。
**4.4.3. 调制阶段分类性能**
调制阶段分类准确率55.0%(随机水平12.5%)。混淆矩阵显示多数误分类发生在相邻阶段,干筋晚期准确率最高(68%)因叶片完全干燥的外观独特。类不平衡影响仍存在,加权准确率42.3%低于未加权55.0%,少数类表现挑战持续。
**4.5. 讨论**
**4.5.1. 基于视觉预测的解释**
核心发现是烟叶视觉特征包含足够信息以中等准确度推断环境条件和过程状态,这与领域知识一致:颜色、纹理和水分含量是温湿度驱动生化转化的直接表现。该方法实际优势包括摄像头维护成本更低、单安装点覆盖更大区域、无需接触恶劣环境。但性能限制需明确:这是可行性概念验证,非生产就绪系统。
**4.5.2. 与直接传感器测量的比较**
基于视觉的方法不旨在取代直接传感器测量,而是提供互补监测能力,可在无传感器覆盖区域估计条件、提供交叉验证、支持有限传感器设施的低成本监测。混合部署中传感器提供高精度参考,视觉系统提供补充空间覆盖。
**4.5.3. 性能限制与实际适用性**
当前性能水平不足以用于自主工业控制。32%的控制状态错误率可能导致错误致动器命令,毁坏整批烟叶。实际部署需更大数据集(估计10000+样本)、时序建模、不确定性量化以标记低置信预测供人工审查,以及分层决策机制。
**5. 结论**
本文提出基于视觉的多目标预测方法用于雪茄烟叶调制监测,IoT系统提供真实标注。关键发现包括:模型从单张图像预测环境参数RMSE 0.268、控制状态准确率67.7%、调制阶段准确率55.0%;多任务学习结合预训练ResNet-50优于单任务和浅层CNN基线;方法证明可行性但性能不足以自主控制;主要局限为数据集较小(1003样本来自5批次)、缺乏时序建模和未与序列模型比较。未来工作包括数据集扩展至10000+样本、集成LSTM或Transformer进行时序建模、使用贝叶斯神经网络或蒙特卡洛dropout进行不确定性量化、开发混合部署架构结合视觉预测与针对性传感器验证。