从端侧视觉到辅助采摘:基于增强现实(AR)眼镜的串收樱桃番茄轻量级实时成熟度评估系统

《Artificial Intelligence in Agriculture》:From on-device vision to assisted harvesting: A lightweight real-time ripeness evaluation system for truss-harvested cherry tomatoes on augmented reality glasses

【字体: 时间:2026年08月11日 来源:Artificial Intelligence in Agriculture 16.1

编辑推荐:

  从经验驱动的人工采摘向数据驱动的智能管理转变,是现代设施农业的关键转型。然而,全自主系统的广泛采用仍受制于温室环境的复杂性和农业机器人的高昂成本。针对串收樱桃番茄生产的实际挑战,研究人员提出了一种增强现实(AR)辅助的实时成熟度评估和原位决策支持系统,通过人机

  
从经验驱动的人工采摘向数据驱动的智能管理转变,是现代设施农业的关键转型。然而,全自主系统的广泛采用仍受制于温室环境的复杂性和农业机器人的高昂成本。针对串收樱桃番茄生产的实际挑战,研究人员提出了一种增强现实(AR)辅助的实时成熟度评估和原位决策支持系统,通过人机协作将人工劳动与智能自动化连接起来。该系统的核心是DGTruss-YOLO,一种面向资源受限可穿戴设备的改进轻量级YOLOv11模型。该架构集成了空间-通道重建卷积(ScConv)模块以抑制空间和通道维度的特征冗余,以及基于多尺度特征调制的辅助特征金字塔网络(MFM-MAFPN),以同时捕获单个果实的细粒度纹理和番茄果串的整体结构特征。为确保无缝边缘部署,研究人员采用了一种基于简化标准卷积的高效检测头(Efficient_Detect),以增强在AR智能眼镜上的硬件兼容性和推理效率。此外,研究引入了一种实用的加权分级策略,将果实级识别结果映射为五级(A-E)串级成熟度指数,使视觉感知结果与实际的采摘需求对齐。实验结果表明,与基线YOLOv11相比,优化模型将参数量和计算复杂度分别降低了11.07%和12.70%,同时在AR智能眼镜上保持了15-20 FPS的稳定实时推理速度。该系统实现了95.26%的串级成熟度评估准确率和100%的相邻容差准确率,为复杂温室环境下的采摘决策提供了一致且基于模型的串级成熟度评估。通过提供直观、免手持和原位视觉引导,这项工作建立了人机协作采摘的实用技术路线,并为在可持续和智能农业生产中部署边缘侧深度学习解决方案提供了实践参考。
现代设施农业正由经验驱动向数据驱动转型,但受环境复杂性和农业机器人高成本制约,完全自主系统在短期内难以普及。番茄成熟度直接决定采收时机和市场价值,然而人工判断易受光照和主观因素影响,现有深度学习研究多集中于大果单果识别,无法满足以整串为采收单位的串收樱桃番茄的成熟度评估需求。为此,论文在《Artificial Intelligence in Agriculture》上提出了一种基于增强现实(AR)眼镜的实时成熟度评估与决策支持系统,旨在通过人机协作弥合人工操作与智能自动化之间的差距。研究人员设计了以DGTruss-YOLO为核心的单模型双尺度检测框架,在同一网络中同步输出果实级成熟度类别和果串边界,并通过加权融合策略将果实级信息转换为A-E五级串级成熟度指数。实验证明,该系统在真实温室环境中达到95.26%的串级评估准确率,模型参数量和计算量显著降低,可稳定运行于AR智能眼镜,为复杂温室中的精细采摘提供了可行的技术路径。

研究人员使用了来自青岛凯盛浩丰智慧农业基地的1200张真实温室图像,经预处理与同步数据增强后形成2864张图像(训练2281张,验证583张),涵盖不同光照、遮挡和果串形态。主要关键技术包括:在YOLOv11中集成空间-通道重建卷积(ScConv)构成C3k2_ScConv模块,通过空间重建单元(SRU)和通道重建单元(CRU)抑制特征冗余;提出多尺度特征调制辅助特征金字塔网络(MFM-MAFPN),包含浅层(MSAF)与深层(MAAF)辅助融合和多尺度特征调制(MFM)模块;设计基于标准卷积的轻量级检测头Efficient_Detect以提升硬件兼容性;采用加权公式将果实级结果映射为A-E串级成熟度指数。模型经ONNX和pnnx转换后用NCNN框架部署于SUPERHEXA AR智能眼镜。

研究人员通过以下实验验证了系统性能。

5.1 消融实验(Ablation study)。通过逐步引入上述三个模块,发现各模块对精度或效率均有贡献,组合后产生协同效应。最终模型相对基线YOLOv11将参数量、计算复杂度和模型大小分别降低11.07%、12.70%和9.62%,平均精度均值(mean Average Precision, mAP@0.5)保持0.8539,平均F1-score由0.8070提升至0.8139。这证明所提架构在轻量化同时保持了稳健的检测能力。

5.2 模型热力图分析(Model Heatmap analysis)。利用梯度加权类激活映射++(Grad-CAM++)对强背光、密集遮挡和混合成熟度场景进行可视化。结果显示,基线模型在高光背景区域出现过激活,而改进模型将注意力集中在果实本身,边界更清晰,对不同成熟阶段的响应更均衡,说明特征重建和多尺度融合提升了判别力。

5.3 不同模型对比(Comparative experiments with different models)。在统一训练和评估协议下,与YOLOv5n、YOLOv8n、YOLOv11n、YOLOv12n、YOLOv13n比较,DGTruss-YOLO以最小的模型规模(5.5 GFLOPs,2,296,916参数,4.7 MB)取得最高的平均F1-score(0.8139)和mAP@0.5(0.8539),尤其对视觉模糊的转变期果实,F1-score和mAP@0.5分别达0.7322和0.7763,优于所有对比模型。

5.4 AR智能眼镜性能评估(Performance evaluation on AR smart glasses)。在SUPERHEXA AR设备上,DGTruss-YOLO检测到249个有效果串,漏检率最低;串级成熟度准确率为95.26%,比YOLOv11和YOLOv10分别高3.56和3.96个百分点;相邻容差准确率100%,Cohen's κ=0.9399,加权F1-score=0.9528,平均绝对误差(Mean Absolute Error, MAE)仅0.0474,表明预测偏差被严格限制在相邻等级内,降低了误采风险。

讨论部分指出,单模型架构在资源受限边缘条件下有效平衡了模型复杂度与推理效率;MFM-MAFPN增强了多尺度语义提取,结合串级加权策略可减轻遮挡和光照变化带来的干扰;该系统在人机协同(Human-in-the-Loop, HITL)框架中充当辅助认知层而非完全替代人类操作。研究也存在局限:数据集来自单一温室,AR硬件在计算能力、续航和散热方面受限,且尚未通过大规模用户研究量化系统对采收效率、决策一致性和工人疲劳的实际影响。未来拟扩展品种和栽培模式多样性,探索知识蒸馏等模型压缩技术,并引入多模态交互以增强协同。研究结论翻译为:研究人员提出了一种用于串收樱桃番茄采收的AR辅助实时识别和原位决策支持系统,通过将轻量级深度学习架构与可穿戴AR硬件结合,弥补了计算机视觉技术与实际农业操作之间的鸿沟。系统在AR平台上达到95.26%的串级成熟度评估准确率,优于YOLOv11和YOLOv10;同时获得100%相邻容差准确率、κ=0.9399、加权F1-score=0.9528和MAE=0.0474,验证了其序数评估的可靠性和安全余量。模型相对基线YOLOv11减少11.07%参数量和12.70%计算复杂度,模型大小仅4.7 MB,并保持15-20 FPS的实时推理速度。尽管受数据集和硬件限制,该工作仍为资源受限温室场景下的轻量级模型部署和AR辅助决策提供了实用技术参考。
相关新闻
生物通微信公众号
微信
新浪微博

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号