基于轻量级DSD-UNet的簇生荔枝分割方法

《Frontiers in Plant Science》:A lightweight DSD-UNet-based method for clustered litchi segmentation

【字体: 时间:2026年08月12日 来源:Frontiers in Plant Science 5.9

编辑推荐:

  自动化荔枝收获需要同时具备高精度和实时性的簇生果实分割,但高计算复杂度和参数冗余构成了实际部署中的关键瓶颈。为应对这些挑战,研究人员提出了一种轻量级DSD-UNet方法,用于快速且高精度地分割荔枝簇。DSD-UNet采用深度可分离卷积(Depthwise Se

  
自动化荔枝收获需要同时具备高精度和实时性的簇生果实分割,但高计算复杂度和参数冗余构成了实际部署中的关键瓶颈。为应对这些挑战,研究人员提出了一种轻量级DSD-UNet方法,用于快速且高精度地分割荔枝簇。DSD-UNet采用深度可分离卷积(Depthwise Separable Convolution)替代传统卷积结构,显著减少了参数和计算复杂度。为了进一步提升模型性能,研究人员在跳跃连接中引入了一种双交叉注意力机制(Dual Cross-Attention Mechanism, DCA),该机制整合了空间注意力和通道注意力,以自适应地增强特征图中目标区域的表示,并提高对细长茎特征的敏感性。此外,研究人员开发了一种复合损失函数(BL-Loss),结合了二元交叉熵(Binary Cross-Entropy)和水平集损失(Level Set Loss),并通过分阶段训练策略进行优化,以缓解前景内部像素不平衡问题并保持细长果-茎连接的边界连续性。在不同光照条件下的实验结果表明,DSD-UNet在簇生荔枝分割任务中实现了平均交并比(mean Intersection over Union, mIoU)91.40%和F1-score 95.42%,推理速度为15.41帧每秒,参数量仅为5.16M。与原始U-Net相比,DSD-UNet的mIoU和F1-score分别提升了3.08和1.81个百分点,推理速度提升了138.9%,参数量减少了61.5%,从而证实了所提方法在保持模型轻量化的同时有效提升了分割精度。这些结果凸显了该方法在显著改善荔枝生产自动化收获过程中的潜力。
**论文解读文章**

**1. 研究背景与问题**

自动化荔枝收获依赖于对果-茎结构的精准像素级分割,以生成切割路径。与单果作物不同,荔枝以簇生模式生长,茎干细长(直径2–4 mm),带来独特挑战:果实与茎干在多变光照和遮挡下严重粘连,常导致边界碎片化或欠分割;结实茎与非结实茎形态高度相似,增加了识别真正采摘目标的难度;移动平台的计算约束要求轻量化解决方案。现有方法中,传统图像处理技术(如HSV空间阈值分割、模糊聚类)对光照、背景和视角高度敏感,鲁棒性有限。基于深度学习的检测方法(如YOLOv7)虽能获得高平均精度(mAP),但边界框不足以精确定义切割路径。语义分割方法(如ResDense-focal-DeepLabV3+、改进YOLACT)在结构化关系和边界质量方面有所提升,但当前方法普遍优先关注分割精度,忽视了模型复杂度与部署可行性之间的权衡。两阶段流水线(先检测/分割果实区域,再匹配/分割果茎)显著增加了参数和计算量,难以应用于资源受限的移动采摘平台,且依赖中间结果传递和匹配,无法实现端到端学习,导致频繁的匹配错误和分割误差。因此,理想解决方案应在三个维度协同改进:采用轻量级骨干网络、引入有效注意力机制增强细结构特征判别、以及优化边界连续性的策略。U-Net架构因其参数效率、细节保留能力和轻量化改造适应性,成为适合的基础。

**2. 研究内容与结论**

研究人员提出了一种轻量级分割模型DSD-UNet,专为簇生荔枝果实设计。该模型采用端到端单阶段分割策略,直接对果-茎整体进行像素级预测,避免了两阶段方法的匹配误差和高计算成本。主要贡献包括:轻量架构——使用深度可分离卷积(Depthwise Separable Convolution, DS-Conv)重构编码器,参数量减少61.5%同时保持精度;自适应双交叉注意力机制(Dual Cross-Attention, DCA)——在U-Net跳跃连接中嵌入DCA模块,解决细长果茎的空间-通道特征相关性,增强多尺度特征的长程依赖建模,提升细茎分割的特征判别和拓扑连续性;边界感知损失函数(BL-Loss)——结合二元交叉熵(Binary Cross-Entropy)和水平集约束(Level Set Loss, LS-Loss),实现拓扑保持的分割。实验结果表明,DSD-UNet在簇生荔枝分割任务中达到mIoU 91.40%、F1-score 95.42%、推理速度15.41 FPS、参数量5.16M,相比原始U-Net,mIoU提升3.08个百分点,推理速度提升138.9%,参数量减少61.5%。与PSPNet、Segformer、FCN、CMTFNet、HRNet、Fast-SCNN、PIDNet-Lite、MaSSFormer、YOLO11n-seg等方法相比,DSD-UNet在mIoU、F1-score、mPA、推理速度等指标上均表现最优。该研究为机器人荔枝收获的智能感知与分割技术提供了坚实基础,其分割框架也可为其他具有类似结构和生长特性的果蔬自动化收获提供参考。论文发表在《Frontiers in Plant Science》。

**3. 主要关键技术方法**

数据集来自2024年6月广州荔枝园的‘井冈红糯’品种,在多种光照条件下(雨天弱光、阴天漫射、晴天强光、晴转阴变化光照)使用Canon 600D相机和移动设备采集790张图像(分辨率4096×3072),按光照分为不均匀光照、低光照和充足光照三类,以7:2:1比例划分训练集、验证集和测试集。标注采用统一果-茎实例标注策略,将每个果实及其支撑茎标注为同一类实例。数据增强包括随机水平/垂直翻转、旋转和加性高斯噪声。主要技术方法包括:(1)深度可分离卷积(DS-Conv)——将标准卷积分解为深度卷积和逐点卷积,降低计算量和参数量;(2)双交叉注意力机制(DCA)——在跳跃连接中构建通道交叉注意力和空间交叉注意力,逐步建模多尺度特征的长程依赖;(3)混合损失函数BL-Loss——结合二元交叉熵损失(BCE-Loss)和水平集损失(LS-Loss),前者优化像素级分类,后者通过区域差异项和边界平滑项维持拓扑连续性和形状完整性;(4)分阶段训练策略——前200轮仅使用BCE-Loss进行粗分割学习,后200轮使用复合损失(λ_BCE=1.0, λ_LS=0.5)进行几何细化。

**4. 研究结果**

**4.3.1 不同模型的对比性能**
通过在测试集上与十种代表性方法(包括U-Net、PSPNet、FCN、HRNet、Segformer、CMTFNet、MaSSFormer、Fast-SCNN、PIDNet-Lite、YOLO11n-seg)进行对比实验,DSD-UNet在关键指标上均达最优:mIoU 91.40%、精度95.73%、召回率95.37%、F1-score 95.42%、mPA 98.95%、推理速度15.41 FPS、模型大小5.16M。相比原始U-Net,mIoU提升3.08个百分点,FPS提升8.96,模型大小降至38.5%。可视化结果(图7)显示DSD-UNet在复杂背景、光照变化和细茎连接处具有最佳分割质量,显著减少欠分割和误分割。

**4.3.2 消融研究**
对三个核心组件(DS-Conv、DCA、BL-Loss)进行系统性消融实验。结果表明:DCA贡献最大,单独集成使mIoU从88.32%提升至89.89%(+1.57个百分点);DS-Conv实现模型压缩至5.16M(减少61.5%)且精度相当;BL-Loss与DCA组合产生协同效应,mIoU提升至91.09%(+2.77个百分点),超过各自贡献之和;全模块联用达到最优配置,mIoU 91.40%、F1-score 95.42%、参数量5.16M。可视化结果(图8)直观验证了各模块对分割质量的影响。

**4.3.3 后处理**
采用条件随机场(Conditional Random Fields, CRF)对网络输出进行后处理,设置高斯核(空间距离参数sxy=3,兼容权重compat=3)和双边核(sxy=20,颜色相似度srgb=4,compat=10)。CRF后处理使mIoU从91.40%提升至91.80%(+0.40个百分点),精度、召回率、F1-score和mPA均有小幅提升,验证了CRF对改善茎分割精度的有效性。

**4.3.4 失败案例分析**
在极端条件下(严重叶片遮挡、密集果实重叠、低光照、过曝、光照不均匀),模型仍存在局限性,主要表现为:目标遗漏、边界不完整、果实粘连、形状失真。分析揭示三大限制:光照适应性不足、严重遮挡下形状推断能力弱、密集场景下个体分离能力不足。未来改进方向包括引入光照不变特征提取、融合多模态信息(深度、光谱数据)、开发专用密集目标分离机制。

**4.4 基于分割结果的采摘点定位定性分析**
为验证分割结果对下游任务的实际价值,设计采摘点定位实验。基于YOLOv8n-pose关键点检测网络,比较三种方案:直接采摘点定位(DPL,输入原始图像)、Fast-SCNN引导采摘点定位(FSGPL,输入Fast-SCNN分割结果)、分割引导采摘点定位(SGPL,输入DSD-UNet分割结果)。在100张测试图像(132个目标)中,SGPL成功定位119个(成功率90.15%),平均计算时间55.2 ms;FSGPL定位94个(71.21%),时间55.4 ms;DPL定位55个(41.67%),时间48.2 ms。SGPL相比FSGPL成功率提升18.94个百分点,表明下游定位收益取决于分割先验的质量。分析认为,DSD-UNet提供的结构先验和背景抑制有效过滤了非结实茎、干扰叶子和复杂纹理,显著降低了误检和漏检概率,并增强了对细茎结构的拓扑表示和边界描绘,提高了定位点的集中度和准确性。

**5. 讨论总结与结论翻译**

研究结论部分翻译如下:
在本研究中,研究人员提出了一种轻量级分割模型DSD-UNet,用于果园荔枝收获任务,旨在提高簇生荔枝果实和茎干分割的准确性和效率。该模型使用DS-Conv重构编码器,大幅减少了模型参数和计算复杂度。在跳跃连接中集成了双交叉注意力机制,以增强细茎结构特征的提取与融合。此外,在预测层采用混合损失函数(BL-Loss),结合二元交叉熵和LS-Loss,以缓解前景内部像素不平衡并改善细长果-茎连接的边界连续性。实验结果表明,DSD-UNet实现了mIoU 91.40%、mPA 98.95%、精度95.73%、召回率95.37%、F1-score 95.42%,推理速度达到15.41 FPS,参数量仅5.16M,完全满足精度和实时应用的要求。与包括U-Net、CMTFNet、HRNet、PSPNet、Segformer、Fast-SCNN、PIDNet-Lite、MaSSFormer和YOLO11n-seg在内的主流方法相比,DSD-UNet在mIoU上分别高出3.08、3.60、8.62、5.06、11.13、6.46、9.47、5.86和13.12个百分点。此外,DSD-UNet在mIoU、精度、F1-score、mPA和推理速度等关键指标上均达到最佳,召回率和模型大小也保持竞争力,从而验证了所提改进的综合有效性。
该研究为机器人荔枝收获的智能感知与分割技术提供了坚实基础,所提出的分割框架也可为其他具有类似结构和生长特性的果蔬自动化收获提供参考。尽管所提方法在分割荔枝果实和茎干方面表现优异,但在极端光照条件(如极低光照场景)下仍存在分割误差和精度下降的问题。未来研究将聚焦于开发光照不变特征提取方法,并融合多模态信息(如3D点云),以进一步增强模型在多样化实际环境中的鲁棒性和泛化能力。
相关新闻
生物通微信公众号
微信
新浪微博

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号