面向道路的注意力与类别平衡学习用于灾后道路损伤分割

《Machine Learning with Applications》:Road-oriented attention and class-balanced learning for post-disaster road damage segmentation

【字体: 时间:2026年07月19日 来源:Machine Learning with Applications 6.1

编辑推荐:

  准确的像素级灾后道路损伤分割对于需要可靠且空间明确的道路场景理解的决策支持应用至关重要。本研究提出了一种深度学习框架,用于定位灾后图像中的可见道路损伤区域。该框架将面向道路的多级注意力(RO-MLA)模块集成到DeepLabV3+骨干网络中,其中通道、空间和像

  
准确的像素级灾后道路损伤分割对于需要可靠且空间明确的道路场景理解的决策支持应用至关重要。本研究提出了一种深度学习框架,用于定位灾后图像中的可见道路损伤区域。该框架将面向道路的多级注意力(RO-MLA)模块集成到DeepLabV3+骨干网络中,其中通道、空间和像素级注意力由平均道路掩膜先验引导,以将特征学习集中在道路相关区域。为了解决灾后道路图像中严重的类别不平衡和弱特征对比问题,研究人员进一步引入了面向道路的类别加权平衡Dice损失(RO-Dice CWB),以改善稀疏、低对比度且代表性不足的损伤区域的分割。为了评估该框架,研究人员从日本灾后道路损伤数据集(PDRDD-J)和社交媒体灾难道路损伤(SoDR)数据集构建了一个融合数据集,获得了2684张像素级标注图像,涵盖真实世界的道路损伤场景。基于验证的消融研究支持选择DeepLabV3+基础架构、ResNet152骨干网络和RO-Dice CWB损失。在保留的测试集上,所提出的框架实现了0.7248的平均交并比(mIoU)和0.6029的损伤类别交并比(IoU),优于代表性分割基线,包括U-Net、FCN、ResUNet、标准DeepLabV3+和MLA DeepLabV3+。定性、分辨率敏感性和误差图分析进一步表明,所提出的注意力和损失设计产生了更连贯的损伤掩膜,同时保持了稳定的道路区域解释。这些结果表明,所提出的框架支持灾后道路损伤分割,并为学习复杂道路场景中的稀疏、不平衡和视觉模糊目标提供了一种任务特定方法。
**论文解读:面向道路的注意力与类别平衡学习用于灾后道路损伤分割**

**研究背景**
灾后道路损伤的像素级分割对于应急响应、可达性评估、紧急路线规划和基础设施恢复至关重要。在灾后环境中,道路可能出现裂缝、坑洼、塌陷、碎片堵塞等危险状况,阻碍通行并延误救援。由于这些状况常出现在视觉杂乱且不受控的成像条件下,基于图像的自动化分析成为灾后评估的有力工具。然而,现有语义分割方法面临严峻挑战:灾后图像中背景和完整道路区域占主导,损伤区域仅占很小比例,且类别间边界弱、对比度低,与周围纹理、碎片、水渍或阴影高度重叠。此外,可用灾后数据集规模有限且异质性高,导致标准分割管线难以准确保持损伤边界并维持对稀疏、视觉模糊区域的敏感性。因此,需要一种针对灾后道路损伤的密集像素级分割方法,以支持下游决策应用。

**研究内容**
研究人员提出了一种基于DeepLabV3+的面向道路的多级注意力(RO-MLA)模块,并结合面向道路的类别加权平衡Dice损失(RO-Dice CWB),用于灾后道路损伤的像素级分割。该框架在融合数据集(由日本灾后道路损伤数据集PDRDD-J和社交媒体灾难道路损伤SoDR数据集合并而成,共2684张像素级标注图像)上进行了评估。实验结果表明,所提出的框架在保留测试集上取得了0.7248的平均交并比(mIoU)和0.6029的损伤类别IoU,优于U-Net、FCN、ResUNet、标准DeepLabV3+和MLA DeepLabV3+等基线模型。定性、分辨率敏感性和误差图分析进一步证实了其生成更连贯损伤掩膜的能力。该研究为灾后道路损伤分割提供了任务特定方法,并发表在《Machine Learning with Applications》上。

**主要关键技术方法**
研究人员采用以下关键技术方法:
1. **数据集构建**:从日本社交媒体平台X(原Twitter)收集PDRDD-J(1243张图像),结合SoDR数据集(来自谷歌图像的1441张图像),经筛选、标注转换和质量控制后,获得2684张像素级标注图像,统一为背景、道路、损伤三类语义标签,并随机拆分为70%训练、20%验证、10%测试集。所有图像统一缩放至128×128像素。
2. **网络架构**:以DeepLabV3+为基础,采用ResNet152作为编码骨干,结合空洞空间金字塔池化(ASPP)提取多尺度上下文特征。在编码器特征后插入RO-MLA模块,该模块依次执行通道注意力、空间注意力和像素注意力,并由训练集平均道路掩膜先验引导,使特征学习聚焦于道路相关区域。
3. **损失函数**:提出RO-Dice CWB损失,在标准Dice损失基础上引入类别逆频率权重和基于道路先验的空间权重,以增强对稀疏、低对比度损伤区域的优化,缓解类别不平衡。

**研究结果**
**4.1 数据集结果**:融合数据集包含2684张图像,像素级类别分布严重不平衡:背景占51.1%,道路占31.9%,损伤仅占16.9%。图像级分布中,PDRDD-J以未损伤场景为主(88.1%),SoDR以损伤场景为主(99.4%),合并后损伤图像占58.9%,未损伤占41.1%。该异质性数据集为模型提供了挑战性基准。

**4.2 模型训练与评估**:采用ImageNet预训练权重、Adam优化器(初始学习率1×10-4)、平衡批次采样、自适应学习率调度和早停策略,在128×128分辨率下训练100轮。训练曲线显示精度、召回率和F1分数快速上升后稳定,验证损失与训练损失一致下降,表明模型稳定收敛。

**4.3 实验结果**
**4.3.1 模型选择与消融研究(验证集)**:通过验证集比较多种架构,RO-MLA DeepLabV3+在mIoU(0.775)和损伤IoU(0.653)上均最优,相比标准DeepLabV3+提升3.89%和5.49%。混淆矩阵显示其损伤像素召回率更平衡。骨干网络比较中,ResNet152以mIoU 0.775和损伤IoU 0.653领先,且训练时间适中(3420秒),阈值稳定性最佳。损失函数比较中,RO-Dice CWB在F1分数(0.904)、mIoU(0.775)和损伤IoU(0.653)上均优于交叉熵、Dice、Focal、Jaccard和Tversky损失。统计检验(配对t检验和Wilcoxon符号秩检验)显示,所提方法在逐图像mIoU和F1分数上显著优于所有基线(p<0.05)。分辨率敏感性分析(256×256)中,RO-MLA DeepLabV3+仍保持最高mIoU(0.741)和损伤IoU(0.613)。

**4.3.2 测试集最终泛化性能**:在保留测试集上,所提框架取得mIoU 0.7248,损伤IoU 0.6029,分别比标准DeepLabV3+(0.7094, 0.5704)和MLA DeepLabV3+(0.6391, 0.4264)提升。计算复杂度分析显示,RO-MLA模块仅增加0.20%参数量和微小延迟(153.808 ms/图像)。定性可视化显示,所提模型在清晰道路、裂纹/变形和严重遮挡场景下均产生更连贯的损伤掩膜。叠加分析和误差图表明,模型在细裂缝、排水结构、泥浆覆盖等困难情况下仍存在边界偏差,但整体空间一致性优于基线。

**讨论与结论**
本研究开发了一个结合RO-MLA和RO-Dice CWB的机器学习框架,用于灾后道路损伤像素级分割。主要贡献在于任务导向的特征细化和优化策略,显著提升了稀疏损伤区域的定位能力。讨论部分指出以下局限性:平均道路先验在极端视角(如无人机俯视、强烈倾斜)下可能可靠性下降;128×128分辨率限制了精细边界分析,但256×256实验表明框架仍保持优势;缺乏地理配准,依赖静态图像监督,未利用时序信息;像素级标注成本高。未来工作方向包括自适应先验、更高分辨率、视频/无人机支持、半监督学习等。研究结论翻译如下:本研究引入了一个面向道路的注意力和损失框架用于灾后道路损伤分割,并在异质真实数据集上证明了其有效性。所提出的RO-MLA DeepLabV3+提升了全局分割性能、损伤特定定位、阈值稳定性和定性空间连贯性。这些发现表明,显式空间先验和感知不平衡的优化可以显著改善稀疏、低对比度和视觉模糊目标的密集预测。更重要的是,该框架为决策支持工具提供了基础,有助于筛选受损道路图像、支持检查优先级确定,并促进灾后道路网络恢复规划。
相关新闻
生物通微信公众号
微信
新浪微博

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号