一种基于转置卷积 -CBAM-Segformer 结合迁移学习的桥梁裂缝识别与分类框架

《Engineering Structures》:An identification and classification framework for bridge cracks using transposed convolution-CBAM-Segformer with transfer learning

【字体: 大 中 小 】 时间:2026年10月03日 来源:Engineering Structures 7.6

编辑推荐:

   CBAM和转置卷积增强了裂缝特征和细节恢复;迁移学习提高了收敛速度和小样本泛化能力;该模型能够对钢桥和混凝土桥梁裂缝进行精确的像素级分割。 **引言** 桥梁通常由混凝土、钢材或两者的组合材料建造,即钢-混凝土结构[[1], [2], [3]]。混凝土结构容易开裂,在混凝

  

CBAM和转置卷积增强了裂缝特征和细节恢复;迁移学习提高了收敛速度和小样本泛化能力;该模型能够对钢桥和混凝土桥梁裂缝进行精确的像素级分割。

**引言**

桥梁通常由混凝土、钢材或两者的组合材料建造,即钢-混凝土结构[[1], [2], [3]]。混凝土结构容易开裂,在混凝土桥梁的整个服役寿命期内,可能会出现大量裂缝[[4], [5], [6]]。另一方面,钢结构与混凝土结构表现出不同的行为特征。当钢桥出现裂缝时,在风荷载和车辆荷载等因素的影响下,裂缝有逐渐扩展的趋势,最终可能导致桥梁失效[7, 8]。因此,钢结构桥梁与混凝土结构桥梁在材料力学性能、裂缝生成机理、病害发展速率以及运维加固方案等方面存在显著差异[[9], [10], [11]]。准确区分这两类桥梁裂缝,可以为后续的结构风险评估、病害分类以及针对性维护修复提供精细的数据基础,有效提升桥梁智能检测的工程实用性。

目前,桥梁裂缝检测有多种方法,包括人工检测、智能手机和无人机等[[12], [13], [14]]。人工检测需要大量人力和财力资源,且通常需要交通管制才能对桥梁进行裂缝检测,导致检测效率低下[15, 16]。另一方面,智能手机和无人机为裂缝检测提供了便捷、便携的解决方案,特别是在桥塔和桥墩等难以到达的区域[17]。然而,智能手机和无人机仅提供图像采集功能,为裂缝检测提供可视化表示[18, 19]。因此,从图像中准确识别裂缝是目前的主要研究焦点。此外,在现有各种裂缝类型中,钢结构桥梁裂缝的分类也是一个重要的研究领域。

卷积神经网络(CNN)被广泛应用于分类和检测任务中,其目标是确定整幅图像的类别标签,如裂缝识别[20]。在CNN中,使用滑动窗口提供像素块作为输入,从而预测每个像素的类别标签[21]。该网络具有两个优势[22]:(1) 可以在输出结果中提供目标类别的位置信息;(2) 可以通过构建以输入训练数据为块的数据库来解决训练数据有限的问题。然而,该方法也有两个明显的缺点[23]:(1) 计算效率较低,因为网络必须逐个训练每个块,且块之间的重叠可能导致同一特征的冗余训练,浪费资源并降低训练速度和效率;(2) 识别率与信息收集之间存在权衡关系。较大的块需要更多的最大池化层,这会导致更多信息丢失[24]。另一方面,较小的块只能捕获非常局部的信息,其所包含的背景信息可能无法准确反映整体图像信息[25]。由于这些局限性,许多研究者对CNN进行了修改并提出了新的模型用于裂缝识别和分类。以下章节将探讨相关的语义分割模型。

U-net网络,如Shang等人[26]所述,包含三个主要组成部分。首先,骨干特征提取涉及一系列卷积和最大池化操作来提取特征,形成五个初步有效特征层,如Jin等人[27]所述。其次,在U-net网络的第二部分,使用五个初步有效特征层进行上采样。随后,通过反卷积过程融合特征,产生一个包含所有提取信息的最终有效特征层,这对于后续分类至关重要,如Siriborvornratanakul[28]所述。最后,U-net网络的第三部分也是最后一个部分是预测部分,在此部分使用最终有效特征层进行分类,将每个特征点或像素分配到特定类别。值得注意的是,U-net网络具有独特的结构,特别是在其编码部分。与传统网络不同,U-net网络没有全连接层,仅依赖卷积层。此外,每个标准卷积层后都跟有Relu激活函数,如Zhao等人[29]所强调的。

例如,在Jiang等人[30]的工作中,介绍了一种U-net的增强迭代版本——融合注意力U-net(FAU-net),用于检测薄钢板箱梁内部的腐蚀损伤。实验结果表明,该方法在像素级损伤定位和损伤面积精确测量方面表现出色。在另一项研究中,Katsamenis等人[31]提出了同步精确定位与分类(SPLAC)架构,利用U-net模型对金属结构的RGB图像进行自动腐蚀检测和定位,以及锈蚀等级识别。比较计算分析表明,所提出的SPLAC U-net模型(包含分割和投影细化)所需总时间少于仅使用传统深度学习模型进行图像分割的时间。此外,Liu等人[32]将基于U-net的混凝土裂缝检测与基于DCNN的方法进行了比较,发现U-Net在准确性、鲁棒性和性能方面均表现更优。此外,对反映方法性能的关键参数的探索表明,与传统全卷积网络(FCN)相比,U-Net架构即使在较小的训练集上也能达到更高的准确性。

PSP-net网络整合了金字塔池化模块,用于从不同尺度提取信息。金字塔池化模块包含1×1、2×2、3×3和6×6的尺度,如Zhong等人[33]和Huyan等人[34]所述。利用双线性插值,这些不同层的特征相互连接以收集全局信息,如Wang等人[35]所述。与全局池化相比,该结构提供了更全面的信息,因为它整合了多尺度信息,如Ijjeh和Kudela[36]所阐述的。具体来说,在第一层,特征图经过1×1卷积和平均池化变换。在下一层,特征图经过2×2卷积和平均池化变换。第三层对特征图进行3×3卷积和平均池化变换。类似地,在第四层,特征图经过6×6卷积和平均池化变换。最后,最后一层的特征图大小与输入图像大小保持一致。

例如,Zhang等人[37]改进了PSP-net算法,用于将桥梁裂缝区域与非裂缝区域分离,目的是消除检测算法造成的视觉干扰。实验结果表明,该方法在通用评估指标方面优于其他基线方法,并在模型大小(MS)和每秒帧数(FPS)方面显示出了优势。在另一项研究中,Su等人[38]介绍了一种利用PSP-net模型识别FPSO模块裂缝的技术。所提出的方法解决了原始模型中多次卷积和压缩导致的细节特征丢失问题。经FPSO数据集验证后,改进的模型mPA值提高了2.4%,MIoU值提高了1.8%。

U-net模型常用于小目标检测,此时局部特征能够有效表示当前场景[39]。然而,其在识别和分割大目标时的准确性可能不足。虽然PSP-net等池化技术可以提高识别准确性,但也存在信息丢失的风险[40]。为解决这些问题,一些研究者提倡使用空洞卷积来扩展识别视野,从而发展出了DeepLab模型[41]。该模型已演变为DeepLabv3+,包含两个主要组成部分:编码器和解码器[42]。解码器包括一个空洞卷积神经网络(DCNN),后接空洞空间金字塔池化(ASPP)模块。其中,ASPP模块通过对给定特征层采用不同维度的空洞卷积,有效地采样和捕获多尺度目标信息[43]。

例如,Savino和Tondolo[44]实施了一种逐像素分类方法,利用语义分割网络从图像中自动识别和测量混凝土缺陷。他们使用了预训练权重的Deeplabv3+网络,取得了令人满意的结果。这表明该模型非常适合整合到数字管理系统中,从而提升参与基础设施检查和数字化转型的组织效率。类似地,Ta等人[45]提出了基于视觉的裂缝分割框架,采用了带有空洞卷积的Deeplabv3+网络(ACDN)。通过优化训练参数,ACDN模型有效地检测了疲劳裂缝,从而提高了裂缝检测的准确性。该框架利用基于视觉的技术,促进了钢结构中小疲劳裂缝的早期识别。此外,Xu等人[46]引入了一种改进的DeepLabv3+模型,通过整合轻量级的MobileNetV2骨干网络并加入转置卷积。该改进减少了参数量并增强了对局部微小损伤的识别能力。比较分析表明,所提出的方法优于基于SegNet和DenseNet的现有轻量级裂缝分割模型。这些研究强调了DeepLabv3+模型及其各种改进版本在准确识别和分割不同场景下的混凝土缺陷和裂缝方面的有效性和适应性。

显而易见,现有的桥梁裂缝识别和分类方法仍存在诸多局限性:(1) 当前模型在识别准确性或效率方面存在不足;(2) 部分研究仅单独引入注意力机制或Transformer模型,未能同时解决特征增强和上采样过程中的信息丢失问题;(3) 数据集预处理大多采用随机采样或传统数据增强策略,未针对裂缝像素比例不平衡导致的模型训练偏差进行优化;(4) 迁移学习的应用未适配源数据集与目标数据集之间的域差异,导致模型在桥梁场景中的泛化性能有限。

为解决上述问题,本研究提出了一种融合卷积块注意力模块(CBAM)、转置卷积和Segformer的桥梁裂缝识别与分类模型。结合困难-简单样本划分预处理和迁移学习策略,实现了裂缝识别准确性和训练效率的双重提升,如图1所示。本文的核心贡献如下:(1) 本文首次将CBAM和转置卷积整合到Segformer架构中。本文通过通道-空间注意力增强关键特征,并用可学习的转置卷积替换双线性插值以减少上采样过程中的信息丢失,形成了特征增强与精确恢复的双重优化机制。(2) 本文提出了一种基于裂缝像素比例的困难-简单样本划分策略。该策略通过剔除无效的低裂缝像素比例样本来缓解数据不平衡问题,提高了模型对有效裂缝的识别敏感度。(3) 本文采用迁移学习方法,利用道路裂缝数据对模型进行预训练。这是因为道路裂缝与桥梁裂缝具有相似性,一方面增强了模型的泛化能力,另一方面提高了模型的识别效率。

本文各章节安排如下:第1节介绍研究背景和意义,并回顾现有主流语义分割模型的原理和应用现状。第2节介绍数据集构建、困难-简单样本划分过程以及迁移学习的实施细节。第3节详细介绍改进后Segformer模型的结构设计、评估指标和训练策略。第4节通过收敛性分析、消融实验和对比实验验证模型性能。第5节总结研究成果并展望未来改进方向。

**章节片段**

**原始数据**

我们的团队在杭州使用智能手机和无人机采集了各类桥梁的裂缝数据,即钢结构桥梁、混凝土桥梁和钢-混凝土桥梁的裂缝数据。数据集包含近10,000张图像[47],如图2所示。其中,我们将从钢结构桥梁采集的裂缝数据定义为钢桥裂缝(s.jpg),而来自其他类型桥梁的裂缝数据定义为混凝土桥裂缝(c.jpg)。数据集包含2036个钢桥裂缝样本。

**Segformer模型**

在深入探讨Segformer模型之前,有必要先介绍Transformer模型。Transformer模型包含编码器和解码器,涵盖编码和解码元素[53, 54]。Segformer将Transformer与轻量级多层感知机(MLP)解码器相结合。

SegFormer 展现出两个关键特征 [55]:(1) SegFormer 模型采用了一种新颖的分层结构——Transformer 编码器,该编码器消除了对位置编码的需求。这使得它能够……

迁移学习对模型收敛的影响

迁移学习对模型的影响不仅限于加速收敛,它还扮演着提高精度、提升训练稳定性以及增强小样本泛化能力的关键角色。具体而言,在训练稳定性方面,通过 HRCC 数据集的预训练,迁移学习提供了更好的初始参数。这避免了梯度消失和爆炸问题,在训练过程中将训练损失和验证损失的波动范围减少了 40% 以上,如图……所示

结论

在本文中,我们提出了一种融合转置卷积、CBAM 和 SegFormer 模型的裂缝识别与分类模型,该模型可提高裂缝识别和分类的精度。我们还在裂缝数据预处理中集成了迁移学习以及难易样本划分策略,这提升了模型在裂缝训练和预测中的计算效率。因此,所提出的模型取得了显著的改进……

CRediT 作者贡献声明

杨丁:写作——审阅与编辑,写作——原始草稿,监督,方法论,调查研究,基金获取。叶小伟:写作——审阅与编辑,监督,资源,项目管理,调查研究,形式分析。张弘:监督,软件,方法论,基金获取,数据整理,概念设计。倪平河:监督,方法论,调查研究,形式分析,数据整理,概念设计。

利益冲突声明

作者声明不存在可能影响本文所报告工作的已知竞争性财务利益或个人关系。

致谢

本文所述工作得到了国家自然科学基金委员会(资助编号:52408349)、浙江省自然科学基金(资助编号:LQN25E080020)、杭州市自然科学基金(资助编号:2025SZRJJ0547)以及山地桥隧工程国家重点实验室(资助编号:SKLBT-2210)的联合资助。

数据声明

支持本研究结论的部分或全部数据、模型或代码可获取自

杨丁 | 叶小伟 | 张弘 | 倪平河
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号