
-
生物通官微
陪你抓住生命科技
跳动的脉搏
基于混合Transformer瓶颈的多注意力增强编解码器网络,用于心脏超声图像分割
《Scientific Reports》:Multi-attention enhanced encoder–decoder network with hybrid transformer bottleneck for echocardiography image segmentation
【字体: 大 中 小 】 时间:2026年07月08日 来源:Scientific Reports 4.9
编辑推荐:
摘要二维超声图的自动分割是诊断和评估心脏疾病的关键步骤。卷积神经网络(CNN),如U-Net,已被证明在医学图像分割中十分有效,但由于卷积操作本质上是局部的,它们往往难以捕捉长距离依赖关系。而变换器模型虽然能够把握全局上下文,但在精细定位方面可能表现不佳。本研究旨在通过结合CNN
二维超声图的自动分割是诊断和评估心脏疾病的关键步骤。卷积神经网络(CNN),如U-Net,已被证明在医学图像分割中十分有效,但由于卷积操作本质上是局部的,它们往往难以捕捉长距离依赖关系。而变换器模型虽然能够把握全局上下文,但在精细定位方面可能表现不佳。本研究旨在通过结合CNN与变换器的优势,开发一种新的深度学习架构,以提升二维超声图的分割精度,从而克服这些局限。我们提出了一种全新的编码器-解码器框架,该框架融入了多种注意力机制以及由视觉变换器(ViT)和多感受野块(MRFB)组成的混合瓶颈结构。ViT的引入使得模型能够处理长距离依赖关系,而MRFB则有助于实现多尺度特征提取,专门用于优化空间特征的表现并减少空间信息的丢失。借助多种注意力机制以及具有空洞空间金字塔池化(ASPP)功能的深度监督机制,我们的模型能够有效捕捉局部和全局上下文。在CAMUS数据集上的训练与验证结果显示,该模型在双心室视图下,左心室心内膜、心外膜及左心房的Dice相似度系数分别为91.11±0.19、87.60±0.11和87.85±0.29;在四心室视图下,这些数值分别为92.25±0.17、87.29±0.17和91.71±0.10。相比纯CNN架构(如UNet)、纯变换器架构(如Swin-unet)以及CNN-变换器混合架构(如UNETR-2d),我们的模型在分割精度和稳定性方面均表现更优。相关代码已公开发布在论文的https://github.com/saeedchamani/CAMUS_Segmentation_Hybrid_Bottleneck仓库中。