MDFormer:面向3D医学图像分割的多尺度密集扩张Transformer模型
《Scientific Reports》:MDFormer: a multi-scale dense dilated transformer model for 3D medical image segmentation
【字体:
大
中
小
】
时间:2025年10月31日
来源:Scientific Reports 3.9
编辑推荐:
本研究针对现有Transformer模型在3D医学图像分割中存在的计算复杂度高、多尺度特征提取不足以及精度与效率难以兼顾等问题,开发了多尺度密集扩张Transformer(MDFormer)。该模型创新性地设计了多尺度密集扩张自注意力(MDDSA)模块,通过动态调整扩张矩阵大小实现固定分辨率下的多尺度信息聚合,在ACDC和Synapse数据集上分别达到92.7%和86.88%的DSC,参数量仅37.7M,FLOPs为47.39G,显著提升了分割精度并降低了计算成本,为临床精准诊断提供了高效解决方案。
在精准医疗时代,医学图像分割质量直接关系到临床诊断的准确性和治疗效果。尽管卷积神经网络(CNN)特别是U-Net及其变体在该领域取得显著进展,但这些模型由于局部卷积的固有局限,难以有效捕捉长程依赖关系。虽然Transformer架构通过自注意力机制弥补了这一缺陷,但在处理三维医学图像时却面临新的挑战:计算复杂度呈指数级增长、多尺度特征整合能力不足,以及在精度与效率之间难以平衡的困境。
为了解决这些核心问题,赣南医科大学李秋霞团队在《Scientific Reports》上发表了题为"MDFormer: a multi-scale dense dilated transformer model for 3D medical image segmentation"的研究论文,提出了一种创新的多尺度密集扩张Transformer模型。该研究旨在开发一种既能保持高分割精度又具有较低计算成本的3D医学图像分割方法,为临床应用提供切实可行的解决方案。
研究团队采用的关键技术方法包括:设计多尺度密集扩张自注意力(MDDSA)模块实现动态多尺度特征提取;构建U型编码器-解码器架构整合局部与全局信息;使用随机裁剪数据增强和Poly学习率策略优化训练过程。实验基于ACDC心脏数据集(100例)和Synapse腹部多器官数据集(30例CT扫描),采用DSC和HD95作为评估指标。
研究团队构建的MDFormer采用经典的U型架构,包含嵌入层、两个下采样层和三个MDDSA块组成的编码器,以及三个上采样层和三个MDDSA块组成的解码器。其核心创新在于MDDSA模块,该模块通过并行设置三种不同扩张率(1、2、3)的扩张卷积,动态调整密集扩张矩阵大小,使模型能够在固定分辨率下捕获从局部细节到全局结构的多尺度特征。特别值得一提的是,研究团队还引入了3D卷积分支与自注意力机制相结合,利用卷积的平移不变性来恢复自注意力机制可能导致的空间信息紊乱,同时从不同权重角度捕获高频局部特征。
在心脏分割任务中,MDFormer表现出色,平均DSC达到92.7%,显著优于对比方法。具体而言,与CNN-based方法如R50 U-Net(87.55%)和R50 Att-UNet(86.75%)相比,MDFormer分别提升了5.15%和5.95%;即使是与Transformer-based方法如nnFormer(92.06%)和MISSFormer(87.90%)相比,也分别有0.64%和4.8%的提升。在右心室(RV)、心肌(Myo)和左心室(LV)三个关键区域的细分指标上,MDFormer均取得最佳成绩,分别为91.51%、90.54%和96.05%。
视觉对比结果进一步验证了MDFormer的优越性。如图2所示,与TransUNet相比,MDFormer预测的分割轮廓与真实标签更加吻合,特别是在心肌边缘分割和右心室区域分类方面表现突出,显著减少了误分割和欠分割现象。
在更具挑战性的腹部多器官分割任务中,MDFormer同样表现卓越,平均DSC达到86.88%,HD95为6.74mm,均优于其他对比模型。与当前表现优异的nnFormer相比,MDFormer在DSC上提升了0.31%,同时将HD95降低了3.89mm。在八个腹部器官(主动脉、胆囊、左肾、右肾、肝脏、胰腺、脾脏和胃)的分割中,MDFormer在多个器官上取得了最佳分割效果。
然而,研究也发现MDFormer在分割较小器官(如胰腺和胆囊)时性能相对较弱。通过深入分析,团队发现这主要是由于数据集中存在的类别不平衡问题所致——胰腺和胆囊的体积占比显著小于其他器官。为此,研究团队尝试了两种优化策略:一是引入针对小器官的特征处理模块,将3D卷积分支替换为深度可分离卷积;二是构建新的联合加权损失函数,增加小器官在损失计算中的权重。虽然这些优化措施确实提升了小器官的分割精度,但整体性能却有所下降,因此在最终模型中未采用这些策略。
在模型效率方面,MDFormer展现出了明显优势。与UNETR(92.25M参数,86.02G FLOPs)、CoTr(41.86M参数,377.48G FLOPs)、TransBTS(32.19M参数,171.3G FLOPs)、nnFormer(150.5M参数,213.4G FLOPs)和Swin-UNETR(62.83M参数,384.2G FLOPs)相比,MDFormer仅需37.7M参数和47.39G FLOPs,却在性能上达到或超过了这些模型,实现了精度与效率的优化平衡。
消融实验进一步证实了MDDSA模块的有效性。与基线模型UNETR相比,加入MDDSA模块后,平均DSC提高了7.32%,HD95降低了16.23mm,而参数数量和FLOPs分别减少了54.55M和38.63G。即使是与仅使用标准卷积的DCA模块相比,MDDSA也在保持较低计算成本的同时,实现了更好的分割性能,特别是在脾脏分割上提升了5.27%的DSC。
研究结论表明,MDFormer通过创新的MDDSA模块成功解决了3D医学图像分割中的三大核心挑战:计算复杂度高、多尺度特征提取不足以及精度-效率权衡困难。该模型不仅在不同医学图像分割任务中表现出色,而且具有较低的计算成本,非常适合资源受限的临床环境应用。
尽管MDFormer取得了显著成果,研究团队也坦诚指出了其在小器官分割方面的局限性,并提出了未来改进方向,包括探索更复杂的多尺度注意力机制、设计针对小器官的加权损失函数,以及将模型扩展到半监督学习框架等。这些改进有望进一步提升模型在复杂临床场景中的适用性和鲁棒性。
这项研究为Transformer在医学图像分析中的应用提供了新思路,通过多尺度密集扩张自注意力机制的有效设计,实现了在保持高精度的同时显著降低计算成本,为临床部署提供了切实可行的解决方案。随着后续优化的推进,MDFormer有望在更多医学图像分析任务中发挥重要作用,推动精准医疗的发展。
生物通微信公众号
生物通新浪微博
今日动态 |
人才市场 |
新技术专栏 |
中国科学人 |
云展台 |
BioHot |
云讲堂直播 |
会展中心 |
特价专栏 |
技术快讯 |
免费试用
版权所有 生物通
Copyright© eBiotrade.com, All Rights Reserved
联系信箱:
粤ICP备09063491号