Embed-MedSAM:面向资源受限地区的嵌入式医学图像分割框架实现高效精准诊断

《npj Digital Medicine》:Embedded framework for clinical medical image segment anything in resource limited healthcare regions

【字体: 时间:2025年09月26日 来源:npj Digital Medicine 15.1

编辑推荐:

  本刊推荐:为解决资源受限地区医疗图像分析中模型计算成本高、依赖人工提示的问题,研究人员开展轻量化无提示医学图像分割模型研究。通过两阶段蒸馏策略和自提示训练框架,提出的Embed-MedSAM在17个基准数据集上平均Dice分数提升近16%,在iPhone 14上实现近30 FPS实时推理,显著提升边缘设备部署能力与诊断效率。

  
在冲突地区、偏远山区和经济欠发达地区,医疗资源的匮乏严重制约着医疗服务的可及性。虽然便携式临床成像设备的发展改善了这些地区的影像获取能力,但缺乏能够解读复杂医学图像的专业人员,导致及时诊断仍面临巨大挑战。医学图像的快速分析和病灶分割对于抢救治疗机会至关重要,而在硬件受限条件下实现多模态医学图像的高效分割与诊断,成为一个紧迫且未解决的难题。
近年来,基于计算机视觉的自动分割技术被引入医学图像分析领域,特别是深度学习模型如卷积神经网络(CNN)和视觉变换器(ViT)的应用显著提升了分割精度。Segment Anything Model(SAM)及其医学专用变体MedSAM在自然图像和医学图像中展现出强大的泛化能力,但仍存在两个关键问题:一是模型参数量超过6亿,计算成本高,难以在资源受限设备上部署;二是推理过程依赖用户提供的提示(如点、框),要求使用者具备一定的医学专业知识,限制了在非专业环境中的应用。
为此,中国医科大学附属盛京医院等机构的研究团队在《npj Digital Medicine》发表了题为“Embedded framework for clinical medical image segment anything in resource limited healthcare regions”的研究,提出Embed-MedSAM模型,通过轻量化编码器替换、两阶段知识蒸馏和自提示训练框架,实现了无需人工提示的高效医学图像分割,为资源受限地区的实时诊断提供了可行方案。
本研究主要采用以下技术方法:1) 使用RepViT作为轻量化图像编码器替代MedSAM的原始编码器;2) 在ImageNet-21K数据集上进行掩码图像预训练,通过重建损失迁移MedSAM的视觉表示能力;3) 在COSMOS 1050K多模态医学数据集上通过均方误差(MSE)损失进行知识蒸馏;4) 设计自提示训练框架,通过初始预测生成伪边界框提示,结合KL散度损失和L1损失优化分割一致性;5) 在17个数据集(覆盖CT、X射线、超声等7种成像模态)上评估模型性能,并与主流轻量化SAM模型及扩散模型进行对比。
监督分割性能评估
在6种医学成像模态的内部数据集(S1-S9)上,Embed-MedSAM与主流全自动分割架构和轻量化SAM变体进行比较。结果显示,Embed-MedSAM在S1、S2、S6和S7数据集上达到最佳性能,在S3和S9上接近第二名。与参数量相近的主流模型相比,Embed-MedSAM的FLOPs(33.5 G)仅为MADGNet的1/6,显著降低计算成本。在无提示设置下,Embed-MedSAM除ESP-MedSAM外优于所有轻量化SAM模型,且参数量(10.6M)仅为ESP-MedSAM(28.46M)的1/3,FLOPs降低40%。
基于扩散模型的分割框架对比
在S4、S5、S8和S10数据集上,Embed-MedSAM与扩散模型MedSegDiff-V2相比,Dice分数仅低0.4%,但推理复杂度仅为后者的1/30(33.5 GFLOPs vs 983 GFLOPs)。在BTCV多解剖结构分割基准上,Embed-MedSAM达到与MedSegDiff-V2相近的精度,进一步验证其在高效部署中的优势。
未见域泛化能力
在外部数据集(T1-T9)上的评估显示,Embed-MedSAM在无提示设置下优于所有轻量化SAM模型,平均Dice分数较次优模型提升近16%。点提示模式虽能提升对比模型的性能,但均未超过Embed-MedSAM的无提示结果,证明其在不依赖人工输入的情况下仍保持强泛化能力。
关键模块消融实验
通过消融实验验证图像编码器蒸馏(EKD)、掩码图像预训练(MIP)和自提示训练(SPT)模块的贡献。完整版Embed-MedSAM在可见域和未见域上的平均Dice分数分别从85.67%提升至89.64%、72.29%提升至75.86%,Hausdorff距离(HD)显著降低。MIP模块将可见域Dice从82.73%提升至84.36%,SPT模块通过自提示机制显著增强模型在无提示条件下的适应性。
损失权重敏感性分析
语义一致性损失(λ1)权重设为5×10-5时模型性能最佳,几何对齐损失(λ2)最优值为0.1,Dice损失(λ3)和BCE损失(λ4)权重分别设为0.8和0.2时分割精度最高。多级监督策略有效平衡了语义一致性、几何对齐和像素级精度。
嵌入式部署验证
在iPhone 14上的部署测试显示,Embed-MedSAM可实现近30 FPS的实时推理速度,一小时连续推理仅消耗25%电池电量,峰值内存占用1.9GB,CPU使用率约30%。相比之下,EfficientSAM-S、MobileSAM等模型因参数量大或计算复杂度高无法在移动设备上运行。
研究结论表明,Embed-MedSAM通过轻量化编码器设计和两阶段蒸馏策略,在保持MedSAM级分割精度的同时显著降低计算成本;自提示训练框架彻底消除对人工提示的依赖,提升模型在非专业环境中的适用性;在17个数据集上的广泛验证证明其跨模态泛化能力和边缘部署可行性。该研究为资源受限地区提供了一种无需高性能硬件和人工交互的通用医学图像分割解决方案,有望提升偏远地区的诊断可及性和效率。
讨论部分指出,尽管Embed-MedSAM在推理阶段高效,但其初始训练仍需要一定计算资源,尤其是第一阶段蒸馏需在4张NVIDIA A800 GPU上训练超过一天。然而,第二阶段下游任务适配训练成本较低(如REFUGE数据集仅需30分钟),一旦完成蒸馏即可支持多种应用场景的低成本部署。未来工作可进一步探索更高效的知识传递方法和跨模态自适应机制,以扩大模型在多样化临床环境中的应用范围。
相关新闻
生物通微信公众号
微信
新浪微博

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号