《Displays》:High-level medical semantic adaptation via an intelligent communication mixture-of-experts for medical image segmentation
编辑推荐:
•我们提出了一种基于智能通信混合专家机制的医疗图像分割高层医学语义适配框架。•IC-MoE设计了三个互补的专家模块:基础专家、语义专家和自适应专家。•语义引导的对比学习调节异质专家表示之间的语义关系。•IC-MoE通过异质专家之间的语义协调增强高层医学语义表示。•大量实验表明
- •
我们提出了一种基于智能通信混合专家机制的医疗图像分割高层医学语义适配框架。
- •
IC-MoE设计了三个互补的专家模块:基础专家、语义专家和自适应专家。
- •
语义引导的对比学习调节异质专家表示之间的语义关系。
- •
IC-MoE通过异质专家之间的语义协调增强高层医学语义表示。
- •
大量实验表明,IC-MoE取得了具有竞争力的性能和稳健的跨数据集泛化能力。
引言
医疗图像分割在疾病筛查、临床诊断和病变监测中起着至关重要的作用[1], [2]。随着深度学习的发展,研究人员提出了多种任务专用分割模型[3], [4], [5], [6], [7]。然而,这些模型严重依赖大规模高质量标注数据,且泛化能力有限。为降低对标注的依赖,半监督医疗图像分割方法探索了伪标签和一致性正则化,如Mean Teacher、不确定性感知自集成和交叉伪监督。近期研究进一步通过统一多任务半监督学习、一致性引导微分解码、文本到视觉对齐以及基于注视-语言的高层语义引导等方向进行拓展[8], [9], [10], [11]。这些研究表明,高层医学语义表示和有效的特征适配对医疗图像分割至关重要。
近年来,视觉基础模型的兴起进一步推动了通用分割技术的发展,例如Segment Anything Model(SAM)[12], [13], [14], [15]。然而,当SAM直接应用于医疗影像任务时,往往表现不佳[16]。因此,研究人员尝试通过参数高效微调(PEFT)方法迁移其预训练知识[17]。尽管取得了进展,现有方法对高层医学语义的适配仍然不足。这一局限主要源于两个方面:(1)单一PEFT通道的适配覆盖范围有限,以及(2)分支增强或基于专家的PEFT方法中异质适配分支之间的语义协调不足。
首先,现有的参数高效微调方法对高层医学语义的适配仍显不足。医疗图像分割不仅依赖于边界、纹理和局部结构等低层视觉线索,还依赖于对病变、器官和组织结构的高层语义理解。尽管SAM学习到的浅层视觉特征相对通用,但从自然图像中学习到的如"鼻子"和"耳朵"等高层语义知识,无法直接迁移到肿瘤等复杂的医学结构中。Zhang等人[18]采用LoRA进行参数高效微调;基于适配器(adapter)的方法被广泛用于领域迁移[19], [20], [21];Chen等人[22]将适配器微调与频域信息相结合以补充领域特定知识;Zhong等人[23]将卷积结构与LoRA集成以增强局部特征提取;Wei等人[24]通过可训练参数细化层间特征。尽管这些方法从不同角度缓解了语义鸿沟问题,但它们在高层医学语义适配方面仍然有限。
其次,现有的分支增强或基于专家的PEFT方法在异质适配分支之间的语义协调方面仍显不足。为弥补SAM在医学表征能力上的不足,部分研究引入了额外的任务专用分支或专家模块。例如,Lin等人[25]和Lin等人[26]在SAM架构外部设计了CNN分支,以改善小病变和模糊边界的局部特征建模;Liang等人[27]引入了VMamba分支以增强医学图像表征;Wang等人[28]在解码器中引入了领域特定专家和原始专家,以实现无遗忘的3D医疗图像分割。这些方法证明了分支增强或基于专家适配的有效性。然而,它们主要关注特征补充、分支融合或专家选择,而未显式调节异质适配分支之间的语义关系。因此,不同适配分支提供的互补信息无法被充分利用。此外,Zhang等人[29]将预训练锚结构融入带有对比正则化的弱监督适配框架,但未显式协调多个异质适配专家。因此,异质适配分支之间的语义协调仍然不足。
为解决上述挑战,我们提出IC-MoE,一种面向医疗图像分割中高层医学语义适配的智能通信混合专家框架。该框架包含三个互补的专家模块:基础专家、语义专家和自适应专家。基础专家提供通用的预训练视觉表示,语义专家将深层表示适配到高层医学语义,自适应专家在Transformer块中引入任务特定的调整。同时,基于像素概率的自适应投票根据专家概率图执行预测级的自适应专家选择。此外,我们引入语义引导的对比学习,通过增强前景-背景语义区分度以及协调表示一致性和表示多样性,显式调节异质专家表示之间的语义关系。
本文的主要贡献如下:
- 1.
我们提出了IC-MoE,一种面向高层医学语义适配的智能通信混合专家框架。该框架构建了具有互补适配角色的基础专家、语义专家和自适应专家,以联合利用通用预训练视觉表示、面向高层医学语义的深层适配以及基于适配器的多级任务特定适配。进一步采用基于像素概率的自适应投票实现预测级的自适应专家选择。
- 2.
我们提出语义引导的对比学习,显式调节异质专家表示之间的语义关系。该方法在增强前景-背景语义区分度的同时,协调表示一致性和表示多样性。
章节摘要
面向高层医学语义适配的智能通信混合专家
当前的微调方法在高层医学语义适配以及异质适配分支之间的语义协调方面仍显不足。为解决这些局限,我们提出了一种面向高层医学语义适配的智能通信混合专家框架(IC-MoE),如图2所示。
首先,在训练过程中,我们根据真实掩膜将输入图像分为三部分。其次,我们将送入模型。
实验参数、数据集与评价指标
实验设置。首先,所有实验均在PyTorch框架中实现。其次,根据图像分辨率将批次大小设置为8或32,所有模型训练100个周期。在主对比实验中,我们使用三个随机种子(0、1和2)重复实验以确保可复现性。第三,实验在24 GB NVIDIA RTX 4090 GPU上进行。我们的实验环境如下:PyTorch 2.0.0、Python 3.8、CUDA 11.8以及Intel Xeon
IC-MoE的讨论
如引言中所讨论的,传统的医疗图像分割微调方法通常面临两个挑战:高层医学语义适配不足以及异质适配分支之间语义协调不足。为解决这一局限,我们提出IC-MoE,该框架结合了互补专家分支、基于像素概率的自适应投票以及语义引导的对比学习。
表1、表2、表3、表4、表中的实验结果表明……
结论与未来工作
结论。参数高效微调是将基础模型迁移至医疗图像分割任务的有效方法。然而,现有方法在高层医学语义适配以及异质适配分支之间语义协调方面仍显不足。为解决这一局限,我们提出IC-MoE,一种面向医疗图像分割的智能通信混合专家框架。IC-MoE构建了三个互补的……
CRediT作者贡献声明
Xinwei Zhang:撰写——初稿、可视化、验证、软件、方法学、概念化、调查。Zhe Yuan:验证。Sukun Tian:撰写——审阅与编辑、经费获取。Hu Chen:撰写——审阅与编辑、调查、指导、经费获取。Peng Feng:撰写——审阅与编辑、指导、经费获取、概念化、形式分析。
利益冲突声明
作者声明不存在已知的可能影响本文所述工作的竞争性财务利益或个人关系。
致谢
本工作部分由中国重庆市自然科学基金(编号CSTB2025NSCQ-LZX0012)、北京市自然科学基金(编号L242114)以及高校科研创新基金——数字智能创新与人才专项(2024LC019)资助。
Xinwei Zhang | Pan Huang | Zhe Yuan | Sukun Tian | Hu Chen | Peng Feng