《Scientific Reports》:A hybrid ConvNeXt-ViT framework with differential evolution optimization for breast cancer classification
编辑推荐:
乳腺癌是全球女性死亡的主要原因之一,通过乳腺X线摄影进行早期检测至关重要。然而,由于类不平衡、数据集有限以及需要同时提取局部和全局特征,自动分类仍然具有挑战性。虽然卷积神经网络(CNN)在乳腺X线摄影分类的局部特征提取方面表现出色,但它们难以捕捉长程上下文依赖
乳腺癌是全球女性死亡的主要原因之一,通过乳腺X线摄影进行早期检测至关重要。然而,由于类不平衡、数据集有限以及需要同时提取局部和全局特征,自动分类仍然具有挑战性。虽然卷积神经网络(CNN)在乳腺X线摄影分类的局部特征提取方面表现出色,但它们难以捕捉长程上下文依赖关系。相反,基于Transformer的模型能有效捕获全局关系,但需要大型数据集和大量计算资源,这限制了它们在医学影像中的应用。为克服这些限制,研究人员提出了DEViTNeXt,这是一个新的混合框架,将ConvNeXt的卷积效率与Vision Transformer(ViT)的注意力机制全局建模协同结合,并通过差分进化(DE)优化增强。该框架采用全面的预处理(高斯滤波、对比度受限自适应直方图均衡化(CLAHE)增强)和混合增强管道,该管道将基于生成对抗网络(GAN)的恶性病例合成与几何变换相结合。双分支特征提取利用ConvNeXt获取层次化局部特征,利用ViT获取全局上下文关系,并通过多头部注意力(MHA)精炼动态强调两个分支中的诊断区域。一个DE优化的MHA融合层自适应地整合互补特征。一个复合损失函数(加权交叉熵 + 焦点损失)在关注复杂恶性病例的同时解决了类不平衡问题。在CBIS-DDSM和MIAS数据集上的大量实验证明了DEViTNeXt的优越性,在CBIS-DDSM的二分类(良性 vs. 恶性)任务中达到了99.63%的准确率、99.45%的灵敏度和99.55%的特异性,在MIAS的三分类任务中达到了98.50%的准确率,超越了现有最先进的方法。
**论文解读:DEViTNeXt——一种结合差分进化优化的混合ConvNeXt-ViT框架用于乳腺癌分类**
**研究背景与问题**
乳腺癌是全球女性最常见的恶性肿瘤之一,每年新发病例数以百万计,早期检测通过乳腺X线摄影(mammography)可显著提高五年生存率。然而,乳腺X线摄影的自动分类面临三大核心挑战:一是公开数据集通常规模较小且存在严重的类不平衡,恶性病变样本往往不足;二是需要同时提取局部精细特征(如微钙化、肿块边缘)和全局上下文信息(如组织不对称、结构扭曲),但传统卷积神经网络(CNN)擅长局部纹理建模却难以捕捉长程空间依赖,而纯Transformer模型(如Vision Transformer, ViT)虽能建模全局关系,却缺乏CNN的局部归纳偏置,且对大规模标注数据依赖性强;三是现有混合模型大多依赖手动调参、静态融合策略,且未充分解决数据稀缺与不平衡问题。因此,研究人员亟需一种能够自适应融合局部与全局特征、自动优化超参数并有效缓解类不平衡的混合框架。
**研究内容与意义**
针对上述问题,研究人员提出DEViTNeXt,一种新型混合深度学习框架,发表于《Scientific Reports》。该框架将ConvNeXt的卷积效率与ViT的注意力机制全局建模相结合,并通过差分进化(Differential Evolution, DE)算法自动优化关键超参数,同时采用基于生成对抗网络(GAN)的合成数据增强与几何变换。在CBIS-DDSM(二分类,良性vs.恶性)和MIAS(三分类,正常、良性、恶性)两个公开乳腺X线摄影数据集上,DEViTNeXt分别达到99.63%和98.50%的准确率,显著超越多种现有方法(如ResNet50、InceptionV3等),并通过外部INbreast数据集验证了其跨数据集泛化能力。该研究为乳腺X线摄影的自动化筛查提供了高灵敏度、高特异性的临床可行方案,推动了计算机辅助诊断(CAD)系统的发展。
**主要关键技术方法**
研究人员采用如下关键技术(忽略具体培养与质粒构建,注明样本来源):
1. **数据预处理**:对CBIS-DDSM(1,459张图像,来源于DDSM的标准化子集)和MIAS(322张图像,来自英国研究团体)数据集进行高斯滤波去噪、对比度受限自适应直方图均衡化(CLAHE)增强及最小-最大强度归一化,并将图像统一缩放至224×224像素。
2. **混合数据增强**:在患者级分层划分后,仅对训练集采用条件深度卷积GAN(cDCGAN)合成恶性样本,并结合几何变换(旋转、翻转、缩放、平移),将CBIS-DDSM扩充至5,950张,MIAS扩充至1,050张。
3. **双分支特征提取与注意力精炼**:ConvNeXt分支提取层次化局部特征,ViT分支通过补丁自注意力提取全局上下文;每个分支后均独立使用多头部注意力(MHA)模块动态聚焦诊断关键区域。
4. **DE优化的MHA融合层**:通过差分进化算法自动优化学习率、权重衰减、丢弃率、注意力头维度和融合系数,并采用基于交叉注意力的MHA融合层自适应整合双分支特征。
5. **复合损失函数**:结合加权交叉熵(WCE)与焦点损失(Focal Loss),通过平衡系数β联合优化,缓解类不平衡并聚焦难分类恶性样本。
**研究结果**
**1. DEViTNeXt模型性能**
在CBIS-DDSM二分类任务中,DEViTNeXt取得99.63%的准确率、99.45%的灵敏度、99.55%的特异性;在MIAS三分类任务中,准确率达98.50%,恶性类别的F1分数为97.99%。受试者工作特征曲线(ROC)下面积(AUC)在CBIS-DDSM上为0.9996,在MIAS上为0.9918,说明模型具有极佳的判别能力。
**2. 消融研究**
渐进式消融实验表明:
- 单独使用ConvNeXt或ViT性能有限,而两者简单组合即优于单一骨干网络。
- DE优化带来最大单项提升(CBIS-DDSM +2.80%,MIAS +2.84%),证实了自适应超参数调优的有效性。
- GAN合成增强在MIAS上提升最大(+2.32%),对缓解小数据集类不平衡至关重要。
- 去除CLAHE导致召回率和F1分数下降,证明其增强局部对比度的必要性。
- 独立MHA精炼与DE优化的交叉注意力融合均优于静态融合方法(如简单拼接、元素相加)。
- 复合损失函数相比单一交叉熵提高了对困难恶性样本的识别能力。
**3. 优化算法对比**
将DE与粒子群优化(PSO)、灰狼优化(GWO)、鲸鱼优化算法(WOA)和网格搜索进行对比,在相同搜索预算下,DE在CBIS-DDSM上达到99.58%准确率,MIAS上98.42%,均优于所有对比方法。DE选择的超参数(如学习率3.2×10??、融合系数0.66)提供了最佳的局部-全局平衡。
**4. 与现有方法对比**
在CBIS-DDSM上,DEViTNeXt的99.63%准确率优于浅层CNN(98.79%)、ResNet50(93.15%)和InceptionV3(97.87%)等;在MIAS上,98.50%准确率与最佳三分类方法(InceptionV3-based,98.96%)相近,但本任务为更复杂的三分类。Wilcoxon符号秩检验证实所有提升均具有统计显著性(p<0.05,经Bonferroni校正后仍显著)。
**5. 外部验证**
在完全独立的INbreast数据集上,无需微调即达到99.02%准确率、98.78%灵敏度,进一步证实了模型学习到的可迁移特征。
**结论与讨论**
研究人员总结指出,DEViTNeXt通过协同整合ConvNeXt的卷积效率、ViT的全局建模、DE优化、MHA融合及复合损失函数,有效解决了乳腺X线摄影分类中的类不平衡、局部-全局特征融合和超参数调优难题。在CBIS-DDSM和MIAS上的优异性能以及外部验证的成功,表明该框架具有临床可行性,可用于早期乳腺癌筛查。未来工作将引入Grad-CAM++等可解释性技术以增强临床信任,并扩展至多模态成像(超声、MRI)以及开展多中心前瞻性临床试验。