《Frontiers in Medicine》:Multi-paradigm Vision Transformer ensemble with regional attention and MLP meta-fusion for explainable dermoscopic skin lesion classification
编辑推荐:
引言:皮肤镜皮肤病变的自动化分类因显著的类别不平衡、极小的类间差异、病变类型间的视觉相似性以及对临床可解释预测结果的要求而具有内在挑战性。方法:本研究设计了一种异构Vision Transformer(ViT)集成框架,用于基于HAM10000数据集的七类皮肤
引言:皮肤镜皮肤病变的自动化分类因显著的类别不平衡、极小的类间差异、病变类型间的视觉相似性以及对临床可解释预测结果的要求而具有内在挑战性。方法:本研究设计了一种异构Vision Transformer(ViT)集成框架,用于基于HAM10000数据集的七类皮肤病变分类。该框架集成了三种架构各异的主干网络——Swin-Tiny、ViT-Base与DeiT-Small,并增强以新颖的区域注意力封装器(Regional Attention Wrapper, RAW)实现空间选择性特征聚合。各主干输出通过堆叠(stacking)协议融合,其中训练得到的MLP元学习器解决模型间的类别感知分歧。类别不平衡通过类别自适应增强、类别加权焦点损失(class-weighted focal loss)与MixUp正则化予以处理。结果:所提框架达到98.37%准确率、98.39%加权F1分数与0.999平均AUC,在所有指标上超越三个独立主干。相较最弱基线,MEL(黑色素瘤)误分类降低78%,McNemar检验确认显著性(p < 0.0001)。综合消融研究验证了RAW模块、各集成组件及各增强策略的贡献。三重交叉验证给出96.14 ± 0.36%平均准确率,自助置信区间分析确认结果可靠可复现。讨论:由区域注意力图、GradCAM++、SHAP与t-SNE构成的详尽可解释性框架,提供互补的空间、基于梯度的、像素级与嵌入级可解释性,保障自动化皮肤镜系统所需的临床信任、透明性与可信度。
研究背景方面,皮肤癌是全球高发且快速上升的恶性肿瘤,其中黑色素瘤致死率最高,早期检出五年生存率超98%而晚期不足25%。皮肤镜作为非侵入成像技术依赖专家判读,存在观察者间差异,尤其黑色素瘤与黑素细胞痣等模糊病变难以区分。传统卷积神经网络(Convolutional Neural Network, CNN)受局部感受野限制,难以建模不对称、边界不规则等长距离空间依赖;现有Vision Transformer(ViT)研究多采单一主干或同构集成,融合策略常等权处理、忽略空间局部性,且临床部署缺乏多维可解释验证。为此,研究人员在《Frontiers in Medicine》发表该研究,提出异构ViT集成框架,旨在兼顾长程依赖建模、架构多样性互补、空间选择性聚合与类别感知分歧消解,并提供多方法可解释证据以满足监管与临床可追溯要求。
关键技术方法上,研究人员采用HAM10000数据集(10,015张七类皮肤镜图,含NV、MEL、BKL、BCC、AKIEC、VASC、DF),以lesion_id去重后做80/20分层划分,训练集回填同病变多视图、验证集严格无泄漏;图像归一至224×224并使用数据集特有逐通道均值标准差。增强方面标准几何色彩变换结合少数类(AKIEC、DF、VASC)强增强与概率0.4的MixUp(α=0.2);损失采用类别加权焦点损失(class-weighted focal loss,α=1,γ=2.5,权重由逆频率×人工乘子截断至[1,18])。主干选取Swin-Tiny(分层移位窗口注意力)、ViT-Base(全局自注意力)、DeiT-Small(蒸馏令牌知识蒸馏)三种异构ViT,各去分类头后统一包覆区域注意力封装器(Regional Attention Wrapper, RAW)做空间加权池化;三主干softmax概率拼接送入MLP元学习器做stacking融合。可解释性并行调用区域注意力图、Ensemble GradCAM++、SHAP GradientExplainer与t-SNE嵌入分析。
研究结果部分,引言指出CNN局限与ViT单主干缺陷,明确异构集成+RAW+MLP元学习+四法XAI的研究定位。相关工作中对比Raghavendra轻量CNN(97.20%)、Najjar VGG19-RSPDA-ViT(HAM10000 97.1%)、Tang SkinSwinViT(97.88%)等,凸显已有方法缺元学习分歧消解与多视角XAI。方法论中,3.1数据集描述给出七类分布与58:1不平衡比;3.2预处理以lesion_id去重与多视图回填消除身份泄漏;3.3增强策略用类自适应几何色彩变换+MixUp;3.4类别加权焦点损失公式LCFL=1/N∑wyi·α·(1-pt,i)γ·CEi缓解难易样本与少数类偏置;3.5主干选择详述Swin-Tiny窗口注意力QK?/√dk+B、ViT-Base全局MHSA、DeiT-Small蒸馏损失LDeiT=(1-λ)LCE+λτ2KL(σ(zs/τ)∥σ(zt/τ));3.6 RAW以可学习空间注意力图重加权主干特征图后全局池化得固定维向量;3.7 MLP元学习器输入为三主干7维概率拼接的21维向量,隐层非线性映射输出最终7类概率;3.8训练用AdamW+余弦调度,主干与元学习器两阶段优化;3.9 XAI四条线分别给出空间注意力热区、梯度归因叠加、像素级SHAP值与t-SNE簇分离。结果章节显示集成框架在HAM10000验证集获98.37%准确率、98.39%加权F1、0.999平均AUC,MEL误分降78%(McNemar p<0.0001),三重交叉验证96.14±0.36%,自助CI准确度(97.55%,99.09%)、F1(97.60%,99.09%)、AUC(0.9978,0.9998);消融证明RAW、异构三主干、MLP元学习器、MixUp与类别加权焦点损失均带来正向贡献。讨论部分强调区域注意力图与GradCAM++一致锁定病变本体、SHAP印证边界色素与蓝白幕区域、t-SNE显示七类嵌入可分,四法互补构成临床可追溯证据链;统计上六组两两McNemar比较均p<0.0001,证实集成显著优于任一单主干。结论翻译如下:研究人员提出异构Vision Transformer集成框架,融合Swin-Tiny、ViT-Base、DeiT-Small三主干与区域注意力封装器(RAW)及MLP元学习器,在HAM10000七类皮肤病变分类中取得98.37%准确率、98.39%加权F1与0.999平均AUC,较单主干显著提升且MEL误分降78%;类别自适应增强、类别加权焦点损失与MixUp协同缓解58:1不平衡;四法可解释框架从空间、梯度、像素与嵌入层面共同保障决策可追溯性,统计检验与交叉验证确认结果可复现,为自动化皮肤镜诊断提供兼具性能与临床信任度的解决方案。