《Intelligence-Based Medicine》:An Efficient Swin Transformer Architecture for Cutaneous Melanoma Detection
编辑推荐:
参数高效的Swin Transformer(Swin Transformer)适配器改善了黑色素瘤分类性能;瓶颈适配器(Bottleneck Adapter)实现了高效的医学图像分析;该框架面向资源受限的临床设备;在降低内存占用的同时保持高分类性能;为黑色素瘤
参数高效的Swin Transformer(Swin Transformer)适配器改善了黑色素瘤分类性能;瓶颈适配器(Bottleneck Adapter)实现了高效的医学图像分析;该框架面向资源受限的临床设备;在降低内存占用的同时保持高分类性能;为黑色素瘤检测任务提供了临床适用的适应性调整。
皮肤黑色素瘤发病率持续上升,早期诊断对预后至关重要。现有诊断流程依赖皮肤科医生视觉检查、皮肤镜及组织病理确认,存在主观性强、观察者一致性低、专科资源不足等问题。人工智能系统在深肤色人群上的准确性显著下降,而标准视觉Transformer模型微调需要更新全部参数,计算成本高,难以部署于内存有限的临床设备。参数高效微调(Parameter-Efficient Fine-Tuning, PEFT)技术已在其他领域取得成效,但在皮肤科任务中缺乏系统比较。为此,研究人员提出了一种基于Swin Transformer(Swin Transformer,一种层次化视觉Transformer架构)的参数高效适配器框架,专门面向皮肤黑色素瘤检测,旨在以极低的可训练参数和内存占用实现与全量微调相当的诊断性能。
该研究使用公开的HAM10000数据集(含10015张皮肤镜图像,覆盖7类皮肤病变,其中黑色素瘤等为恶性,黑色素细胞痣为多数类)。数据预处理为224×224,采用ImageNet统计量归一化,并应用随机水平/垂直翻转、旋转和颜色扰动等增强。模型以预训练的Swin Transformer Tiny(Swin-T)和Small(Swin-S)为骨干,冻结全部主干参数,设计并行双适配器(Parallel Dual-Adapter)结构:在每个Swin Transformer块的多头自注意力(Multi-Head Self-Attention, MSA)和多层感知机(Multi-Layer Perceptron, MLP)子层旁并联一个瓶颈适配器(Bottleneck Adapter),适配器依次包含LayerNorm、降维线性层、GELU激活、随机失活(dropout)和升维线性层。通过恒等初始化(降维投影采用Kaiming均匀初始化,升维投影置零)确保初始状态与预训练模型完全一致,并保留全秩梯度通路。训练采用AdamW优化器、余弦退火学习率、梯度裁剪和焦点损失(focal loss),使用5折分层交叉验证,模型选择基于宏F1分数。此外,通过Grad-CAM(Gradient-weighted Class Activation Mapping)进行可解释性分析,并与全量微调、低秩适配(Low-Rank Adaptation, LoRA)比较推理延迟和内存占用。
研究结果如下:
3.1 跨任务的计算效率指标:通过参数统计和性能评估,适配器仅占用模型全部参数的1.02%–7.54%,相比全量微调减少92.5%–99.0%的可训练参数。Swin-T双注入、秩4、每类2000样本时准确率为88%±0.2%,GPU内存636 MB;Swin-T仅MLP注入、秩16时准确率87%±0.9%,GPU内存578 MB。
3.2 内存与训练效率分析:在每类500/1000/2000样本设置下,所有配置的性能随样本量增加单调提升,准确率提高6–7%,未出现对重复增强视图的过拟合。比较两种注入方式,双注入平均准确率比仅MLP注入高0.4个百分点,但宏平均F1和宏敏感性差异很小;dropout率对性能的影响大于适配器容量,低dropout(0.1)优于高dropout(0.75)。
3.3 与全量微调和LoRA的比较:在相同协议下,仅MLP注入适配器以3.84%的可训练参数达到与全量微调相当的宏F1(差异0.002,p=0.776);LoRA秩4以0.40%的参数显著损失0.040宏F1(p=0.010)。
3.4 推理延迟与计算成本:批量大小为1时,仅MLP注入使延迟增加17.6%,双注入增加45.9%;批量32时分别降至约9%和18%。延迟增加主要来自额外内核启动而非浮点运算。
3.5 注入策略比较的稳定性:在四种随机种子下重训,两种注入的宏F1差异在种子间改变符号(均值0.004,p=0.660),表明双注入的优势不稳健,二者在宏平均指标上等价。
3.6 临床部署考虑:Swin-T Tiny、仅MLP注入、秩16、每类2000样本的配置仅需578 MB GPU内存,适合现代移动/嵌入式临床设备(3–4 GB内存)部署。
3.7 每类诊断性能:通过ROC曲线和混淆矩阵分析,双注入配置的宏平均曲线下面积(Area Under the Curve, AUC)为0.985,仅MLP注入为0.975;黑色素瘤AUC分别为0.952和0.932,敏感性在所有类别中最低(0.767和0.686)。错误方向分析显示,恶性病变被误判为良性的比例达到反向误差的2.5–3.3倍,黑色素瘤被误判为痣的比例超过15%,提示模型倾向于漏诊恶性病变。
3.8 模型注意力的定性评估:Grad-CAM可视化显示,正确分类样本的激活区域集中于病灶本体,对毛发、暗角、凝胶气泡等采集伪影响应极低,说明适配器无需修改冻结主干即可引导预训练特征关注病变形态。
3.9 局限性及未来工作:研究仅使用HAM10000数据集,该数据集主要来自欧洲人群,深肤色样本不足,泛化性有待验证;模型预测概率未校准,存在过度自信;当前操作点不适合自主筛查。未来需在ISIC等数据集上验证,进行阈值校准、动态秩选择,并扩展至其他影像模态。
讨论总结:研究证实了参数高效适配器能在保持高诊断性能的同时极大降低训练参数和内存需求,为资源受限环境下的皮肤病变分类提供了可行方案。然而,注入方式的差异在宏平均指标上不显著,而漏诊恶性病变的错误方向是临床应用中必须解决的问题。
研究结论:研究人员提出了一种基于Swin Transformer的参数高效适配器皮肤病变分类方法。在HAM10000七类任务中,可训练参数占比仅1.02%–7.54%;最高效率配置(Swin-T Tiny、MLP注入、秩16、2000样本/类)达到87.0%±0.9%准确率,仅283,092个可训练参数和578 MB GPU内存;最准确配置(Swin-S Small、双注入、dropout=0.5、秩4)达到88.0%±0.3%准确率,1,096 MB内存。双注入宏平均AUC为0.985,仅MLP注入为0.975,黑色素瘤AUC为0.932–0.952。与全量微调相比,仅MLP注入适配器在训练3.84%参数的情况下无显著性能损失,而LoRA损失显著。推理开销在批量1时为17.6%(MLP)和45.9%(双注入),批量32时降至约9%和18%。两种注入策略的差异在随机种子间不稳定,仅MLP注入因训练参数减半和推理开销更低更适合部署。临床上最重要的发现是模型将恶性病变误判为良性的概率是反向误差的2–3倍,且黑色素瘤敏感性最低,因此需要通过成本敏感决策规则或阈值校准调整操作点,方可用于自主筛查。未来需进行跨数据集验证、阈值校准、动态瓶颈宽度选择和更长训练计划下的比较研究。