《Frontiers in Reproductive Health》:Evaluation of vision transformers and vision foundation models for sperm morphology analysis
编辑推荐:
背景:精子形态学评估是精液分析的重要组成部分但变异性极高,受染色、图像质量、采集条件及观察者解读影响。现代预训练视觉编码器有望提升该评估的客观性与可重复性,但其在精子形态学分析中的性能与鲁棒性尚未被充分表征。目的:比较视觉Transformer(Vision
背景:精子形态学评估是精液分析的重要组成部分但变异性极高,受染色、图像质量、采集条件及观察者解读影响。现代预训练视觉编码器有望提升该评估的客观性与可重复性,但其在精子形态学分析中的性能与鲁棒性尚未被充分表征。目的:比较视觉Transformer(Vision Transformer, ViT)与视觉基础模型(Vision Foundation Model, VFM)同既有预训练卷积神经网络(Convolutional Neural Network, CNN)在精子形态分类中的表现;评估自适应策略的影响;并考察跨图像源性能一致性、对未见数据集的泛化能力及模型归因的形态学相关性。方法:研究人员采用三所独立机构来源的7770张显微图像(1253张正常、6517张异常,涵盖头、颈/中段、尾异常),对10个覆盖监督、自监督、掩码图像及视觉-语言预训练的ViT/VFM在线性探测(linear probing)、轻量微调(light fine-tuning)与全微调(full fine-tuning)下评估,并以5个预训练CNN为基线;主要分析采用源分层划分考察池化性能、源特定性能与类特定召回,次要分析通过留一源验证考察外部泛化,并用架构适配的可解释性方法检验归因。结果:SigLIP2全微调与ConvNeXt-Tiny加权F1分别为0.958与0.955;BEiT全微调与SigLIP2轻量微调ROC-AUC最高(0.982);SigLIP2全微调跨源宏F1与正常类召回均为0.91;DINOv2全微调在三类外部验证中ROC-AUC介于0.654–0.928;可解释性分析显示预测主要定位于精子相关结构。结论:预训练策略、自适应深度与数据集偏移显著影响性能;ViT与VFM在AI辅助精子形态评估中具强潜力,可作为提升精液分析客观性、一致性与效率的可扩展工具。
研究背景与动机
精子形态学评估是男性不育诊疗中精液分析的核心环节,头部、颈部或尾部结构异常常反映受精能力受损。然而该评估受样本制备、染色、显微镜设置及观察者经验影响,变异性居各精液参数之首。早期基于传统图像处理与CNN的研究虽提升了自动化水平,但多数停留在单数据集或小规模公开集(如HuSHeM仅聚焦头部),且对自监督、掩码图像建模、视觉-语言等现代预训练范式覆盖不足。现有工作难以回答:哪类预训练视觉表征家族迁移至精子形态学最优、需多少任务适配、在异源与未见图像源下是否稳健。为此,研究人员在《Frontiers in Reproductive Health》报道了一项多源基准研究,系统比较视觉Transformer(ViT)与视觉基础模型(VFM)同CNN基线在二分类(正常vs异常)任务上的表现。
主要技术方法概述
研究人员整合SMIDS、HuSHeM、HiLabSpermMorpho三套公开显微图像集,剔除极小图后得7770张(正常1253、异常6517),按源内分层切分60%训练、15%验证、25%测试并合并分区。模型侧选取10个ViT/VFM家族——监督类(ViT-B/16、ViT-Small-PT、DEiT)、自监督/掩码类(DINOv2、DINOv2-reg、ViT-MAE、BEiT)、视觉-语言类(CLIP、SigLIP2、BiomedCLIP),每家族走线性探测、轻量微调(解冻末两层+归一化+投影)、全微调三策略;CNN基线含ResNet50、DenseNet121、EfficientNetV2-M、MobileNetV2、ConvNeXt-Tiny。训练用类别加权交叉熵+标签平滑(ε=0.05)、AdamW、余弦退火,输入统一224×224;评估指标为ROC-AUC、加权F1、等权跨源宏F1、正常/异常类召回,次要分析采用留一源验证与梯度加权注意力滚动(transformer)及Grad-CAM(CNN)归因。
研究结果
3.1 分析概览
研究围绕池化判别力、跨源一致性、类特定召回、留一源泛化与归因五问展开。
3.2 整体判别与池化分类性能
BEiT全微调与SigLIP2轻量微调ROC-AUC并列最高0.982;SigLIP2全微调加权F1最高0.958,略胜ConvNeXt-Tiny(0.955)。全微调较线性探测在BEiT(0.905→0.982)、CLIP(0.865→0.966)等家族显著提升。
3.3 跨图像源性能一致性
以等权宏F1防大源主导:SigLIP2全微调等权宏F1 0.91(SMIDS 0.89、HuSHeM 0.98、HiLabSpermMorpho 0.87),ConvNeXt-Tiny与SigLIP2轻量微调均0.90。HuSHeM普遍高分,HiLabSpermMorpho多为短板,证明池化指标掩盖源间落差。
3.4 正常与异常类召回
SigLIP2全微调正常类召回0.91、异常类0.96;ConvNeXt-Tiny为0.88/0.95。多数模型异常召回高于正常,ViT-MAE线性探测正常召回仅0.32,显示固定嵌入对少数正常态区分弱。
3.5 留一源外部泛化
DINOv2全微调在SMIDS留出AUC 0.844、HuSHeM留出0.928、HiLabSpermMorpho留出降至0.654;CNN基线最高仅0.580(EfficientNetV2-M)或0.802(DenseNet121,HuSHeM留出)。表明域偏移下泛化剧烈波动,HiLabSpermMorpho是最难未见域。
3.6 注意力滚动与Grad-CAM可解释性
选BEiT全微调与ConvNeXt-Tiny-PT,归因热区多落于精子头部及邻近中段,偶延至尾部或背景;同图两架构空间证据不完全重合,说明相似预测可来自不同形态线索。
讨论与结论翻译
讨论指出:自适应策略非普适最优,全微调常优但SigLIP2轻量微调已近顶;无单一架构范式通吃,SigLIP2全微调夺加权F1与跨源宏F1,BEiT/SigLIP2夺ROC-AUC,DINOv2领留一源;CNN基线(ConvNeXt-Tiny、DenseNet121)仍极具竞争力,推翻“Transformer必然优于CNN”预设;源间/类间差异使池化指标失真;留一源暴露域迁移脆弱性;归因虽锚定头部中段但偶吸背景,宜作质控而非临床推理证明。临床转化需看类特定灵敏度、校准与不确定度,近程价值在预筛、二审与质控而非替补报告。
结论(译):本研究系统评估预训练ViT、VFM与CNN基线在异源多源显微基准下的二分类精子形态性能。预训练策略、适配深度与图像源显著塑形结果,全微调普遍利好而轻量微调仍具竞争力。部分Transformer/VFM配置表现强劲,但现代CNN同样出色,无族类全域占优。源特定与留一源分析证明代表分布内高性能不等于未见集可靠泛化。结果支持将AI辅助精子形态系统发展为标准精液分析中提升一致性、质控与效率的决策支持工具而非替代专家;未来应推前瞻多中心验证、细粒度多标签建模、校准不确定度及接入数字男科学工作流。