七分类视网膜病变眼底图像分类中EfficientNet-B3、Vision Transformers与RETFound的比较评估与队列溯源审计

《Diagnostics》:Comparative Evaluation of EfficientNet-B3, Vision Transformers, and RETFound for Seven-Category Retinopathy Fundus Image Classification

【字体: 大 中 小 】 时间:2026年09月25日 来源:Diagnostics 3.8

编辑推荐:

  背景/目的:视网膜眼底照相是筛查威胁视力疾病最广泛可用的手段,但判读困难:多种疾病可在同一张照片上留下重叠体征,区分它们的特征往往细微且局限于视网膜小区域,并且单张图像不携带任何系统性背景,因此自动化判读器必须解决经验丰富的临床医生本身也只有中等一致性的分类问

  
背景/目的:视网膜眼底照相是筛查威胁视力疾病最广泛可用的手段,但判读困难:多种疾病可在同一张照片上留下重叠体征,区分它们的特征往往细微且局限于视网膜小区域,并且单张图像不携带任何系统性背景,因此自动化判读器必须解决经验丰富的临床医生本身也只有中等一致性的分类问题。方法:研究人员在回顾性计算研究中,使用分层五折交叉验证,在一个多来源眼底图像基准上比较了五种深度学习架构——EfficientNet-B3、DenseNet-121、ViT-Base/16、Inception-V3和RETFound ViT-Large——用于同步七类视网膜疾病分类。研究人员汇总了来自三个公开、去标识数据集的11,223张患者-眼睛眼底图像(ODIR-5K、RFMiD和APTOS 2019),涵盖年龄相关性黄斑变性(age-related macular degeneration, AMD)、白内障、糖尿病视网膜病变(diabetic retinopathy, DR)、青光眼、高血压性视网膜病变、病理性近视和正常眼底;该队列明显类别不平衡(DR占62.5%,正常占25.6%,其余每类<3%),且未收集任何新患者数据。图像通过MD5哈希去重,并在患者水平进行划分以消除数据泄漏,固定15%留出测试集和五个分层交叉验证折;训练图像接受Ben Graham光照归一化和类别平衡增强,而验证和测试图像未增强。研究人员训练了三个ImageNet预训练卷积神经网络(convolutional neural network, CNN)(EfficientNet-B3、DenseNet-121、Inception-V3)、ViT-Base/16和RETFound ViT-Large(通过掩码自编码在160万张视网膜照片上预训练);主要结局是五折平均加权F1分数(weighted-F1),两两比较使用折水平F1的配对t检验(自由度df=4),并应用梯度加权类激活映射(gradient-weighted class activation mapping, Grad-CAM)进行可解释性分析。结果:EfficientNet-B3取得了最高的五折平均准确率(95.53%;加权F1 0.9507),并显著优于RETFound ViT-Large(p=0.001;Cohen's d=3.40;95%CI 0.018–0.033)、ViT-Base/16(p=0.002;d=2.92;CI 0.009–0.026)和Inception-V3(p=0.04;d=2.13;CI 0.001–0.018),而与DenseNet-121表现相当(p=0.35);Grad-CAM显示CNN架构具有临床合理的激活定位。结论:因此,一个紧凑、资源高效的CNN匹配或超过了显著更大的视网膜基础模型和Vision Transformers,表明更大的领域特定基础模型并非天然适用于异质性视网膜筛查;由于此类紧凑模型可在普通硬件上运行,它们可能为眼科医生覆盖最稀缺的社区、农村和资源有限环境提供更实用的筛查解决方案。跨影像来源和人群的外部有效性仍未得到证实,强调前瞻性、多中心验证必须先于临床部署。对该汇总队列的溯源审计随后发现其存在混杂。审计识别出五种失败模式,其中三种是决定性的:仅图像宽度就能以99.98%的准确率在未使用任何视网膜像素的情况下复现糖尿病视网膜病变标签;来源与标签几乎完全依赖,Cramér's V=0.9996;且所有五种架构的糖尿病视网膜病变召回率恰好为1.0000。队列随后从单一来源重建,采用每眼标签,并在统一方案下重新训练九种架构,同时进行外部验证。修正后的主要结果是内部宏平均曲线下面积(macro-AUC)0.930和外部0.978,宏F1为0.686。未宣称任何架构更优,汇总队列的结论不成立。
论文解读:七分类视网膜病变眼底图像分类的架构比较与队列溯源审计

一、研究背景与现存问题

视网膜疾病是全球可预防性不可逆视力损害和失明的主要原因,WHO估计全球至少22亿人存在视力损害,其中糖尿病视网膜病变(diabetic retinopathy, DR)、青光眼、年龄相关性黄斑变性(age-related macular degeneration, AMD)和白内障占多数。眼底照相是公认经济有效的筛查手段,但判读困难:多种疾病体征重叠、特征细微且局限于小区域,单张图像缺乏系统性背景,经验丰富的临床医生之间判读一致性仅中等。深度学习已能实现专家级DR检测,但多数研究针对单一疾病、单一机构数据集,无法满足真实世界中多病共存的同步鉴别需求。Vision Transformers(ViTs)和领域特定基础模型(如RETFound,在160万张视网膜照片上通过掩码自编码预训练)是当前前沿,但其在多类、多源分类中是否优于紧凑CNN,尚缺乏受控条件下的严格评估。此外,影像机器学习普遍存在快捷学习、数据泄漏和评价偏倚,导致大量性能虚高。因此,研究人员对五种架构进行了系统性头对头比较,并进一步对汇总队列实施溯源审计,发现严重混杂后重建队列并重新分析。

二、研究内容与总体结论

研究人员从ODIR-5K、RFMiD和APTOS 2019三个公开去标识数据集汇总11,223张患者-眼睛眼底图像,构建七类疾病分类任务,比较EfficientNet-B3、DenseNet-121、Inception-V3、ViT-Base/16和RETFound ViT-Large。原始池化队列分析显示EfficientNet-B3表现最佳。但随后的溯源审计发现,该队列存在决定性混杂:所有DR图像来自1024像素宽度的来源,其余六类图像均为512像素宽度,仅凭文件头宽度即可达99.98%准确率预测DR;来源与标签的Cramér's V达0.9996,五类体系结构DR召回均为1.0000。此外,患者级标签被直接套用到双眼导致左右眼标签不一致率为0%,RETFound的微调还存在位置嵌入静默加载失败。研究人员随即从单一来源ODIR-5K重建队列,按每眼诊断关键词解析标签,去除跨来源泄漏,并在统一训练方案下重新训练九种架构。修正结果显示,集成模型内部宏AUC为0.930,宏F1为0.686;外部验证宏AUC为0.978。在预指定的主要对比中,EfficientNet-B3与ViT-Base/16无显著差异,未宣称任何架构更优。原始“紧凑CNN优于基础模型”的结论不成立。

三、主要关键技术方法

研究采用回顾性计算研究设计,样本来自ODIR-5K(重建后训练)、RFMiD(外部验证)和APTOS 2019(仅原始池化队列)。关键方法包括:分层五折交叉验证、MD5哈希去重和患者水平划分以控制数据泄漏;Ben Graham光照归一化和类别平衡增强(仅训练图像);统一训练方案(AdamW优化器、余弦退火、判别式学习率、EMA权重);溯源审计四探针(眼标签不一致率、分辨率统一性、无解剖特征统计量对来源和类别的可恢复性、来源数量);统计推断采用Nadeau–Bengio校正和患者级配对bootstrap,外部验证用图像级bootstrap;可解释性用Grad-CAM。

四、研究结果

五折分类性能(原始池化队列):EfficientNet-B3获得最高五折平均准确率95.53%和加权F1 0.9507,DenseNet-121次之,RETFound ViT-Large最低(加权F1 0.9251)。但该结果建立在混杂队列上,不能作为有效估计。

统计比较(原始):配对t检验显示EfficientNet-B3显著优于RETFound、ViT-Base/16和Inception-V3,但与DenseNet-121无显著差异。这些检验将交叉验证折视为独立样本,未做多重性校正,推断存在缺陷。

可解释性:Grad-CAM显示CNN的激活定位在渗出、视盘边缘、玻璃膜疣等病理相关区域,但事后证明看似合理的激活图在混杂模型上同样存在,不能作为无快捷学习的证据。

经典机器学习参考:以EfficientNet-B3特征训练的SVM准确率93.5%,接近端到端网络,表明原始特征空间可分性良好,同样受队列混杂影响。

溯源审计发现:审计证实五种失败模式,其中三种决定性:图像宽度单独复现DR标签(99.98%)、来源与标签近完全依赖(Cramér's V=0.9996)、所有架构DR召回恰为1.0000。另有单幅图像左右眼标签不一致率0%以及RETFound位置嵌入静默丢失。

修正结果:重建队列上,九种架构集成达到宏AUC 0.930(95%CI 0.911–0.948),宏F1 0.686(0.637–0.733);外部RFMiD上宏AUC 0.978(0.970–0.985),宏F1 0.677(0.621–0.730)。所有相邻排序架构的成对对比均不显著,唯一预指定对比(EfficientNet-B3 vs ViT-Base/16)置信区间包含零。

原始与修正估计对比:加权F1 0.9507与宏F1 0.686在不同队列、不同标签单位、不同指标下测得,不可直接比较。修正估计因去除来源-标签混杂而更低,但才是有效估计。

五、讨论与结论

讨论部分重新解释原始发现:原始准确率主要衡量来源恢复而非病理识别;配对t检验违反独立性假设,经Nadeau–Bengio校正后显著性消失;RETFound原始结果部分源于位置嵌入加载故障。修正后,九种架构在统一方案下统计等价,仅在范围两端(宏AUC 0.863–0.924)有少数经校正后仍显著的对比。领域特定预训练未显示出优于ImageNet预训练。临床部署方面,紧凑模型资源需求低,但本研究不提供任何临床效用声明。研究结论:汇总队列结论不成立;修正后的结论是九种架构在单一来源、每眼标签队列上无架构优越性,集成模型具备中等至良好判别能力;真正可迁移的成果是溯源审计协议,公共多来源眼底数据集在训练前必须筛查来源-标签依赖、标签粒度和指标语义,并报告筛查结果,否则基准数字无法解释。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号