《Eye》:Foundation model-based haemoglobin concentration estimation and anaemia risk assessment from retinal fundus images
编辑推荐:
摘要:贫血的广泛筛查目前受到有创血液检测需求的限制。本研究的主要目的是评估基于Vision Transformer (ViT)的基础模型(包括在自然或医学领域预训练的模型)用于利用视网膜眼底图像非侵入性估计血红蛋白(Hb)水平的可行性和可解释性。方法:这项回顾
摘要:贫血的广泛筛查目前受到有创血液检测需求的限制。本研究的主要目的是评估基于Vision Transformer (ViT)的基础模型(包括在自然或医学领域预训练的模型)用于利用视网膜眼底图像非侵入性估计血红蛋白(Hb)水平的可行性和可解释性。方法:这项回顾性横断面研究纳入了来自首尔国立大学医院健康促进中心(2005–2016)的34,511名个体。研究人员采用低秩适应(LoRA)和部分微调,对五个基础模型(DINOv2, OpenCLIP, MAE, RETFound, 和 VisionFM)进行Hb浓度回归的适配。为了可解释性,研究人员使用了Grad-CAM显著性映射和基于视网膜血管分割的扰动分析。结果:在所有测试的模型中,自然域模型DINOv2结合LoRA取得了最佳性能(贫血检测的MAE = 0.703, R2 = 0.682, 和 AUROC = 0.917)。在不同Hb阈值下,在固定特异性水平上检查了操作特性。Grad-CAM分析显示,模型的预测主要依赖于黄斑和视乳头周围区域。扰动分析证实,视网膜动脉亮度和颜色饱和度的增加与估计的Hb水平升高相关。结论:微调的基础模型,特别是DINOv2结合LoRA,在从视网膜眼底图像进行非侵入性Hb估计中展示了有竞争力的性能。研究人员发现模型的决策过程在定性与临床和生理预期一致,预测集中在已知的解剖和血管指标上。这些初步发现提示适配的基础模型作为贫血风险评估辅助工具的潜在用途,尽管外部验证仍然必要。
贫血是全球性健康问题,2021年影响约19.2亿人,其诊断依赖于有创血液检测,限制了大规模筛查、患者依从性和资源有限地区的可及性。近年来,深度学习在非侵入性血红蛋白(Hb)估计领域展现出潜力,但基础模型(Foundation Model, FM)——即在大规模数据上预训练的通用视觉模型——在该任务中的应用尚未被系统评估。本研究旨在填补这一空白,评估基于Vision Transformer(ViT)的基础模型(包括自然图像和医学图像预训练模型)用于视网膜眼底图像非侵入性Hb估计的可行性和可解释性,并探索其作为贫血风险评估辅助工具的潜力。
研究人员开展了一项回顾性横断面研究,纳入来自首尔国立大学医院健康促进中心(2005-2016)的34,511名韩国成年人,共63,528张视网膜眼底图像。通过低秩适应(LoRA)和部分微调两种方法,对五个基础模型(DINOv2、OpenCLIP、MAE、RETFound、VisionFM)进行Hb浓度回归的适配。使用Grad-CAM生成显著性图,并利用视网膜血管分割进行扰动分析,以解释模型决策。研究得出以下结论:自然域模型DINOv2结合LoRA微调取得了最佳性能(MAE=0.703, R
2=0.682, 贫血检测AUROC=0.917),其决策过程与临床生理预期一致,主要关注黄斑和视乳头周围区域,且视网膜动脉亮度与饱和度与估计Hb水平正相关。该研究首次证明了微调基础模型在非侵入性Hb估计中的竞争力,论文发表在《Eye》期刊。
**关键的技术方法**:本研究样本来源于首尔国立大学医院健康促进中心的34,511名韩国成年人(2005-2016),使用CR-2数字非散瞳眼底相机采集视网膜图像。研究人员采用五种基于Vision Transformer(ViT)的基础模型(DINOv2、OpenCLIP、MAE、RETFound、VisionFM),通过低秩适应(LoRA)和部分微调两种方法进行Hb浓度回归。利用Grad-CAM生成显著性图,并结合AutoMorph模块的视网膜血管分割进行扰动分析,以评估模型对动脉亮度和饱和度的响应。
**研究结果**:
**Study population and characteristics**:研究人群包括34,511名个体,平均年龄约58岁,女性占比约49%,血红蛋白浓度均值约14.45 g/dL,贫血患病率较低(约5.75%)。训练、验证和测试集的人口统计学特征平衡。
**Performance of the models for predicting haemoglobin levels**:通过比较各模型的平均绝对误差(MAE)、决定系数(R
2)和贫血检测的受试者工作特征曲线下面积(AUROC),发现LoRA微调方法整体优于部分微调。DINOv2模型结合LoRA取得了最佳性能:MAE=0.703,R
2=0.682,贫血检测AUROC=0.917,临床显著贫血(Hb<11 g/dL)检测AUROC=0.982。操作点分析显示,在固定特异性70%至95%时,对任意贫血的敏感性从0.930降至0.611,但对临床显著贫血的敏感性始终高于0.95。预测Hb百分位数越低,真正贫血患病率越高,且在性别、年龄、高血压、糖尿病、血脂异常亚组中结果一致。
**Explaining the clinical rationale of the model**:平均Grad-CAM显著性图显示,DINOv2模型(LoRA微调)主要关注双侧黄斑和视乳头周围区域。扰动分析表明,将视网膜动脉亮度增加10%可使预测Hb增加0.43 g/dL,亮度降低10%则使预测Hb减少0.91 g/dL;动脉饱和度增加10%使预测Hb增加0.90 g/dL,降低10%则减少0.87 g/dL。全图修改对预测影响微小,说明模型依赖动脉局部特征。
**Comparison with previous haemoglobin estimation methods**:与既往有创、无创及深度学习模型相比,本研究基于基础模型的方法在MAE(0.70)和95%一致性界限(-1.84至1.67)上表现出竞争力,优于其他非侵入性方法,接近有创方法。
**总结讨论部分**:研究人员指出,基础模型在医学AI中具有可扩展性、高效微调及减少对大规模标注数据依赖等优势。本研究首次利用基础模型从视网膜眼底图像预测Hb,发现自然域模型DINOv2优于医学域模型,可能归因于自然图像训练数据的质量和规模。模型决策过程与临床知识一致,但存在比例偏差(低Hb时高估,高Hb时低估)和较宽的一致性界限(约3.5 g/dL),因此应作为辅助风险评估工具而非独立诊断方法。研究局限性包括:单中心、单设备,缺乏外部验证;亚组中R
2出现负值,可能与Hb分布变异度小有关;临床显著贫血病例数有限(n=51);可解释性分析仅为定性合理性检查。未来研究需进行多中心外部验证、交叉验证、性别特异性建模和更全面的特征隔离分析。
**研究结论部分翻译**:总之,本研究提供了初步证据,表明微调的基础模型,包括在自然图像上预训练的通用视觉模型,可以在受控临床环境中从视网膜眼底图像捕捉与血红蛋白估计相关的信号。在评估的模型中,使用LoRA微调的DINOv2模型取得了最强的预测性能,并显示出对解剖学相关视网膜区域(黄斑和视乳头周围区域)的注意力集中。这些观测表明,模型的预测并非由明显的虚假图像特征主导。然而,可解释性分析应被视为定性合理性检查,而非因果或机械推理的证据。因此,这些发现应在若干局限性背景下解读,包括有限的泛化性、亚组变异性和比例偏差。因此,该模型应被视为辅助风险评估工具,而非独立的诊断方法。总体而言,这些发现支持了在受控条件下将微调基础模型应用于视网膜眼底图像血红蛋白估计的可行性,同时强调了在更广泛的临床使用前需要进行严格的外部验证。