《Computerized Medical Imaging and Graphics》:AI-driven retinal image quality monitoring in diabetic retinopathy screening: A retrospective study identifying actionable insights to improve imaging protocols
编辑推荐:
视网膜图像质量评估模型在糖尿病视网膜病变筛查中的应用研究。通过分析55,801张视网膜图像,比较NaIA-RD、EyeQ和DeepDRiD三个模型的RIQ评分与临床决策的一致性,发现DeepDRiD平均精确度最高(0.431)。研究提出利用连续RIQ评分监测数据漂移,并分解为 artifact和opacity指标以指导临床优化,验证了模块化AI工具在影像质量控制和筛查流程改进中的实用性。
伊马诺尔·平托(Imanol Pinto)|阿尔瓦罗·奥拉扎兰(álvaro Olazarán)|大卫·胡里奥(David Jurio)|博尔哈·德拉奥萨(Borja de la Osa)|米格尔·桑兹(Miguel Sainz)|阿里茨·奥斯科兹(Aritz Oscoz)|赫罗尼莫·巴拉兹(Jeronimo Ballaz)|哈维尔·戈里乔(Javier Gorricho)|米克尔·加拉尔(Mikel Galar)|何塞·安多内吉(José Andonegui)
健康技术服务部门,电信与数字化总局,C/ Cabarceno 6,3楼,Sarriguren,31621,西班牙
摘要
目的:
验证视网膜图像质量(RIQ)模型在现实世界糖尿病视网膜病变筛查中的适用性,以发现可操作的见解,从而改进成像协议。
材料与方法:
纳瓦拉大学医院(西班牙)开发的定制AI系统NaIA-RD被用于监测医院内多个成像部位的视网膜图像质量(RIQ)。为此目的,收集了一个包含55,801张常规视网膜图像的大型回顾性数据集,这些图像是在3.6年内收集的。此外,还使用了两个在公开数据集(EyeQ和DeepDRiD)上训练的卷积神经网络作为独立比较器。然后分析了NaIA-RD、EyeQ和DeepDRiD模型的纵向RIQ输出,以评估它们与临床决策的一致性。
结果:
所有三个模型都发现了不同成像部位、相机型号和成像技术人员之间的相似差异。无法评分的图像比例在各部位之间差异很大,范围从2.23%到28.23%不等。这些差异随着时间的推移而变化,这是由于数据分布的变化或数据漂移造成的。在三个模型中,使用DeepDRiD训练的模型与临床医生的吻合度最高,平均准确率为0.431,而NaIA-RD为0.389,EyeQ为0.392。
讨论:
监测RIQ揭示了一些可操作的见解,例如识别与相机型号和技术人员经验相关的差异,这表明有潜力通过有针对性的培训来标准化成像协议。
结论:
具有模块化设计和详细RIQ评分的AI工具可以有效地监控临床成像工作流程,从而推动数据驱动的医疗质量改进措施。
引言
糖尿病视网膜病变(DR)是发达国家视力丧失的主要原因之一(Fong等人,2003年),通过可视化视网膜图像来进行筛查。经过培训的人员会审查这些图像,如果发现疾病迹象或视网膜图像质量(RIQ)不足以进行诊断(即图像无法评分),则会将患者转诊给眼科医生(Wong等人,2018年)。
文献中将RIQ描述为一个可量化的——尽管有些主观的——属性,可以通过算法进行评估(Lin等人,2020年)。先进的方法结合了全局图像属性(例如对比度、焦点、颜色)和视网膜的结构特征(黄斑、视盘和血管弓的可见性)(Lin等人,2020年)。通常,RIQ被分为二元(可评分/不可评分)或三级量表(例如,良好、可用、拒绝)。然而,目前缺乏一个被普遍接受的RIQ评估标准。因此,实际DR筛查项目中的不可评分率差异很大,从高度控制的瞳孔扩张环境中的2.4%(Heydon等人,2021年)到未经扩张的筛查人群中的近20%(van der Heijden等人,2018年)不等。最近,像EyeQ(Fu等人,2019年)和DeepDRiD(Liu等人,2022年)这样的大型公开数据集推动了基于AI的RIQ模型的发展(早期的较小数据集如DRIMDB也可用(Sevik等人,2014年))。
RIQ模型对于全面的DR筛查至关重要,但将其集成到医疗设备中却面临独特挑战。虽然RIQ对于检测轻度DR(这对于筛查至关重要)是必不可少的,但它受到技术人员技能、环境和患者因素的严重影响(Scanlon等人,2005年;Beede等人,2020年)。尽管如此,即使是质量较差的图像也能显示出DR的迹象,尤其是在疾病的晚期或老年患者中。
商业化的DR筛查AI工具通常在RIQ被认为不足时需要重复拍摄图像(IDx-DR,2024年;EyeArt,2024年;Retmarker,2024年;SELENA+,2024年)。在这些系统中,未能达到最低质量要求的视网膜图像被归类为不可评分,因此不会进行DR评估。这种分类通常基于固定的、不可定制的决策阈值,并且不会向医院提供连续的RIQ评分。因此,这些工具在低质量图像常见且重拍不总是可行的临床环境中缺乏适应性。这种僵化的设计导致某些DR筛查项目中AI的部署失败(Beede等人,2020年)。此外,缺乏详细的RIQ反馈使得医院无法利用这些信息来推动主动的质量改进工作。例如,跟踪随时间变化的RIQ评分可以帮助识别表现不佳的相机,强调对技术人员进行再培训的必要性,或根据当地实践调整AI的灵敏度——最终提高筛查效果。
NaIA-RD(Pinto等人,2025年)正是考虑到这些要求而设计的。NaIA-RD是由纳瓦拉大学医院(HUN)开发的一种用于内部使用的DR筛查AI工具。它将DR评估与RIQ评估分开,并将详细的评分存储在医院信息系统中。它可以分析所有视网膜图像,而无需重复拍摄。自2020年7月以来一直在使用,生成了一个独特的回顾性数据集,使得这项工作成为可能。
在这项工作中,我们假设模块化的医疗AI工具能够生成详细的图像质量评分,从而支持成像协议的监控,并为医疗保健提供者提供可操作的见解。我们专注于DR筛查来验证这一假设,分析了NaIA-RD生成的回顾性RIQ评分。这些连续评分预计能够反映由潜在数据分布变化引起的图像质量变化。为了增强对观察到的趋势的信心并减少模型特定的偏差,我们将NaIA-RD的RIQ输出与使用公开数据集EyeQ(Fu等人,2019年)和DeepDRiD(Liu等人,2022年)开发的两个独立训练模型的输出进行了比较。所有模型都应用于HUN的同一大型回顾性数据集,从而实现了直接比较。有意避免了使用标准的模型性能指标,因为它们不是数据分布变化的可靠指标(Kore等人,2024年)。
据我们所知,这是第一项在现实世界的糖尿病视网膜病变筛查项目中纵向评估连续RIQ评分的研究,并展示了这种监控如何生成可操作的运营见解。我们的方法新颖之处在于将RIQ从其传统的二元“门卫”角色转变为一个连续评分,作为无监督数据漂移检测的代理。此外,我们探索了一个框架,将质量评分分解为伪影(Artifact)和透明度(Opacity)指标,这可能有助于识别技术人员的培训差距和成像协议问题。这些发现为医疗AI供应商提供了一个战略机会,通过整合所提出的功能来提高产品的实用性,从而使最终用户能够获得可衡量和以实践为导向的好处。
本文的结构如下:第2节介绍相关工作。第3节介绍NaIA-RD和HUN的DR筛查程序。第4节详细介绍了我们用于比较的公共RIQ数据集上训练的模型。第5节概述了我们的回顾性研究设计。第6节展示了我们的研究结果,第7节对其进行了讨论。最后,第8节总结了本文。
章节片段
相关工作
与本研究不同,大多数关于DR筛查AI工具的回顾性和前瞻性研究并没有独立分析RIQ。相反,它们主要关注实际环境中的诊断准确性,使用眼科医生评分的图像作为黄金标准(van der Heijden等人,2018年;Shah等人,2020年;Heydon等人,2021年;Raumviboonsuk等人,2019年)。这些研究包括被专家分类为不可评分的图像,但分析通常仅限于二元分类
NaIA-RD:HUN中的AI辅助DR筛查
HUN的DR筛查项目始于2015年,是一项公共卫生服务(Pinto等人,2025年)。其协议要求每年对所有被分配到该医院的2型糖尿病患者进行视网膜成像和筛查,每年大约涉及8000名患者。
HUN的筛查项目在五个成像站点进行:Altsasu、Doneztebe、Pamplona、Sangüesa和Tafalla(出于隐私原因,我们将对这些站点进行匿名处理)。图像使用两种相机模型捕获:Topcon TRC-NW400和Visucam Pro NM。
在公共数据集上训练的RIQ模型
为了评估NaIA-RD产生的RIQ数据分布,我们使用了EyeQ(Fu等人,2019年)和DeepDRiD(Liu等人,2022年)数据集(两者均根据Creative Commons许可)训练了两个最先进的RIQ模型。由于公共RIQ数据集的有限可用性(Lin等人,2020年),进一步的比较受到了限制。
回顾性研究设计
对于我们的分析,我们使用了自NaIA-RD部署以来(2020年6月–2024年2月)HUN筛查项目的所有匿名视网膜成像研究和临床记录。NaIA-RD在每项研究中独立地对每位患者的眼睛进行了DR和RIQ的评分,并将其建议提交给全科医生进行一级筛查决策。
这导致了一个包含55,801张视网膜图像的回顾性数据集,来自15,400名患者,共27,922项研究。对于每项研究,我们收集了以下数据:
结果
相关性分析。图2显示了一个皮尔逊相关矩阵,探讨了患者年龄、DR、RIQ和筛查决策之间的关系。主要发现包括:(1)三个RIQ模型高度相关,表明评估结果一致;(2)转诊决策更多地受到图像质量(RIQ评分)的影响,而不是疾病存在(DR评分),特别是对于NaIA-RD;(3)患者年龄与NaIA NG、EyeQ拒绝和DeepDRiD透明度评分有中等程度的相关性
讨论
我们的分析使用了55,801张视网膜图像的数据集——据我们所知,这是文献中最大的回顾性RIQ数据集。这个数据集使我们能够全面监测NaIA-RD(HUN的AI工具),并将其与其他两个RIQ模型EyeQ和DeepDRiD进行比较。我们严格训练了这些神经网络,达到了相应数据集作者报告的测试集指标或更高的指标。据我们所知,这是首次在DR筛查中
结论
我们的结果表明,AI模型可以高性能地评估RIQ,并可以有效地用于回顾性RIQ监控。在HUN的AI辅助DR筛查项目中应用这一分析,得出了可以直接应用于改进成像协议的可行见解。这些发现突显了RIQ监控在优化临床工作流程和潜在提高筛查效果方面的实际价值。
我们的方法依赖于比较
CRediT作者贡献声明
伊马诺尔·平托(Imanol Pinto):撰写——原始草稿,软件开发,调查,形式分析,数据管理,概念化。阿尔瓦罗·奥拉扎兰(álvaro Olazarán):撰写——审阅与编辑,软件开发,调查,形式分析,数据管理,概念化。大卫·胡里奥(David Jurio):撰写——审阅与编辑,软件开发,调查,形式分析,数据管理,概念化。博尔哈·德拉奥萨(Borja de la Osa):撰写——审阅与编辑,调查,形式分析,概念化。米格尔·桑兹(Miguel Sainz):撰写——审阅与编辑。阿里茨(Aritz)
伦理声明
所有临床记录和DICOM研究在使用前均已匿名处理,且任何时候都没有访问个别患者的临床历史。因此,不需要个别患者的同意。该研究得到了纳瓦拉卫生服务局–Osasunbidea(SNS-O)的批准和机构同意。
利益冲突声明
作者声明以下可能被视为潜在利益冲突的财务利益/个人关系:伊马诺尔·平托报告称获得了纳瓦拉政府的财政支持。阿尔瓦罗·奥拉扎兰、大卫·胡里奥、博尔哈·德拉奥萨、米格尔·桑兹、阿里茨·奥斯科兹、赫罗尼莫·巴拉兹、哈维尔·戈里乔报告称获得了纳瓦拉政府的财政支持。伊马诺尔·平托报告与纳瓦拉政府存在包括就业关系。阿尔瓦罗·奥拉扎兰、大卫·胡里奥