基于光学相干断层扫描眼科影像中的人工智能:从自动诊断到个性化疾病监测

《Eye & ENT Research》:Artificial Intelligence in Optical Coherence Tomography-Based Ophthalmic Imaging: From Automated Diagnosis to Personalized Disease Monitoring

【字体: 大 中 小 】 时间:2026年09月25日 来源:Eye & ENT Research

编辑推荐:

  人工智能(AI)越来越多地应用于眼科光学相干断层扫描(OCT),但自动诊断的证据比纵向监测的证据更强。本叙述性综述评估了基于OCT的AI,重点关注疾病监测和进展,尤其是视网膜疾病和青光眼。研究人员检索了2016年至2026年主要生物医学数据库中的文献,并纳入了

  
人工智能(AI)越来越多地应用于眼科光学相干断层扫描(OCT),但自动诊断的证据比纵向监测的证据更强。本叙述性综述评估了基于OCT的AI,重点关注疾病监测和进展,尤其是视网膜疾病和青光眼。研究人员检索了2016年至2026年主要生物医学数据库中的文献,并纳入了45个可验证来源。视网膜OCT模型支持转诊分诊、液体分割和治疗反应预测,而青光眼应用面临特定挑战:视网膜神经纤维层地板效应、不一致的进展定义、参考标准循环性、谱偏倚、高度近视、视盘异常以及设备相关领域偏移。最近的荟萃分析显示青光眼检测具有较高的诊断性能,但进展预测的外部验证仍较少。因此,临床有用的基于OCT的AI应作为临床医生主导的决策支持实施,并明确预期用途、外部验证、校准、部署后监测和生命周期治理。
1 引言

人工智能(AI)已从实验性图像分类转向眼科临床决策支持。光学相干断层扫描(OCT)因其能提供高分辨率结构数据,成为这一转变的核心,广泛应用于转诊分诊、诊断、治疗决策和随访。视网膜OCT研究已证明转诊分类和疾病检测具有临床相关性,而视网膜基础模型提示大规模预训练可能提高跨下游眼科任务的泛化能力。然而,临床转化不仅需要较高的内部准确性。AI试验、诊断准确性研究和预测模型的报告框架日益要求明确预期用途、预先指定的资格标准、透明的参考标准、缺失或不可分级数据的处理、人机交互以及外部验证。这些要求对于基于OCT的疾病监测尤为重要,因为临床问题不仅在于疾病是否存在,还在于随时间的变化究竟代表真实进展、测量噪声、图像质量改变还是设备相关伪影。本综述的独特贡献在于:比较了相对成熟的自动诊断证据与尚不稳固的个性化监测和进展预测证据,并强调了综述中常被低估的方法学问题,包括参考标准循环性、谱偏倚、视网膜神经纤维层(RNFL)地板效应、进展标签异质性、设备相关领域偏移、前节OCT在闭角性疾病中的应用以及软件即医疗设备(SaMD)的生命周期治理。

2 材料与方法

本综述采用叙述性文献回顾方法,以识别OCT眼科影像中AI应用的临床相关证据,重点聚焦监测、进展预测和临床实施。研究人员在PubMed/MEDLINE、Web of Science、Cochrane Library、Google Scholar及出版商平台检索了2016年1月1日至2026年8月5日发表的英文文献,最终检索日期为2026年8月5日。通过高影响力论文、系统综述、荟萃分析、报告指南和监管文件的引文追踪确定额外来源。检索词涵盖人工智能、机器学习、深度学习、OCT、OCTA、视网膜疾病、青光眼、进展、RNFL地板、领域偏移、设备泛化性、联邦学习、软件即医疗设备等组合。初步筛选约220条记录,其中82篇进入全文评估,最终纳入45篇可验证来源。优先纳入同行评审的临床研究、系统综述、荟萃分析、报告指南和官方监管文件,排除预印本、非同行评审会议摘要、重复记录及与OCT眼科影像无关或文献信息不确定的记录。由于旨在提供临床导向的叙述性综合而非正式系统综述,未计算合并效应量,也未准备PRISMA流程图。纳入文献按临床领域、影像模态、AI任务、验证水平、参考标准、实施障碍和潜在临床意义进行叙述性综合。

3 结果

在视网膜疾病领域,OCT-AI提供了最清晰的概念验证。深度学习方法已用于黄斑病变的转诊级别分类、可治疗疾病检测、视网膜内和视网膜下液体的自动分割、抗血管内皮生长因子治疗指征评估、新生血管性年龄相关性黄斑变性(nAMD)转化预测以及未来视力估计。这些任务支持转诊优先级和治疗规划,但与纵向监测存在本质区别:一个分割模型可能在单次访视中准确量化液体,却无法预测治疗间隔的安全延长。糖尿病眼病方面,彩色眼底照相已确立了自主AI筛查路径,而OCT和OCTA补充了关于糖尿病黄斑水肿和黄斑缺血的诊疗信息;近期综述强调需要外部验证、明确的参考标准以及跨设备和跨人群的测试。对于nAMD,治疗反应预测虽有吸引力,但系统综述证据表明研究异质性、有限的前瞻性验证和多变的结局定义限制了即时临床转化。

青光眼领域清楚地展示了监测和进展预测为何比诊断更难。OCT青光眼评估依赖于结构-功能关系,但该关系是非线性且分期依赖的。在晚期青光眼中,环乳头视网膜神经纤维层(cpRNFL)可能接近约30–50μm的测量地板,限制其捕捉进一步损伤的能力,而黄斑神经节细胞-内丛状层(GCIPL)/神经节细胞复合体(GCC)测量对部分患者仍可能有信息价值。Bruch膜开口-最小盘沿宽度(BMO-MRW)提供了解剖学导向的视神经头参数,可能减少倾斜视盘和近视眼中基于RNFL图谱的假阳性分类。然而,监测时仍应结合cpRNFL、GCIPL/GCC、视野和临床检查,因为分割质量、正常数据库和视神经头解剖会影响其可靠性。

荟萃分析证据支持AI应用于OCT青光眼检测具有较高诊断性能,但这不应被视为进展监测就绪的证明。一项2024年针对青光眼检测的荟萃分析纳入了20项研究和51个模型,合并敏感度为0.91(95% CI = 0.86–0.94;I2 = 94.67%),特异度为0.90(95% CI = 0.87–0.92;I2 = 89.24%),曲线下面积(AUC)为0.95(95% CI = 0.93–0.97)。高异质性提示合并表现因人群、设备、标签定义和验证方法而异。另一项更新的荟萃分析显示,OCT诊断青光眼的合并敏感度为0.90(95% CI = 0.84–0.94),特异度为0.87(95% CI = 0.81–0.91),受试者工作特征曲线下面积(AUROC)为0.86(95% CI = 0.83–0.90);外部测试集的性能下降至敏感度0.83、特异度0.80、AUROC 0.80。对于OCT进展预测,合并敏感度较低(0.74,95% CI = 0.51–0.89),特异度为0.93(95% CI = 0.88–0.96),AUROC为0.90(95% CI = 0.84–0.95),且现有证据主要为内部验证。这支持本综述的核心结论:诊断证据比进展监测证据更成熟。

个体研究进一步展示了进展定义对模型输出的决定性影响。一项研究使用黄斑OCT和自监督视觉Transformer检测功能性青光眼进展,将进展定义为五次Humphrey视野检查中平均偏差(MD)变化率≤?0.5 dB/年,快速进展定义为≤?1 dB/年,该模型区分稳定与进展眼的AUC为0.90(95% CI = 0.88–0.91),快速进展检测AUC为0.92(95% CI = 0.91–0.93),未来进展预测AUC为0.85(95% CI = 0.83–0.87)。另一项研究评估了134例开角型青光眼患者202只眼的纵向en-face黄斑OCTA图像,以24-2视野MD率的统计学显著负值为进展定义,模型AUC为0.81(95% CI = 0.59–0.93),敏感度为0.67(95% CI = 0.34–0.78),特异度为0.83(95% CI = 0.42–0.97)。

进展定义并非技术脚注,而是模型输出的决定因素。不同研究可能使用基于事件的视野算法、MD斜率阈值、结构OCT变化、治疗升级或临床判断。阈值如MD斜率≤?0.5 dB/年(进展)和≤?1 dB/年(快速进展)虽直观,但并非通用。基于一种定义训练的模型可能无法转换到另一种临床路径。OCTA、测量地板和黄斑神经节细胞研究进一步表明,结构和血管终点在动态范围、可重复性和疾病分期敏感性方面存在差异。未来研究应使用替代定义进行敏感性分析,并明确预期用途是检测现有进展、预测未来进展还是识别快速进展者。

参考标准循环性是青光眼AI的主要风险。如果模型使用由OCT RNFL、GCC或视神经头参数衍生的标签进行训练,而这些相同OCT信息又是模型输入,那么高性能可能代表标签的复制而非独立疾病检测。当临床医生标签包含被评估的OCT报告时也会出现类似问题。当预期用途是自动化复制基于测量的分类时,循环性问题较小,但当稿件声称疾病诊断、进展检测或临床决策支持时则问题严重。为降低这一风险,研究应说明标签创建方式、OCT信息是否参与参考标准,以及功能、纵向或多模态确认是否独立于AI输入。

谱偏倚同样重要。许多青光眼AI研究将确诊青光眼与健康对照组对比,这会夸大AUROC。真实临床场景涉及可疑眼、临床前期疾病、高度近视、倾斜视盘、视网膜前膜、玻璃体黄斑牵拉和低患病率筛查人群,此时即使在敏感度和特异度看似较高的情况下,阳性预测值也会下降。因此,诊断模型应报告在可疑眼、早期疾病、高度近视、不同严重程度分层和低患病率场景中的表现,而非仅在病例对照数据集中。

OCTA可能通过测量盘周和黄斑血管密度丰富青光眼监测。较低的血管密度与进行性RNFL丢失相关,纵向OCTA模型可能检测到结构厚度未完全捕捉的进展信号。但该潜力需谨慎限定:OCTA血管密度指标易受投影伪影、分层定义和分割错误、运动及散焦伪影、信号强度依赖性、眼轴长度、扫描尺寸、设备软件以及影响眼部灌注的全身或局部因素影响。OCTA相对于已确立的结构参数(如cpRNFL和GCIPL/GCC)的增量价值尚不确定,可能取决于疾病分期、扫描质量、伪影控制以及针对有临床意义进展的外部验证。OCTA应被视为风险分层的补充模态,而非视野、结构OCT和临床评估的替代。

前节OCT(AS-OCT)与闭角性疾病相关,可量化房角解剖和虹膜小梁接触,深度学习方法已用于房角分割、定位和闭角相关解剖分类。然而,AS-OCT解读依赖照明、固视、瞳孔大小、动态房角解剖以及影像发现与房角镜检查的关系。AI可标准化角度测量,但不能取代症状、眼压、视神经状态和治疗选择的更广泛决策背景。

设备相关领域偏移对监测尤为关键,因为进展依赖于比较随时间发生的微小变化。OCT平台在扫描模式、轴向分辨率、分割算法、正常数据库和软件衍生厚度值方面存在差异。跨域学习研究表明,深度学习模型可被训练为跨设备工作,但也证明迁移是一个具体的验证问题而非假设。一项研究提出从视神经头OCT扫描中提取设备无关特征,制造商报告的cpRNFL在CIRRUS和3D OCT-2000之间的组内相关系数(ICC)为0.590(95% CI = ?0.079至0.901),卷积神经网络(CNN)衍生的cpRNFL ICC为0.667(95% CI = ?0.035至0.939),而CNN衍生的MRW跨设备ICC为0.917,表明设备协调虽有所改善但仍不完整,必须明确报告。

多中心数据共享和联邦学习可能在不集中患者数据的情况下提高泛化性。在眼科,联邦学习已在早产儿视网膜病变中通过七个机构的5255张广角视网膜图像得到评估,提供了机构间学习的示例。但联邦学习不能消除对外部验证、亚组报告或治理的需求,因为各中心的患病率、影像方案、疾病严重程度、种族、合并症和治疗阈值可能存在差异。

监管和生命周期考量对个性化监测至关重要。美国食品药品监督管理局(FDA)对IDx-Dr的De Novo授权确立了自主糖尿病视网膜病变检测的先例,但OCT监测工具即使自动化程度较低,在用于临床决策支持时仍属于软件即医疗设备原则范畴。FDA关于AI/ML软件和预定变更控制计划的材料强调预期用途、性能监控、版本控制和算法变更管理,这与OCT监测直接相关,因为设备、软件版本、人群和治疗路径在部署后均会发生变化。

4 讨论

本综述支持对OCT-AI采取谨慎且临床聚焦的解读。视网膜疾病应用为检测、转诊和分割提供了强有力的概念验证,但在监测和进展领域仍存在明显缺口。在青光眼中,诊断与监测的差异十分显著:诊断荟萃分析显示较高的合并性能,而进展预测的外部验证较少,对标签定义更敏感,且更容易受到测量噪声、RNFL地板效应、谱偏倚和参考标准循环性的影响。

关键的方法学和实施障碍包括参考标准循环性、谱偏倚、不一致的进展定义、RNFL地板效应、高度近视和视盘异常、设备相关领域偏移、生命周期漂移以及OCTA伪影和不确定的增量价值。为推进临床转化,提出了一种临床医生主导的AI支持工作流程:图像采集和质量控制后,进行AI分割或分类、风险预测、临床医生审核,最终制定个性化管理计划。该流程强调AI输出应支持而非取代临床判断,并应在部署后监测漂移、偏倚和工作流程安全性。

最有用的未来OCT-AI系统不应仅输出疾病概率,而应明确预期的临床行动:紧急转诊、治疗指征、安全间隔延长、复发风险、快速进展可能性、需要确认性视野检查或需要房角镜检查。每种预期行动都需要不同的参考标准、阈值、可接受的误差谱和验证路径。在病例对照数据集中表现良好的模型,若阳性预测值低,仍可能不适合筛查可疑人群。

监测聚焦的解读也改变了证据报告方式。对于青光眼,研究应报告疾病严重程度、眼轴长度或屈光状态、高度近视的处理方式、视盘异常、BMO-MRW可用性、视网膜前膜、玻璃体黄斑牵拉、视野可靠性、检查次数和间隔、治疗变化以及可获得的眼压史。还应说明OCT衍生特征是否用于创建标签,因为标签循环性可能使OCT模型在临床上显得比实际更强。包含OCTA的模型应进一步报告血管密度特征是否在cpRNFL、GCIPL/GCC和BMO-MRW之外增加了预测价值,而非假设额外影像模态自动改善个性化监测。

对视网膜疾病,同样的逻辑适用于治疗监测。液体分割和活动性检测很重要,但个性化护理需要预测复发、治疗负担、视力结局和安全间隔修改。因此,前瞻性研究应评估AI是否能安全地改变管理并改善患者水平结局,而不仅仅是匹配阅片者或在回顾性图像集上获得高AUROC。

最后,部署应包括校准、不确定性报告、亚组表现、设备和软件版本文档、漂移监测以及更新计划。公平性应被测量而非假定,因为视网膜AI研究常低估社会人口学变量,当工具不适应工作流程或在代表性不足群体中表现不佳时,临床影响可能失败。

5 结论

OCT-AI在支持眼科护理方面具有巨大潜力,但证据不均匀。自动检测和转诊分诊比个性化疾病监测更成熟。在青光眼中,进展预测仍受RNFL地板效应、不一致的进展定义、参考标准循环性、谱偏倚、OCTA变异性和设备相关领域偏移的限制。在视网膜疾病中,监测应用需要证据表明AI能改善治疗决策和患者结局。最安全的近期角色是临床医生主导的决策支持,并明确预期用途、外部验证、透明的参考标准和部署后生命周期治理。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号