基于纵向电子健康记录表格数据的糖尿病视网膜病变年度与双年度筛查间隔预测模型研究

《Ophthalmology Science》:Biennial vs. Annual Screening: Predicting Yearly Progression of Diabetic Retinopathy in a Large Veteran Population from Tabular Data

【字体: 大 中 小 】 时间:2026年09月25日 来源:Ophthalmology Science 5.0

编辑推荐:

  目的:利用机器学习模型,基于表格数据,将糖尿病患者分类为低风险(适合双年度筛查)和高风险(需要年度筛查)类别,预测其在1年和2年内仅发生糖尿病视网膜病变(DR)恶化(不包括糖尿病黄斑水肿(DME)进展)的可能性。 设计:回顾性队列研究。 参与者:来自美国退伍军

  
目的:利用机器学习模型,基于表格数据,将糖尿病患者分类为低风险(适合双年度筛查)和高风险(需要年度筛查)类别,预测其在1年和2年内仅发生糖尿病视网膜病变(DR)恶化(不包括糖尿病黄斑水肿(DME)进展)的可能性。 设计:回顾性队列研究。 参与者:来自美国退伍军人健康管理局技术与眼保健服务(TECS)远程眼科项目的32,542例糖尿病患者的去标识化电子健康记录数据。 方法:评估了八种预测方法,涵盖基于规则的方法、传统机器学习及深度学习架构。 主要结局指标:受试者工作特征曲线下面积(AUROC)、敏感性、特异性、期望校准误差(ECE)和Brier评分,均附95%置信区间。 结果:1年队列纳入16,606例基线无DR的退伍军人,2年队列纳入15,397例。预测模型在两个预测时间范围内均展现出具有临床意义的风险分层能力。深度学习模型(BEHRT)实现了最强的判别性能,1年AUROC为0.91(95% CI 0.85–0.96),2年AUROC为0.84(95% CI 0.76–0.91)。当将敏感性约束在90%以捕获至少十分之九的进展患者时,XGBoost在1年时正确识别了53%的非进展者作为低风险,在2年时为52%,提示超过一半的低风险患者可在不实质性损害真实进展者检出率的前提下,从常规筛查中延期。两个时间范围的良好性能仅通过常规收集的表格变量即可实现,无需视网膜影像。 结论:机器学习模型无需视网膜影像即可有效识别适合双年度筛查间隔的低风险糖尿病患者。这些模型还可能有助于优先安排尚未接受筛查的患者,因为糖尿病视网膜病变常常未被诊断。总体而言,研究结果支持将相当比例的低风险患者转为双年度筛查的可行性,有望在高负担医疗系统中减少不必要的检查并优化资源配置,同时不损害临床显著疾病进展的检出。
糖尿病视网膜病变(DR)筛查间隔的个体化决策是当前糖尿病眼部并发症管理中的重要议题。研究背景方面,DR作为糖尿病(DM)的主要微血管并发症,是全球可预防性不可逆视力丧失的首要原因之一。2025年国际糖尿病联盟糖尿病地图集估计,全球20-79岁成年人中有11.1%(约每9人中1人)患有糖尿病,其中超过40%未意识到自身诊断。在糖尿病患者中,约三分之一终生将发生DR。为降低未检出进展的风险,美国眼科学会目前推荐成人糖尿病患者接受年度散瞳眼底筛查。然而,该推荐的依从性并不理想,2019年美国仅64.8%的成人糖尿病患者报告在过去12个月内接受过眼部检查,至2023年仅微增至66.0%。在退伍军人健康管理局(VA)等大型医疗系统中,年度普遍筛查还面临额外挑战:患者年龄较大、合并症负担更高,且需战略性配置设备和人员以应对资源密集型的年度检查。流行病学证据表明,DR进展风险并非很高,且从无视网膜病变或轻度视网膜病变起步时风险最低。一项近期大型回顾性队列研究报告,轻度NPDR和中度NPDR进展为重度非增殖性DR(NPDR)或增殖性DR(PDR)的5年概率分别为5.8%和17.6%,对应约三倍的风险差异。这提示许多正常或轻度视网膜病变患者可安全地延长筛查间隔至每两年一次,而高风险患者可能受益于更频繁的监测。尽管对个体化筛查计划兴趣渐增,指南仍继续推荐统一的年度筛查,主要原因在于缺乏经过验证的工具来准确预测较长时间范围(尤其是2年间隔)内的进展风险。既往预测DR模式的研究使用人口统计学和实验室变量及传统机器学习方法,如逻辑回归、随机森林和梯度提升,获得中等预测性能。早期的深度学习方法如长短期记忆(LSTM)模型可利用随时间收集的患者数据,但可能难以捕捉长期模式。较新的Transformer模型(如BEHRT和Hi-BEHRT)能更好地学习患者医疗历史和不同类型临床数据之间的复杂关系,从而提升预测性能,但通常需要大量数据才能有效运作。现有基于影像的预测方法仅实现中等判别能力(AUROC约0.79),且未能纳入强烈影响DR演变的系统性临床因素。因此,研究人员在VA远程眼科项目筛查的大型糖尿病患者队列中,应用传统和深度机器学习模型(包括时间序列模型),预测1年和2年时间范围的DR进展,以识别可安全纳入延长双年度筛查计划的低风险患者。
研究人员利用VA远程眼科项目2009年1月1日至2023年12月31日期间美国退伍军人的纵向数据开展回顾性队列研究。源人群包括18岁及以上、首次眼科就诊前有记录的1型或2型糖尿病诊断的退伍军人。患者纳入标准为基线时无DR或不超过轻度NPDR,且至少两次眼科筛查。研究构建了两个分析子集:1年间隔队列(N=16,606,要求锚点访视与下一次视网膜检查间隔≥11个月)和2年间隔队列(N=15,397,要求间隔≥23个月)。锚点访视定义为预测窗口起始的索引眼科访视。每个观测包含访视日期、DR严重程度分级及一系列已知影响DR进展的临床特征:静态人口统计学特征(年龄、性别、种族、出生性别)和跨访视收集的时间性临床测量值,包括糖化血红蛋白(HbA1C)、血清肌酐、微量白蛋白尿、低密度脂蛋白(LDL)、估算肾小球滤过率(eGFR)、身高、体重、收缩压和舒张压、平均动脉压及体质指数(BMI)。DR严重程度分为5级:无或轻度NPDR、中度NPDR、重度NPDR和增殖性DR,二元目标变量定义为0(无或轻度DR)和1(中度、重度或增殖性DR)。研究人员评估了八种预测方法:基于规则的基线方法包括视网膜病变风险评分(RRS,源自血糖控制HbA1C和糖尿病病程)和末次访视携带向前(LVCF)方法;传统机器学习模型包括随机森林(RF)、支持向量机(SVM)、XGBoost和CatBoost,均使用网格搜索确定最佳超参数;深度学习方法包括时间长短期记忆网络(T-LSTM)和BEHRT(一种改编自医疗保健双向编码器表示Transformer的架构)。针对序列模型采用两阶段训练策略:先在完整队列上用掩码语言建模进行预训练,再以1:1匹配的正负样本进行微调。模型性能在患者层面划分的保留测试集上评估,判别能力以AUROC、敏感性和特异性衡量,校准性能以期望校准误差(ECE)和Brier评分评估。数据使用Python 3.11.5在NVIDIA RTX Pro 6000 Blackwell 96GB工作站上分析。

1年间隔队列

在1年预测时间范围,所有模型均表现出中等到强判别能力,BEHRT实现最高AUROC(0.91;95% CI,0.85–0.96),其次为XGBoost(0.74;95% CI,0.68–0.80)和RF(0.71;95% CI,0.64–0.78)。从预防保健角度,高敏感性下的性能更具临床相关性,因为漏检真实进展者的风险高于不必要筛查低风险患者。在固定敏感性90%时,XGBoost在评估模型中实现最高特异性(0.53;95% CI,0.27–0.60),表明超过一半的非进展患者可在保持高真实进展者检出率的同时从年度筛查中延期。

2年间隔队列

在2年预测时间范围,各模型判别能力保持稳健,BEHRT的AUROC为0.84(95% CI,0.76–0.91),其次为XGBoost(0.75;95% CI,0.67–0.81)和RF(0.74;95% CI,0.67–0.80)。重要的是,在固定敏感性90%评估时,XGBoost保持了可比的特异性0.52(95% CI,0.08–0.68),与1年队列的表现密切对应。两个时间范围在高敏感性下特异性的一致性表明,将低风险患者的筛查间隔延长至两年可能是可行的,而不会实质性增加漏检疾病进展的可能性。校准结果显示,BEHRT在两个预测时间范围均实现最强整体校准,ECE为0.01,Brier评分为0.02,表明其风险估计密切且一致地追踪观察到的进展率。SVM和LVCF表现相当,1年时均实现ECE 0.02和Brier评分0.02,SVM在2年时进一步改善至ECE 0.00。相比之下,树模型(RF、XGBoost)和T-LSTM的校准明显较差,ECE值范围为0.30至0.95,限制了其概率输出的直接临床可解释性,需额外的事后重校准。
讨论部分指出,时间序列模型尤其是BEHRT在判别和校准两方面均优于所有表格和基于规则的基线。与近期基于影像的深度学习方法比较确认,仅使用结构化电子健康记录(EHR)数据训练的模型在近期和中期预测窗口均具有竞争力:1年时间范围BEHRT(AUROC 0.91)优于使用7视野眼底照相的DCNN+随机森林方法(12个月AUROC 0.79±0.05)和基于EyePACS的深度学习模型(≤15个月AUROC 0.73;95% CI,0.68–0.78);2年时间范围BEHRT(AUROC 0.84)同样优于眼底DCNN在25–36个月的结果(AUROC 0.69;95% CI,0.63–0.74),并与其24个月结果(AUROC 0.77±0.04)相当。Transformer架构专门设计用于学习患者整个医疗历史中的复杂关系,包括不规则访视间隔和共同变化的临床趋势。操作点分析表明,相当比例的低风险患者可安全转为双年度筛查,支持在高负担医疗系统中实现更高效的资源配置。对于VA这类美国最大的一体化医疗系统,即使适度减少不必要的检查也能转化为可观的操作节约,且不损害患者安全。该模型还可能用于确定哪些糖尿病患者应接受视网膜病变筛查,因为超过75%经照相证实的DR患者未意识到自身诊断,超过25%的糖尿病住院患者存在此前未诊断的DR。研究局限性包括:队列来自以老年男性为主的VA人群,可能限制对更多样化患者群体(包括女性和西班牙裔/拉丁裔患者)的普适性;约四分之一的原始队列因记录不完整、随访不足或糖尿病诊断时间线无效而被排除,这些排除可能并非随机发生;测试集规模相对较小,导致某些操作点估计的置信区间较宽;DR进展队列固有的类别不平衡构成训练挑战;2年时间范围性能较1年下降与更长范围预后预测的固有难度一致;未考虑糖尿病黄斑水肿(DME)进展。结论指出,使用常规收集的EHR数据而非对所有患者进行年度筛查的风险导向DR筛查方法是可行的,可改善有限资源的分配,优先高风险患者,同时减少低风险患者的不必要检查。但该模型仅用于指导DR筛查间隔,部分患者仍可能因家族史、系统性合并症、人口统计学风险因素或其他临床指征而需要定期眼科检查。在临床判断辅助下,该模型有助于将有限资源导向最可能受益于更频繁评估的患者。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号