《Ophthalmology Science》:Machine Learning Prediction of Strabismus With and Without Amblyopia from Fixation Eye Movements
编辑推荐:
目的(Objective):评估经注视性眼球运动(Fixation Eye Movement, FEM)特征训练的机器学习(Machine Learning, ML)模型能否区分斜视性弱视(strabismic amblyopia)、不伴弱视的斜视(strab
目的(Objective):评估经注视性眼球运动(Fixation Eye Movement, FEM)特征训练的机器学习(Machine Learning, ML)模型能否区分斜视性弱视(strabismic amblyopia)、不伴弱视的斜视(strabismus without amblyopia)及视力正常对照者(visually normal controls)。
设计(Design):横断面研究(cross-sectional study)。
受试者(Participants):共纳入159例受试者,均来自克利夫兰诊所(Cleveland Clinic)单中心——中度/重度斜视性弱视49例,治疗后/轻度斜视性弱视24例,不伴弱视的斜视47例,对照39例。
方法(Methods):记录单眼注视下的水平与垂直眼位轨迹(双眼分别行优势眼注视[fellow-eye viewing, FEV]与弱视眼注视[amblyopic-eye viewing, AEV],或右/左眼注视[right-/left-eye viewing, REV/LEV])。采用基于密度的空间聚类扫描(DBSCAN)计算注视与聚散不稳定性(vergence instability)、快/慢相FEM振幅与速度、快FEM频率及基于时间的眼偏斜控制指标(time-based eye deviation control metrics)。特征分为单眼特征、视内两眼间(inter-ocular within-viewing,非注视眼vs注视眼)、视间两眼间(inter-ocular across-viewing,比较FEV与AEV或REV与LEV中注视眼)及双眼协调特征(聚散不稳定性与眼偏斜度量)。采用多种ML模型评估六组二分类任务,并用Shapley Additive exPlanations(SHAP)识别最具预测性的特征。
主要结局指标(Main Outcome Measures):各分类任务的准确率(Accuracy)、受试者工作特征曲线下面积(Area Under the Receiver Operating Characteristic Curve, AUROC)及SHAP衍生的特征重要性(feature importance)。
结果(Results):中重度疾病的区分效能最强——弱视vs斜视:准确率0.81±0.09,AUROC 0.85±0.09;斜视vs对照:准确率0.90±0.07,AUROC 0.92±0.07;弱视vs对照:准确率0.90±0.07,AUROC 0.97±0.03。治疗后/轻度弱视vs斜视性能降低(准确率0.70±0.12,AUROC 0.60±0.19),但治疗后/轻度弱视vs对照仍较好(准确率0.94±0.06,AUROC 0.87±0.13)。所有弱视与斜视合并vs对照:准确率0.89±0.05,AUROC 0.93±0.04。SHAP分析显示,弱视的最强预测因子为弱视眼注视相对于优势眼注视的异常;不伴弱视的斜视及伴弱视斜视vs对照的最佳预测因子为非注视眼FEM指标及双眼协调特征。
结论(Conclusions):本概念验证研究证明,FEM衍生特征联合ML可客观区分斜视性弱视、不伴弱视的斜视及正常对照,中重度病例区分效能最佳。未来将拓展至更年幼人群并结合便携式眼动追踪设备以实现可扩展的床旁筛查(point-of-care screening)。
论文解读:《Machine Learning Prediction of Strabismus With and Without Amblyopia From Fixation Eye Movements》发表于《Ophthalmology Science》
一、研究背景与立项依据
人工智能(Artificial Intelligence, AI)在成人眼科如糖尿病视网膜病变、青光眼及黄斑变性筛查中已取得较高准确率,但小儿眼科中尤其对常见且影响预后的斜视(strabismus)与弱视(amblyopia)的客观诊断手段仍十分有限。斜视因眼位偏斜破坏正常双眼视可能引发弱视——即关键期内单眼最佳矫正视力下降且无器质性病变;若未及时干预可致永久性视功能损害。目前临床依赖视力表(低龄儿童配合差)、偏好注视检查(检查者主观性强、重测信度低),难以客观区分"单纯斜视不伴弱视"与"斜视合并弱视",而这一鉴别直接关系到治疗方案(遮盖疗法/手术时机等)。已有研究表明注视性眼球运动(Fixation Eye Movement, FEM)——包括微小扫视(microsaccade/fixational saccade)与慢相漂移(slow drift)——在弱视及斜视中存在特征性改变(如注视不稳定性fixation instability增加、两眼间不对称性),但尚未有用FEM衍生特征结合机器学习(Machine Learning, ML)区分上述两类疾病的研究。本研究由Kevin Xu、Archayeeta Rakshit与Fatema Ghasia(Case Western Reserve University School of Medicine)开展,旨在概念验证FEM特征联合ML能否客观鉴别中重度斜视性弱视、不伴弱视的斜视及正常对照,为未来床旁筛查奠基。
二、主要关键技术方法
研究人员回顾性纳入克利夫兰诊所伦理审批通过的159例受试者:中度/重度斜视性弱视(n=49)、治疗后/轻度斜视性弱视(n=24)、不伴弱视的斜视(n=47)、视力正常对照(n=39)。使用EyeLink 1000 Plus眼动仪记录单眼45秒注视白点靶标时的水平/垂直双眼位置信号(弱视组行FEV与AEV,其他组行REV与LEV),非注视眼以红外滤光片遮挡但仍追踪。预处理去除眨眼伪迹,微分求速度并Savitzky–Golay滤波降噪;计算双变量轮廓椭圆面积(Bivariate Contour Ellipse Area, BCEA,含68%注视点,k=2.291,BCEA=2kπσxσy√(1?ρ2))量化注视不稳定性,取log10正态化;用Engbert–Kliegl算法检测微扫视与快相,定义慢相漂移区间;采用基于密度的空间聚类(Density-Based Spatial Clustering of Applications with Noise, DBSCAN)分析瞬间两眼水平/垂直偏差合成复合偏差,划分"对齐良好(±3.5°水平/±2.0°垂直)"与"偏斜(misaligned)"簇,导出"良好对齐时间占比(% time well aligned)"与"时间加权平均偏斜(time-weighted mean deviation)"。初筛128维特征经Pearson相关(r>0.85去高共线)、ANOVA(p<0.05)降维,RobustScaler标准化后75%/25%切分训练测试集。五类ML模型——Logistic Regression(LR)、Random Forest(RF)、Gaussian Na?ve Bayes(GNB)、Multilayer Perceptron(MLP)、Support Vector Machine(SVM)——以GridSearchCV五折交叉验证调参,以AUROC与F1分数选最优模型,1000次Bootstrap估计标准差;SHAP(SHapley Additive exPlanations)解析特征贡献。
三、研究结果
受试者人口学特征
四组年龄(斜视组16±13岁vs对照14±11岁,p=0.49)与性别(p=0.27)无差异,种族分布无差异(p=0.14)。斜视性弱视中以内斜视(esotropia,51例)与外斜视(exotropia,22例)为主;不伴弱视斜视中亦含内外斜视(外斜28例/内斜19例),两组斜视类型分布差异显著(p<0.001),不伴弱视组间歇性外斜比例更高。对照允许生理性隐斜(近距2–4?外隐斜)。
Classification Task 1:中度/重度斜视性弱视 vs 不伴弱视的斜视
筛选14个特征(单眼4个、视内两眼间比率3个、视间两眼间比率7个)。Random Forest最优:准确率0.81±0.09,灵敏度0.88±0.12,特异度0.77±0.12,F10.77±0.12,AUROC 0.85±0.09,AUPRC 0.77±0.14。SHAP显示最重要特征为视间两眼间注视不稳定性比率(弱视眼AEV与优势眼FEV之BCEA比),反映弱视眼较优势眼注视稳定性恶化,伴快FEM振幅增大与微扫视(<1°)减少、大扫视(>1°)增多,而不伴弱视斜视REW与LEV间此类差异极小。
Classification Task 2:不伴弱视的斜视 vs 对照
筛选33个特征(含双眼协调指标4个)。Random Forest最优:准确率0.90±0.07,灵敏度0.86±0.13,特异度0.92±0.08,F10.85±0.11,AUROC 0.92±0.07,AUPRC 0.92±0.08。SHAP首要预测因子为FEV条件下时间加权平均偏斜及良好对齐时间占比——即非注视眼异常与偏斜幅度是单纯斜视区别于正常者的标志。
Classification Task 3:中度/重度斜视性弱视 vs 对照
筛选29个特征(四类特征均含)。Multi-layer Perceptron(MLP)最优:准确率0.90±0.07,灵敏度0.77±0.14,特异度1.00±0.00,F10.86±0.10,AUROC 0.97±0.03,AUPRC 0.97±0.04。SHAP最重要为慢FEM速度之弱视眼/优势眼比率(FEV条件)及快/慢FEM速度比,体现弱视眼单独视物时慢漂移加速与扫视动力学异常叠加双眼偏斜。
Classification Task 4:治疗后/轻度斜视性弱视 vs 不伴弱视的斜视
仅保留2个特征(视内与视间比率各1)。Logistic Regression最优但效能低:准确率0.70±0.12,灵敏度0.80±0.13,特异度0.52±0.23,F10.75±0.11,AUROC 0.60±0.19,AUPRC 0.72±0.15。表明经治疗或轻度弱视FEM异常轻微,与单纯斜视重叠大,鉴别困难。
Classification Task 5:治疗后/轻度斜视性弱视 vs 对照
筛选27个特征。Gaussian Na?ve Bayes最优:准确率0.94±0.06,灵敏度0.83±0.16,特异度1.00±0.00,F10.90±0.11,AUROC 0.87±0.13,AUPRC 0.90±0.11。SHAP首要为FEV时间加权偏斜与视间注视不稳定性比率,即便轻症仍可通过双眼偏斜及残余两眼不对称区别于正常。
Classification Task 6:所有斜视性弱视+不伴弱视斜视合并 vs 对照(筛查框架)
Logistic Regression最优:准确率0.89±0.05,灵敏度0.96±0.04,特异度0.76±0.13,F10.92±0.04,AUROC 0.93±0.04,AUPRC 0.97±0.02。证明FEM特征可将病理性(异质表型)与正常儿童稳健分离,具筛查可行性。
独立验证集表现
对后续新收集的中重度弱视(6例)、不伴弱视斜视(9例)、对照(2例)用Task1–3最优模型验证,准确率分别为87%、90%、88%,提示模型具一定泛化能力。
四、讨论与结论翻译总结
本研究表明基于FEM特征的ML模型可区分斜视性弱视、不伴弱视的斜视及正常对照,中重度疾病区分最强。SHAP揭示:(1)弱视判别主要靠视间两眼间比率(弱视眼vs优势眼FEM异常);(2)单纯斜视判别靠非注视眼FEM指标与双眼协调/偏斜幅度;(3)视内(IORw)与视间(IORa)两眼间比率通过归一化个体内差异减小年龄/配合度干扰,提升模型稳健性。轻/治疗后弱视vs单纯斜视因FEM重叠鉴别力下降(AUROC~0.60),但与对照仍可区分。局限性含单中心中等样本量、未细分伴发眼球震颤亚组、未涵盖所有斜视亚型、需专用眼动设备;未来需多中心大样本、便携设备验证及多分类模型开发。结论(Conclusions):This proof-of-concept study demonstrates that FEM-derived features combined with ML can objectively distinguish strabismic amblyopia from strabismus and controls, with strongest performance in moderate/severe disease. Future work will extend validation to younger populations and incorporate portable eye-tracking devices to support scalable, point-of-care screening.(本概念验证研究表明,FEM衍生特征联合机器学习可客观区分斜视性弱视、不伴弱视的斜视及正常对照,中重度疾病区分效能最佳。未来工作将拓展至更幼龄人群并整合便携式眼动追踪设备以支持可扩展的床旁筛查。)