《Japanese Journal of Ophthalmology》:Genome-wide association study for refractive error imputed from fundus images via deep learning: a proof-of-concept study
编辑推荐:
**摘要**
**目的**:评估深度学习从眼底照片预测的表型能否作为全基因组关联研究(Genome-Wide Association Study, GWAS)的替代表型,以等效球镜(Spherical Equivalent, SE)作为模型性状。研究人员评估
**摘要**
**目的**:评估深度学习从眼底照片预测的表型能否作为全基因组关联研究(Genome-Wide Association Study, GWAS)的替代表型,以等效球镜(Spherical Equivalent, SE)作为模型性状。研究人员评估了由实测值与人工智能(Artificial Intelligence, AI)填补值分别推导的遗传关联之间的一致性。
**研究设计**:基于人群队列的横断面分析,整合深度学习预测与遗传关联分析。
**方法**:本研究纳入长滨研究(Nagahama Study)的9850名参与者。研究人员对Swin Transformer模型进行微调,使其能够从眼底照片预测等效球镜。模型训练在无基因型数据且未接受白内障手术的参与者中进行。随后将训练好的模型应用于其余参与者,生成AI填补的等效球镜值。分别对实测等效球镜和AI填补等效球镜进行GWAS。通过显著单核苷酸多态性(Single-Nucleotide Polymorphism, SNP)的重叠情况以及效应量估计值的相关性来评估GWAS结果间的一致性。
**结果**:该模型在独立测试集上取得平均绝对误差(Mean Absolute Error, MAE)为0.78屈光度(Diopter, D),皮尔逊相关系数(Pearson's correlation coefficient, r)为0.92。基于AI填补等效球镜的GWAS捕捉到了实测等效球镜GWAS中识别的所有全基因组显著SNP。跨全基因组范围内,由AI填补GWAS得到的效应量估计值与实测GWAS高度一致(r = 0.96)。
**结论**:从眼底图像经深度学习填补的等效球镜可作为遗传发现中可靠的替代表型。该方法能够为难以获取或获取成本高昂的表型开展大规模且成本高效的GWAS。
**论文解读:基于深度学习眼底图像推算等效球镜的全基因组关联研究——概念验证**
**一、研究背景与问题**
全基因组关联研究(Genome-Wide Association Study, GWAS)已成功揭示大量与复杂性状和疾病相关的遗传变异。然而,传统GWAS依赖于大规模、表型刻画详尽的队列,数据收集往往需要大量精力和资源。对于罕见或难以测量的表型,由于数据可得性有限,开展GWAS仍面临挑战。为此,研究人员探索了使用替代或代理表型来扩展GWAS适用性的策略。例如,利用自我报告的首次戴镜年龄作为近视的替代标志物,已能产生具有生物学意义的结果。近年来,深度学习技术的进展表明,包括年龄、性别、吸烟状况、心血管疾病风险、高血压、血常规指标、慢性肾脏病、糖尿病乃至阿尔茨海默病或帕金森病等神经退行性疾病在内的多种表型,均可直接从视网膜眼底照片中推断出来。由此催生了“眼组学”(Oculomics)这一新兴领域,系统探索从眼部检查(包括眼底成像)中提取全身健康信息。这些进展提示,AI预测的表型可能成为遗传学研究中有价值的替代表型。本研究以此为基础,提出概念验证方法,评估AI填补的替代标志物在GWAS中的可用性,具体以等效球镜为模型性状,探讨从眼底图像预测的等效球镜能否作为等效球镜的替代性状用于GWAS。
**二、研究内容与结论**
研究人员利用长滨研究中9850名参与者的眼底图像、等效球镜测量值及DNA样本,微调Swin Transformer模型以从眼底图像预测等效球镜。模型在无基因型数据且未行白内障手术的参与者中训练,随后应用于其余参与者生成AI填补的等效球镜值,并分别对实测与AI填补等效球镜进行GWAS。结果显示,AI填补等效球镜GWAS能捕获实测等效球镜GWAS中所有全基因组显著SNP,且两者效应量在全基因组范围内高度一致(r = 0.96)。该研究证明,深度学习从眼底图像填补的等效球镜可作为遗传发现的可靠替代表型,为难以直接测量或测量成本高昂的表型开展大规模、低成本的GWAS提供了可行途径,有望扩展现有生物库资源在遗传发现中的适用范围。
**三、关键技术方法**
本研究基于日本长滨社区队列,纳入9850名参与者,其中9392人具备等效球镜、晶状体状态及眼底图像数据,最终GWAS分析包含5156名参与者。研究人员采用在ImageNet上预训练的Swin Transformer(swin_base_patch4_window12_384),将其分类头替换为单单元回归头,以连续值输出等效球镜。训练数据为无基因型数据的晶状体眼(A组),测试集包括有基因型数据的晶状体眼(B组)及有/无基因型数据的假晶状体眼(C、D组)。GWAS使用线性回归模型,调整年龄、性别及前三个主成分;采用LD分数回归(LD Score Regression, LDSC)评估基因组膨胀;连锁不平衡(Linkage Disequilibrium, LD)分析筛选独立SNP;并以BOLT-LMM进行敏感性分析以校正隐亲缘关系和人群分层。
**四、研究结果**
**参与者特征**:研究共纳入9392名有等效球镜、晶状体状态及眼底图像数据的参与者。A组4208名无基因组数据的晶状体眼个体用于模型微调,随机分为训练集(n = 3366)和验证集(n = 842);B组4672名晶状体眼个体作为主要测试集;另有190名无基因组数据的假晶状体眼个体(C组)和322名有基因组数据的假晶状体眼个体(D组)用于泛化性评估。女性比例整体多于男性,A组平均年龄最低(约50多岁),假晶状体组(C、D组)平均年龄最高(约70岁)。A组平均等效球镜更偏近视(约?1.7 D),测试集B、C、D组近视程度较低,晶状体眼平均约?1.3 D,假晶状体眼约?1.0至?1.4 D。
**等效球镜预测模型的微调与测试性能**:模型在验证集上MAE为0.70 D,Pearson r为0.94(95% CI 0.93–0.95)。在晶状体眼测试集(B组,n = 4672)上,MAE为0.75 D,r为0.94(95% CI 0.93–0.94)。九次独立训练运行显示模型预测性能稳定,MAE为0.78 ± 0.09 D,r为0.94 ± 0.008。在假晶状体眼测试集(C、D组,n = 512)上,模型精度降低,MAE为1.07 D,r为0.72(95% CI 0.67–0.76)。在模拟真实临床场景的合并数据集(B、C、D组,n = 5184)中,模型MAE为0.78 D,r为0.92(95% CI 0.92–0.93)。分层分析显示,在晶状体眼中,轻度、中度和高度近视组的MAE分别为0.68 D、0.82 D和1.26 D。
**实测与AI填补等效球镜的全基因组关联信号**:三种GWAS场景(实测等效球镜B组、AI填补等效球镜B组、AI填补等效球镜B+D组)均仅在15号染色体LINC02252–GJD2位点达到全基因组显著水平(P < 5.0 × 10
?8)。实测等效球镜GWAS检出9个SNP超出显著阈值,AI填补等效球镜在晶状体眼中检出14个,在晶状体眼与假晶状体眼合并分析中检出17个。值得注意的是,实测等效球镜GWAS中识别的所有SNP均包含在AI填补等效球镜分析检出的集合内。基因组膨胀因子λGC范围为1.064至1.074,LDSC截距为1.040(标准误0.0083)至1.054(标准误0.0085),比值统计量为0.63至0.72,提示存在轻度膨胀,可能反映隐亲缘关系或人群分层。使用BOLT-LMM且以基因分型阵列类型作为协变量的敏感性分析得到了与原始分析一致的结果,λGC降至1.039–1.045。
**已知屈光不正SNP效应量在实测与AI填补等效球镜间的一致性**:共299个既往报道的屈光不正相关独立性SNP用于效应量一致性分析。实测等效球镜与AI填补等效球镜(晶状体眼)的SNP效应量(β)相关性为r = 0.96(95% CI 0.95–0.97);实测等效球镜与AI填补等效球镜(晶状体眼+假晶状体眼)的效应量相关性为r = 0.93(95% CI 0.92–0.95)。LINC02252–GJD2位点最显著SNP rs524952在实测分析中β = ?0.327(P = 1.14 × 10
?8),在AI填补分析中β = ?0.327(P = 4.76 × 10
?9)。
**五、讨论与结论**
本研究建立了AI填补的眼科测量值可作为遗传研究替代表型的概念验证。GWAS基于AI填补等效球镜得到的关联信号与实测等效球镜高度一致,包括在LINC02252–GJD2这一已被充分验证的屈光不正易感位点。GJD2编码 connexin-36,一种参与视网膜神经元信号的间隙连接蛋白,是轴长增加和近视屈光最公认的易感基因之一。与既往研究相比,本模型预测精度与文献报道一致。在高度近视和假晶状体眼亚组中预测精度较低,研究人员认为这与数据结构和眼部生理学相符:高度近视MAE较高是其屈光值范围更宽的直接结果;假晶状体眼因模型在晶状体眼上训练,可能估算的是原始眼结构而非术后状态,从遗传学角度看可能更直接地反映基础生物学结构。研究人员观察到AI预测GWAS在主要位点检出的显著SNP数量多于实测等效球镜GWAS,推测AI模型可能通过减轻临床测量噪声(如调节波动)捕获了屈光不正的稳定结构成分,提示具有改善遗传关联研究信噪比的潜力,但未经正式功效计算验证,应视为假设。替代表型的概念在遗传学中已有先例,如自我报告首次戴镜年龄、教育程度作为认知功能的代理指标、父母寿命作为长寿的替代指标等。本框架同样适用于其他图像衍生表型,如视网膜年龄差(Retinal Age Gap, RAG)和脑年龄差(Brain Age Gap, BAG)的GWAS已识别出与衰老相关变异的遗传位点。在眼科学中,脉络膜厚度、黄斑无血管区等临床重要但难以测量的表型有望通过该框架获得遗传发现。研究局限性包括:模型预测性能可能未达理论最大值;GPU加速环境下位级可重复性无法完全保证;初始GWAS存在轻度基因组膨胀,但BOLT-LMM敏感性分析支持结果稳健性;LDSC分析样本量相对有限,其指标需谨慎解读。总之,这项概念验证研究表明,来自眼底图像的AI衍生表型可作为GWAS的可靠替代性状,利用现有生物库资源生成高质量、可扩展的表型,有望扩展遗传发现的范围,不仅限于眼科学,也可惠及医学多个领域。