《Current Issues in Molecular Biology》:Integration of Machine Learning-Based Pathogenicity Prediction and Phenotype Matching Improves Variant Prioritization in Rare Clinical Testing
编辑推荐:
基因组测序与外显子组测序已成为罕见遗传性疾病诊断的核心手段,但每次检测均会返回数以千计的变异,临床科学家必须人工逐一审阅,才能找出导致患者病情的责任变异。此类人工解读是临床基因组学中的主要瓶颈。为降低这一负担,研究人员开发了 DiagAI,这是一种机器学习系统
基因组测序与外显子组测序已成为罕见遗传性疾病诊断的核心手段,但每次检测均会返回数以千计的变异,临床科学家必须人工逐一审阅,才能找出导致患者病情的责任变异。此类人工解读是临床基因组学中的主要瓶颈。为降低这一负担,研究人员开发了 DiagAI,这是一种机器学习系统,可对患者检出的变异进行排序,并返回最可能致病的候选短名单。DiagAI 整合了三类证据来源:其一,来自 Universal Pathogenicity Predictor(UP2)的致病性评分;UP2 是研究人员训练的模型,用于在 American College of Medical Genetics and Genomics(ACMG)五级分类体系上评估变异的损害程度。其二,来自 PhenoGenius 的表型匹配评分;该工具衡量某基因已知临床特征与患者症状之间的匹配程度,患者症状以 Human Phenotype Ontology(HPO)术语编码。其三,涵盖遗传模式与测序质量的专家规则。研究人员在 966 例因病因未明肾脏疾病而接受检测的成人外显子组上评估了 DiagAI,其中 196 例具有已确认的遗传学诊断。研究首先单独测试了 UP2:在 62 个未包含于其训练数据中的已确认致病错义变异中,UP2 在 87% 的病例中将责任变异排入前 100 个候选之内,而广泛使用的工具 REVEL 的对应比例为 61%。在全部 196 例已诊断外显子组中,当提供患者症状时,完整的 DiagAI 短名单在 94.9% 的病例中包含责任变异;未提供症状时,该比例为 90.8%;典型短名单约含 10 个变异。提供症状时,排名第 1 的变异在 74% 的病例中即为正确诊断;未提供症状时为 42%;该表现优于同一队列中的既有工具 Exomiser 与 AI-MARRVEL。DiagAI 可生成紧凑且准确的候选短名单,随着诊断性测序工作量持续增长,有望降低人工解读负担。
该研究发表于《Current Issues in Molecular Biology》,围绕罕见遗传病临床检测中的变异解释瓶颈,提出并验证了一个名为 DiagAI 的智能化变异优先级排序框架。研究背景在于,外显子组测序(ES)与全基因组测序(WGS)虽已成为遗传病分子诊断的重要工具,但高通量测序一次通常会检出海量候选变异,临床人员需依照 American College of Medical Genetics and Genomics(ACMG,美国医学遗传学与基因组学学会)标准进行人工判读。尤其是意义未明变异(VUS,临床意义未明变异)广泛存在,而现有预测算法与证据积累仍不充分,导致人工解释成为临床基因组学的主要瓶颈。因此,开发能够联合分子致病性、临床表型和遗传模式信息的自动化排序工具,具有明显现实必要性。
研究人员提出的 DiagAI 旨在模拟临床科学家的顺序推理过程,对患者样本中的变异进行打分、筛选与排序,最终形成一个适于人工复核的紧凑短名单。该系统并非单一分数模型,而是由两层结构组成。第一层为 Universal Pathogenicity Predictor(UP2,通用致病性预测器),用于从分子层面判断变异的致病可能性;第二层为整合模型,将 UP2 评分、PhenoGenius 表型匹配评分以及与遗传方式和测序质量有关的专家规则共同纳入,生成 0 到 100 的最终排序分值。研究对象为 966 例因病因未明肾病接受外显子组检测的成人,其中 196 例已由遗传学专家确认存在责任变异,可作为阳性病例评估算法性能。
方法上,研究主要采用以下关键技术:首先,对成人不明原因肾病队列(n = 966)开展回顾性外显子组分析;其次,基于 ClinVar 04-2024 构建包含 270 万变异的 UP2 训练集,使用 XGBoost 梯度提升决策树(Gradient Boosting Decision Tree)训练 ACMG 五分类致病性模型,并结合 gnomAD、VEP、dbNSFP、dbscSNV、CI-SpliceAI 等注释;再次,利用独立多中心专有数据集训练 DiagAI 线性回归整合层,将 HPO 编码表型经 PhenoGenius 转化为基因-表型匹配分值,并整合遗传模式、一致性及测序质量信息;最后,在肾病外显子组队列中与 REVEL、CADD、AlphaMissense、Exomiser v13、AI-MARRVEL 等工具比较性能,并用 Shapley 值分析模型可解释性。
研究结果部分可概括如下。
3.1. Comparison Between UP2, CADD, REVEL and AlphaMissense
研究首先独立评估了 DiagAI 的分子组成部分 UP2。为避免信息泄漏,仅选取 62 个未收录于 ClinVar 的责任错义变异进行比较。结果显示,在极短名单场景下,REVEL 对前位排序更有优势,其 top 1 与 top 10 命中率分别为 12.90% 和 32.26%;UP2 的对应比例分别为 0% 和 27.42%。然而在更符合临床筛查需求的较大候选范围中,UP2 表现更优:其将责任变异纳入前 100 位的比例达到 87.10%,显著高于 REVEL 的 61.29%、AlphaMissense 的 19.35% 以及 CADD 的 11.29%。这一结果表明,UP2 在强调敏感性的临床诊断场景中更具实用价值。
3.2. Interpretability of the Classifier
考虑到临床工具不仅要给出高分,还需解释高分来源,研究人员进一步利用 Shapley 值分析 UP2 的可解释性,并将 74 个特征映射至 ACMG 证据条目。对 196 个已诊断外显子组中的 176 个独立责任变异分析后发现:对于 85 个在 ClinVar 中已有提交记录的诊断变异,影响 UP2 预测最显著的是与 ClinVar 致病或良性提交数量相关的特征。对于其中少数变异,PP3/BP4(计算机预测支持致病或良性)、PVS1(预测功能缺失高强度证据)以及 PM2/BA1(群体中缺失或频率极低/频率过高支持良性)等 ACMG 条目具有更大影响。对 91 个未有 ClinVar 提交的诊断变异,66% 主要由 PP3/BP4 相关特征驱动,29% 主要由 PVS1 相关特征驱动。这说明,当外部临床数据库证据缺乏时,模型更依赖计算预测和变异功能后果信息。
3.3. Proportion of Causal Variants Identified in Shortlists
研究随后考察 DiagAI 是否能在显著压缩候选变异数目的同时保留真实责任变异。在 196 例已明确分子诊断的样本中,若纳入 HPO 表型术语,94.9%(186/196)的责任变异进入最终短名单;若不纳入 HPO,仍有 90.8%(176/196)被保留。未使用 HPO 时,短名单中位数为 9 个变异;使用 HPO 时为 12 个变异。研究指出,表型信息的引入虽使短名单略有扩展,但能够挽救部分仅凭分子评分会低于阈值的真实责任变异,因此换来了更高召回率。换言之,名单略长反映的是灵敏度提升,而非排序质量下降。
3.4. Variant Ranking
在更具临床意义的排序层面,研究比较了责任变异是否能够位列最前。结果表明,临床表型信息对排名提升作用显著:在不使用 HPO 术语时,仅有 42% 的病例中 top 1 变异即为诊断变异;引入 HPO 后,该比例提升至 74%。若观察前 20 个基因范围,则未纳入 HPO 时可覆盖 93% 的诊断变异,纳入后增至 97%。与 Exomiser v13 及 AI-MARRVEL 相比,DiagAI 在提供 HPO 时具有更优的基因层级排序表现;在未使用 HPO 时,对于 top 3 及以上候选列表,DiagAI 同样优于这些对照工具。此结果说明,DiagAI 在变异筛选与优先级排序两个层面均表现稳健,尤其受益于分子信息与表型信息的联合建模。
3.5. Causal Variants Absent from the Shortlists
尽管总体性能较高,研究仍分析了漏检病例。在 196 例已诊断样本中,共有 10 次责任变异调用未进入 DiagAI 短名单,涉及 9 个不同变异。其中 4 个在 ClinVar 中曾被标注为良性,2 个被标为 VUS,因此 UP2 受到训练标签限制而给出偏良性分数,且无额外证据足以纠正。另有 1 个 COL4A4 变异在模型训练时仍为 ClinVar 良性,后续才被更新为致病。其余 2 个漏检则源于机制层面的局限:一个 PKD2 复杂插入虽在 UP2 中获得致病分数,但因测序质量过滤被剔除;一个 NPHS2 变异位于隐性基因中,仅以单个杂合状态出现,缺乏可组成复合杂合诊断的第二变异,因此无法被组装为完整致病解释。研究由此强调,训练数据库状态、质量阈值以及复杂致病机制仍是当前算法的限制来源。
讨论部分指出,DiagAI 在成人肾病外显子组场景中展现出较高实用性:无论是否具备表型数据,其短名单均可在绝大多数病例中保留责任变异,并在基因层级排序上优于 Exomiser v13 和 AI-MARRVEL。UP2 相较于 REVEL、CADD、AlphaMissense 的比较则表明,尽管 REVEL 在极短排名中表现较好,但 UP2 在更大候选范围中保持更高敏感度,更契合临床诊断需求。研究人员认为,DiagAI 的优势来源于三个方面:其一,UP2 使用与 ACMG 证据体系关联的广泛特征,并对 ClinVar 冲突标签进行了细致整理;其二,通过数据增强缓解 ClinVar 偏向致病变异所带来的分布偏倚;其三,采用结合机器学习与专家规则的双层架构,从而更贴近临床实践中的综合证据判断。
同时,论文也明确陈述了局限性。首先,尽管 DiagAI 的整合层训练数据覆盖智力障碍、心脏病和肾病等不同疾病领域,但本文验证仅限成人肾病队列,能否推广至儿科、神经发育障碍或心血管专科,仍需前瞻性验证。其次,针对 ClinVar 外责任错义变异的 UP2 基准测试样本仅 62 个,置信区间相对较宽。再次,当前 DiagAI 仅优先级排序单核苷酸变异(SNVs)和短插入缺失(indels,<300 bp),尚未纳入结构变异。尽管上游 GermlineVar 流水线可检测结构变异,但其优先级排序仍有待扩展。研究还指出,即便算法能够显著减轻人工负担,自动检出的已诊断病例比例仍不足 60%,说明专家复核在新型机制、低外显率变异、隐匿剪接异常等复杂场景中仍不可替代。
研究结论可译为:DiagAI 在变异排序方面具有较高准确性,尤其在整合临床数据时更为突出,这表明其有潜力通过减少需人工审阅的变异数量来优化基因组诊断流程。然而,通向完全自动化的道路仍较漫长,因为被自动识别出的已诊断病例仍不足 60%。这些结果提示,诸如 DiagAI 的人工智能工具可在保持较高诊断准确性的同时,显著减轻临床基因组学中的解释工作负担。未来仍需在肾脏病学之外的场景,以及在全基因组测序分析背景下,进一步验证其表现。