基于可解释人工智能的标记筛选与EastFocus AISNPplex 61体系的构建:面向精细尺度生物地理祖先推断的6色荧光复合检测系统

《Cell Reports》:Explainable AI-driven marker selection and development of EastFocus AISNPplex 61 assay for fine-scale biogeographical ancestry inference

【字体: 大 中 小 】 时间:2026年10月07日 来源:Cell Reports 7.7

编辑推荐:

  本研究构建了一个分层祖先推断框架,用于解决大陆尺度及东亚精细尺度的人群结构解析问题,以满足法医学应用需求。研究人员将沙普利加性解释(SHAP)方法与递归特征消除(RFE)相结合,筛选出58个祖先信息性单核苷酸多态性(AIM-SNPs)。研究人员自主开发了一套6

本研究构建了一个分层祖先推断框架,用于解决大陆尺度及东亚精细尺度的人群结构解析问题,以满足法医学应用需求。研究人员将沙普利加性解释(SHAP)方法与递归特征消除(RFE)相结合,筛选出58个祖先信息性单核苷酸多态性(AIM-SNPs)。研究人员自主开发了一套6色荧光等位基因特异性PCR复合扩增体系(EastFocus AISNPplex 61),整合了上述AIM-SNPs、2个Y染色体插入/缺失标记(Y-InDels)以及Amelogenin基因座。验证结果表明,该体系在250–500 pg模板DNA下可实现可靠的单一来源分型,在混合DNA样本中可完整回收次要贡献者基因型,混合比例最高可达1:7(次要贡献者模板量为125 pg)。群体遗传学及自动化机器学习分析证实,该检测组合可有效区分五大洲际人群(各类别曲线下面积(AUC)值介于0.981至0.999之间),并能够区分东亚内部精细结构(所有聚类特异性AUC值均超过0.940)。将模型概率与降维分析相结合,可实现二维空间映射,以可视化所研究人群的遗传亲和性与混合模式。该工作流程为法医生物地理祖先推断及微遗传结构映射提供了一套实用、可解释且兼容毛细管电泳的解决方案。

论文解读

一、研究背景与意义

在法医调查中,当常规DNA数据库比对无法提供调查线索时,从生物检材中推断供体的生物地理祖先可为侦查提供关键方向。祖先推断的核心在于分析一组祖先信息性标记(AIMs),以评估个体的群体遗传组成,进而推断其遗传来源。近年来,基于单核苷酸多态性(SNP)的AIM体系在法医遗传学领域得到广泛应用。与传统遗传标记相比,SNP具有突变率低、多态性稳定且适合高通量分型等显著优势;更重要的是,由于其扩增子长度较短,SNP在高度降解法医样本的祖先推断中具有重要价值。
然而,现有技术仍面临多重瓶颈。早期AIM-SNP检测组合的分辨率主要局限于大陆尺度人群,当应用于遗传背景高度同质且历史上存在频繁基因流的区域内人群时,往往分辨力不足。尽管高通量测序(MPS)等技术在标记容量上具有显著优势,但其对昂贵专用设备的依赖和较长的分析周期限制了在常规一线法医实验室的推广。此外,尽管机器学习算法在祖先预测中可达到较高分类精度,但复杂算法的黑箱特性在一定程度上限制了其在法医应用中的生物学可解释性。如何在有限的荧光通道和电泳窗口内,将可解释人工智能技术与高集成度法医复合检测平台有效整合,构建从核心标记筛选、体系开发验证到概率解释的完整实用工作流程,是法医遗传学中亟待解决的关键交叉学科研究方向。

二、研究内容概述

为克服上述技术瓶颈,本研究提出了一种整合可解释机器学习算法与等位基因特异性PCR(AS-PCR)技术的分层祖先推断框架。研究人员在大规模基因组数据上部署机器学习驱动的特征选择策略,筛选出既能解析大陆尺度又能解析东亚精细结构的少量高信息量AIM-SNP组合;在此基础上开发并优化了兼容常规法医毛细管电泳(CE)平台的6色荧光复合检测体系(EastFocus AISNPplex 61);进一步结合降维分析与预测概率建模,构建了二维空间投影映射流程,以可视化遗传亲和性与混合模式。该整合框架为降解或低模板法医样本的生物地理祖先追溯提供了多层次解决方案,同时建立了可推广至更广泛群体遗传学研究的可解释特征选择与空间映射范式。

三、关键技术方法

本研究整合了两个公共基因组参考数据集——1000 Genomes Project(1KGP)Phase 3(2,504个无关个体,26个地理人群)和GenomeAsia 100K项目数据子集(n = 1,163),并新收集了308份样本,包括陕南汉族(SNH,n = 143)和广西壮族(ZHG,n = 165)。主要技术方法包括:基于SHAP算法结合递归特征消除(RFE)策略的分层特征筛选;基于AS-PCR原理的复合扩增引物设计与优化,通过5′端非互补尾序列将单核苷酸变异转化为CE可检测的长度多态性,并在引物3′端引入人工错配碱基以增强特异性;6色荧光复合扩增体系的构建与系统优化;以及利用自动化机器学习(AutoML,基于FLAML包)框架进行模型选择与超参数调优,结合SHAP值量化各基因座的分类贡献。

四、主要研究结果

候选AIM-SNPs的筛选。 研究人员在1,874个候选AIM-SNPs基础上,采用SHAP-RFE策略进行分层降维。在大陆推断层级,东亚(EAS)人群仅需13个SHAP排名最高的SNP即可实现高精度区分(AUC = 1.000),而非洲(AFR)、欧洲(EUR)和美洲(AMR)人群分别需要128、193和198个标记。在东亚精细层级,日本人群(JPT)仅需53个关键位点即可达到最优分类(AUC = 1.000),而东南亚(SEA)和汉族人群因历史上频繁的基因流动导致遗传背景更为混合,分别需要173和193个位点。
EastFocus AISNPplex 61体系的构建与评估。 通过生物信息学特征选择与实验复合优化的联合评估,最终整合58个AIM-SNPs、2个Y染色体插入/缺失标记(Y-InDels)和Amelogenin基因座,建立了6色荧光复合检测体系。ADMIXTURE分析(K = 6)表明,这58个AIM-SNPs不仅能有效区分主要大陆人群,还能解析东亚内部细微遗传亚结构。固定指数(FST)和信息量(In)计算显示,部分位点在大陆层面和东亚内部均具有较高区分效能。
复合扩增体系优化。 通过系统评估Master mix浓度、退火温度、最终延伸条件和循环数,确定2.0×Master mix浓度、60°C退火温度、60°C最终延伸60分钟和30个循环为最优扩增条件,在保证100%检出率的同时维持良好的位点间信号均衡。
法医学系统验证。 灵敏度测试表明,体系在500 pg至1 ng模板下可实现100%检出率,250 pg时检出率仍达97.27%。对六种常见PCR抑制剂的耐受性测试显示,体系在腐殖酸1.25 mM、靛蓝胭脂红5 mM、钙离子5 mM等浓度下均保持100%检出率。24次重复等位基因阶梯的分型精度分析显示,所有61个位点的片段大小标准差均低于0.30 bp。混合样本测试中,在1:1至1:7比例范围内可完整检出双贡献者基因型。物种特异性测试证实体系对人DNA具有高度靶向特异性,与常见非人类物种无交叉反应。
群体遗传学与法医学效能评估。 哈迪-温伯格平衡(HWE)和连锁不平衡(LD)检验确认58个AIM-SNPs在SNH和ZHG中均符合遗传平衡且独立分离。58个位点在七个东亚人群中的累计匹配概率(CPM)介于4.1114 × 10?13至5.9858 × 10?10之间,累计鉴别力(CPD)大于0.999999999,表明该体系在提供祖先信息的同时兼具辅助个体识别的潜力。
群体遗传结构与系统发育分析。 主成分分析(PCA)显示SNH和ZHG个体分别聚类于东亚和东南亚人群区域。ADMIXTURE分析(K = 5)表明SNH呈现介于北方汉族(CHB)和南方汉族(CHS)之间的过渡性遗传特征,而ZHG则具有较高的东南亚特征祖先成分。成对FST分析显示SNH与CHB遗传分化最小(FST = 0.0200),ZHG与越南京族(KHV)分化最小(FST = 0.0158)。TreeMix基因流分析推断出9次迁移事件,客观反映了群体分化过程中的网状基因交流。
基于机器学习的层级祖先推断与空间映射。 自动化机器学习框架确定LightGBM和Extra Trees分别为大陆层级和东亚层级的最优模型。大陆层级模型的AUC值介于0.981至0.999之间,东亚层级模型各聚类的AUC值均超过0.940。SHAP特征重要性分析识别出各人群分类的关键驱动位点。将模型预测概率与降维组分(PCA、t-SNE)结合的二维空间映射显示,SNH样本在汉族类别高概率区域密集聚集,而ZHG样本沿东南亚类别概率轴呈现离散分布,反映了其内部遗传多样性与混合特征。

五、讨论与结论

本研究构建了整合可解释人工智能与等位基因特异性PCR技术的分层祖先推断框架。通过SHAP-RFE策略从高维基因组数据中筛选出58个能有效解析大陆及东亚精细人群结构的AIM-SNPs。自主开发的EastFocus AISNPplex 61体系在CE平台上展现出高灵敏度、强抑制剂耐受性和高效的混合物解析能力,满足痕量和降解法医样本的分析要求。群体遗传学分析与分层机器学习模型证实该体系能稳健区分五大洲际人群,同时客观捕捉东亚内部精细遗传结构与历史基因流。结合模型预测概率与非线性降维的二维空间映射流程,为解析混合人群遗传背景提供了有效的可视化工具。
该工作流程涵盖标记筛选、体系开发和基于自动化机器学习的概率解析,为法医遗传学中的精细尺度空间祖先映射提供了兼具实用性与理论可解释性的系统解决方案。研究局限性包括:AS-PCR每个SNP位点需三条引物导致引物池复杂度较高,限制进一步扩展;CE平台荧光通量有限,对复杂或低模板DNA混合物的解析能力不及高通量MPS;模型依赖现有公共数据库,对孤立或代表性不足的少数群体可能存在分类偏差;概率-维度投影输出缺乏标准化统计似然比,仅可作为探索性调查线索而非法庭证据。未来研究可将该机器学习与概率映射框架扩展至谱系特异性标记或微单倍型,以进一步提升法医生物地理祖先推断的粒度和精度。

订阅生物通快讯

订阅快讯:

最新文章

限时促销

会展信息

关注订阅号/掌握最新资讯

今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

版权所有 生物通

Copyright© eBiotrade.com, All Rights Reserved

联系信箱:

粤ICP备09063491号