利用GPN-Star预测全基因组功能约束

《Nature》:Predicting genome-wide functional constraints with GPN-Star

【字体: 时间:2026年09月11日 来源:Nature 56.1

编辑推荐:

  基因组语言模型(genomic language model, gLM)已成为直接从DNA序列中学习全基因组功能约束的强大方法。然而,从自然语言处理改编而来的标准基因组语言模型往往需要较大的模型规模和计算资源,但在预测任务上仍不及经典进化模型。本文介绍了一种具

  
基因组语言模型(genomic language model, gLM)已成为直接从DNA序列中学习全基因组功能约束的强大方法。然而,从自然语言处理改编而来的标准基因组语言模型往往需要较大的模型规模和计算资源,但在预测任务上仍不及经典进化模型。本文介绍了一种具有物种树和比对表示的基因组预训练网络(genomic pretrained network with species tree and alignment representations, GPN-Star),这是一种具有生物学基础的基因组语言模型,其采用系统发育感知架构,利用全基因组比对(whole-genome alignment, WGA)和物种树显式建模进化关系。研究人员在涵盖脊椎动物、哺乳动物和灵长类进化时间尺度的比对数据上训练GPN-Star,在人类基因组编码区和非编码区的多种变异效应预测任务中均达到最先进性能。跨时间尺度分析表明,建模近期进化与深层进化具有任务依赖性优势。为展示其推动人类遗传学研究的潜力,研究人员证明GPN-Star在优先排序致病性和精细定位全基因组关联研究(genome-wide association study, GWAS)变异方面显著优于以往方法,在复杂性状遗传力富集中表现突出,并提升了罕见变异关联检验的功效。除人类外,研究人员还为五种模式生物——小鼠(Mus musculus)、鸡(Gallus gallus)、果蝇(Drosophila melanogaster)、线虫(Caenorhabditis elegans)和拟南芥(Arabidopsis thaliana)——训练了GPN-Star,证明了该框架的稳健性和泛化能力。综上,这些结果将GPN-Star定位为一种可扩展、强大且灵活的全基因组解读工具,非常适合利用日益增长的比较基因组学数据。
GPN-Star:系统发育感知的基因组语言模型用于全基因组功能约束预测
一、研究背景与问题
理解遗传变异的功能意义是生物学的基本挑战。尽管基因组学实验技术取得了巨大进步,但确定哪些变异影响表型或导致疾病仍然困难。进化提供了宝贵线索:有害突变往往被自然选择清除,而耐受或有利的变化可能累积,因此数百万年的进化为变异解读提供了全基因组功能约束记录。基因组语言模型(genomic language model, gLM)通过自监督学习直接从原始DNA序列中提取进化信息,预测掩蔽核苷酸的可能性以反映进化约束。然而,基于标准语言建模框架的gLM在复杂真核基因组(如人类基因组)和远端调控元件(如增强子)的变异解读任务上,仍逊于更简单的经典系统发育模型,即便模型规模庞大也是如此。另一方面,多序列比对(multiple sequence alignment, MSA)通过算法比对同源位点,展示位点特异的保守模式并促进推断特定位置变异的进化偏好,蛋白质MSA已催生AlphaFold、MSA Transformer和EVE等高度成功的模型。将gLM框架与WGA数据结合是前景广阔的方向,研究人员此前已在90个脊椎动物物种的WGA上展示了GPN-MSA的潜力。在此基础上,本文提出GPN-Star,一种通过新模型架构和系统发育感知设计更有效利用多物种WGA的通用gLM框架。
二、研究内容与结论
GPN-Star是一种仅编码器的架构,采用掩蔽语言建模(masked language modelling, MLM)目标训练。每个输入包含一个WGA窗口及其物种树,比对被划分为目标序列和源序列,模型在序列上下文和源序列进化信息的条件下预测目标中掩蔽的核苷酸。该架构通过堆叠编码器块实现,每个块包含序列自注意力模块、系统发育感知的交叉注意力模块和前馈网络。为高效表示系统发育结构,模型根据进化距离将密切相关的源物种分组,并通过注意力池化将其序列压缩为进化支级表示。交叉注意力模块利用物种树衍生的进化距离自适应加权源序列贡献。另一方法创新是考虑了突变率变异:由于GPN-Star在自然界观察到的基因组序列上训练,其预测同时反映突变和选择,研究人员利用基因组中高置信中性位点估计的背景突变效应进行归一化,以分离信号并隔离选择性约束。
研究人员将GPN-Star应用于人类基因组,分别使用最大的脊椎动物、哺乳动物和灵长类WGA训练了三个模型,分别记为GPN-Star (V)、GPN-Star (M)和GPN-Star (P),最大模型为2亿参数,在8块NVIDIA A100 GPU上训练数天。相比之下,现有单序列gLM如Nucleotide Transformer(128块A100 GPU训练一个月)和Evo 2(2000多块H100 GPU训练数月)需要大量计算资源隐式学习进化约束。GPN-Star通过利用比对数据提供的显式进化上下文,以更小的资源占用实现更优的约束预测。与跨越极广进化距离(如从原核生物到人类)训练的以往gLM不同,GPN-Star聚焦于与人类密切相关的更窄、更近的系统发育距离,建模更长进化历史并非总是有益,捕捉近期进化约束对解读某些类别的遗传变异尤为有利。
三、主要技术方法
研究人员使用的主要关键技术方法包括:基于WGA和物种树的系统发育感知Transformer架构,通过进化支级注意力池化和交叉注意力整合进化信息;掩蔽语言建模自监督训练目标;针对突变率变异的校准评分方法,利用高置信中性位点估计背景突变效应进行归一化;模型在脊椎动物(90物种)、哺乳动物和灵长类(239物种)三个进化时间尺度的WGA上训练;下游评估采用ClinVar、COSMIC、OMIM、HGMD、GWAS精细定位、ProteinGym、S-LDSC和DeepRVAT等多种基准;此外为五种模式生物(小鼠、鸡、果蝇、线虫和拟南芥)训练模型,比对包含18至135个物种。
四、研究结果
致病性编码变异。 在ClinVar致病与良性错义变异分类中,GPN-Star (V)取得最高AUPRC,匹配蛋白语言模型ESM-1b并超越ESM-2和ESM-3-open。在COSMIC高频体细胞癌症变异与gnomAD常见错义变异区分中,GPN-Star (V)大幅超越所有竞争模型。在31个人类蛋白深度突变扫描(deep mutational scanning, DMS)数据集上,GPN-Star (V)超越所有全基因组模型,略逊于蛋白特异性模型。利用gnomAD等位基因频率对GPN-Star (V)预测进行简单事后调整后,其在ClinVar上的表现超越PrimateAI-3D并接近AlphaMissense。
致病性非编码变异。 在OMIM和HGMD非编码致病变异分类中,GPN-Star (M)在两个基准上均取得最佳表现。序列到功能模型(Enformer、Borzoi和AlphaGenome)在此任务上明显逊于基于比对的gLM和系统发育模型。分层分析表明GPN-Star在各变异类型中一致取得顶级表现,在远端增强子上的优势最大。在启动子变异评估中,GPN-Star (M)超越所有竞争模型,包括启动子特异性模型PromoterAI、SpeciesLM和GPN-Promoter,提升幅度显著。
GWAS精细定位变异。 在65个UK Biobank性状的精细定位错义变异分类中,GPN-Star (M)取得最高预测性能,且大幅超越利用群体等位基因频率信息的AlphaMissense和PrimateAI-3D。在83个性状的精细定位非编码变异分类中,GPN-Star (M)继续超越所有其他模型,Evo 2预测价值有限。在启动子区域的精细定位变异中,GPN-Star (M)再次超越所有模型。
罕见变异关联检验。 研究人员使用DeepRVAT框架,在UK Biobank 161,822名无关欧洲裔个体的全外显子组测序(whole-exome sequencing, WES)数据上对34个定量性状进行罕见变异关联检验(rare variant association testing, RVAT),保留MAF<0.1%的变异。将三个GPN-Star模型的预测作为变异注释加入DeepRVAT后,在家族错误率<0.05下发现的基因数从383增至402(三次随机初始化平均),在更大样本量常规RVAT研究中复现的基因-表型关联从338增至353。值得注意的是,原始DeepRVAT已包含AlphaMissense、PrimateAI和DeepSEA等注释,GPN-Star仍提供互补信息并提升检验功效。
复杂性状遗传力。 使用分层连锁不平衡得分回归(stratified linkage disequilibrium score regression, S-LDSC),在106个独立性状中元分析,选择前0.1%最受约束的常见变异。GPN-Star (P)大幅改进此前最优的灵长类PhastCons结果,GPN-Star (M)次之,在编码和非编码区域分别分析时改进持续存在,非编码区域增益更强。在不同二值化阈值和三个进化时间尺度下,GPN-Star一致优于以往保守性评分。GPN-Star (P)优先捕获的变异中,错义变异占33%(170倍富集),远端增强子区域变异占26%(2.4倍富集)。
相关进化时间尺度。 GPN-Star (P)优先捕获高多基因性性状的贡献变异,而GPN-Star (M)对低多基因性性状相对更有信息量,表明进化时间尺度与复杂性状遗传架构之间存在联系。
组织特异性遗传力信号。 研究人员设计简单方法将组织特异性纳入GPN-Star,仅考虑组织特异性表达基因(specifically expressed gene, SEG)附近或组织特异性候选顺式调控元件(candidate cis-regulatory element, cCRE)中的高分变异。该方法在大多数组织中改善表现但未一致超越组织不可知的GPN-Star注释,然而GPN-Star在全部七个组织中均超越Enformer和Borzoi。脑特异性GPN-Star对精神分裂症富集最高,血液/免疫特异性GPN-Star对狼疮表现最佳。
GPN-Star的可解释性。 GPN-Star的嵌入区分主要基因组功能元件,对进化保守区域分离更强。核苷酸依赖性分析显示有生物学意义的共进化信号,包括转录因子结合位点(transcription factor binding site, TFBS)、编码区和剪接位点间的依赖性,以及灵长类特异性调控约束的证据。在PhyloP和PhastCons预测中性而GPN-Star正确预测有害的疾病变异案例中,这些变异不表现强位点保守性但位于具有独特序列上下文的功能重要元件中。
全基因组进化约束。 利用gnomAD v.3.1.2的76,156个人类个体等位基因频率数据,在22号染色体(训练中留出的染色体)上,三个GPN-Star模型在相同分位数区间的变异平均等位基因频率均低于PhyloP和PhastCons对应区间。在稀有变异(单例)相对常见变异(MAF>5%)的最受约束尾部富集分析中,三个GPN-Star模型均产生显著更高的富集,其中脊椎动物模型总体最强。按分子后果分层时,GPN-Star在每个类别中均取得最高富集。校准程序大幅降低了与突变率估计的相关性,同时改善了大多数下游基准表现。
模式生物的GPN-Star。 为五种模式生物训练GPN-Star后,在五个对应群体基因组数据库中,GPN-Star评分均表现出比PhyloP和PhastCons显著更高的稀有变异富集。在MMRdb小鼠致病变异、FlyBase果蝇致死变异和线虫致死变异分类中,GPN-Star一致超越其他模型。果蝇MSE增强子位点的核苷酸依赖性分析展示了TFBS间的学习依赖性。
五、讨论与结论
GPN-Star是一个系统发育感知的基因组语言建模框架,在全基因组功能约束和有害变异预测方面一致超越现有方法,尤其对远端增强子变异表现突出,表明跨物种比较衍生的进化约束信息可为建模这类历史性挑战的调控元件提供宝贵信号。研究核心见解是训练数据所代表的进化时间尺度强烈影响gLM学习的约束:深层时间尺度模型更好地捕捉编码区和其他高度约束区域,较浅时间尺度更好地指导快速进化的调控元件。进化时间尺度应被视为未来gLM的重要设计考量。与经典保守性评分类似,GPN-Star预测量化特定时间尺度的进化约束而非一般变异致病性,应根据生物学问题选择适当时间尺度。GPN-Star以显著更小的模型和上下文规模实现最先进的功能约束预测性能,有效性可能源于比对提供的显式同源信息。实际局限是推理时需要WGA,对插入缺失和结构变异的分析不太适用。研究人员已通过公共存储库发布全基因组预测以促进使用。未来工作可能通过灵活的同源检索机制桥接不同范式,使模型无需依赖刚性比对结构即可动态整合进化信息。
相关新闻
生物通微信公众号
微信
新浪微博

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号