
-
生物通官微
陪你抓住生命科技
跳动的脉搏
Nature:新的基因组语言人工智能模型,可以预测遗传变异的致病性
【字体: 大 中 小 】 时间:2026年09月11日 来源:news-medical
编辑推荐:
在科学家首次对整个人类基因组(DNA密码的全部30亿个字母或碱基对)进行测序20多年后,这些密码的大部分意义仍然是一个谜。
据估计,人类DNA中有1%到2%编码蛋白质,其余的则是“垃圾DNA”——不再编码任何东西的进化遗留物——和控制基因表达的时间、地点和强度的调控元素的混合体。基因组的这些非编码区域可能是理解各种遗传特征的关键,包括那些导致癌症、心脏病和自闭症等疾病的遗传特征。但首先,科学家们必须了解这种DNA的变异是如何导致我们每个人都独一无二的众多特征的。
加州大学伯克利分校(UC Berkeley)的研究人员创建了一种新的基因组语言人工智能模型,名为GPN-Star,在识别导致遗传性状(包括导致疾病的性状)的最重要基因变异方面,该模型远远超过了竞争对手。它的计算效率也比大型模型高得多,只需要一小部分时间和计算资源来训练。
“我们的模型在预测遗传变异的致病性和识别基因组中的功能与非功能元素方面表现出色。”该研究的资深作者、伯克利大学计算机科学与统计学教授、创新基因组学研究所研究员Yun Song说。
在这项研究的同时,研究人员还发表了基于他们的模型的全基因组预测,这些预测强调了可能对遗传性状影响最大的基因变异。生物学家可以使用这些注释来识别相关基因和调控元件,以便进一步研究。
“我们希望我们的工作将有助于推动生物学的发现,人们已经开发出非常有创意的工具来分析基因变异的影响,但他们无法通过实验测试基因组中的每一个变异。”我们相信,我们的预测将有助于优先考虑可能对人类健康产生最大影响的实验。”Yun Song说。
Song还是伯克利计算生物学中心的主任,以及最近宣布的加州大学伯克利分校-加州大学旧金山分校巴卡尔计算生物医学计划的联合主任。这项由美国国立卫生研究院部分资助的研究今天(9月9日)发表在《自然》杂志上。
基因组语言模型的工作方式有点像DNA的聊天机器人,但它们不是在自然语言上训练,而是在大量的DNA序列上训练。这些模型的高级模式识别技能可以比人类更快地识别重复的模式和序列,从而使它们能够识别出基因组中可能不可能识别的重要元素。
“从数学上讲,一个DNA序列就是一串字母——a、C、G和t。我们不能先验地知道基因组的哪些部分是有功能的,而且基因组中只有很小一部分是有功能的,”Yun Song说。通过在许多不同的序列上训练DNA语言模型,该模型可以识别基因组中出现的某些模式。人们一直在用它来学习我们所说的基因组的“语法”。
大多数基因组语言模型,包括今年早些时候发表的大规模Evo 2模型,都是在完整的未对齐基因组序列上进行训练的,这些基因组的大小可以从人类一直到单细胞生物。然而,这种方法对计算的要求非常高。Evo 2模型可以从零开始生成整个基因组,在所有生命领域的10万多个物种的基因组上进行了训练,需要2000个强大的NVIDIA计算机处理器和数月的训练时间。
为了训练GPN-Star模型,Song和他的团队使用了来自全基因组比对(WGAs)的数据,而不是单个未比对的基因组。WGAs使用专门的算法将数百个不同物种的基因组与单个物种的基因组联系起来,突出代码中的相似性和差异性。例如,在以人类为锚定的WGA中,将其他物种的基因组与人类基因组进行比较,揭示在进化过程中哪些地方的密码是保守的,哪些地方发生了变化。
由于wga的工作是识别代码的保守区域,GPN-Star的训练时间和计算能力要比使用未对齐基因组的模型少得多。只需使用少数几个处理器,它就可以在几天甚至几小时内完成训练。它也不太可能被大多数物种基因组中发现的大量垃圾DNA所混淆。
Song说:“我们试图通过整理更有可能包含功能元素的数据来帮助模型学习。”“我们的方法是,我们应该利用这些生物学见解来改进模型,而不是希望模型自己找出什么是重要的。”
在这项新研究中,研究小组在三种不同的人类锚定WGAs上训练了该模型,以及小鼠、果蝇、鸡、秀丽隐杆线虫(蛔虫)和拟南螺旋体(一种植物)的WGAs。每个以人类为锚定的WGAs都包括来自不同物种组合的基因组,代表不同的进化时间尺度:一个包括其他灵长类动物的基因组,一个包括哺乳动物的基因组,最后一个包括其他脊椎动物的基因组。
该研究的第一作者之一、加州大学伯克利分校统计学研究生叶成忠说:“我们发现,在不同的进化时间尺度上训练的模型,实际上在解释不同类型的基因变异方面得到了优化。”“从进化生物学的角度来看,这实际上是有道理的,因为一些基因组元素比其他元素进化得快得多。”
例如,他们发现,基于更长的进化时间尺度的数据训练的模型更能预测蛋白质中罕见的遗传变异的影响,这些变异往往进化得非常缓慢,并且在许多物种中都是保守的。然而,在较短的进化时间尺度上训练的模型在预测遗传变异对精神分裂症风险等复杂特征的影响方面表现得更好。这些复杂的特征与多达10,000种不同的基因突变有关,其中许多突变位于基因组的非编码区域。
“对于复杂的特征,我们很惊讶也很高兴地看到,训练一个专门针对灵长类基因组的模型——这与最近的人类进化更相关——确实帮助我们做出了更好的预测。”
由于该模型需要最少的资源来训练,研究人员希望世界各地的其他团队可以很容易地修改、适应和改进他们的工作,从而加快我们对人类和其他物种遗传学的理解。
“我们正在取得巨大的进步,但是,使用这些模型的人越多,他们的效果就越好。”