NucleicBERT通过自监督语言建模解读RNA序列空间

《Nature Machine Intelligence》:NucleicBERT interprets RNA sequence space through self-supervised language modelling

【字体: 时间:2026年09月04日 来源:Nature Machine Intelligence 29.8

编辑推荐:

  人类基因组中大部分非蛋白质编码部分直接通过RNA发挥作用,然而这些序列中编码的结构和功能角色仍鲜为人知。由于RNA结构数据稀缺,深度学习在该领域的应用受到阻碍,且尚不清楚这类模型能否仅从海量RNA序列中直接恢复生物学约束。为了应对这些挑战,研究人员开发了Nuc

  
人类基因组中大部分非蛋白质编码部分直接通过RNA发挥作用,然而这些序列中编码的结构和功能角色仍鲜为人知。由于RNA结构数据稀缺,深度学习在该领域的应用受到阻碍,且尚不清楚这类模型能否仅从海量RNA序列中直接恢复生物学约束。为了应对这些挑战,研究人员开发了NucleicBERT,一种自监督掩码语言模型(Self-Supervised Masked-Language Model),该模型无需进化信息即可从单条序列中学习上下文表征(contextual representations)。可解释人工智能(Explainable Artificial Intelligence, XAI)分析表明,该模型在潜在空间中组织RNA序列并编码结构特性,这证明仅从序列关联中即可学习到具有生物学意义的约束。在下游结构与功能任务上进行微调(fine-tuning)时,NucleicBERT仅需单条序列即可达到或超越现有RNA预测模型。这一无比对(alignment-free)框架在解决带注释3D RNA数据稀缺问题的同时,也为实验技术提供了快速的计算补充。通过将丰富的未标记序列数据与稀缺的结构注释相连接,NucleicBERT推进了RNA结构预测,并为大型语言模型如何编码生物信息提供了启示。
NucleicBERT:基于单序列自监督语言模型的RNA结构-功能统一预测框架

一、研究背景与问题

RNA在细胞过程中扮演着从遗传信息传递到构成核糖体结构及催化核心等多种重要角色,非编码RNA(ncRNA)参与基因表达调控,但多数ncRNA的功能尚未被充分表征。RNA三维结构是理解其功能的基础,然而基于核磁共振波谱、X射线晶体学和冷冻电镜(cryo-EM)等实验结构测定方法耗时费力、通量受限。尽管深度学习方法在蛋白质结构预测上取得了显著成功,但RNA结构预测面临根本性的数据稀缺问题:测序技术已生成海量RNA序列,但相应的结构数据极为有限。此外,现有计算方法大多依赖从多序列比对(MSA)中提取进化信息,如直接耦合分析(DCA)等,此类方法不仅计算昂贵,且在缺乏高质量MSA的RNA家族中表现有限。针对上述问题,研究人员提出了NucleicBERT——一种基于BERT架构的自监督掩码语言模型,旨在直接从单条RNA序列中学习上下文表征,以兼容预测RNA结构与功能,从而弥补序列-结构之间的鸿沟。

二、研究设计与核心发现

研究人员利用MARS数据库提取了约3000万条ncRNA序列对NucleicBERT进行预训练,模型包含32个Transformer层、32个注意力头及1,024维嵌入维度,参数量为4.04亿。通过掩码语言建模目标,该模型在验证集上达到83.1%的掩码token预测准确率,并展现出校准良好的困惑度-准确率关系。PHATE降维与k近邻(kNN)分析显示,预训练嵌入能有效将不同RNA家族区分为功能相关的簇,且其效果优于序列长度和碱基组成等平凡特征所能解释的范围。微调后,NucleicBERT在二级结构预测、距离及接触图预测、剪接位点预测和适应性预测等下游任务中,以单序列输入超越或匹配现有专用工具。可解释性分析揭示了模型内部表征的结构生物学意义,而单序列掩码似然影响(MLI)分析则表明该模型无需MSA即可恢复部分类协同进化信号。该研究发表于《Nature Machine Intelligence》,标志着RNA计算生物学向统一、可解释及无限比对方向迈出了重要一步。

三、主要关键技术方法

基于MARS数据库中约3000万条非编码RNA序列进行自监督掩码语言建模预训练(80%训练、20%验证),并采用字符级字节对编码分词策略。特征评估采用PHATE降维及kNN分类;可解释性分析综合使用显著性映射、注意力权重剖析与扰动灵敏度分析。为探测类协同进化信号,设计了掩码似然影响(MLI)耦合矩阵,并分别以互信息(MI)与DCA为MSA参照基线。下游任务分别基于RNAStrAlign、ArchiveII、bpRNA-1m、BGSU RNA三维代表数据集及CPEB3突变数据集构建。

四、研究结果

1. 预训练性能验证:通过掩码token预测任务评估,预训练模型准确率为0.831,显著优于未预训练基线,且准确性-困惑度关系呈现较强的负相关,证明模型确实学到了有意义的RNA序列特征,而非随机猜测。

2. RNA序列嵌入的PHATE分析:对预训练模型、随机初始化模型及6-mer频次表示三种来源的嵌入进行PHATE投影比较,并辅以原始嵌入空间中的kNN分类定量评估。在长度匹配条件下,预训练模型仍保持分类优势,表明其表征超越了长度与组成信息,捕捉了RNA家族间的序列规律性。

3. 下游任务性能:在ArchiveII600和TS0数据集上,NucleicBERT在二级结构预测优于RNAfold、MXfold2等热力学或深度学习方法;在距离与接触图预测上超过RiNALMo和RNA-FM;在跨四个物种的剪接位点预测中平均准确率达0.948;在CPEB3核酶突变数据集上微调后测试R2达0.994,且收敛速度较随机初始化大幅提升,线性探针实验进一步凸显了预训练表征的价值。

4. 可解释人工智能分析:
- 通过显著性分析理解决策过程:针对掩码预测任务,模型显著性地定位到掩码位置;在二级结构预测中,显著性尖峰出现在配对与非配对区域的过渡边界;在接触图预测中,显著性水平与接触密度呈正相关(r=0.387),说明模型优先关注高接触度位点。
- 扰动敏感性评估序列真实性:序列洗牌比例与真实性分类准确率强负相关(r=-0.951),当洗牌比例达到约20–25%时性能急剧下降。将扰动限制在沃森-克里克配对残基时相关性更强(r=-0.989)。自然RNA家族平均序列差异为26.9%±10.4%,与模型的敏感阈值接近,表明模型已内化生物学序列约束。
- 注意力模式揭示结构学习:接触图预测在早中层(第0–15层)表现出显著注意力;二级结构预测在初始层(第1–2层)注意力增强;洗牌检测则呈现均匀注意力模式作为对照。这表明结构任务调动了特异性神经通路,且早期层为通用特征提取器,深层处理序列级信息。
- 单序列类协同进化耦联:对14个Rfam家族提取MLI矩阵,其能在无需MSA的条件下恢复部分类DCA信号,在富集因子(EF)上显著高于随机零分布但低于MSA基线的MI/DCA。按到预训练语料的最近邻Jaccard距离分层后,MLI的Top-L精度基本持平,排除了记忆化作为主导驱动因素的可能性。

五、讨论与结论

NucleicBERT凭借单序列输入在多项RNA结构-功能预测任务上达到了有竞争力的表现,消除了对MSA的依赖,从而避免了进化分析的计算瓶颈与低深度家族适用性差的问题。线性探针与全微调实验分离了预训练表征与任务自适应各自的贡献:固定预训练骨干显著优于随机初始化骨干,且微调收益在标注数据稀缺时更为明显。PHATE与MLI分析为预训练表征的几何结构提供了互补视角,显示自监督掩码语言建模可以内化可测量的序列约束。该模型的可解释性使其能无缝整合至实验流程中,为RNA靶向药物发现等功能应用提供计算决策依据。研究结论如下:NucleicBERT确立了单序列RNA基础模型在结构与功能预测中的统一框架,弥合了丰富无标注序列数据与稀缺结构注释之间的鸿沟,为RNA生物学与治疗设计共同提供了可解释、可扩展的计算工具。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号