综述:机器学习与语言模型在RNA结构预测中的应用:进展与展望

《Current Opinion in Structural Biology》:Machine learning and language models for RNA structure prediction: Progress and perspectives

【字体: 大 中 小 】 时间:2026年07月22日 来源:Current Opinion in Structural Biology 7.8

编辑推荐:

  RNA结构是各类RNA发挥功能的核心基础,但已注释序列与经实验解析的结构之间存在巨大鸿沟。为填补这一空白,计算方法已从热力学自由能最小化演进至监督式深度学习,再到基于数百万序列训练的自监督RNA语言模型(RNA-LM),逐步提升了结构预测性能。研究人员系统综述

  
RNA结构是各类RNA发挥功能的核心基础,但已注释序列与经实验解析的结构之间存在巨大鸿沟。为填补这一空白,计算方法已从热力学自由能最小化演进至监督式深度学习,再到基于数百万序列训练的自监督RNA语言模型(RNA-LM),逐步提升了结构预测性能。研究人员系统综述了RNA结构预测领域的最新进展,涵盖关键训练数据集、社区基准测试及当前模型的性能表现。进一步探讨了整合多模态数据的潜在路径,例如化学探针信号与RNA修饰信息,同时分析了生成式模型在该领域的新兴作用。该领域仍面临泛化能力、非经典相互作用处理及情境依赖性结构预测等开放性挑战。
引言
RNA作为细胞内的核心生物分子,其功能复杂性既体现在RNA家族的多样性,也反映在其参与的转录及转录后调控过程的广泛性。单链核酸链通过自身折叠形成特定构象,核碱基堆叠形成局部二级结构,长程相互作用最终构建三维结构,且该结构具有动态性,其构象景观的动力学特征受所处细胞环境调控。解析RNA所采用的结构对于理解其生物活性状态至关重要。X射线晶体学、核磁共振(NMR)及冷冻电镜(cryo-EM)等实验技术可提供序列的三维构象信息,但通量较低;SHAPE、DMS等化学探针技术能揭示核苷酸可及性,结合测序可实现活细胞内的转录组水平单核苷酸分辨率检测。然而,结构数据的增长远滞后于已知RNA序列的积累——RNAcentral收录数千万条RNA序列,RFam涵盖数千个家族的数百万成员,而蛋白质数据库(PDB)中仅包含约10000–15000个含RNA的结构,且多为片段、蛋白结合RNA或冗余样本,经筛选后仅存不足1000种独特RNA折叠类型。这种差距甚至超过AlphaFold问世前蛋白质结构的缺口,导致大部分转录组缺乏三维结构表征,限制了对其功能的认知。RNA序列中蕴含的结构元件调控着转录本从转录、加工、翻译(编码RNA)、定位到降解的全生命周期,还可通过结构依赖性相互作用组织生物分子凝聚体。SARS-CoV-2基因组研究即证实了复杂RNA结构在调控机制中的关键作用,包括劫持宿主RNA结合蛋白(RBP)及功能性RNA结构的存在。此外,RNA结构也是遗传疾病与病毒感染治疗干预的特异性靶点。近年来,基于大语言模型架构的核酸序列分析方法蓬勃发展,将核苷酸类比为按语境规则组织的“词汇”,催生了RNA语言模型(RNA-LM)。但由于各方法采用的数据集、预处理策略差异较大,且缺乏标准化评估体系,难以直接比较模型性能。近期研究提出了标准化数据集与基准测试框架,旨在量化模型相对性能、识别驱动性能的关键架构选择,并评估模型在训练数据外的泛化潜力。本文概述了基于RNA-LM的前沿结构预测方法,梳理了核心训练数据源、常用基准及其关键结果,并从输入数据到建模策略层面展望了提升RNA结构计算预测的路径。
数据集用于训练与基准测试RNA结构预测模型
随着机器学习模型的激增,训练数据集的多样性显著影响模型架构与应用场景。早期数据集如Archive II与bpRNA数据集,将RNA序列与其点括号表示法的二级结构配对,覆盖经过筛选的RNA家族——Archive II包含约4000个结构,跨越10个家族;bpRNA-1m整合超10万个来自多源的结构,为深度模型训练提供了必要规模。通用数据库如RNAcentral与RFam则成为RNA-LM的重要预训练资源。为避免训练与测试集间序列、结构相似性过高导致的泛化能力高估,新型数据集应运而生:bpRNA-new与RNAStralign引入独立于早期数据集的新序列与结构;RNA3DB与RNAsolo通过聚类降低冗余,其中RNA3DB确保序列与结构均无冗余,从根本上避免了数据泄露导致的性能虚高。社区挑战赛是模型基准测试的重要平台,CASP15(2022)与CASP16(2026)首次纳入专用RNA结构靶点,以X射线晶体学、NMR或cryo-EM解析的三维结构为评估标准;Kaggle Ribonanza挑战赛则基于大规模合成序列的化学探针数据,推动模型从序列预测结构与反应活性。在线挑战赛常保留私有测试集,进一步保障评估客观性。除序列-结构配对外,化学探针数据集可反映实验条件下核苷酸的反应活性,作为碱基柔性与可及性的代理指标,既可用于引导折叠算法,也可作为直接预测目标,避免点括号表示法引入的算法偏差。Kaggle Ribonanza挑战赛提供了近百万条序列的探针信号统一数据集,RASPdb则整合了438个已发表的化学探针数据集。此外,GARNET数据集关联rRNA序列与生物体最适生长温度,NAbench数据集聚合了260万条突变DNA/RNA序列的高通量结合/活性检测数据,助力探索RNA与适应度的关系。现有结构数据集多集中于非编码RNA,且偏向核糖体RNA、tRNA、核糖开关、核酶等强结构、进化保守家族,长链非编码RNA、信使RNA、微小RNA等长RNA类型占比极低,仅少数针对性数据集(如RNAndria涵盖mRNA 3'端与pri-miRNA结构)有所覆盖。大规模探针实验多采用合成或突变序列,天然RNA类别标签缺失,因此数据集的选择直接决定了模型训练与评估阶段接触的RNA类型。而结构保守性正是RNA-LM利用大规模无标注序列进行预训练的基础——假设结构化非编码RNA的进化以结构保留的协变为主导,使得掩码语言预训练可从序列本身推断碱基配对依赖关系。
前沿预测方法与基准测试
1970年代至2006年,RNA结构预测依赖热力学自由能最小化方法(如RNAfold),基于Zuker动态规划算法与Turner参数,以及Pfold等基于随机上下文无关文法(SCFG)的比较方法,利用序列比对的进化协变信息。早期机器学习方法如CONTRAfold(2006)采用条件对数线性模型,性能匹配热力学方法;ContextFold(2011)则揭示了模型在未见RNA家族上的过拟合问题。随后出现的实验训练神经网络进一步推进了该领域:CROSS(2017)首次直接基于高通量探针数据(SHAPE、PARS、icSHAPE)与NMR/X射线结构训练,可在单核苷酸分辨率下从无长度限制的序列预测单双链结构谱,其输出可反馈至热力学方法以提升准确性;CROSSalive(2020)在此基础上整合预测的蛋白相互作用与m6A甲基化依赖性模型,捕捉细胞内RNA结合蛋白与修饰对折叠的影响。RNA结构预测的基石模型时代始于大规模RNA-LM的自监督掩码序列建模:RNA-FM(2022)是基于RNAcentral中2370万条非编码RNA预训练的12层双向Transformer;RNA-MSM(2024)引入多序列比对(MSA)协变信号,注意力图谱可揭示碱基配对接触;RhoFold+(2024)融合RNA-FM嵌入与几何深度学习,在RNA-Puzzles与CASP15上实现最优精度;StructRFM(2025)通过2100万序列-结构对的结构感知预训练,在三级结构预测上超越AlphaFold3;RiNALMo则证明此类语言模型嵌入可整合至混合架构,在无MSA条件下仍具竞争力。这些模型利用大规模无标注序列数据捕获进化与结构模式,支持孤儿RNA的单序列预测,并为结构与功能分析提供通用嵌入。由于各研究采用的训练-测试数据组合及对比模型不同,跨方法直接比较存在困难。近年基准测试框架试图解决这一问题:EternaBench(2022)显示CONTRAfold2等机器学习模型优于ViennaRNA等传统热力学模型;BEACON(2024)覆盖13项RNA结构分析、功能研究与工程应用任务,RNA-FM等表现突出;Sinc-lab RNA-LLM-Folding(2025)聚焦RNA-LM在低同源性二级结构预测任务中的性能,RiNALMo与RNA-FM领先;Wang等人(2026)的零样本评估表明,RNA-MSM、AIDO.RNA等在无需微调的情况下即可通过嵌入适配下游任务;CASP16结果显示,机器学习方法在处理非经典相互作用、假结及维持三级折叠所需的长程依赖时仍面临挑战,而热力学引导的预测通过整合生物物理约束,可作为精准二级支架与复杂三维结构间的桥梁,弥补纯数据驱动模型对物理折叠规律的忽视。总体而言,RNA-LM在多任务中表现优异,但跨家族预测时性能下降明显,且受限于PDB中RNA结构数据仅为蛋白质的1/25、长序列计算成本高昂等问题,还需进一步考虑RNA构象系综、化学修饰对稳定性的影响、环境情境及全转录本尺度建模等挑战。
展望:化学探针信号、多模态数据与建模改进
化学探针信号可指示RNA各位置核苷酸的局部柔性与可及性——高反应性对应未配对、构象灵活的核苷酸,低反应性对应碱基配对或受限状态,为序列折叠结构提供情境化信息。ViennaRNA与RNAStructure等主流折叠算法已将其作为折叠约束;ShaKer与StructureImpute等早期机器学习方法验证了从序列建模探针信号的可行性;Atom-1是基于此类数据训练的闭源基石模型;Kaggle Ribonanza挑战赛发布的大规模化学探针数据集推动了大量深度学习模型的开发,其最终模型RibonanzaNet采用双塔架构,序列表示与二维成对表示在训练中相互更新,可有效捕捉基序与长程依赖,在二维与三维结构预测中表现优异。但该数据集基于合成序列,未涵盖体内情境化RNA结构。近期发布的eFold模型基于体内化学探针数据集RNAndria训练,在Ribonanza数据集上展现出良好泛化性能。值得注意的是,体外折叠主要反映RNA序列固有的热力学与生物物理约束,而体内探针信号可捕获蛋白相互作用、分子拥挤、主动重塑及共转录效应等额外调控层,提供更贴近生理状态的RNA结构快照,甚至可能识别同一RNA在不同情境下的可变结构,如FoldARE方法即尝试突破单结构静态预测的限制。
多模态输入数据展望
RNA修饰(如m6A)可显著改变未修饰序列的相互作用景观,是折叠过程中的关键影响因素。尽管ViennaRNA与RNAStructure套件已成功整合此类数据,但目前尚无深度学习方法尝试联合RNA序列与修饰信息进行折叠预测,这将是未来的重要方向。此外,RNA可及构象集合还可被其他生物分子的相互作用重塑,包括内源性RBP(如翻译过程中解旋mRNA的解旋酶)与外源性分子(如RNA治疗药物或小分子)。整合实验测定或预测得到的此类信号,有望提升结构预测的情境准确性,但解析因果关系仍需更多实验数据与建模方法的支撑。
从预测模型到生成式AI方法
与预测模型输出单一最可能结构不同,生成式模型学习训练数据中结构的整体分布并进行采样,更符合RNA可采样多种替代构象的生物学特性。扩散模型通过渐进加噪与去噪过程生成新样本,RNADiffFold、DynaRNA等已成功将该架构应用于RNA结构预测,RNAGenesis作为基石模型在BEACON基准测试中表现优异。但生成信号的变异性是否反映模型学习到的生物学相关波动(如结构动态、柔性、能量状态),抑或是重构信号的不确定性,仍需进一步厘清。此类模型的优势与局限有待更全面的评估。
结论
本文梳理了机器学习尤其是RNA-LM在RNA结构预测中的最新进展。当前模型评估体系仍需完善,需明确区分架构选择与数据建模策略的实际贡献。不同模型可能具有互补性,新方法应批判性分析其失效场景,并审视参考“真实结构”的本质。未来,新型生成式深度学习架构、多模态或多任务学习策略有望实现更具情境感知与不确定性意识的RNA序列折叠预测。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号