《Non-coding RNA Research》:LncPNdeep: A long non-coding RNA classifier based on large language model with peptide and nucleotide embedding
编辑推荐:
准确分类长链非编码RNA(long non-coding RNAs,lncRNAs)对于转录组注释和理解基因调控至关重要。现有的计算方法主要依赖核苷酸序列特征,常常忽略lncRNAs中编码的生物学相关肽信号。为了克服这一限制,研究人员开发了LncPNdeep,
准确分类长链非编码RNA(long non-coding RNAs,lncRNAs)对于转录组注释和理解基因调控至关重要。现有的计算方法主要依赖核苷酸序列特征,常常忽略lncRNAs中编码的生物学相关肽信号。为了克服这一限制,研究人员开发了LncPNdeep,一个整合的深度学习框架,它结合了通过掩码语言模型(Masked Language Model,MLM)提取的核苷酸和肽嵌入(peptide embeddings),特别利用了BigBird、Longformer和ProtTrans的上下文表示。通过将两种特征在拼接的神经架构中融合,LncPNdeep稳健地捕获了复杂的序列关系,并提高了lncRNAs和编码RNA(coding RNAs)之间的区分能力。在人类转录组上的基准测试达到了97.1%的准确率,超越了已有的lncRNA分类工具和基线机器学习模型。LncPNdeep在跨物种数据集上也表现出优越的泛化能力,保持了一致的高准确率和F1分数。置换分析(permutation analysis)强调了肽嵌入,特别是平均肽嵌入(Average Peptide Embedding)在模型性能中的关键作用,而t-SNE可视化证实了整合多种嵌入显著增强了lncRNAs与编码RNA的分离。这些结果将LncPNdeep定位为转录组研究中一个多功能且强大的工具,促进了lncRNA发现、生物标志物识别和比较基因组学。模型和说明可在https://github.com/yatoka233/LncPNdeep免费获取。
长链非编码RNA(long non-coding RNAs,lncRNAs)是一类长度超过200个核苷酸且缺乏蛋白质编码潜能的RNA分子,在基因调控、发育过程(如X染色体失活、基因组印记和Hox基因表达)中发挥关键作用,其失调与癌症、心血管疾病和阿尔茨海默病等重大疾病相关。现有计算方法大多依赖核苷酸序列特征,通过机器学习或深度学习建模,如CPC2(支持向量机)、PLEK(改进k-mer谱)、CPAT(逻辑回归)、CNCI(相邻核苷酸三联体频率)及FEELnc(随机森林)等,但均忽视了lncRNA中可能编码的生物学相关肽信号。近年研究发现,部分lncRNA通过小开放阅读框(small open reading frames,sORFs)编码短功能肽,这些肽具有独特的结构和生物学特性,提示肽信息可作为区分lncRNA与编码RNA的互补信号。为弥补这一不足,研究人员开发了LncPNdeep——一种整合大语言模型(large language models,LLMs)提取的核苷酸和肽嵌入的深度学习框架,旨在更准确地进行lncRNA分类。该论文发表在《Non-coding RNA Research》。
研究人员开展的研究包括:利用人类GENCODE Release 43(GRCh38.p13)数据集(训练集48,876个lncRNA和99,187个编码RNA;测试集5,415个lncRNA和11,037个编码RNA),通过自举重采样平衡训练数据;从6种脊椎动物(熊猫、牛、斑马鱼、鸡、长臂猿、猪)和6种真菌(构巢曲霉、稻瘟病菌、禾柄锈菌、酿酒酵母、粟酒裂殖酵母、小麦壳针孢)的Ensembl数据库获取跨物种验证数据集。主要技术方法包括:使用大语言模型(BigBird、Longformer、ProtTrans)分别提取核苷酸嵌入(Longformer256、BigBird256、BigBird768)和肽嵌入,其中肽嵌入通过扫描开放阅读框(open reading frames,ORFs)生成三种表示——假肽嵌入(Fake Peptide Embedding)、最大肽嵌入(Max Peptide Embedding)和平均肽嵌入(Average Peptide Embedding);将六种嵌入分别输入含残差连接的一维卷积神经网络(1D CNN),拼接后经双向长短期记忆网络(BiLSTM)和密集神经网络(DNN)进行二分类。该框架整合了多模态特征,实现了端到端分类。
**3.1 人类lncRNA识别性能**:通过对比LncPNdeep与六种已有方法(CNCI、CPC2、CPAT、PLEK、LncAdeep、LncRNA Mdeep)及传统机器学习模型(支持向量机、逻辑回归、随机森林),LncPNdeep在人类测试数据集上达到97.1%准确率、96.7%特异性和98.0%敏感性,敏感性显著优于所有对比方法(较LncAdeep提高3.6%,较LncRNA Mdeep提高7.0%,较CPC2提高27.3%,较CNCI提高17.5%,较CPAT提高64.8%,较PLEK提高28.4%)。
**3.2 跨物种lncRNA识别性能**:仅使用人类RNA数据集训练,LncPNdeep在12个物种(6种脊椎动物和6种真菌)上测试,表现出高准确率和F1分数,尤其在熊猫(95.5%准确率,97.6% F1)、牛(93.5%准确率,97.7% F1)和斑马鱼(90.6%准确率,96.3% F1)上表现突出。尽管在真菌物种中性能略有下降(如CPAT在牛和Z. tritici上准确率略高),但LncPNdeep在所有物种上F1分数均超过90%,显示其稳健性和泛化能力。
**3.3 每种肽嵌入的置换分析**:通过300次随机置换测试,发现置换平均肽嵌入导致准确率和特异性下降最大(平均准确率降至0.902,p<0.001),表明ORF衍生的肽嵌入提供最关键的分类信号;假肽嵌入置换后下降最小但特异性仍显著降低,说明弱肽表示在融合框架中仍提供互补信息。
**3.4 肽嵌入表示的比较分析**:主成分分析(PCA)显示平均肽嵌入占据主成分主要方差,而最大肽嵌入和假肽嵌入在低方差区域高度重叠,表明假肽嵌入与生物学衍生的肽嵌入分布一致。k-近邻(KNN)分类中,BigBird256嵌入准确率最高(0.89),优于其他嵌入。
**3.5 各嵌入的t-SNE聚类**:t-SNE可视化显示,单独使用任一嵌入(核苷酸或肽)时,lncRNA与编码RNA聚类存在明显重叠;而整合所有六种嵌入后,两类RNA的分离显著改善,证实多模态特征融合对分类性能的提升作用。
**3.6 计算资源**:预训练阶段在单张NVIDIA V100 GPU(16 GB)上耗时约5天;下游阶段嵌入提取和模型训练可在单张RTX 4080 Super GPU上完成,每转录本嵌入提取耗时约1.5秒,分类器内存和计算需求有限。
**讨论总结**:LncPNdeep通过整合核苷酸和肽嵌入,在人类和跨物种数据集上均达到最优性能,特别是肽矢量信息显著提高了预测准确性。置换分析表明平均肽嵌入贡献最大,但假肽嵌入主要起正则化作用,不代表生物学翻译。局限性包括:肽嵌入的生物学相关性需实验验证,依赖注释数据库可能引入偏差,跨物种性能在真菌中下降可能源于ORF结构差异。未来方向包括整合Ribo-seq数据、扩展至其他非编码RNA类型,并实验验证预测的lncRNA衍生肽。
**结论翻译**:总之,LncPNdeep通过整合核苷酸和肽水平序列特征,利用最先进的语言模型,在lncRNA计算分类方面取得了显著进展。该模型一致优于传统机器学习方法和已有lncRNA检测工具,在多种物种中提供稳健的准确性。重要的是,肽嵌入的纳入增强了预测性能,同时为lncRNA的功能景观提供了新见解。LncPNdeep作为转录组注释中假设生成和候选优先级排序的资源,支持而非替代实验验证。未来工作将聚焦于整合额外序列和结构特征、扩展至其他非编码RNA类型,并通过实验验证预测的lncRNA衍生肽。总之,该研究展示了生成式人工智能(GenAI)模型在计算转录组学中的潜力,并强调了与经验数据整合的持续需求。LncPNdeep在识别lncRNA方面达到最高准确率(97.1%)、特异性(96.7%)和敏感性(98.0%),优于所有基线方法。