深度学习驱动的脱氮副球菌核糖体结合位点从头设计

《Synthetic and Systems Biotechnology》:Deep learning-driven de novo design of ribosome binding sites in Paracoccus denitrificans

【字体: 时间:2026年08月14日 来源:Synthetic and Systems Biotechnology 4.8

编辑推荐:

  摘要翻译: 脱氮副球菌(*Paracoccus denitrificans*)是一种异养硝化-好氧反硝化细菌,广泛应用于废水处理,并作为研究电子传递链的模式系统,使其成为环境合成生物学中颇具潜力的底盘生物。基因表达的精确翻译控制对于在该生物中改造目标性状至

  
摘要翻译:
脱氮副球菌(*Paracoccus denitrificans*)是一种异养硝化-好氧反硝化细菌,广泛应用于废水处理,并作为研究电子传递链的模式系统,使其成为环境合成生物学中颇具潜力的底盘生物。基因表达的精确翻译控制对于在该生物中改造目标性状至关重要,然而在*P. denitrificans*中设计功能性核糖体结合位点(ribosome binding site, RBS)仍因对其序列-活性关系了解有限而受到阻碍。为弥补这一空白,研究人员通过整合转录组学与蛋白质组学分析,系统剖析了1335个天然RBS序列。研究发现,RBS强度主要由位于起始密码子上游5–8 bp处的富嘌呤Shine–Dalgarno(SD)基序决定,该区域中特定的A/G模式是关键决定因素。基于该数据集,研究人员开发并比较了CNN、BiLSTM和Transformer模型用于RBS强度预测;其中,CNN取得了最高的预测相关性(Pearson r = 0.68)。此外,研究还构建了WGAN-GP框架以生成新型RBS序列,随后通过预测框架进行筛选和评估,从而实现具有用户指定强度的RBS设计。实验验证显示,预测强度与实测强度之间具有较强相关性(Pearson r = 0.75)。该工作建立了首个面向*P. denitrificans*的深度学习RBS设计平台,为精确翻译调控提供了稳健工具,并推动了环境生物技术中的合成生物学应用。
论文解读

**研究背景与问题**
脱氮副球菌(*Paracoccus denitrificans*)作为α-变形菌纲的代表菌种,广泛分布于土壤、水体和活性污泥等环境中,具有异养硝化-好氧反硝化能力,可高效完成NO??→NO??→N?O→N?的脱氮过程,在氮循环和环境生物修复中发挥关键作用。同时,其呼吸链在硝酸盐还原过程中的独特角色使其成为研究电子传递和氧化磷酸化的模式生物。此外,该菌还能降解吡啶、二氰基二甲苯等芳香族污染物,并可生产单细胞蛋白和聚羟基脂肪酸酯,在污染场地修复、生物采矿、工业废水资源回收及材料科学等领域具有重要应用价值。然而,要实现对该菌代谢网络的有效工程化改造,精确调控基因表达至关重要。启动子和核糖体结合位点(ribosome binding site, RBS)分别在转录和翻译水平控制基因表达,是代谢工程中最关键的调控元件。尽管已有针对*P. denitrificans*的启动子筛选和表征研究,但对其RBS元件缺乏系统研究,保守序列和构效关系尚未阐明,严重阻碍了合成生物学在该菌中的应用。传统的RBS设计方法主要依赖经验性试错和突变库筛选,成本高、周期长,且基于*Escherichia coli*的热力学模型和数学模型在*P. denitrificans*中预测准确性显著下降,因为不同菌群的16S rRNA anti-SD(aSD)序列及其可及性差异较大,导致物种特异的SD–aSD相互作用不同于*E. coli*。因此,亟需建立*P. denitrificans*特异的RBS数据库,并引入深度学习等先进计算框架实现RBS强度预测和序列设计。

**研究内容与结论**
研究人员首先从NCBI数据库获取*P. denitrificans*全基因组注释(SAMN27734047),利用自行开发的Python工具提取每个基因起始密码子上游50 bp序列作为候选RBS区域,共获得5227个CDS区域。通过WebLogo序列特征分析发现,起始密码子上游约8 bp处存在富嘌呤基序。进一步使用STREME进行基序发现,得到6类SD基序,其中Class 1具有最高的统计显著性(p = 2.3 × 10??)和最高的出现频率(30%),其保守基序为AAGGAG,与*E. coli*典型SD序列AGGAGG高度相似。通过FIMO扫描定位SD序列,并分析间隔区长度分布,发现Class 1序列富集于起始密码子上游1–8 bp处,符合原核生物功能性SD的空间组织特征,因此Class 1被认定为*P. denitrificans*的保守SD基序。
为验证不同SD基序的功能,研究人员构建了含有不同SD变体的sfGFP报告质粒,并转入*P. denitrificans* DYTN-1菌株进行荧光测定。结果显示,所有6类基序均具有翻译起始活性,但Class 1表现出最宽的动态调控范围(最高12.3倍表达变化)和最高的平均表达水平。进一步分析表明,非Class 1 SD的翻译活性与其序列相似性无关,而可能受SD上游AG富集序列的补偿作用影响。删除上游AG富集序列后,Class 1表达仅下降5.9%,而Class 2–6表达下降42.5%–65.8%,证实了上游AG序列对弱SD的补偿作用。
为构建大规模RBS强度数据集,研究人员整合转录组(RNA-seq)和蛋白质组(LC-MS/MS)数据,对*P. denitrificans* DYTN-1在模拟废水培养基中培养至对数期(OD??? ≈ 0.35)的样本进行分析。蛋白丰度采用Label-Free Quantification(LFQ)值,mRNA丰度采用FPKM值,定义翻译效率(translation efficiency, TE)为LFQ/FPKM。最终获得1335个高置信度RBS–TE配对数据,log10TE值范围3.86–11.49,呈近似正态分布,表明天然RBS具有极宽的调控范围。方差分解显示,TE解释了蛋白丰度变异的64.86%,而转录贡献仅35.14%,表明RBS驱动的翻译调控在*P. denitrificans*蛋白表达中占主导地位。序列比较发现,高TE RBS在SD区域特定位置(如第2、3、8位A)显著富集,G在第4、5位严格保守,而C在低TE RBS的第1、2位富集,可能干扰核糖体结合构象。间隔区长度和SD–aSD结合亲和力(ΔG)在高TE组中显著更高。
基于该数据集,研究人员开发了三种深度学习模型——卷积神经网络(CNN)、双向长短期记忆网络(BiLSTM)和Transformer——进行RBS强度预测。输入序列为包含SD、间隔区和起始密码子的25 bp区域,通过One-hot编码输入模型。在7:3训练/测试划分下,CNN获得最高的预测相关性(Pearson r = 0.68),Transformer和BiLSTM均为r = 0.60。分布比较中,CNN的推土机距离(EMD = 0.14)最低,KS统计量(0.13)与BiLSTM(0.12)接近,综合表现最佳。
为实现RBS的从头设计,研究人员构建了WGAN-GP(带梯度惩罚的Wasserstein生成对抗网络),以1335条天然RBS为真实样本进行对抗训练。该模型包含生成器和判别器,每个网络由7个残差块组成,采用梯度惩罚(λ = 10)稳定训练。训练后,生成序列与天然序列在SD和起始密码子区域展现出高度一致的保守特征,k-mer(k=2–6)频率相关系数均高于0.83,且约70%的生成序列未出现在训练集中,表明模型产生了新颖的RBS序列。通过CNN预测模型对生成序列进行强度筛选,选取50条预测强度覆盖弱、中、强的候选序列进行实验验证,预测与实测强度之间的Pearson相关系数达到0.75,验证了生成-筛选联合策略的有效性。

**关键技术与方法**
该研究涉及的主要技术方法包括:1)基因组序列提取与基序发现:使用自开发的Specified Sequence Extraction Tool提取候选RBS区域,采用STREME进行保守基序发现,FIMO进行全序列扫描定位SD;2)多组学整合分析:通过RNA-seq和LC-MS/MS分别获得转录组和蛋白质组数据,计算LFQ/FPKM比值作为翻译效率(TE),构建RBS强度数据集;3)深度学习预测模型:构建并比较CNN、BiLSTM和Transformer三种架构,其中CNN采用两层一维卷积加全局平均/最大池化,BiLSTM采用双向LSTM加注意力机制,Transformer采用多头自注意力编码器;4)生成对抗网络设计平台:使用WGAN-GP生成新型RBS序列,配合CNN预测模型进行目标强度筛选。样本来源为*P. denitrificans* DYTN-1菌株,培养于含特定抗生素的模拟废水培养基中。

**研究结果**
3.1 从*P. denitrificans*基因组中挖掘RBS基序
通过基因组注释提取5227个CDS上游50 bp候选区域,WebLogo分析显示起始密码子上游约8 bp处存在富嘌呤基序。STREME鉴定出6类SD基序,其中Class 1(AAGGAG)具有最高显著性(p = 2.3 × 10??)、最高出现频率(30%)和最强的位置富集(1–8 bp),被认定为保守SD基序。

3.2 不同基序RBS的功能验证
通过构建sfGFP报告系统,验证了6类SD基序均具有翻译起始活性,但Class 1的动态范围和平均表达水平最高。序列相似性分析显示非Class 1 SD的活性不是由SD序列相似性驱动,而是受上游AG富集序列的补偿作用影响,删除实验证实了该结论。

3.3 *P. denitrificans*全基因组RBS强度分析
整合转录组和蛋白质组数据,获得1335个RBS–TE配对数据集。TE可解释64.86%的蛋白丰度变异,显著高于转录贡献(35.14%)。高TE RBS在SD区域特定位置具有A富集、G保守、C贫乏的特征,且间隔区长度和结合亲和力更高。

3.4 基于深度学习的RBS强度预测模型构建
比较CNN、BiLSTM和Transformer三种模型,CNN获得最佳预测性能(Pearson r = 0.68,EMD = 0.14),表明CNN能有效捕获RBS序列中的局部关键特征。

3.5 基于WGAN-GP的RBS从头设计平台开发
WGAN-GP生成的序列保留了天然RBS的保守基序,k-mer相关性高(>0.83),70%为新颖序列。通过CNN预测筛选后,实验验证预测与实测强度相关性达0.75,证明该平台可设计具有定制强度的新型RBS。

**讨论与结论**
本研究首次系统鉴定了*P. denitrificans*的RBS序列,建立了涵盖宽翻译效率范围的RBS数据集,并开发了基于深度学习的RBS强度预测和从头设计平台,填补了该菌RBS设计工具的空白。与依赖热力学模拟的传统方法相比,基于实验数据训练的深度学习模型具有更高的物种特异性和预测可靠性。研究构建的梯度强度RBS库可作为合成生物学的重要资源,也为其他非模式细菌的RBS设计提供了可推广的工作流程。但研究也指出,天然基因组的规模和多样性有限,未来需构建大规模合成RBS库并结合高通量表征,以进一步提升模型性能。此外,*P. denitrificans*的翻译调控还受5′-UTR二级结构等非RBS因素影响,引入标准化RBS元件或构建5′-UTR文库将有助于提高翻译稳定性和可预测性。
研究结论:该工作建立了首个面向*P. denitrificans*的深度学习RBS设计平台,实现了RBS强度的准确预测和具有预定强度新型RBS的从头生成,为精确翻译调控和环境生物技术中的合成生物学应用提供了有力工具。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号