《Natural Product Reports》:Advancing biosynthetic pathway discovery through short-read-directed long-read sequencingOpen Access
编辑推荐:
文献时间跨度为2020年至今。宏基因组方法快速发展,使研究人员能够直接从复杂微生物组数据中识别生物合成途径。短读长测序(short-read sequencing)虽然准确且成本效益高,但常产生碎片化组装结果,导致不完整生物合成基因簇(biosynthetic
文献时间跨度为2020年至今。宏基因组方法快速发展,使研究人员能够直接从复杂微生物组数据中识别生物合成途径。短读长测序(short-read sequencing)虽然准确且成本效益高,但常产生碎片化组装结果,导致不完整生物合成基因簇(biosynthetic gene cluster, BGC)回收。长读长测序(long-read sequencing)可解决碎片化问题,但技术要求和较高成本限制了其可扩展性。研究人员分析了大型宏基因组组装基因组(metagenome-assembled genome, MAG)数据库中短读数据里的BGC碎片化现象,并估算用于回收“完整”BGC所需的靶向基因组连续性。研究人员提出,随着近期超低输入DNA扩增用于高保真PacBio测序(现仅需纳克级DNA)的发展,从短读宏基因组中恢复的MAG可依次用于推动生物合成途径发现。研究人员展示了天然产物研究人员如何借助短读MAG比较来指导以低DNA量和/或有限经费进行靶向长读重测序。该分析为更广泛科学界如何最好地利用短读与长读数据优势、高效配置资源并加速天然产物发现提供了策略建议。
《Natural Product Reports》刊发的这篇论文聚焦复杂微生物组中天然产物生物合成基因簇的发现瓶颈。当前基因组中心天然产物发现高度依赖测序数据,但大多数公共数据库由短读长测序衍生的宏基因组组装基因组(metagenome-assembled genome, MAG)主导。短读组装常因BGC本身长度大、重复序列多而出现碎片化,单个BGC被拆到多个contig上,使完整BGC回收困难,也干扰BGC真实存在与否的判断。长读长测序能提高连续性并回收完整BGC,但传统方案需微克级DNA且成本较高,难以用于低生物量环境样本。因此,研究人员希望回答:能否用已有短读资源指导靶向长读重测序,并在低DNA输入和有限预算下提升天然产物发现效率。
研究人员通过跨数据库分析、海洋微生物组高质MAG比较、N50与完整BGC关系建模,以及已有海洋和珊瑚相关案例,说明BGC发现的主要瓶颈不是binning而是assembly;并给出短读定向长读测序的工作流与建议。该研究意义在于把“已经产生的短读大数据”转化为靶点发现入口,再用超低输入长读技术验证和补全BGC,从而降低资源门槛、提高后续异源表达与生态注释的可行性。
关键技术方法上,研究人员使用Ocean Microbiomics Database中高质量MAG与antiSMASH预测的BGC数据,按mOTU归并后比较连续基因组(≤3个contig)与碎片化基因组随N50变化时的完整BGC数量差异;借助已有Illumina与PacBio HiFi小鼠粪便MAG数据说明长读连续性优势;并利用Tara Oceans、Tara Pacific、Reef Microbiomics Database等公共队列中BGC丰富度与分类单元丰度信息,筛选高目标物样本,再用纳克级剩余DNA进行超低输入PacBio长读测序。
第二节Mining genomic resources for microbial biosynthetic diversity中,研究人员对比环境无关与环境特异性、(分离株)isolates与MAG数据库,指出MAG虽更碎片化但能覆盖不可培养微生物的更广系统发育与BGC多样性;并通过Ocean Microbiomics Database分析发现,当MAG的N50达到约30 Kbp、分离株基因组达到约45 Kbp时,连续与碎片化基因组的完整BGC数无显著差异,说明组装连续性比binning更关键。
第三节Ultra-low DNA input long-read sequencing中,研究人员梳理PacBio HiFi与Nanopore R10.4.1后长读精度已超99%,且扩增方案使PacBio可至纳克级、ONT可至25 ng、TELL-seq可亚纳克级;同时提醒扩增可能引入嵌合、GC偏移、技术偏好与污染风险。
第四节Short read-directed long read sequencing中,研究人员以Ca. Eudoremicrobium malaspinii和珊瑚相关候选Acidobacteriota(Ca. Moanaiibacterium opulentum)为例,说明先用短读MAG与丰度分布锁定富BGC样本,再用剩余不足10 ng DNA做长读重测序,可获得近完整或完整染色体,并补回短读MAG常缺失的16S rRNA,但也要注意16S不能作为物种界限完美代理。
第五节Recommendations for short-read-directed long-read sequencing中,研究人员给出三步建议:BGC mining利用公私数据绘图并保留≥10 ng DNA备份;abundance profiling用TPM等合理丰度指标锁定样本并管理季节性与GC偏差;long read sequencing在5–10 ng DNA时采用超低输入方案,并核对短读与长读组装重叠、调控区、转运/抗性/靶标标记及宿主表达适配性。
讨论部分强调,公共短读数据库虽有碎片化局限,却是识别富BGC谱系和样本的低成本入口;短读定向长读重测序配合超低输入建库,能在材料与资金受限时把BGC置于更完整基因组上下文中,支撑生态分布刻画、分类学定位、异源表达宿主选择与下游工程化。结论部分译为:研究人员将基因组连续性确定为BGC挖掘与发现中的限制因素,揭示了直接利用多数公共测序数据库数据时的系统性挑战。尽管如此,短读数据库仍可提供宝贵信息,用于识别有前景、富BGC的微生物谱系与感兴趣样本,并为目标导向的重测序提供靶点。短读定向长读重测序与超低输入建库技术相结合,使得即使在资金和遗传物质有限的情况下,也能靶向感兴趣BGC。该工作流通过在更广阔基因组背景下对BGC进行语境化,为生态表征和下游生物技术应用生成高分辨率数据。研究人员提供了一套逐步建议,以指导短读定向长读重测序工作,并将天然产物发现推进到下一阶段。