编辑推荐:
大型基因组数据库显著提高了研究人员对海洋微生物的理解。尽管这些资源集中在原核生物上,但许多优势海洋谱系的基因组,如Pelagibacter和Prochlorococcus,明显未得到充分代表。在此,研究人员介绍了大堡礁微生物基因组数据库(GBR-MGD),该数
大型基因组数据库显著提高了研究人员对海洋微生物的理解。尽管这些资源集中在原核生物上,但许多优势海洋谱系的基因组,如Pelagibacter和Prochlorococcus,明显未得到充分代表。在此,研究人员介绍了大堡礁微生物基因组数据库(GBR-MGD),该数据库包含使用Nanopore和Illumina测序从大堡礁海水样本中获得的5,283个原核基因组,包括一组未充分代表类群的高质量基因组。研究人员表明,由于菌株异质性和低GC百分比测序偏差的共同作用,标准短读长组装遗漏了这些种群。GBR-MGD还包括20个染色体水平的微微型真核生物基因组和808,585个病毒基因组,包括一个新描述的海洋Crassvirales分支。研究人员展示了GBR-MGD在识别指示类群方面的实用性,这些类群可以可靠地预测珊瑚礁管理措施的效果,例如建立海洋保护区。
海洋微生物通过代谢相互作用驱动全球生物地球化学循环,构成海洋食物网的基础。然而,现有大规模基因组数据库(如Tara Oceans和GEM)对优势海洋谱系(如Pelagibacter和Prochlorococcus)的基因组覆盖严重不足,且病毒和真核生物成分常被忽略。大堡礁(GBR)作为全球最大的珊瑚礁生态系统,其浮游微生物组尚未得到系统研究。为填补这一空白,研究人员利用混合长读长(Nanopore)和短读长(Illumina)测序技术,构建了综合性大堡礁微生物基因组数据库(GBR-MGD),旨在揭示微生物群落结构、功能及其对管理措施的响应。该研究发表于《Nature》。
研究人员发现,短读长组装因菌株异质性和低GC含量测序偏差而遗漏关键类群,而长读长技术可有效克服这些限制。GBR-MGD包含5,283个原核宏基因组组装基因组(pMAG)、20个染色体级微微型真核生物宏基因组组装基因组(eMAG)和808,585个病毒宏基因组组装基因组(vMAG),其中66.7%的原核物种为新增。通过整合微生物组数据与海水理化参数,研究人员利用机器学习方法识别出可预测珊瑚礁保护区划(如禁渔区NTMR与开放捕捞区Fished)的指示类群,准确率达74.6%。此外,GBR-MGD扩展了海洋Crassvirales的多样性,并揭示了染色体级真核生物基因组中的结构变异,如Bathycoccus和Ostreococcus的倒位与易位。该研究首次证明渔业管理对海水微生物群落具有大规模生态系统效应,为珊瑚礁适应性管理提供了分子工具。
**关键技术方法**:研究人员从大堡礁48个站点(覆盖南北断面,与澳大利亚海洋科学研究所AIMS长期监测计划LTMP联合采集)采集海水样本,每个站点4个5升生物学重复,经0.22μm过滤后提取DNA。对27个站点进行Nanopore(PromethION平台)和Illumina(NovaSeq 6000)混合测序,其余21个站点仅用Illumina测序。使用Aviary流程进行混合组装(metaFlye + metaSPAdes),并通过MetaBAT、MaxBin、CONCOCT等工具分箱,再经DAS Tool整合获得pMAG。病毒预测使用GeNomad、Virsorter2、ViralVerify、VIBRANT和PPR-Meta(排除DeepVirFinder),经CheckV评估质量。真核生物基因组通过竞争性比对与手动注释获得染色体级eMAG。理化参数(17项)按Terzin等(2021)方法测定。
**混合宏基因组组装的基准测试**:通过对比等量测序深度(30Gbp)的Illumina-only与混合组装(Illumina+Nanopore),发现混合组装的pMAG连续性提高29倍(N50中位数730 vs 25kb),每样本高质量pMAG数量从13增至40。Pelagibacterales、Prochlorococcus、SAR86等难回收类群在混合组装中显著增加,而Illumina-only组装的核苷酸多样性(inStrain)超过0.02时无法回收pMAG。此外,低GC含量(<40%)类群在Illumina数据中平均被低估3-18倍,揭示GC偏差是短读长遗漏的另一关键因素。
**原核MAG的回收**:27个混合组装样本获得4,713个pMAG(含1,505个高质量、345个环状),加上21个Illumina-only样本的570个pMAG,总计5,283个。物种水平去重复(95%平均核苷酸相似度ANI)得到876个独特物种,其中584个(66.7%)未在海洋微生物组数据库(OMD)中代表。读长映射显示,GBR-MGD pMAG平均覆盖群落47%±11%,优于Tara Oceans(7%)和GEM(约20%),接近OMD(约58%)。跨7个扇区的群落组成显著不同,但Parasynechococcus sp002724845在6个扇区占优势(平均8.5%-14.7%)。Townsville扇区(TO)因高磷酸盐和低铵盐而富集Prochlorococcus_A等类群,基因功能分析支持营养差异。
**珊瑚礁分区的微生物指示物**:利用MINT sPLS-DA(多变量集成稀疏偏最小二乘判别分析)进行特征选择,再结合随机森林分类,以pMAG、vOTU和真核生物contig为输入,预测保护区划准确率为74.6%±1.4%。仅用pMAG时准确率为71.4%±0.9%。NTMR指示类群主要为基因组精简(低GC、小基因组)的寡营养菌,如Pelagibacterales(NTMR平均7.9% vs Fished 5.4%)、SAR86(1.6% vs 1.1%)、Marinisomatota(0.6% vs 0.4%),这些类群均具有高菌株异质性和低GC含量。Fished reef指示类群为高GC(>45%)的富营养菌,如UBA11663、UBA8752等。营养测量显示NTMR中溶解氮(氨、硝酸盐、亚硝酸盐)显著低于Fished reef,表明保护状态通过营养水平选择不同生态策略的微生物。区域特异性明显,如Innisfail扇区(IN)NTMR富集Pelagibacter物种,而TO NTMR富集Prochlorococcus_A。
**DNA病毒的回收**:经五种工具(GeNomad、Virsorter2、ViralVerify、VIBRANT、PPR-Meta)联合预测,获得808,585个单一contig的vMAG,代表362,802个病毒操作分类单元(vOTU,95% ANI)。读长映射显示病毒占每个宏基因组的4%-27%(平均13%)。分类学上,67%为Caudoviricetes,其中Kyanoviridae(2.8%)和Autographiviridae(1.4%)为常见,6%为Nucleocytoviricota(巨病毒),27%未分类。
**海洋Crassvirales的回收**:312个vMAG被GeNomad归类为Crassvirales,但系统发育分析(基于TerL基因和全基因组)表明,其中155个(93%)属于姐妹分支Pachyviridae和Pervagoviridae,仅12个为典型Crassvirales。GBR-MGD Crassvirales与南极C1、C2分支共同构成单系海洋分支,其中GBR序列形成高GC亚群(平均45% vs 34%),预测宿主为Bacteroidota。
**微微型真核生物基因组的回收**:利用Nanopore长读长获得5个Bathycoccus eMAG和15个Ostreococcus eMAG,均为染色体级别且含端粒。Bathycoccus存在两个基因组变体(BV1与BV2),BV2在染色体4上存在约350kb倒位。Ostreococcus全为clade B,与RCC809高度相似(>99% ANI),但染色体8和12间存在约350kb易位。Ostreococcus clade B是GBR中第二丰富的微生物物种(平均3.5%,最大30%)。
**讨论与结论**:研究表明,短读长测序因高菌株异质性和低GC偏差而遗漏关键海洋微生物类群,长读长(Nanopore)可有效解决。GBR-MGD整合了原核、病毒、真核基因组与理化数据,首次证明渔业管理对海水微生物群落的大规模生态系统效应。研究扩展了海洋Crassvirales的多样性,实现了染色体级真核微生物基因组重建。研究人员建议将长读长宏基因组学纳入海洋微生物群落的常规分析,并指出低GC含量和菌株异质性并非海洋环境独有,其他生态系统也可能受此限制。最终,研究人员提出将长读长宏基因组学(生物学)与理化测量(营养盐)整合到珊瑚礁监测中,将为实现适应性管理提供必要框架。