Metax实现宏基因组的精准跨域分类学谱系分析

《Cell》:Metax enables accurate cross-domain taxonomic profiling of metagenomes

【字体: 时间:2026年09月12日 来源:Cell 45.1

编辑推荐:

  分类学谱系分析是微生物组研究的基础,然而对于跨越细菌、病毒、真核生物和古菌的复杂群落,实现高物种水平准确度仍具挑战,且在低生物量、宿主主导的样本中这些局限更为突出。研究人员提出了Metax,一种跨域分类学谱系分析工具,它整合基于覆盖度的概率建模与期望最大化(e

  
分类学谱系分析是微生物组研究的基础,然而对于跨越细菌、病毒、真核生物和古菌的复杂群落,实现高物种水平准确度仍具挑战,且在低生物量、宿主主导的样本中这些局限更为突出。研究人员提出了Metax,一种跨域分类学谱系分析工具,它整合基于覆盖度的概率建模与期望最大化(expectation-maximization, EM)框架,以区分真实微生物信号与伪信号。在来自宿主相关、环境、废水和低生物量临床环境的超过600个样本中(包括参考序列代表性有限的基准数据集),Metax提高了谱系分析准确度,平均F1分数比其他方法高55%,Bray-Curtis相异度低45%。此外,这项广泛评估表明,Metax解析出口腔微生物组中种植体周围炎(peri-implantitis)的细菌和病毒特征,并揭示了血浆游离DNA(plasma cell-free DNA, cfDNA)中提示试剂来源污染物和参考基因组错误组装的信号。通过利用全基因组覆盖度证据,Metax能够在多样化的样本类型和测序深度下实现稳健的跨域谱系分析,包括参考数据库高度不完整的情况。
宏基因组学通过直接测序环境或宿主相关DNA研究微生物群落,能够同时检测细菌、古菌、病毒和微真核生物。然而,实现高准确度的物种水平分类学谱系分析仍面临挑战,尤其在跨越多个微生物域的复杂群落中;低生物量、宿主主导的样本更会加剧这些问题。此外,参考基因组错误组装、试剂来源DNA污染(kitome)以及共享保守区域、移动遗传元件等均会导致假阳性信号。为此,研究人员开发了Metax——一种基于基因组覆盖度信息的跨域分类学谱系分析工具,并通过大规模基准评估证明其能有效区分真实微生物信号与伪信号。该研究发表在《Cell》。

Metax将序列同源性、概率读段分配和基因组覆盖度一致性相结合,利用期望最大化(expectation-maximization, EM)框架估计类群丰度,并通过观测-期望广度比(observed-to-expected breadth ratio, OEBR)等指标过滤异常信号。在超过600个样本中,Metax平均F1分数提高55%,Bray-Curtis相异度降低45%。其方法核心包括五个步骤:首先将测序读段比对到参考基因组数据库并过滤低质量比对;其次区分具有唯一映射读段的物种(species with exclusively mapped reads, SEM)与不具有唯一映射读段的物种(species without exclusively mapped reads, SNM);接着通过EM算法解析多映射读段,对SNM采用最低共同祖先(lowest common ancestor, LCA)分配;然后将观测覆盖广度与随机抽样模型下的期望广度比较,计算OEBR及块水平指标(chunk-level OEBR, COEBR);最后基于最终深度估计计算相对丰度。研究使用了多个样本队列:10个模拟人类肠道宏基因组;10个模拟腹水和10个模拟脑脊液样本;CAMI II海洋数据集;基于土壤微生物组研究构建的116个模拟土壤宏基因组;41个真实下呼吸道感染样本(34阳性、7阴性);真实废水宏基因组/宏转录组;GIAB(Genome In A Bottle)人类全基因组测序数据;肿瘤血浆cfDNA样本;以及317个口腔微生物组样本(健康77、黏膜炎111、种植体周围炎129)。

**利用覆盖度信息进行分类学谱系分析的Metax方法**:Metax工作流程包含五个主要步骤,通过覆盖广度与深度计算、SEM/SNM分类、EM和LCA分配、OEBR/COEBR评估以及丰度计算,识别由参考污染、试剂来源DNA、共享保守基因或移动遗传元件(mobile genetic elements, MGEs)导致的假阳性信号。

**Metax提高了人类肠道复杂群落的物种水平跨域分类学谱系分析准确度**:在10个模拟人类肠道宏基因组上,与mOTUs3、MetaPhlAn4、Sylph、Phanta和Centrifuge等工具相比,Metax在物种水平F1分数提高4%–134%,加权UniFrac误差降低10%–63%,Bray-Curtis相异度降低5%–47%,丰度秩误差(abundance rank error, ARE)降低16%–73%。

**浅测序深度下的性能提升**:在10个腹水和10个脑脊液(cerebrospinal fluid, CSF)样本模拟数据中,测序深度从1k到1M reads,Metax的平均F1分数为0.99,完整性为0.99,纯度为0.99,比最佳方法提高1.7–22倍,并能识别所有细菌、真菌和病毒类群,包括小基因组病毒。

**复杂深度测序海洋群落的准确物种水平类群鉴定和丰度估计**:在CAMI II海洋数据集上,短读长和长读长数据均获得最高物种水平F1分数(0.88),Bray-Curtis相异度为0.01,加权UniFrac误差为0.015,物种丰度预测与真实值的Pearson相关系数为0.97。

**对具有高菌株多样性和有限参考代表性的土壤宏基因组的普适性**:在模拟土壤宏基因组中,76%物种不在参考数据库内,每个物种含3–10个菌株。Metax仍取得最高平均物种F1分数(0.24),属水平
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号