哥斯达黎加两株福氏耐格里虫临床分离株的基因组组装与注释

《Microbiology Resource Announcements》:Genome assembly and annotation of two clinical Naegleria fowleri isolates from Costa Rica

【字体: 时间:2026年09月04日 来源:Microbiology Resource Announcements 0.6

编辑推荐:

   摘要在此,我们报告了利用 Illumina 测序对 2020 年哥斯达黎加原发性阿米巴脑膜脑炎病例中分离出的两株Naegleria fowleri临床分离株的基因组组装和注释。每个组装包含 37 个参考导向支架,基因组大小约为 28 Mbp,GC 含量为 36.87%。公告自

  

摘要

在此,我们报告了利用 Illumina 测序对 2020 年哥斯达黎加原发性阿米巴脑膜脑炎病例中分离出的两株Naegleria fowleri临床分离株的基因组组装和注释。每个组装包含 37 个参考导向支架,基因组大小约为 28 Mbp,GC 含量为 36.87%。

公告

自由生活阿米巴Naegleria fowleri(超级群 Excavata;门 Percolozoa;纲 Heterolobosea)分布于世界各地的淡水和土壤环境中,引起原发性阿米巴脑膜脑炎(PAM),其致死率极高(>97%)(1)。尽管Naegleria属水平的泛基因组提供了关于这些自由生活阿米巴多样性和适应性的结构和功能见解(2),但N. fowleri的致病性和生物学特性仍未被完全理解。需要来自临床 PAM 病例的额外接近完整的组装,特别是来自中美洲的,以更好地代表致病谱系。在此,我们组装和注释了两株于 2020 年从哥斯达黎加加纳卡斯特省和利蒙省的 PAM 病例中获得的临床分离株(3, 4)。
N. fowleri Guanacaste(MT090627; NF_Guanacaste)和N. fowleri Limón(MT210902; NF_Limón)从脑脊液中分离,并在 37°C 下以 2% 酪蛋白水解物进行无细胞培养(3, 4)。基因组 DNA 是从大约 1 × 10?个滋养体中提取的,使用经过 RNase A 处理的 QIAamp DNA Mini Kit,使用 NanoDrop 进行定量,并在法国巴斯德研究所的 Biomics 核心设施使用 Nextera XT 文库在 NextSeq 500 系统上进行测序(2 × 150 bp)。读段使用 FastQC v0.12.1 进行评估(5),使用 Cutadapt v5.0 进行修剪(6),并使用 Trimmomatic v0.39 进行过滤(7)(LEADING:5, TRAILING:5, SLIDINGWINDOW:4:20, and MINLEN:36)。除另有说明外,使用默认参数。
使用 SPAdes v4.0.0 进行从头基因组组装(8),并使用 QUAST v5.3.0(9)和 BUSCO v5.7.1 进行评估,在基因组模式下使用 eukaryota_odb10(255 个标记)(10)。使用 RagTag v2.1.0 的 scaffold 命令针对N. fowleri TY 参考基因组(NF_TY)对重叠群进行支架化(11)。最终覆盖度是通过使用 BWA-MEM v0.7.18 将 Illumina 读段映射到每个参考导向组装并使用 samtools 计算平均深度来估计的。在 MAKER v2.31.11 基因预测之前,使用 RepeatModeler v2.0.5 对重复序列进行建模,并使用 Dfam 数据库使用 RepeatMasker v4.1.6 进行屏蔽,遵循以前描述的过程(2)。蛋白编码基因是使用基于证据的比对、从头预测器 SNAP 和 AUGUSTUS、来自公共N. fowleri RNA-seq 数据的基因组导向转录组装(ENA 项目PRJNA642022; 来自瓜德罗普的 NF1_LV 和 NF45_HV 菌株)(12)以及 Swiss-Prot 蛋白作为证据进行预测的。
使用 MAKER 预测转录本上的转录组模式 BUSCO 和注释编辑距离(AED)评估注释完整性。AED 得分是使用 AED_cdf_generator.pl 脚本计算的(13);AED ≤0.5 的基因模型分别代表 NF_Guanacaste 和 NF_Limón 的 98.0% 和 97.8%。使用 MAKER 预测的蛋白序列和具有默认参数的 MMseqs2 easy-rbh 工作流鉴定共享和菌株特异性基因(14, 15)。
最终参考导向的草图组装包含 37 个支架,基因组大小为 27.95 和 27.97 Mbp,鸟嘌呤 - 胞嘧啶(GC)含量为 36.87%,NF_Guanacaste 和 NF_Limón 的平均测序深度分别为 341×和 270×。未确定支架末端是否完整。基因预测在 NF_Guanacaste 和 NF_Limón 中分别鉴定出 9,082 和 8,920 个蛋白编码基因。基因组模式下的 BUSCO 完整性接近 88%,注释转录组模式下的接近 80%(表 1)。比较分析鉴定出 8,306 个共享基因,其中 714 个基因是 NF_Guanacaste 特有的,542 个基因是 NF_Limón 特有的。
表 1
表 1 N. fowleri分离株 NF_Guanacaste 和 NF_Limón的基因组测序、组装和注释统计
基因组特征NF_GuanacasteNF_Limón
原始读段59,622,89137,983,163
Q30 读段 (%)89.2488.69
重叠群数量 (SPAdes)6,7564,191
N50 (bp) (SPAdes)79,683101,789
最终参考导向支架3737
最终组装大小 (Mbp)27.9527.97
GC 含量 (%)36.8736.87
映射到 SPAdes 组装的读段 (%)94.6997.00
平均测序深度,最终组装341×270×
蛋白编码基因数量9,0828,920
最终组装中的 BUSCO,基因组模式,eukaryota_odb10(完整,片段化,缺失)C: 87.1%, F: 2.7%,
M: 10.2%
C: 88.3%, F: 2.4%,
M: 9.3%
注释中的 BUSCO,转录组模式,eukaryota_odb10(完整,片段化,缺失)C: 79.2%, F: 7.8%,
M: 13.0%
C: 80.4%, F: 7.8%,
M: 11.8%
AED ≤0.5 的基因模型98.0%97.8%

致谢

感谢 Georges Haustant 和 Laure Lemée(巴黎巴斯德研究所 Biomics 平台)提供的技术支持。
本研究由哥斯达黎加大学研究副校长办公室通过研究项目 C-3090 和 C-5461 资助。EU-FEDER–GUS 和 MESRI(法国)提供了额外的财政支持。资助方在研究设计、数据收集和解释或决定提交作品发表方面未发挥作用。
Nina Allouch, 概念化,数据整理,形式分析,调查,方法论,项目管理,资源,软件,可视化,写作 – 初稿,写作 – 审查和编辑 | Lissette Retana Moreira, 样本制备,项目管理,资金获取,写作 – 审查和编辑 | Nalhyte Aurago, 形式分析,调查 | Elizabeth Abrahams Sandí, 项目管理,资金获取,写作 – 审查和编辑 | Isabel Marcelino, 概念化,调查,方法论,资金获取,项目管理,写作 – 审查和编辑。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号