NanoTS:基于深度学习的纳米孔长读长转录组数据单核苷酸多态性精准调用工具

《Nature Methods》:NanoTS: a deep learning tool for accurate SNP calling in nanopore long-read transcriptome data

【字体: 时间:2026年09月23日 来源:Nature Methods 28.3

编辑推荐:

  摘要翻译:利用纳米孔长读长转录组数据进行精准变异检测仍然充满挑战。研究人员推出了NanoTS——一种基于深度学习的工具,可从多种类型的纳米孔转录组测序数据中检测单核苷酸多态性(single nucleotide polymorphism,SNP)。对于至少有五

  
摘要翻译:利用纳米孔长读长转录组数据进行精准变异检测仍然充满挑战。研究人员推出了NanoTS——一种基于深度学习的工具,可从多种类型的纳米孔转录组测序数据中检测单核苷酸多态性(single nucleotide polymorphism,SNP)。对于至少有五条支持读段的SNP,NanoTS在纳米孔直接RNA(direct RNA,dRNA)和cDNA测序数据上的F1分数分别超过0.980和0.966,优于现有方法。值得注意的是,对于等位基因不平衡变异,NanoTS相较于现有方法表现出显著改进。研究人员还证明,NanoTS能够精准检测和基因分型导致孟德尔疾病的致病变异,凸显了其潜在的临床应用价值。
论文解读文章:

**研究背景与科学问题**

纳米孔转录组测序技术凭借其能够表征全长转录本以及直接检测RNA修饰的能力,极大地推动了RNA研究领域的发展。近年来,牛津纳米孔技术(Oxford Nanopore Technologies, ONT)平台的进步显著提升了测序通量与准确性,进一步增强了其成本效益和在变异检测方面的应用潜力。然而,与Illumina短读长测序和太平洋生物科学(Pacific Biosciences, PacBio)HiFi长读长测序相比,纳米孔测序较高的错误率仍是精准变异检测所面临的挑战,在转录组测序数据中尤为突出。

相较于基因组测序数据,转录组测序数据本身因基因间高度不均一的读段覆盖度、转录本异构体多样性、等位基因特异性异构体表达以及文库构建引入的伪迹等因素,使得变异检测变得复杂。这些因素制约了标准长读长DNA变异调用器在转录组测序数据上的表现,因而亟需开发专门针对转录组的变异调用方法。为应对上述挑战,研究人员开发了NanoTS(nanopore transcriptome SNP caller)——一种基于深度学习的工具,用于从纳米孔直接RNA(dRNA)和cDNA测序数据中精准调用单核苷酸多态性(single nucleotide polymorphism, SNP)。NanoTS采用等位基因分相堆叠策略,通过跨读段分相整合单倍型信息,以提高变异调用准确性。在多个基准数据集的评估中,NanoTS持续优于现有纳米孔转录组变异调用器,包括Clair3-RNA和LongcallR。此外,NanoTS还能精准检测和基因分型导致孟德尔疾病的致病变异,进一步凸显了其在基于RNA的基因组诊断中的应用潜力。

**研究内容与主要技术方法**

研究人员利用基因组参考联盟(Genome in a Bottle, GIAB)数据库中的高置信度变异判定与区域作为训练和评估基准。训练数据来自HG002样本的纳米孔dRNA和cDNA测序数据。NanoTS框架包含分相与未分相两种模型,均采用卷积神经网络与全连接层相结合的网络架构。其核心创新在于等位基因分相堆叠策略,依据目标变异的等位基因类型和链方向将读段分为四类,并整合六大类特征:局部碱基频率、碱基频率信息熵、归一化碱基覆盖度、归一化读段末端距离、归一化最大覆盖度以及最近20个SNP候选位点的等位基因碱基频率。分相模型额外整合了未分相数据、单倍型1和单倍型2的特征信息。变异调用流程包括:原始电流数据转换、参考基因组比对、初始未分相SNP调用、基于WhatsHap的变异分相以及最终分相模型SNP调用。此外,研究人员通过对FASTQ文件进行降采样来增强训练数据,提高模型在不同覆盖度下的鲁棒性。

**研究结果**

**性能评估与基准测试**:在多个全转录组dRNA和cDNA数据集上,以GIAB高置信度变异为标准,NanoTS在至少5条ALT读段且ALT读段比例≥0.05的判定条件下,在dRNA和cDNA数据中的F1分数分别超过0.980和0.966,精准度和召回率均优于Clair3-RNA和LongcallR。在cDNA数据中,NanoTS的F1分数比Clair3-RNA和LongcallR分别提高了0.047–0.088和0.127–0.159。

**基因型纯合性判定**:在HG004样本中,NanoTS分别以0.988、0.957和0.957(dRNA数据)以及0.993、0.940和0.954(cDNA数据)的F1分数区分0/0、0/1和1/1三种基因型,优于现有工具。

**等位基因不平衡变异的检测**:在cDNA数据中,对于ALT读段比例介于0.05和0.20之间的等位基因不平衡变异,NanoTS的F1分数比Clair3-RNA和LongcallR分别提高了0.338–0.478和0.497–0.635,表现出对这类变异显著增强的检测能力。

**不同基因组环境下的表现**:三种工具在均聚物区域准确性随均聚物长度增加而下降,在编码序列(CDS)中表现最佳。NanoTS在dRNA和cDNA数据的各类基因组环境中均持续获得最高F1分数。

**特征贡献分析**:碱基频率与碱基覆盖度被识别为影响SNP调用准确性的最关键特征。分相模型在杂合变异判定的F1分数上较未分相模型提高了0.010–0.023。

**PacBio HiFi数据上的泛化能力**:在PacBio HiFi cDNA数据上,NanoTS取得了与Clair3-RNA相当的F1分数,并优于LongcallR,且在低ALT读段比例的等位基因不平衡变异检测中同样表现最优。

**靶向测序数据的应用**:在HG001的422个先天免疫错误(IEI)基因TEQUILA-seq靶向测序数据中,NanoTS在所有性能指标上显著优于Clair3-RNA和LongcallR。在相同测序深度下,靶向测序较全转录组测序可鉴定出更多金标准阳性SNP。

**孟德尔疾病致病变异的临床验证**:研究人员对3名先天性糖基化障碍(CDG)患者和22名原发性线粒体疾病(PMD)患者的成纤维细胞cDNA TEQUILA-seq数据进行变异调用,这些患者共携带32个已知致病变异。NanoTS正确检测和基因分型了其中30个变异,优于Clair3-RNA(27/32)和LongcallR(24/32)。在PMD-014患者中,NanoTS成功检测并正确分型了位于内含子区域的第二个致病变异,并通过读段分相揭示了该变异对MPV17转录本的反式剪接影响,包括外显子5跳跃和多个隐蔽供体剪接位点的激活。

**讨论与结论**

NanoTS通过与靶向纳米孔cDNA测序相结合,能够检测和辅助分相遗传变异及转录本改变,展示了其在基于RNA的罕见孟德尔疾病基因组诊断中的潜力。该工具目前仅限于胚系变异调用,未来工作可扩展至体细胞变异调用,进一步拓宽其应用范围。该研究发表于《Nature Methods》,为纳米孔长读长转录组数据的精准变异检测提供了新的深度学习解决方案。
相关新闻
生物通微信公众号
微信
新浪微博

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号