
-
生物通官微
陪你抓住生命科技
跳动的脉搏
Nature Methods:从长读长测序数据中检出体细胞变异的新工具
【字体: 大 中 小 】 时间:2026年09月11日 来源:生物通
编辑推荐:
香港大学的研究人员近日开发出一款名为ClairS的工具,旨在从ONT长读长测序数据中检测与癌症相关的体细胞小变异。研究团队利用合成数据对模型进行了训练,以克服高质量体细胞突变数据匮乏的难题。
分析癌细胞中的遗传变化有助于深入了解肿瘤是如何发展的,并为精准肿瘤学提供信息。然而,鉴定与癌症相关的突变可能颇具挑战性,特别是当这些突变发生频率较低或位于基因组的复杂区域时。
短读长测序在处理重复序列和难以映射的基因组区域时往往力不从心,而长读长测序则有助于解析这些区域。不过,现有的体细胞变异检出方法大多是针对短读长测序而设计的。
为此,香港大学的研究人员近日开发出一款名为ClairS的工具,旨在从ONT长读长测序数据中检测与癌症相关的体细胞小变异。研究团队利用合成数据对模型进行了训练,以克服高质量体细胞突变数据匮乏的难题。
这项研究由香港大学计算与数据科学学院副教授罗锐邦领导,发表在《Nature Methods》杂志上。

研究团队此前曾开发过基于深度学习的生殖系变异检测工具,但体细胞突变检测面临着不同的难题,因为高质量的训练数据十分稀缺。
ClairS通过一个多步骤的工作流程来应对这一挑战,该流程将相位分析与两个神经网络相结合:一个基于堆叠分析的模型,用于检查特定基因组位置上的测序读数;另一个全比对模型,用于更详细地分析单个读数。
ClairS的一个关键特征在于其合成数据训练策略。研究人员没有依赖真实的肿瘤样本,而是利用真实的测序数据生成了合成肿瘤样本和正常样本。
他们将一种样本中存在、另一种样本中缺失的变异作为模拟体细胞突变,并在不同的肿瘤DNA水平、测序覆盖度和正常细胞污染程度下进行模拟。
他们发现,精心设计的合成数据、可靠的训练标签以及相位分析,使得ClairS能够准确预测不同测序覆盖度和肿瘤纯度下的真实体细胞变异,即使在训练过程中未使用真实肿瘤样本也是如此。长读数提供的单倍型信息还提高了低频变异的检测能力。
在肿瘤/正常覆盖度分别为50×和25×的Nanopore Q20+数据集上,ClairS在单核苷酸变异(SNV)检测中实现了89.83%的F1分数,在插入缺失(indel)检测中实现了73.38%的F1分数;在训练中加入真实的癌细胞系后,性能分别提升至96.19%和79.67%。
研究人员指出:“通过在不同覆盖度、纯度、污染水平、多种平台以及真实癌细胞系上的实验,我们证明了ClairS是一款稳定且可靠的变异检出工具。”
他们表示,未来的工作将侧重于针对各种真实的临床癌症样本优化该方法,并探索长读长测序在覆盖度与变异检测能力之间的成本效益权衡。
随着长读长测序技术的不断发展,ClairS等工具有望帮助研究人员发现那些采用传统方法一直难以检测的癌症突变。
ClairS工具采用开源模式,可在GitHub网站(https://github.com/HKU-BAL/ClairS)上获取。