《Genome Biology》:COSIGT: population-scalable genotyping of complex loci from low-coverage sequencing data using pangenome graphs
编辑推荐:
pangenome graph能够捕获广泛的结构多样性,但从浅层测序数据中解析复杂基因座仍然具有挑战性,尤其是当样本质量较低(如ancient DNA(aDNA,古DNA))时。研究人员提出了COSIGT(COsine SImilarity-based Gen
pangenome graph能够捕获广泛的结构多样性,但从浅层测序数据中解析复杂基因座仍然具有挑战性,尤其是当样本质量较低(如ancient DNA(aDNA,古DNA))时。研究人员提出了COSIGT(COsine SImilarity-based GenoTyper,基于余弦相似度的基因分型器),该方法通过cosine similarity将read-depth分布与haplotype path进行匹配来指定diploid genotype(二倍体基因型)。由于该度量评估的是相对 coverage profile而非绝对 read count,COSIGT在低覆盖度(1–2X)下显著优于现有的likelihood-based工具。研究人员展示了其对数千个现代和古代基因组的scalability,从而能够直接基于低覆盖度数据集开展稳健的population-scale复杂变异分析。
研究背景方面,结构复杂基因组区域包含多kb插入、缺失、重复和copy-number variation(CNV,拷贝数变异),单线性的reference genome无法代表这些基因座的allelic diversity,标准variant-calling流程也难以恢复structural haplotype。haplotype-resolved pangenome改善了read mapping与结构变异检测,但现有基于比对似然的方法(如Locityper)在覆盖度下降时信噪比退化,对low-coverage数据、biobank队列和aDNA(ancient DNA,古DNA)不利,因为aDNA常低于2X且受postmortem降解与微生物污染影响。因此,研究人员开展COSIGT研究,以解决低覆盖度下复杂基因座基因分型不准的问题。该研究发表于《Genome Biology》。
关键方法上,研究人员使用HPRC(Human Pangenome Reference Consortium)与HGSVC(Human Genome Structural Variation Consortium)的haplotype-resolved assembly构建locus-specific pangenome graph;用minimap2做haplotype重比对,impg做隐式pangenome查询与边界优化,PGGB构图,kfilt通过ROI-specific k-mer招募unmapped read,bwa-mem2或aDNA场景用bwa aln比对,gfainject投影到graph,gafpack计算node coverage vector;以cosine similarity匹配observed sample vector与synthetic diploid genotype vector。样本来自1000G、HPRCy1、HGSVCv3、Moli-sani队列及模拟aDNA。
Results and discussion
研究人员描述COSIGT流程:建局部pangenome graph、提取目标区reads并用k-mer救援unmapped reads、比对得到graph node traversal、构造haplotype与sample coverage vector、枚举所有diploid haplotype pair并取cosine similarity最高者。因cosine similarity衡量向量方向而非幅值,具coverage-invariant特性。
在326个CMRGs(challenging medically relevant genes,难检医学相关基因)与265个SVs(structurally variable regions,结构可变区)基准中,leave-zero-out下5X和30X两法均高质;30X时Locityper更优,但1–2X时COSIGT错误率更低,1X时93.4%达mid-or-higher quality而Locityper为84.5%。leave-all-out下真haplotype不在图中时,COSIGT仍达最大可获质量的87%以上。模拟aDNA的48个CMRGs中,1X时COSIGT约94% mid-or-higher而Locityper约46%,2X时95%对60%,且性能接近同覆盖度现代DNA。Moli-sani约20X的1085个样本HLA typing中,COSIGT单倍型精度89.5%,与专用工具T1K的90.8%相当。
Conclusions
研究人员指出,graph-based genotyping可解析线性参考掩盖的多kb等位基因;扩展到low-coverage可挖掘legacy dataset与archaeological sample。COSIGT用cosine similarity比较vector orientation而不依赖magnitude,在低于5X时多数基因座优于Locityper,对low-coverage aDNA和heterogeneous-depth biobank尤其有用,且兼容long-read input。局限在于依赖pangenome完整度,缺失haplotype会被赋给最相似可用haplotype;当前需pre-aligned BAM/CRAM,未来将支持FASTQ与haplotype subsampling。研究人员已将COSIGT用于6000余现代与古代人类基因组,证明其对complex repeats与multi-copy genes的population-scalable分析能力,降低测序成本并纳入aDNA与异质深度数据。
讨论总结为:COSIGT把复杂基因座基因分型从“依赖绝对覆盖度与比对似然”转向“比较相对覆盖剖面方向”,使shallow sequencing不再必然意味着低质量结构基因分型;其局部图、k-mer救援、cosine匹配共同降低了reference bias与深度敏感噪声。研究意义在于让pangenome reference中的allelic diversity可被low-coverage modern/aDNA队列常规利用,推动population genomics、pharmacogenetics与evolutionary genomics从高质量样本走向大规模异质样本。
结论部分翻译:
通过把变异表示为互连path,graph-based genotyping可准确解析线性参考模糊掉的多kb等位基因。将这些优势扩展到low-coverage sequencing具有变革性:它使研究人员能系统挖掘legacy dataset与archaeological sample,释放此前受浅测序深度与降解样本质量限制的comprehensive、population-level生物医学与进化分析。COSIGT通过解决当前基因分型方法的关键局限——在低测序深度保持准确性——直接实现这一转型。cosine similarity独立于幅值比较vector orientation,从而对coverage variation稳健。这在低于5X覆盖度最有价值,此时COSIGT在大多数基因座优于Locityper,显示其对low-coverage aDNA数据与深度可变大型biobank的特殊效用。该流程设计也兼容long-read input,可扩展到不足以组装的low-coverage long-read数据集。
一些局限值得考虑。基因分型精度取决于输入pangenome的质量与完整度:参考面板中不存在的haplotype无法被call出,新型structural variant会被赋给最相似可用haplotype。leave-all-out基准量化了该效应,显示当地面真值haplotype不在pangenome中时COSIGT仍恢复大部分最大可获精度。此外,COSIGT当前需要pre-aligned BAM/CRAM文件,引入对reference-based alignment的依赖。未来工作将通过支持direct FASTQ input与haplotype subsampling来维持pangenome增长下的scalability。
pangenome reference正快速在size、quality与taxonomic breadth上扩展。随着资源增长,限制因素从参考完整度转向scalable genotyping。研究人员已将COSIGT用于6000多个现代与古代人类基因组,证明对complex repeats与multi-copy genes的population-scalable分析。COSIGT对low-coverage的容忍支持更大cohort、更低测序成本、纳入ancient sample与分析heterogeneous depth数据集,使pangenome reference捕获的allelic diversity在整个测序深度范围内可用于routine genotyping。