《Nature Biomedical Engineering》:Analysing long-read CRISPR experiments with CRISPRLungo
编辑推荐:
长读长测序(Long-read sequencing)能够表征复杂的基因组编辑诱导的DNA序列变化,如大片段缺失、插入和倒位(inversions),这些变化难以通过短读长测序(short-read sequencing)检测。然而,PCR扩增和测序错误使准确
长读长测序(Long-read sequencing)能够表征复杂的基因组编辑诱导的DNA序列变化,如大片段缺失、插入和倒位(inversions),这些变化难以通过短读长测序(short-read sequencing)检测。然而,PCR扩增和测序错误使准确的变异检测复杂化,且现有分析工具未针对基因编辑特定的等位基因结果进行优化。在此,研究人员提出CRISPRLungo,一个专门为基因编辑样本的长读长扩增子测序(long-read amplicon sequencing)设计的计算流程。CRISPRLungo整合了基于独特分子标识符(unique molecular identifier, UMI)的错误校正和统计过滤,以区分真实编辑事件与背景噪声,从而能够稳健地检测小插入缺失(small indels)和结构变异(structural variants)。通过使用模拟数据集进行系统基准测试,研究人员证明CRISPRLungo在准确性和读长恢复方面均优于现有方法。CRISPRLungo支持Oxford Nanopore和PacBio两种平台,并能在已发表的CRISPR数据集中识别出先前未检测到的结构变异编辑,如倒位。为展示等位基因特异性编辑定量,研究人员将CRISPRLungo应用于分析来自携带复合杂合(compound heterozygous)SBDS突变患者的编辑原代细胞,尽管存在来自同源SBDSP1假基因的污染读段,仍能准确量化SBDS编辑结果。为最大化可及性,研究人员开发了一个完全客户端运行的网页应用程序,无需安装,使无论计算专业程度如何的研究人员都能进行高级长读长分析。CRISPRLungo在https://github.com/pinellolab/CRISPRLungo免费提供,并配有用户友好的网页界面,网址为https://pinellolab.github.io/CRISPRLungo。
CRISPR基因组编辑技术(如CRISPR-Cas系统)已广泛应用于精确修饰DNA,但诱导的突变类型多样,包括小插入缺失(small indels)和大片段结构变异(structural variants, SVs),如大缺失、插入和倒位。短读长测序难以全面检测这些变异,而长读长测序虽能胜任,但PCR扩增和测序错误引入大量背景噪声,现有分析工具缺乏针对CRISPR编辑结果的优化,无法检测倒位等复杂结构变异,且命令行操作限制了许多实验室的使用。为此,研究人员开发了CRISPRLungo,一个专门用于基因编辑样本长读长扩增子测序的综合计算流程。该研究通过模拟数据基准测试、公开数据集重分析以及患者来源原代细胞编辑实验,验证了CRISPRLungo在检测多种突变类型(包括先前未发现的倒位)方面的准确性和优势,并开发了无需安装的网页应用以增强可及性。论文发表在《Nature Biomedical Engineering》。
研究用到的主要关键技术方法包括:(1)基于独特分子标识符(UMI)的误差校正,通过两步VSEARCH聚类和pyspoa生成共有序列,减少测序错误;(2)优化的Minimap2比对参数(长连接带宽设为参考序列长度的30%)和递归重比对策略,用于捕获大片段结构变异;(3)两步统计过滤流程,结合卡方检验或Fisher精确检验及Benjamini–Hochberg错误发现率(FDR)校正,并基于截断负二项分布模型确定≥10 nt的插入缺失(indel)阈值,以区分真实编辑与背景噪声;(4)开发客户端网页应用(基于WebAssembly和Web Workers),实现浏览器内本地分析,无需上传数据。样本来源包括镰状细胞病患者造血干细胞和祖细胞(HSPCs)、脊髓小脑性共济失调2型(SCA2)小鼠脑组织,以及携带SBDS复合杂合突变的SDS患者HSPCs。
**CRISPRLungo: a comprehensive pipeline for CRISPR mutation analysis**(CRISPRLungo:用于CRISPR突变分析的综合流程)
CRISPRLungo由五个模块组成:预处理(去除低质量读段并分离嵌合读段)、共有序列生成(基于UMI进行错误校正)、变异识别(检测小缺失插入、大缺失、插入、重复和倒位)、统计过滤(比较处理组与对照组,去除背景信号)和可视化(生成堆叠柱状图、等位基因图等)。该流程支持双引导RNA系统(如PE3、TwinPE)的双位点分析,并能根据预期突变分类精确编辑与不精确编辑。开发了基于浏览器的客户端版本,所有计算在用户浏览器内完成,确保数据隐私。
**Optimization of CRISPRLungo pipeline**(CRISPRLungo流程的优化)
通过模拟数据集(基于BCL11A基因5.8 kb片段,使用Badread模拟Nanopore和PacBio错误)系统优化了四个关键组件:(1)优化比对参数,将长连接带宽设为参考序列长度的30%,并采用递归重比对策略,解决了大缺失(3.15–5.95 kb)和倒位(>2.45 kb)的检测不足;(2)两步UMI聚类(先90%后95%序列一致性阈值)减少错误聚类;(3)统计过滤中,基于截断负二项分布最大似然估计确定≥10 nt的插入缺失阈值,并采用卡方或Fisher检验及FDR校正(FDR<0.05),有效控制假阳性。
**Validation of CRISPRLungo**(CRISPRLungo的验证)
在模拟PacBio HiFi数据(>99.9%准确性)中,CRISPRLungo所有模式的结果与模拟频率偏差<2%,而longread_umi+LV_caller高估小缺失插入+野生型类别3.8%且未检测倒位。在模拟Nanopore数据(90–99%准确性)中,背景过滤减少假阳性最多18.7%,且UMI共有序列与过滤联合使用效果最佳。相比之下,pipeline-umi-amplicon未能检测倒位。
**CRISPRLungo reveals previously undetected mutations in published CRISPR datasets**(CRISPRLungo在已发表CRISPR数据集中发现先前未检测到的突变)
重分析镰状细胞病患者HSPCs的BCL11A位点PacBio数据(UMI分析),CRISPRLungo检测到0.15±0.17%的倒位事件,原分析完全遗漏;与longread_umi+LV_caller在大缺失和插入定量上高度相关(r=0.979)。重分析nCATS(Nanopore Cas9靶向测序)数据(ATXN2基因),CRISPRLungo定量结果与ddPCR一致,但因保守过滤和纳米孔读长偏差而略低,并检测到AAV ITR/Cas9/scaffold插入(平均长度4342 bp)。此外,应用于TISCC-seq数据集(TP53碱基编辑文库),准确识别了高编辑效率变异N239D及旁观者编辑事件。
**CRISPRLungo analyses TwinPE outcomes**(CRISPRLungo分析TwinPE结果)
在K562细胞中,TwinPE引入TINF2外显子6的37个替换,纳米孔测序分析显示:全窗口分析(full-window analysis)精确编辑频率为15.8%,而端部聚焦分析(end-focused analysis)为30.13%,与Illumina结果(33.5%)更接近;全窗口分析中9.1%的读段被归为部分编辑。CRISPRLungo还检测到双向和单向大缺失,这些在Illumina数据中无法发现。
**CRISPRLungo enables allele-specific gene editing outcome analysis**(CRISPRLungo实现等位基因特异性基因编辑结果分析)
针对携带SBDS复合杂合突变的SDS患者HSPCs,CRISPRLungoAllele模块利用三个区分性序列变异(c.635del24、c.1036C>G、c.2115A>G)将读段分为SBDS等位基因1、等位基因2、SBDSP1、混合及模糊五类。Cas9处理后,靶向等位基因1的插入缺失频率从0.0%升至73.4%,而等位基因2仅从0.0%升至6.53%,表明高效等位基因偏向性编辑。SBDSP1读段也显示高插入缺失率(76.2%),因靶位点序列相同。
**讨论**
CRISPRLungo在模拟和实际数据中均表现出高准确性和广泛的突变检测能力,尤其适合多引导RNA系统(如PE3、TwinPE)和患者样本中等位基因特异性分析。背景过滤方法在低测序准确性下可能无法区分低频真实变异与重复出现的错误,而UMI共识生成更为稳健。端部聚焦分析推荐用于纳米孔数据评估大结构变异,PacBio HiFi则适用于全窗口验证长插入。在SBDS样本中,7–12%的SBDS-SBDSP1混合读段主要源于PCR介导的嵌合体,而非基因组重排。网页版支持长达25 kb的读段和约500 MB的未压缩文件,但UMI共识生成尚未实现,未来将集成WebGPU加速。
**研究结论**:CRISPRLungo提供了一个统一平台,用于分析CRISPR编辑细胞的长读长测序数据。该流程提供高度准确的突变检测,支持等位基因分辨率,并能识别比现有工具更广泛的编辑结果。研究人员期望CRISPRLungo为CRISPR基因组编辑中的长读长测序分析建立稳健标准,支撑实验研究和治疗开发。