Digenome-Detect:基于统计的高精度基因组编辑脱靶切割位点识别分析软件

《STAR Protocols》:Digenome-Detect: Accurate, statistics-based analysis software for identifying off-target cleavage sites in genome editing

【字体: 时间:2026年09月16日 来源:STAR Protocols 1.4

编辑推荐:

  脱靶突变因其可能导致严重不良事件(如癌变)而对基因组编辑治疗构成重大安全担忧。因此,准确预测和评估脱靶突变对于确保基因组编辑治疗的安全性至关重要。在可用于预测脱靶突变的方法中,无细胞分析(cell-free assays)通过体外检测经基因组编辑工具处理的提取

  
脱靶突变因其可能导致严重不良事件(如癌变)而对基因组编辑治疗构成重大安全担忧。因此,准确预测和评估脱靶突变对于确保基因组编辑治疗的安全性至关重要。在可用于预测脱靶突变的方法中,无细胞分析(cell-free assays)通过体外检测经基因组编辑工具处理的提取基因组DNA中的切割位点,因其全基因组、无偏倚且灵敏的检测能力而具有重要价值。然而,无细胞分析容易识别出假阳性的脱靶切割位点,限制了其实用性。为解决这一问题,研究人员开发了“Digenome-Detect”,一种针对Digenome-seq(最简单的无细胞分析)的高准确性和高灵敏性数据分析软件工具。Digenome-Detect对基因组切割位点计算基于统计的得分,并通过额外过滤减少假阳性。与当前标准软件Digenome-toolkit相比,Digenome-Detect识别出更多脱靶切割位点,且明显更少的假阳性。Digenome-Detect能够准确、灵敏地预测脱靶切割位点,从而有助于确保基因组编辑治疗的安全性。
基因组编辑技术能够在基因组DNA的靶向位点引入突变,其中应用最广泛的CRISPR-Cas9系统通过引导RNA(gRNA)与基因组DNA的碱基配对及前间隔序列邻近基序(PAM)识别,诱导DNA双链断裂,从而实现基因敲除、修复或插入。然而,脱靶突变(发生于非预期基因组位点的突变)是基因组编辑治疗面临的主要安全隐患,可能引发包括癌症在内的严重不良事件。因此,准确预测和评估潜在脱靶突变是确保治疗安全的关键。目前预测脱靶突变的方法包括计算分析(in silico)、无细胞分析(cell-free assay)和细胞分析(cell-based assay)。美国食品药品监督管理局(FDA)、欧洲药品管理局(EMA)及日本医药品医疗器械综合机构(PMDA)的监管文件均建议在计算分析之外结合实验分析。其中,无细胞分析因可使用高浓度编辑工具而产生更高的敏感性,且不受染色质状态等细胞特性影响,能够更全面地识别潜在脱靶位点,但同时也更易产生假阳性,限制了其应用。为此,研究人员开发了Digenome-Detect,一种针对最简无细胞分析Digenome-seq的高精确、高灵敏数据分析软件。该软件基于统计模型计算切割可能性得分(CL-score),并设置多重过滤机制降低假阳性。在自有HAP1细胞系(Horizon Discovery, Cambridge, UK)Digenome-seq数据集(约70×深度)上的测试显示,Digenome-Detect相较于标准软件Digenome-toolkit,识别出更多真实脱靶切割位点,同时显著减少明显假阳性。进一步在两个公共数据集(HBB基因靶向gRNA,NCBI: PRJEB20021;VEGFA基因靶向gRNA,NCBI: SRX2487860)上的验证表明,Digenome-Detect能够以高置信度重现既往通过多种正交方法确认的脱靶位点,并发现更多潜在真阳性位点。该软件不依赖编辑工具识别序列信息,有望适用于不同gRNA或多种基因编辑工具(如不同Cas变体、TALEN、ZFN)的脱靶分析,但需实验数据验证。Digenome-Detect基于全基因组测序(WGS)背景设计,不适用于靶向富集类方法(如SITE-seq、CIRCLE-seq、GUIDE-seq)。通过排除裁剪读段和比对质量零的读段来减少比对错误导致的假阳性,同时保留了对弱切割位点的灵敏性。测序深度是影响性能的重要因素,较低深度导致敏感性、准确性和稳定性下降,建议在实际可行的范围内尽量提高测序深度。阈值设定需在灵敏度和准确性之间权衡,本研究为安全评估目的选择了相对高灵敏度的阈值(非切割样本与切割样本累积位点数比≤0.1)。总之,Digenome-Detect与Digenome-seq结合,提供了一种灵敏、准确、方法学上低偏倚的脱靶位点预测方案,尤其适用于基因组编辑治疗的安全评估。

关键方法:研究人员使用近单倍体HAP1细胞系(C859;Horizon Discovery)提取基因组DNA,进行Digenome-seq实验(SpCas9-gRNA核糖核蛋白处理,未处理样本为对照),通过PCR-free文库制备和NovaSeq 6000双端测序获得约100×深度原始数据,经比对(bwa-mem至GRCh38)、去重复和抽样至70×进行预处理。Digenome-Detect计算每个位点的CL-score(基于泊松分布的概率模型),先以默认阈值4提取候选位点,再用CL-score>7以及与对照样本比较确定最终阈值,并通过排除裁剪读段和比对质量零读段进行过滤。公共数据集分析采用相同流程,其中HBB数据按补充方法排除污染gRNA相关切割位点。

分析Digenome-seq数据(使用Digenome-toolkit):通过分析HAP1细胞Digenome-seq数据,发现Digenome-toolkit对距离(d)小(如d=1、3)的位点检出率100%,但检测的所有位点中约47%为d≥7且大部分无典型PAM,其序列分布与随机序列相似,经IGV人工检视为假阳性;同时存在漏检的弱切割位点(d≤4含PAM)以及由读段裁剪造成的假阳性。

开发Digenome-Detect:开发了以CL-score为核心的算法,CL-score基于泊松分布计算某位点正向头端和反向尾端随机累积的概率,并取负对数作为得分;设计了两个过滤步骤,一是去除在未切割样本中亦有高分的位点,二是排除由比对质量零读段和裁剪读段导致的假阳性。CL-score与距离呈负相关,与PAM存在性呈正相关,且切割样本的CL-score整体高于未切割样本,证明该得分能反映杂交依赖性切割。

使用Digenome-Detect分析Digenome-seq数据:通过比较切割与未切割样本的累积位点数比例,确定阈值10.37(非切割/切割<0.1),切割样本中检测到960个位点(非切割92个)。与Digenome-toolkit相比,d≥7位点占比较低(32% vs 47%),且其中78%含典型PAM,显示假阳性显著减少。测序深度影响评估显示,50×、30×和10×数据检测位点数分别为70×的86%、59%和25%,低深度下敏感性和准确性均下降,且结果稳定性降低。

比较Digenome-Detect和Digenome-toolkit:两种工具共同检出223个位点;Digenome-toolkit独有187个(约99%为d≥7,多为假阳性),Digenome-Detect独有737个(60%为d≤6,d≥7中78%含PAM)。IGV显示Digenome-Detect独有位点存在正向头端和反向尾端累积,确认为真实切割;而Digenome-toolkit独有位点多为裁剪伪影。

使用公共数据集评估性能:对针对HBB位点的Digenome-seq公共数据(PRJEB20021)进行分析,识别出通过两种以上正交方法确认的全部33个高置信度脱靶位点(包括靶向深度测序鉴定到的4个)。对VEGFA位点数据(SRX2487860,ARPE-19细胞),Digenome-Detect识别出8,868个位点,包含原研究报道的全部42个脱靶位点,且其最低CL-score为141.68,表明这些位点具有极高置信度;在恢复所有报道位点的最高阈值下,额外检测到153个可能的新位点。

讨论与结论:Digenome-Detect通过统计得分和针对性过滤,在提高灵敏度的同时降低了假阳性率,其算法不依赖识别序列,原则适用于多种编辑工具。由于基于WGS背景,不适合富集测序方法。测序深度是性能关键因素,推荐高深度以获取稳定可靠的结果。在灵敏度与准确度权衡上,本研究选择了偏向灵敏度的阈值,用户可根据研究目标调整。总体而言,Digenome-seq联合Digenome-Detect提供了一种灵敏、准确且无偏的脱靶位点预测方法,为基因组编辑治疗的安全评估提供了有力工具。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号