基于机制的先导编辑结果预测机器学习

《Nature Biotechnology》:Mechanistic machine learning for prediction of prime editing outcomes

【字体: 时间:2026年08月13日 来源:Nature Biotechnology 44.5

编辑推荐:

  先导编辑(prime editing, PE)能够对活体基因组DNA进行特定的局部改变,但其高效应用目前需要对PE引导RNA(pegRNA)序列进行大量优化。研究人员在此提出OptiPrime,一个基于当前对PE机制理解的PE效率机器学习模型。OptiPrim

  
先导编辑(prime editing, PE)能够对活体基因组DNA进行特定的局部改变,但其高效应用目前需要对PE引导RNA(pegRNA)序列进行大量优化。研究人员在此提出OptiPrime,一个基于当前对PE机制理解的PE效率机器学习模型。OptiPrime在PE效率预测上达到了最先进的准确度,并能够预测切口引导RNA(PE3)和双pegRNA(twinPE)的结果。研究人员验证了OptiPrime已学习到哺乳动物错配修复(mismatch repair, MMR)的决定因素,并且非常适合推荐规避MMR的沉默编辑,从而提高PE效率。研究人员展示了OptiPrime在原代人类和小鼠细胞中的多种前瞻性治疗情境中的应用。最后,研究人员表明OptiPrime可用于实现KIF1A相关神经障碍小鼠模型大脑中致病突变的高效体内纠正。研究人员提供了一个OptiPrime的网页服务器(https://optipri.me/)作为社区资源。
**论文解读:基于机制的先导编辑结果预测机器学习模型OptiPrime**

**研究背景与问题**
先导编辑(prime editing, PE)是一种无需双链断裂或供体DNA模板即可在活细胞基因组中实现精确编辑的多功能技术。然而,PE的高效应用依赖于对PE引导RNA(pegRNA)设计参数(如间隔序列、逆转录模板长度、引物结合位点长度及沉默编辑组合)进行大量优化,通常需要评估数百至数千种组合,耗时且成本高昂。现有机器学习模型(如PRIDICT、DeepPrime、OPED)虽能预测PE效率,但存在以下问题:一是训练数据中大量低效pegRNA被过滤,导致模型难以区分高效候选;二是模型缺乏生物学机制基础,无法直接利用PE分子过程的关键节点信息,且难以从训练状态中提取生物学见解。因此,亟需一种基于机制、能够准确预测PE效率并加速治疗策略开发的模型。

**研究内容与结论**
研究人员开发了OptiPrime,一种基于PE机制数学结构的机器学习模型。该模型通过将PE过程分解为多个生化步骤(如DNA结合、切口、逆转录、MMR等),分别用独立的机器学习模型预测各步骤的“伪速率”(pseudorate),并通过常微分方程组积分得到最终编辑效率。研究团队在MMR缺陷的HEK293T细胞和MMR正常的HeLa细胞中进行了高吞吐量pegRNA-靶点文库筛选(Lib-MMR和Lib-CV),结合来自其他实验室的40种实验条件下的数据,共收集297,962个PE效率数据点。OptiPrime在五折交叉验证中达到平均Spearman秩相关系数ρ=0.745,显著优于PRIDICT2.0(ρ=0.590)和DeepPrime(ρ=0.399)。消融实验表明,其性能依赖于机制性时间演化层、HetFormer预训练及反应分配的正确性。此外,OptiPrime学习的伪速率可用于预测PE3编辑效率(平均ρ=0.534)和twinPE结果(ρ=0.412),即使这些模式未出现在训练中。在治疗应用方面,OptiPrime在囊性纤维化(CFTR p.F508del)、COL7A1、IL-2受体正交化及Kif1a小鼠模型等多个场景中实现了高效编辑,其中在Kif1algdg/+小鼠大脑皮层中,体内编辑效率在转导细胞中超过70%,平均达40%以上。论文发表在《Nature Biotechnology》。

**主要技术方法**
1. **高吞吐量pegRNA-靶点文库筛选**:设计Lib-MMR(10,000个pegRNA,靶向200个外显子位点,涵盖多种编辑类型)和Lib-CV(10,406个pegRNA,纠正ClinVar数据库中944个致病突变),通过慢病毒包装以低感染复数(MOI<0.3)转导HEK293T和HeLa细胞,使用PE2和PE4系统进行编辑,收集74,769个PE效率数据点。样本队列来源包括人类基因组外显子位点及ClinVar数据库。
2. **机制性机器学习模型构建**:采用神经网络和线性回归模型分别预测PE机制中六个步骤的伪速率(如DNA结合速率kon,PE、合成速率ksyn、MMR相关速率kMMR等),通过常微分方程时间积分输出最终编辑效率。其中,HetFormer(受AlphaFold中EvoFormer启发)用于预测MMR依赖性修复速率,并在6400万个模拟异源双链体上预训练。
3. **整合多源数据联合训练**:结合本研究和来自PRIDICT、DeepPrime等研究的297,962个PE效率数据点,采用五折交叉验证(按protospacer序列分层)评估性能。
4. **PE3和twinPE预测**:利用OptiPrime输出的伪速率作为特征,训练梯度提升树模型预测PE3效率;通过机制重连(仅使用3'- flap合成伪速率)预测twinPE效率。

**研究结果**

**1. 高吞吐量PE文库筛选重现MMR决定因素**
通过比较PE2和PE4在HEK293T和HeLa细胞中的编辑效率比(PE4:PE2),研究人员发现:PE4在HeLa细胞中优于PE2中位数达4.3倍,且PE4:PE2值与已知MMR蛋白MutSα/MutSβ结合偏好一致(如C-to-T编辑导致最高PE4:PE2,而G-to-C和A-to-G最低)。更长连续替换、纯插入或纯删除的编辑导致PE4:PE2下降,符合MutSα优先结合小错配区域的结构特征。在Lib-CV中,沉默编辑的引入以MMR依赖性方式提高PE2效率,且与PE4:PE2呈正相关(HeLa r=0.539)。这些数据表明,异源双链体中间体通过规避MMR复合物结合来提高编辑效率。

**2. OptiPrime是基于机制的PE效率预测模型**
OptiPrime采用机制诱导偏差,将PE过程分为prime editor介导步骤和DNA修复步骤,分别用定制特征预测伪速率。模型在五折交叉验证中达到平均r=0.693、ρ=0.745,显著优于PRIDICT2.0和DeepPrime。消融实验表明,移除机制性时间演化层、HetFormer预训练或随机分配反应均导致性能显著下降,证实模型的高精度源于其架构与PE机制的一致性。在独立测试集(如ATP1A3位点)上,OptiPrime的秩相关系数(ρ=0.604-0.599)高于PRIDICT2.0和DeepPrime(均低于0.43)。此外,OptiPrime预测的伪速率koff,MutS与经验PE4:PE2呈负相关(ρ=-0.42),表明模型已学习到MMR结合的序列决定因素。

**3. OptiPrime伪速率实现PE3和twinPE预测**
基于OptiPrime伪速率和预测效率,研究人员训练了PE3梯度提升树模型,在ATP1A3纠正实验中平均ρ=0.534,而去除OptiPrime特征后预测能力丧失(ρ=0.025)。SHAP分析显示,kon,PE、OptiPrime预测效率及koff,MutS是PE3模型的最重要特征。对于twinPE,通过仅使用3'- flap合成伪速率,模型在四个内源位点数据集上达到平均ρ=0.412,尽管从未训练过twinPE数据,表明OptiPrime已学习到PE机制中可分离的通用特征。

**4. OptiPrime加速治疗性PE策略开发**
研究人员开发了OptiPrime网页服务器(https://optipri.me/),集成ClinVar、dbSNP及UCSC基因组浏览器,可自动生成沉默编辑和预测。在多个治疗场景中:
- CFTR p.F508del纠正:OptiPrime推荐的8个pegRNA中最佳达到22%效率,是之前最佳策略SE2(11%)的2倍,而PRIDICT2.0和DeepPrime推荐的16个中无一超过1%。
- COL7A1 p.R185X纠正:在RDEB患者成纤维细胞中,OptiPrime最佳pegRNA实现37%纠正,而PRIDICT2.0和DeepPrime均低于5%。
- IL2RBH134D;Y135F安装:在原代人T细胞中,OptiPrime设计(含沉默编辑)实现7.0%编辑,远超无沉默编辑的1.1%和PRIDICT2.0的≤0.1%。
- eePASSIGE:在CFTR内含子1中安装attP位点,OptiPrime推荐的pegRNA对实现10%的整合效率,优于专家设计的8.0%。
- Kif1algdg体内纠正:仅需15个pegRNA和4周实验,即在小鼠胚胎成纤维细胞中获得64%编辑效率。通过双AAV9递送,在新生小鼠大脑皮层中实现平均40%以上编辑,转导细胞中超过70%,且仅需102个vg剂量。

**总结与讨论**
OptiPrime通过机制性机器学习架构,将PE生物学知识直接融入模型结构,实现了比传统黑箱模型更高的预测精度和泛化能力。其伪速率可解释性强,能够用于预测PE3和twinPE等未训练编辑模式。研究团队指出,OptiPrime在Cas9核酸酶分数与PE效率不相关时表现较差,未来可通过引入PE特异性protospacer效率启发式规则改进。此外,OptiPrime目前未整合染色质状态信息,但可与ePRIDICT等模型结合。研究团队提供了一个开源网页服务器,以促进PE在研究和治疗中的广泛应用。

**研究结论翻译**
先导编辑(PE)的通用性为研究及精确改造活体基因组用于治疗和其他应用提供了巨大潜力。在本工作中,研究人员证明,机制性机器学习模型OptiPrime能够以足够高的精度预测PE效率,从而大大简化了原本繁琐的pegRNA优化过程。此外,研究人员表明,OptiPrime的机制性公式化赋予其优于传统ML模型的若干优势,包括能够使用迁移学习和机制重连来预测PE3和twinPE的结果(这些编辑机制在训练中未曾见过)。总体而言,这些发现表明,OptiPrime通过加速识别高效编辑策略增强了PE的潜力,并且机制性ML模型能够提供对复杂生物分子过程动态的见解,从而实现对活体系统中结果的模块化、高性能预测。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号