《Nature Biotechnology》:Adaptive model-guided protein evolution with sparse data optimizes compact eukaryotic genome editors
编辑推荐:
高效的蛋白质工程受到广阔序列空间和有限实验通量的制约,尤其是对于缺乏大规模突变数据集的蛋白质家族。研究人员结合了Fanzor2 (Fz2) 直系同源物发现、ωRNA支架工程和EvoMax(一种用于紧凑型真核Fz2核酸酶稀疏数据工程的模型引导优先级排序策略)。E
高效的蛋白质工程受到广阔序列空间和有限实验通量的制约,尤其是对于缺乏大规模突变数据集的蛋白质家族。研究人员结合了Fanzor2 (Fz2) 直系同源物发现、ωRNA支架工程和EvoMax(一种用于紧凑型真核Fz2核酸酶稀疏数据工程的模型引导优先级排序策略)。EvoMax将迭代实验表征与高斯过程回归(Gaussian process regression, GPR)、蛋白质语言模型(protein language model, PLM)和逆折叠(inverse folding, IF)相结合,以导航复杂的序列到适应度景观。将该策略应用于真核Fz2核酸酶,产生了一个高性能变体FanzMAX v3-hLa,在最佳表现内源位点实现高达97%的编辑效率,在19个内源位点平均编辑效率约为33%,优于已建立的紧凑型基因组编辑器enNlovFz2和enCnCas12f1超过2.6倍。在人源化小鼠中对hPCSK9的体内编辑支持了优化后Fz2编辑器的转化潜力。综上,这些结果确立了EvoMax作为工程化紧凑型真核Fz2基因组编辑器的整合策略,并鉴定FanzMAX v3-hLa为用于哺乳动物基因组编辑的高效可编程核酸酶。
论文解读文章
**研究背景与问题**
蛋白质工程是现代生物技术的基石,但其发展受限于序列空间的庞大规模和实验通量的有限性,尤其是对于缺乏大量突变数据的新发现蛋白质家族。传统方法如理性设计、定点突变和定向进化虽取得进展,但劳动密集且依赖详细的结构或机制知识。近年来,机器学习方法如EVOLVEpro、AiCE和MULTI-Evolve利用蛋白质语言模型(PLM)或逆折叠(IF)进行活性学习,但仍需大量任务特异性训练数据,且在不同蛋白质家族间的可迁移性不确定。Fanzor核酸酶作为最近发现的紧凑型真核可编程核酸酶家族,其数据驱动工程研究尚未充分开展,尤其是Fanzor2 (Fz2) 核酸酶(通常小于500 aa)在哺乳动物细胞中实现一致的高编辑活性仍具挑战。因此,需要一种数据高效的框架,能够利用稀疏测量指导相关蛋白质支架的可实验优化。
**研究目的与结论**
研究人员开发了EvoMax,一种结合迭代实验表征与高斯过程回归(GPR)、蛋白质语言模型(ESM-2)和逆折叠模型(ESM-IF)的蛋白质工程流程,用于优化紧凑型真核Fz2核酸酶。通过该框架,研究人员系统优化了效应蛋白和ωRNA支架,最终获得高性能变体FanzMAX v3-hLa,在未筛选的哺乳动物细胞中,于19个内源位点实现平均约33%的编辑效率(最佳位点达97%),超越已建立的紧凑型编辑器enNlovFz2和enCnCas12f1超过2.6倍。该变体还扩展了靶向邻近基序(TAM)兼容性。此外,EvoMax成功恢复了多个天然无活性的Fz2直系同源物的功能,并实现了体内基因组编辑。论文发表在《Nature Biotechnology》。
**主要技术方法**
研究人员使用的主要技术方法包括:EvoMax框架(整合BLOSUM62编码的高斯过程回归、ESM-2蛋白质语言模型和ESM-IF逆折叠模型,用于突变优先级排序)、结构引导的ωRNA支架工程(基于AlphaFold 3和RNAfold预测,进行环区替换和截短)、荧光报告基因检测(基于mCherry激活的HEK293T细胞系统)、下一代测序(NGS)进行编辑效率定量、以及AAV8介导的在人源化PCSK9小鼠中的体内递送。样本来源包括HEK293T细胞、HuH-7细胞和人源化PCSK9小鼠。
**研究结果**
**系统性筛选与功能表征真核Fz2直系同源物**
研究人员通过生物信息学扩展鉴定出超过1600个Fz2样序列,从中选择7个代表性直系同源物进行体外转录-翻译(IVTT)基TAM筛选,发现NaloFz2和M7具有活性,且N端结构域(NTD)完整性是活性必需。NaloFz2在HEK293T细胞中表现出可检测的基因组编辑,但效率较低。
**结构引导的ωRNA支架工程**
通过AlphaFold 3建模NaloFz2-ωRNA-靶DNA复合物,研究人员对ωRNA的茎环(SL)区域进行工程化,获得最小化变体enωRNA v1和v2(92 nt),显著提高编辑活性。此外,人La蛋白(hLa)的C端融合进一步增强了ωRNA稳定性和编辑效率。
**用于Fz2计算进化的迁移学习框架**
开发EvoMax,包含数据收集、模型选择和层次化多目标优化。训练数据集包含209个单点突变,采用BLOSUM62编码的GPR实现最佳拟合(R2=0.693)。EvoMax通过两阶段评分(阶段1:GPR+ESM-2;阶段2:加ESM-IF)迭代选择候选突变。
**通过EvoMax对NaloFz2进行迭代工程**
经三轮优化,EvoMax逐步提高编辑活性,最佳变体FanzMAX v3相对野生型NaloFz2提高超过13倍。与EVOLVEpro和AiCE相比,EvoMax的命中率更高(84% vs 20%和35%)。端到端贡献分析表明,ωRNA支架优化、蛋白质进化至FanzMAX v3以及C端hLa融合均贡献了活性提升。
**恢复和二次优化休眠Fz2直系同源物**
通过将NaloFz2的NTD嫁接到无活性直系同源物(M1-M6、M8)上,并应用EvoMax进行全局评分和筛选,成功恢复了M2、M3、M5和M8的活性。进一步的二次优化使enM2和enM3的活性分别提高1.9倍和2.5倍。该策略也扩展至NlovFz2,优化后变体活性显著提升。
**EvoMax实现高效基因组编辑与体内活性**
FanzMAX v3-hLa在19个内源位点平均编辑效率为33%±6.1%,优于WT-NaloFz2(3.4%)、enNlovFz2(11%)和enCnCas12f1(12.5%)。TAM分析显示其兼容性扩展。在AAV8介导的体内实验中,AAV 1.0配置(FanzMAX v1-hLa)在人源化小鼠肝脏中实现约25%编辑和34%的PCSK9降低,但更高活性的AAV 2.0和3.0导致急性毒性,提示需平衡编辑效率与基因组耐受性。
**讨论与结论**
EvoMax通过结合实验迭代与模型引导优先级排序,解决了新发现蛋白质家族缺乏大规模突变数据的瓶颈。该框架可恢复并优化序列多样化的Fz2直系同源物,且优于仅依赖单一模型的方法。然而,迁移学习性能可能随序列差异增大而下降,且EvoMax不显式建模高阶上位相互作用。体内研究揭示了高活性变体可能引发大片段缺失和毒性,提示需平衡催化效率与基因组耐受性。结论部分:通过结合迭代实验表征与自适应模型引导优先级排序,EvoMax实现了紧凑型真核核酸酶的高效优化,建立了一个数据高效的工程框架,以改进其活性和递送兼容性。