在一项近期发表于《科学》(Science)的研究中,Tran 等人引入了 MULTI-evolve(模型引导、通用、靶向安装多突变体),一种机器学习引导的定向进化(MLDE)框架,用于快速设计高活性多突变蛋白。1 通过整合蛋白质语言模型(PLMs)、上位性感知建模和高效多位点诱变平台,作者解决了长期阻碍蛋白质工程和药物开发的主要组合挑战。

蛋白质功能由氨基酸序列编码,但发现有效的突变组合仍然困难,因为蛋白质适应性景观是高维的,并强烈受上位性相互作用塑造。定向进化长期以来提供了通过重复诱变和筛选进行蛋白质优化的强大途径。2 最近,MLDE 通过计算机筛选扩展了可访问的序列空间,但其性能仍取决于准确捕获上位性相互作用,即塑造蛋白质适应性的突变间上下文依赖效应。3 特别地,许多现有方法需要大型训练数据集、多轮实验或劳动密集型的合成,并且由于上位性建模不完整,在外推到高级别多突变体方面仍然有限。Tran 等人通过一个端到端框架来解决这些限制,用于直接探索多突变体。

MULTI-evolve 建立在三个概念组件之上。首先,该框架部署了 PLM 零样本集成方法来提名功能增强的单突变。通过结合结构知情模型和基于序列的模型以及 z-score 标准化,与单独的 PLM 相比,作者改进了有效突变的识别。其次,他们使用实验表征的单突变和双突变紧凑数据集在全连接神经网络(FCNNs)上进行了训练,以学习上位性相互作用并预测高级别变体。这种数据高效策略支持从单突变和双突变数据外推到高级别组合,包括在基准分析中具有多达 12 个突变的变体。第三,作者开发了 MULTI-assembly,一种基于切口酶的多位点诱变方法,支持跨数千碱基编码序列高效构建预测的多突变体,从而减少对商业基因合成的依赖(图 1)。

图 1
图 1
全尺寸图片

MULTI-evolve 结合 PLM 先验、上位性学习和多位点诱变,用于单轮多突变工程。从感兴趣的蛋白开始,使用 PLM 零样本预测或现有功能数据集识别功能增强单突变,之后对紧凑的配对组合面板进行实验表征以捕获关键的上位性相互作用。这些数据训练神经网络模型,外推到高级别组合并提名顶级多突变体,然后由 MULTI-assembly 跨数千碱基编码序列快速构建。该框架应用于 APEX、dCasRx 和抗 CD122 抗体,产生了具有显著催化活性、RNA 引导的反式剪接性能或结合 - 表达特性增益的协同变体,确立了 MULTI-evolve 作为加速蛋白质工程的可推广平台。图由 BioRender.com 制作(https://BioRender.com/6ym60ij

MULTI-evolve 的通用性在三种不同的工程化蛋白中得到证明。对于工程化抗坏血酸过氧化物酶(APEX),PLM 引导的扫描重现了经典的 A134P (APEX2) 突变,并识别了额外的替换,其活性比野生型 APEX 高出多达 256 倍,并在生物化学和细胞测定中较 APEX2 有高达 4.8 倍的改进。4 值得注意的是,即使在缺乏 A134P 的情况下,该框架生成的变体活性比野生型 APEX 高出多达 13.5 倍,而 EVOLVEpro 在五轮后仅实现了高达 1.9 倍的增强。5 生物化学和细胞分析进一步表明,活性增益并非归因于细胞表达的增加。

并行地,MULTI-evolve 被应用于工程化催化失活的 RNA 靶向 CRISPR 效应子 dCasRx (dead Cas13d) 用于可编程 RNA 反式剪接,使用基于深度突变扫描 (DMS) 的功能数据作为初始化,而不是 PLM 预测。这产生了剪接活性高达 9.8 倍的 dCasRx 多突变体,并在三个内源人基因 ITGB1、TFRC 和 SMARCA4 中反式剪接效率高至 4.5 倍。激活突变 E282 和 S354P 映射在 crRNA/靶 RNA 双链体附近,表明可能在改善 RNA 双链体参与方面发挥作用作为机制基础。这些活性增益在 RNA 引导的 Cas 编辑器 (RESPLICE) 反式剪接背景下也被保留,尽管程度较小,其中 dCasRx 与 Cas7-11 顺式干扰模块耦合,表明工程化变体在不额外融合效应子的情况下改善功能。

MULTI-evolve 的临床相关应用是 HuABC2 的多目标优化,这是一种高亲和力抗 CD122 抗体,对白癜风和乳糜泻等自身免疫性疾病具有治疗潜力。抗体开发通常涉及导航复杂的帕累托前沿,其中改善一个可开发性参数可能会损害另一个。在此背景下,MULTI-evolve 识别了潜在表达和结合亲和力的不同上位性架构。通过考虑拮抗性突变相互作用,它实现了表达产量的同时 6.5 倍改善和结合亲和力的 2.7 倍增强,从而改善了治疗功能和可制造性。

尽管取得了这些进展,仍应考虑 MULTI-evolve 的若干局限性。第一,其性能取决于初始识别足够数量的功能增强单突变。当 PLM 零样本预测未产生有利变体时,该框架可能难以应用,特别是如果进化偏差不对应感兴趣的功能且缺乏实验 DMS 数据时。该框架采样围绕有益突变的序列空间,可能错过优化变体源于单独中性或有害突变组合的进化路径。未来迭代可以纳入此类突变以扩展序列空间并捕获高级别正上位性效应。第二,其在神经网络中对 one-hot 序列编码的依赖限制了模型的表示能力。它未整合更广泛的生物物理特征,如残基 - 残基接触或蛋白质结构信息,这些是 PLM 嵌入可以捕获的,并且可能能够实现更好的结构外推。此外,这种外推的准确性可能会随着与训练数据的突变距离增加而下降,特别是在高度崎岖的适应性景观中。鉴于 AI 驱动蛋白质结构预测和表示学习的最新进展,整合蛋白质基础模型的结构嵌入可以改善上位性预测并超越简单序列编码的泛化能力。

MULTI-evolve 的更广泛意义在于其简化迭代蛋白质工程工作流程的潜力。通过结合计算优先级排序与紧凑的实验周期,MULTI-evolve 可能减少与多突变优化相关的时间和实验负担。该框架数据高效、多目标优化的能力与生物制药开发特别相关,其中功效、可制造性和安全性通常需要并行平衡。随着靶向治疗越来越依赖工程化模态,包括抗体、基因编辑系统和合成酶,设计和测试协同多突变体的能力可以扩展蛋白质工程的实际范围。总体而言,MULTI-evolve 通过整合 PLM 引导的突变发现、上位性感知建模和组合多位点变体设计,为蛋白质工程提供了一个数据高效框架。该框架可能促进计算机设计蛋白向生物医学应用的转化。