《Digital Discovery》:Recent advances in AI-driven biotherapeutic discovery using protein generative modelsOpen Access
编辑推荐:
深度学习正在通过快速生成经实验验证的新颖结构与序列,变革治疗性蛋白质的设计。本综述调查了AI驱动的用于生物治疗药物发现的蛋白质设计方法的最新进展,并按照计算设计流程进行组织。首先,研究人员回顾了基于AI的蛋白质结构生成方法,这些方法能够基于各种条件产生新颖的主
深度学习正在通过快速生成经实验验证的新颖结构与序列,变革治疗性蛋白质的设计。本综述调查了AI驱动的用于生物治疗药物发现的蛋白质设计方法的最新进展,并按照计算设计流程进行组织。首先,研究人员回顾了基于AI的蛋白质结构生成方法,这些方法能够基于各种条件产生新颖的主链骨架。与传统的计算方法相比,这些方法实现了显著更高的实验命中率。其次,研究人员概述了新颖蛋白质序列设计方法的全景,这些方法能够为设计的骨架生成可实验实现的序列。第三,作为模块化方法的一种新兴替代方案,研究人员还回顾了同时优化主链几何形状和残基身份的结构-序列共生成(structure–sequence co-generation)方法。第四,研究人员回顾了针对多状态(multi-state)和动力学感知(dynamics-aware)设计的新兴努力,这放宽了每个设计都是一个单一静态结构的假设。在这些方法类别中,研究人员比较了采样效率、条件控制、报道的可设计性、实验成熟度和可扩展性,并探讨了为何已发表的值在不同研究中几乎无法比较。除了对计算方法的回顾,研究人员还调查了基于AI的蛋白质设计方法在治疗领域的应用,范围从从头(de novo)结合子设计到抗体和疫苗设计。最后,研究人员讨论了当前AI设计方法的局限性,包括计算指标与治疗效果之间的差距、标准化基准的缺失以及结构训练数据集引入的偏差。研究人员还指出了未来向闭环、实验指导的临床可行生物治疗药物设计的方向发展。
论文主体内容总结
1 引言
蛋白质介导生命系统中几乎所有的分子过程。设计具有特定结构和功能的蛋白质的能力对生命科学具有变革性影响,能够按需创造新型疗法、工业生物催化剂、生物传感器和功能生物材料。然而,序列空间的组合爆炸使这一任务极具挑战。近期,深度学习通过开发能够以前所未有的高实验成功率生成新型蛋白质结构和序列的生成模型,正在重塑生物分子设计领域。AlphaFold2(AF2)标志着范式转变,它不仅实现了近实验精度的结构预测,其模型置信度分数(pLDDT和PAE)也被证明与蛋白质设计的成功率强相关,可作为高通量的计算机模拟(in silico)交叉验证过滤器。从预测到生成的转变由深度学习的结构生成模型催化,如RFdiffusion,它能够直接生成多样化的骨架。AI驱动的蛋白质设计正成为计算生物学和生物治疗药物开发中最前沿的领域之一。
2 结构设计
通常,主链生成是从头(de novo)蛋白质设计的第一阶段。生成模型产生满足全局或功能约束的三维骨架,随后进行独立的序列设计。最近的生成模型将主链生成重新定义为从学习到的蛋白质结构分布中对氨基酸空间分布进行采样。本节按生成机制回顾了这些方法:基于扩散的模型、基于流匹配的模型和潜在空间模型。然后从任务导向的角度进行分类,考察了基序支架构建、结合子设计和对称约束组装等关键应用。
2.1 基于扩散的主链生成
扩散模型已成为生成机器学习的主要范式。RFdiffusion通过使用RoseTTAFold作为去噪器,将去噪扩散应用于蛋白质主链生成,支持单体设计、基序支架构建、结合子设计和对称约束寡聚体组装等多种条件生成。在对五个靶点的结合子设计活动中,RFdiffusion实现了约19%的整体实验命中率,比之前的Rosetta方法高出两个数量级。FoldingDiff使用内部键和二面角序列表示主链几何,避免了等变网络架构的需求。部分模型旨在满足SE(3)-不变性或等变性,例如Genie采用非对称扩散策略,FrameDiff开发了SE(3)-不变的扩散框架。
2.2 用于更快主链采样的流匹配
扩散模型的迭代去噪过程对于大型蛋白质可能计算成本高昂。流匹配算法通过学习一个时间依赖的速度场来解决此问题,该速度场将样本从简单的基础分布传输到目标数据分布。FrameDiff的改编版FrameFlow在SE(3)上应用流匹配,报告的可设计率约为FrameDiff的两倍,而采样步骤减少五倍。FoldFlow在一个通用框架内引入了确定性、随机性和最优传输变体。Proteina通过大型非等变Transformer架构和基于CATH折叠类标签的分层条件作用执行基于流的生成,训练数据扩展到来自AlphaFold数据库(AFDB)的2100万个结构。
2.3 蛋白质结构潜在空间中的生成
在主链生成中显式控制整体折叠拓扑是一个挑战。因此,最近的模型引入了中间抽象,包括潜在全局编码、接触图和多尺度表示。TopoDiff通过拓扑感知的潜在编码增强扩散,实现对CATH折叠类型的更好覆盖。LSD采用由粗到细的生成策略,首先生成接触图,然后生成原子坐标。PAR提出了一种多尺度自回归框架,先生成粗略结构,再由基于流的解码器细化。
2.4 用于生物治疗药物开发的结构生成任务
无条件生成有助于探索可能的折叠空间,但大多数生物治疗药物开发的设计问题需要生成满足特定结构或功能约束的主链。
2.4.1 基序支架构建
基序支架构建解决在预定义功能几何周围生成结构可行支架的核心挑战。RFdiffusion通过条件生成和修复式条件作用支持此任务。Genie 2解决了更困难的多基序设置,其中基序的相对排列未完全指定。RFdiffusion2将基序支架构建范式扩展到原子级活性位点指定,无需预先指定残基索引或逆旋转异构体枚举。
2.4.2 结合子设计
结合子设计是主链生成的另一主要应用。RFdiffusion3将生成扩展到全原子设置,显式建模配体、核酸和其他非蛋白质原子。PPIFlow采用AF3的配对变换器架构与流匹配相结合,用于结合子生成,并结合了计算机模拟(in silico)亲和力成熟阶段。
2.4.3 对称寡聚体和复合物
对称约束生成对于设计纳米材料和多价蛋白质组装体至关重要。RFdiffusion支持多种对称群的生成,并通过实验验证了设计的低聚状态。Chroma将条件蛋白质和复合物设计表述为一个可编程的生成过程。
2.4.4 比较分析
直接比较这些方法比报告的数字所暗示的要复杂。扩散模型最成熟,支持最广泛的条件模式,但采样缓慢。流匹配解决了采样成本问题,但湿实验证据仍有限。潜在空间模型使全局组织成为显式控制对象,但在潜在编码和原子坐标之间增加了额外抽象。
3 序列设计
蛋白质序列设计问题被公式化为反向折叠(inverse folding)。深度学习将其重构为基于PDB中主链-序列对的监督学习任务。本节回顾的方法包括基于消息传递神经网络的、基于替代架构的、基于蛋白质语言模型的和基于扩散/流匹配的方法。
3.1 基于消息传递神经网络的方法
消息传递神经网络(MPNN)通过聚合来自相邻节点的消息来更新节点表示。ProteinMPNN将主链表示为残基上的k-最近邻图,实现了比Rosetta快200倍的序列生成,并将天然序列恢复率提高到50%以上。LigandMPNN将此框架扩展到条件作用于所有非蛋白质原子坐标。
3.2 序列设计的替代架构
后续方法探索了不同的编码器-解码器组合。ESM-IF1将GVP-GNN编码器与自回归Transformer解码器配对。PiFold用非自回归编码器取代了自回归解码,实现了单次前向传播预测所有残基身份。Frame2seq应用不变点注意力(IPA)于编码器仅掩码语言模型。SurfFold结合了表面描述符。CarbonDesign反转了AlphaFold的Evoformer作为编码器。
3.3 基于蛋白质语言模型的序列设计
蛋白质语言模型(PLM)被用作序列设计的信息先验。LM-Design通过插入轻量级结构适配器重新编程冻结的ESM-2模型。KW-Design通过多模态知识融合实现了超过60%的恢复率。
3.4 基于扩散和流匹配的序列生成
扩散和流匹配框架已成为序列设计的替代方案。MapDiff使用了离散去噪扩散。TriFlow用三轨全局注意力架构取代了局部消息传递。ADFLIP将离散流匹配扩展到全原子上下文。ConformAb将引导离散扩散应用于抗体CDR设计。MOG-DFM结合了多目标引导。
4 结构-序列共生成
共生成方法旨在同时探索耦合的序列-结构景观。本节回顾了四类方法:基于幻觉的、基于流的、基于蛋白质语言模型的和全原子的方法。
4.1 基于幻觉的方法
基于幻觉的方法利用预训练的结构预测网络,通过优化序列使预测结构满足所需属性。RFDesign引入了约束幻觉和修复两种互补策略。松弛序列优化(RSO)在连续序列空间中执行梯度优化。BindCraft利用AF2的预训练权重设计从头(de novo)蛋白质结合子。Protein Hunter迭代地交替进行序列重设计和结构重预测。
4.2 基于流的共生成
基于流的方法学习从先验分布流向蛋白质序列和结构联合分布的向量场。MultiFlow结合了用于氨基酸序列的离散流模型和用于主链坐标的连续SE(3)流。CoFlow完全在离散空间中操作。FoldFlow-2引入了一个序列条件的SE(3)-等变流匹配模型。PT-DiT引入了一个多模态扩散Transformer。
4.3 基于蛋白质语言模型的共生成
基于PLM的方法将蛋白质共生成重新表述为跨多个模态的掩码预测问题。ESM3是一个多模态PLM,联合推理蛋白质序列、结构和功能,通过设计一种新的绿色荧光蛋白(esmGFP)证明了其生成新型功能性蛋白质的能力。
4.4 全原子共生成
全原子方法将生成过程扩展到包括侧链原子。Protpardelle在扩散过程中将所有侧链状态表示为叠加态。La-Proteina引入了一个部分潜变量的流匹配框架。
5 多状态和动力学感知的蛋白质设计
许多治疗相关的靶点违反了单一静态结构的假设。多状态设计的进展明显慢于单状态生成。在主链层面,现有生成器被直接使用。在序列层面,多状态约束已被纳入逆折叠目标函数。在多状态和动力学感知设计中,基于物理的增强采样方法与深度学习预测相结合,以识别稳定不同构象状态的突变。