综述:人工智能工具在酶设计中的应用与局限性

《Protein Science》:Applications and limitations of AI tools in enzyme design

【字体: 时间:2026年07月12日 来源:Protein Science 5.6

编辑推荐:

  酶相较于合成催化剂,通常能够以更高的效率和选择性催化多种不同的化学反应。过去几十年中蛋白质工程的发展,使研究人员能够设计酶、提升其催化性能,并使其适用于特定化学反应或全新的化学转化。然而,对成千上万种计算设计结果进行实验验证的需求,仍然是该领域的主要瓶颈之一。

  
酶相较于合成催化剂,通常能够以更高的效率和选择性催化多种不同的化学反应。过去几十年中蛋白质工程的发展,使研究人员能够设计酶、提升其催化性能,并使其适用于特定化学反应或全新的化学转化。然而,对成千上万种计算设计结果进行实验验证的需求,仍然是该领域的主要瓶颈之一。另一项限制则来自当前对过渡态结构、突变效应以及活性位点动态等问题的认识仍然有限。为克服这些限制,实验方法与计算方法的结合至关重要,但许多实验研究人员在进入计算酶设计领域时仍面临显著障碍。为应对这些障碍,本文综述性地介绍并概述了若干当前可用于酶设计的人工智能(AI)驱动方法,重点关注反应到序列设计、结构预测、底物范围预测、稳定变体工程、含非天然氨基酸酶的设计以及从头(de novo)设计。由此,本文可作为有意学习如何在酶工程中使用基于人工智能的计算方法的实验研究人员的一份易于获取的指导性综述。
1 INTRODUCTION

文章首先指出,酶是自然进化优化形成的高效且高选择性的催化蛋白,已广泛应用于食品、生物制药和化学工业等领域。当前蛋白质科学的重要方向之一是面向目标的酶工程,其核心在于定制酶活性,使其能够催化特定底物反应或非天然化学反应。传统上,这一过程高度依赖对酶结构及活性位点的深入理解,以便通过理性改造优化天然底物催化或容纳非天然底物。与通常需要筛选大量变体的定向进化相比,基于结构的设计可显著缩小候选库规模,但其应用长期受限于高质量结构数据的缺乏。随后,分子对接、分子动力学(MD)模拟和量子力学(QM)方法逐渐成为现代酶工程的重要组成部分,而机器学习(ML)与深度学习的加入进一步推动了结构—功能关系预测和新型催化骨架设计的发展。作者强调,尽管这些方法能力强大,但计算成本高且技术门槛明显,因此本综述旨在为实验研究人员提供一份实用且审慎的人工智能酶设计指南,聚焦反应到序列设计、结构预测、底物特异性、稳定性优化、非天然氨基酸(ncAAs)应用及从头设计等关键方向。

2 AI FOR REACTION-TO-SEQUENCE DESIGN

本节讨论如何从目标化学反应映射到蛋白序列,并将相关人工智能方法划分为预测型模型与生成型模型两大范式。预测型模型主要用于评估和排序天然酶序列是否适合目标反应,而生成型模型则尝试依据催化功能或反应描述直接创建新序列。作者指出,当前可用工具仍以预测型为主,更多承担候选优选而非直接生成全新酶序列的任务。文中系统概述了若干代表性方法:Selenzyme 及其升级版 SelenzymeRF 通过反应相似性和基于机器学习的原子到原子映射来匹配候选酶;酶-底物预测器(ESP)可根据已有酶序列与底物信息预测相互作用;其改进版本 ProSmith 在面对未见蛋白和稀疏化学类型时具有更好的泛化能力;FusionESP 借助对比学习策略增强了对训练集外酶和小分子的适用性,并以余弦相似度输出不确定性信息。除此之外,ALDELE 可预测酶是否会催化给定小分子反应,并输出残基热点图和底物热图,用于指导工程改造;CATNIP 专门针对α-酮戊二酸/Fe(II) 非血红素铁酶家族进行酶—底物双向匹配;CLEAN 则用于未知酶功能注释,为后续工程提供功能骨架;EZSpecificity 结合三维(3D)结合复合物信息和交叉注意力图神经网络,用于预测酶的底物范围和特异性。作者强调,这些模型的核心价值在于缩小实验筛选空间,但由于训练数据覆盖度、外推能力和假阳性累积等问题,其结果仍需实验验证。

3 AI FOR STRUCTURE PREDICTION

本节聚焦人工智能在酶结构预测中的进展,特别强调近期模型已从多肽链预测拓展到包含小分子、金属离子、核酸和修饰残基的生物大分子复合体。AlphaFold3(AF3)被介绍为一种全原子、基于扩散的结构预测器,能够处理蛋白质与DNA/RNA、小分子配体、离子以及修饰或非天然残基的复合体系。作者同时指出,OpenFold 虽基于 AlphaFold2,但在本地部署、再训练、基准评测和模型架构修改方面更具开放性。RoseTTAFold All-Atom(RFAA)则作为另一类通用生物分子共折叠模型,具备对蛋白-配体、蛋白-金属、蛋白-核酸以及共价修饰残基的整体预测能力,且完全开源。Chai-1 支持从 FASTA 序列和化学输入直接预测完整复合物结构,在蛋白-配体、蛋白-蛋白及蛋白-核酸任务中均表现出较强性能,但也存在链间相对取向错误和对修饰残基敏感等问题。Boltz-2 的突出特点在于不仅预测复合物结构,还可预测结合亲和力,其性能接近基于物理的自由能微扰(FEP)方法,但计算速度显著提升,因此适用于实际的计算筛选与迭代设计。总体而言,本节表明结构预测人工智能工具正从静态蛋白结构预测迈向更贴近酶设计实际需求的复杂体系建模,但其结果仍需结合下游能量评估与实验检验使用。

4 AI TO SUPPORT ENGINEERING OF SUBSTRATE SPECIFICITY

本节围绕底物特异性工程展开,指出改变酶的底物范围是过程导向酶工程中的核心任务之一,尤其在新化合物合成和制药研究中具有重要价值。传统的位点定向突变方法虽然能够改变底物范围,但高度依赖对蛋白结构、酶-底物相互作用及结构—功能关系的详细了解,同时还需考虑上位性效应,即多重突变的总体效应往往并非简单加和。因此,在知识有限和筛选能力不足的条件下,人工智能工具可显著提升工程效率。文章介绍了多种相关方法:ProGen 是基于大规模蛋白序列训练的语言模型,可生成具有目标功能的新蛋白序列,并已在溶菌酶体系中得到实验验证,可作为特定底物范围工程的起始序列来源。PLACER 可用于评估设计活性位点的结合准确性和预组织状态,从而支持候选变体筛选。EnzyACT 能够预测单突变或多突变对酶活性的影响,同时评估与野生型相比的活性和稳定性变化。AI.zymes 提供了接近全流程的体外实验前定向进化框架,整合 Rosetta、ESM-Fold、ProteinMPNN 和 FieldTools 等模块,实现设计、筛选和突变循环,最终输出优化后的突变体结构。GDEE 则可从酶和配体的结构文件出发,对用户指定残基进行突变空间采样,也可用于特定功能的新酶发现。作者借此说明,人工智能不仅能够支持起始酶选择和突变体优选,还可在迭代式工程流程中承担更大比例的设计任务,但终端实验验证仍不可替代。

5 AI-BASED APPROACHES TO AUGMENT PROTEIN STABILITY

本节讨论人工智能在提高蛋白稳定性方面的应用。文章指出,稳定性与催化效率常常内在耦联,提高稳定性虽有助于增强酶在复杂条件下的耐受性,却也可能限制催化所需的构象动态,因此理想设计应同时兼顾稳定框架和局部柔性。作者回顾了 FoldX 和 Rosetta 等传统方法在稳定性设计中的作用,并重点介绍近年来涌现的人工智能模型。ProStab 结合序列和结构信息,直接预测点突变的稳定化效应,且在转氨酶实验中表现出一定实用价值。ProstaNet 基于原生蛋白或突变体的结构比较来评估突变的稳定或去稳定效应,并在人源化纳米抗体体系中获得实验支持。SPURS 融合 ProteinMPNN 和 ESM 框架,可一次性评估所有单点突变对稳定性的影响。Pythia 采用自监督学习,仅依赖结构信息,不借助进化背景,在环氧化物水解酶实验中表现出较高命中率。SPIRED-Stab 通过先由序列预测结构、再评估一到两个替换对 fitness 的影响,最终推断稳定性变化。Stability Oracle 将蛋白表示为图,并结合预训练化学环境表示与带标签稳定性数据进行预测。ESMtherm 是基于 ESM 微调得到的稳定性预测框架,适合判断突变是否稳定化或去稳定化,且在短结构域预测中表现较好。ProSTAGE 则通过图表示整合序列与结构信息,预测点突变对结构—功能关系中稳定性维度的影响。作者特别强调,部分工具虽然概念先进,但缺乏充分、可量化的同行评议实验验证,因此在应用中应保持谨慎。

6 AI FOR ENZYME DESIGN WITH NON-CANONICAL AMINO ACIDS

本节聚焦含非天然氨基酸(ncAAs)酶的设计。作者指出,传统蛋白设计长期受限于20种天然氨基酸,而 ncAAs 的引入为扩展遗传密码、赋予新功能以及改善酶性能提供了重要机遇。但目前面向 ncAAs 的计算工具仍十分有限,主要困难包括:蛋白质数据库(PDB)中含 ncAAs 的结构样本稀缺,以及不同于标准氨基酸的侧链缺乏参数化和可靠结构建模方法。文章首先简要提及一批非人工智能但对该领域有奠基意义的方法,如用于 Rosetta 的 MakeRotLib、适用于复杂 ncAAs 参数化的 FakeRotLib、包含大量参数化 ncAAs 的 ff_NCAA 力场,以及用于 chemistry at HARvard macromolecular mechanics 力场的参数生成工具包。随后,作者指出,尽管 AlphaFold2 和 AlphaFold3 推动了蛋白结构预测革命,但它们本质上仍局限于训练数据中编码的标准氨基酸集合,面对 ncAAs 时常采用近似替代或侧链信息不完整的表示。为突破这一限制,NCFlow 被介绍为一种显式支持标准与非标准氨基酸混合字母表的流匹配生成模型,其通过原子图表示任意 ncAA,并采用小分子构象、蛋白-配体复合物以及天然 ncAA 残基三阶段训练策略,以弥补 ncAA 结构数据稀缺的问题。基准测试显示,NCFlow 在含新型 ncAAs 序列的主链和侧链构象预测上优于 AF3。RareFold 则基于 AF2 的 EvoFormer 架构扩展而来,将20种天然氨基酸和29种 ncAAs 视为独特标记进行训练,并且可以针对特定 ncAA 进行显式微调。该方法已获得实验验证,代表了 ncAA 蛋白结构预测的重要进展。总体而言,本节认为 ncAA 酶设计的计算框架仍处于早期发展阶段,未来仍需解决力场覆盖不足、训练数据有限及难以纳入端到端设计流程等问题。

7 AI-POWERED DE NOVO ENZYME DESIGN PIPELINE

本节总结人工智能驱动的从头(de novo)酶设计流程。作者将从头酶设计定义为围绕预先定义的活性位点模型,自底向上构建全新蛋白骨架的方法,其目标是创造自然界中不存在的蛋白,进而实现新型催化折叠、定制活性位点和全新功能。然而,这一任务要求同时满足折叠稳定性、结构完整性、催化几何、构象动态和底物结合等多重约束,因此实验失败率仍然较高。当前主要策略包括基于扩散的骨架生成、hallucination 方法以及生成式蛋白语言模型。RFdiffusion 通过将 RoseTTAFold 改造为骨架去噪网络,实现了在用户定义结构约束下的骨架生成和功能基序嫁接,并已在多类蛋白中获得实验验证。RiffDiff 进一步结合机器学习骨架生成与原子级建模,用于围绕预定义催化阵列构建稳定的从头酶。作者指出,扩散模型通常与 ProteinMPNN 和 LigandMPNN 等序列设计工具形成串联流程,即先生成候选骨架,再设计序列,随后使用 AlphaFold(AF)及能量学方法进行筛选,这一流程已成功产生具备全新功能的实验验证蛋白和酶。与扩散方法不同,hallucination 方法并不依赖针对特定目标的专门训练,而是从随机噪声出发,通过神经网络迭代优化评分函数,以“幻觉式”生成高评分的序列与结构。这类方法的优势在于可直接优化某些难以转化为结构约束的功能指标,但也更容易受到评分偏差影响。作者进一步指出,混合使用扩散、hallucination 与基于能量的过滤策略,可能构成更完整的前进方向。最后,文章介绍了以序列为中心的生成式语言模型,如 ProtGPT2,可在不显式建模结构的情况下生成新蛋白序列,并已通过实验验证其可折叠性与稳定性。GENzyme 则代表了面向反应条件的从头酶设计新趋势,其以底物/产物 SMILES 为输入,生成催化口袋、酶结构与序列以及预测的酶-底物复合体,体现出将目标化学转化直接作为设计约束的潜力。

8 CONCLUSIONS

在结论部分,作者认为人工智能正在全面重塑蛋白与酶设计领域,使研究人员能够以过去难以想象的方式调控酶功能。无论是从反应化学出发筛选候选酶、预测复合体结构、优化稳定性、调整底物范围、引入非天然氨基酸,还是开展从头酶设计,人工智能都显著提高了探索序列—结构—功能空间的效率。然而,文章也清楚指出当前仍存在若干根本性瓶颈,包括尚不能高效实现高催化效率的从头设计、对蛋白动态与变构的理解有限、对过渡态及反应能量学的准确建模能力不足,以及难以构建全新催化机制。作者进一步强调,当前问题未必仅在于设计数量不足,更在于尚未掌握如何生成足够高质量的设计。与此同时,已发表研究常偏重成功案例,失败设计数据缺失,导致训练集存在明显发表偏倚,限制了人工智能模型对成功与失败决定因素的学习。未来若能系统整合正负实验结果,并加强人工智能与分子动力学(MD)、量子力学/分子力学(QM/MM)及实验验证流程的耦合,将有助于提升预测稳健性、可解释性和设计实际可行性。文章最终认为,数据驱动人工智能、物理建模与实验生物化学三者的协同,将决定未来酶工程的发展方向,并为可持续且创新性的生物催化奠定基础。
相关新闻
生物通微信公众号
微信
新浪微博

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号