《International Journal of Molecular Sciences》:Diffusion-Based Protein Structure Design: Geometric Modelling, Validation Strategies, and Thermodynamic Challenges
编辑推荐:
尽管深度学习已经改变了蛋白质结构预测,但在结构生物信息学中,可控生成具有功能性且易于实验操作的蛋白质结构仍然是一个重大挑战。扩散模型为生成蛋白质主链、基于 Motif 条件的支架、全原子结构以及生物分子相互作用几何形态提供了一种通用的方法,同时能够适应显式的结
尽管深度学习已经改变了蛋白质结构预测,但在结构生物信息学中,可控生成具有功能性且易于实验操作的蛋白质结构仍然是一个重大挑战。扩散模型为生成蛋白质主链、基于 Motif 条件的支架、全原子结构以及生物分子相互作用几何形态提供了一种通用的方法,同时能够适应显式的结构和功能约束。本综述聚焦于基于坐标和残基框架的扩散方法以生成蛋白质结构,特别关注几何等变性、条件化策略、全原子建模以及相互作用感知设计。研究人员将衍生自 RoseTTAFold、Frame Diffusion 架构以及定向残基云表示的代表性方法,根据其分子表示、生成目标和验证策略进行了比较。研究人员审查了用于评估生成蛋白质的标准,例如立体化学质量、结构一致性、可设计性、新颖性、多样性、计算效率和实验性能。特别关注了学习到的结构分布与条件依赖的热力学系综之间的区别。未来的进展将取决于生成模型与分子力学、构象采样、不确定性估计、自由能方法以及实验设计-构建-测试-学习(DBTL)循环的整合。在此框架内,扩散模型在更广泛的蛋白质工程工作流程中提供了候选生成和约束满足能力。
1. 引言
蛋白质工程的目标是鉴定能够采用特定三维结构的氨基酸序列,同时满足功能、热力学、动力学和可开发性约束。由于序列、结构、构象动力学、稳定性、分子识别和生物学功能在高维能量地貌中紧密相连,该逆问题本质上是多目标的。深度学习改变了这一现状,AlphaFold2 证明了端到端神经架构可以高精度预测蛋白质结构。然而,单独的结构预测并不能解决逆向设计问题,预测与生成正越来越多地被整合。扩散模型在从先验分布逐步去噪以生成目标结构方面表现出色,可根据 Motif、对称性等进行条件约束,并广泛应用于主链生成、Motif 支架和全原子复合物生成等任务。蛋白质主链并非无序点云,而是具有立体化学约束和局部残基坐标框架的有序聚合物,因此 SE(3)-等变架构(如 RoseTTAFold、AlphaFold2 和 RFdiffusion)被广泛采用,以确保在刚体变换下坐标更新的几何一致性。近期应用表明,扩散模型已从方法学演示转向实验导向的蛋白质工程(如设计高亲和力结合剂)。
2. 理论背景
2.1 扩散模型
扩散模型由前向加噪过程和学习的反向去噪过程组成。在离散时间的去噪扩散概率模型(DDPM)中,前向过程定义为马尔可夫链 q(x
t|x
t-1),逐步将数据样本 x
0 扰动至各项同性高斯分布。反向过程从先验分布 x
T 采样,通过参数化模型逐步去噪以逼近数据分布,网络常被训练用于预测前向添加的噪声。扩散模型也可通过随机微分方程(SDE)在连续时间中表述。前向 SDE 包含漂移项和扩散系数,对应存在边际分布相同的逆向时间 SDE 和概率流常微分方程(ODE)。基于分数的生成模型通过去噪分数匹配训练时间相关的分数函数。在蛋白质设计中,这些公式可应用于序列、主链坐标等不同分子表示。
2.2 蛋白质设计的实际考量
扩散模型的实际应用取决于分子表示、条件变量和下游评估的组合。基于序列的模型操作氨基酸序列,而基于坐标和全原子方法直接生成几何结构和复合物组装。选定的表示决定了条件能否施加于 Motif、配体或对称性等。当前工作流程通常将扩散模型与逆向折叠、结构预测和实验筛选相结合。
3. 蛋白质工程的结构扩散模型
SE(3)-等变性已成为生成物理合理蛋白质结构的基本设计原则之一。每个残基由局部 SE(3) 坐标框架表示,确保旋转和平移的一致性。当前方法可大致分为三个代表性家族:
RFdiffusion 家族采用 RoseTTAFold 衍生的结构表示进行迭代主链去噪,支持无条件和条件生成(如保留特定 Motif 生成支架)。其扩展版本向原子级迈进,RFdiffusionAA 适应生成围绕非蛋白质组分的结构,RFdiffusion2 接受功能位点的原子描述,RFdiffusion3 原生引入全原子生成式公式。
FrameDiff 家族将主链表示为残基局部刚体框架序列,直接在旋转和平移分量上定义扩散,适用于无条件主链生成。其扩展如 FrameDiPT 用于结构修复,TDS 用于条件采样,VFN-Diff 采用向量场网络提升了可设计性。
Genie 家族在正向采用坐标噪声过程并在去噪期间重建定向残基框架。Genie2 扩展至多 Motif 支架,Genie3 引入全原子表示。
另外,Chroma 支持结构和语义约束的可编程组合;ProteinGenerator 耦合序列空间扩散;AlphaFold3 采用扩散模块用于条件全原子生成;DiffDock 专攻分子对接;Mac-Diff 从分子动力学轨迹学习蛋白质构象分布。
4. 评估指标、基准框架和实验验证
应使用互补标准评估生成模型,包括局部立体化学质量、序列-结构自洽性、新颖性与多样性等。
MolProbity 广泛用于评估立体化学质量(如空间位阻冲突),但它不确立全局稳定性。
PDB-Struct 采用结构自洽性和实验标注的稳定性互补测量,使用 TM-score 量化结构相似性,pLDDT 评估局部置信度,并通过突变数据集评估热力学稳定性,研究指出编码器-解码器方法在重折叠性和稳定性上通常优于结构预测方法。
Scaffold-Lab 从可设计性、新颖性、多样性等维度评估(如使用 RMSD 评估结构恢复,最高 TM-score 评估新颖性),但计算排名不应等同于实验证据。
Melodia 是包含微分几何描述符的结构分析库,但不能作为生成式设计基准。
这些评估标准构成层级关系,应单独报告局部几何、序列-结构恢复等指标。计算指标需辅以物理计算和实验测量,并需控制训练数据泄露和评估器依赖,报告结构冗余过滤和时间分割等。需明确区分实验验证与计算排名,报告重组表达、溶解度等各验证阶段的成功率。
5. 讨论
扩散模型通过将灵活条件化与几何分子表示相结合,扩大了蛋白质生成范围。然而其局限性是任务依赖的,且比较优势尚不完全确立。
5.1 局限性
训练数据集的组成限制了泛化能力,结构数据库过度代表易于实验的稳定蛋白质,而膜蛋白和无序区域代表性不足。模型可能重现这些偏差。
动力学和内在无序性表征不足。生成的一组构象不应自动解释为平衡系综,缺乏物理意义的种群和动力学连通性。
功能设计复杂性远超几何生成,功能标签更稀缺,需任务特异性实验测量以弥合结构与功能的差距。
架构未完全编码化学和环境背景,可能产生空间冲突或不当的溶液相互作用,需结合分子力学和能量指导。
评估协议标准化不足。TM-score、pLDDT 等量化不同属性不应互换。循环验证可能因共享架构而产生,需报告评估器独立性和失败测试。
可开发性构成额外局限。计算上可设计的序列可能表现出表达差或免疫原性,需评估长期稳定性和下游生产兼容性。
计算成本和代码可访问性差异也限制了独立复制。
5.2 迈向热力学信息与动力学感知的蛋白质设计
从统计力学角度,平衡系综在特定热力学条件下遵循玻尔兹曼加权的分布。数据库的经验分布和学习到的模型分布受到实验选择限制,本质上均不等同于平衡系综。恢复平衡种群需要校准的统计权重或自由能差。
从统计热力学来看,蛋白质构象分布在崎岖的自由能地貌上。热力学有利并不代表动力学上可及。当代扩散模型多使用去噪等生成目标优化,分数并非校准的热力学量。仅生成多个不同构象不足以重构物理系综,需关联有意义的统计权重和转移速率。
未来可将生成先验与物理信息结合,通过立体化学验证或分子动力学过滤。物理指导的效果取决于力场准确性和构象采样充分性,需通过经验评估而非假设其能改善所有目标。热力学信息设计应被视为条件依赖的推理,不应假设模型代表了通用的蛋白质自由能地貌。
6. 结论
基于扩散的蛋白质设计包含众多方法家族,其效用取决于设计目标。RFdiffusion 衍生方法适合 Motif 支架和全原子设计;FrameDiff 提供残基框架公式以无条件生成;Genie 强调主链探索和全原子生成;Chroma 支持可编程约束;ProteinGenerator 耦合序列与结构;Mac-Diff 针对构象异质性。各项对比结果高度依赖于训练数据和采样预算。立体化学质量和结构自洽性等应单独报告,不可直接作为折叠自由能或生物学功能的证据。未来研究应将任务匹配的生成模型与条件感知的分子建模、不确定性估计及实验验证相结合。