《Protein Science》:DreamFold: A World Model to efficiently generate protein folding pathways in the latent space
编辑推荐:
尽管生物大分子结构的静态数据十分丰富,但其折叠机制与动力学相关的数据却极为稀缺,这给人工智能模型的训练带来了挑战。已在机器人领域取得巨大成功的世界模型(World Model)方法可在此发挥作用。从有限的数据出发,该方法能够构建一个关于时空折叠环境的潜在近似表
尽管生物大分子结构的静态数据十分丰富,但其折叠机制与动力学相关的数据却极为稀缺,这给人工智能模型的训练带来了挑战。已在机器人领域取得巨大成功的世界模型(World Model)方法可在此发挥作用。从有限的数据出发,该方法能够构建一个关于时空折叠环境的潜在近似表征,用于训练下游人工智能模型。为此,研究人员开发了DreamFold——一种基于世界模型的生成式框架,用于执行生物分子模拟。DreamFold利用变分自编码器(Variational Autoencoder, VAE)将蛋白质结构及其二面角移动编码为潜向量,随后使用另一个神经网络快速预测经过一次潜运动后的下一个潜结构,使模型能够自行建立对蛋白质动力学的理解。最终,在一个“幻象”潜环境中,智能体通过进化算法学习驱动折叠模拟朝向目标状态前进的策略。潜构型随后可被解码回全原子结构。DreamFold计算蛋白质折叠路径的速度比分子动力学(Molecular Dynamics, MD)快四个数量级,最高可达约30,000倍。此外,对于本研究所测试的单体蛋白(最大至449个氨基酸),其计算成本随原子数(N)呈线性增长O(N)(相比之下,MD的复杂度为O(NlogN))。研究人员将结果与已有的MD基准及其他可用实验数据进行了验证。最后,研究表明DreamFold能够识别出含有隐藏结合位点的折叠中间态,这些位点具有治疗价值。总体而言,DreamFold通过生成式AI促进了蛋白质动力学的研究,并在基于结构的药物发现中具有应用潜力。
研究背景与研究意义
蛋白质折叠是一个高维度的复杂问题,涉及巨大的构象空间,蛋白质可能采取的天文数字般的构型使得该过程受复杂的能量景观、精细的原子间相互作用以及随机涨落所支配,呈现出高度非线性和计算密集的特点。传统的平衡态分子动力学(Molecular Dynamics, MD)方法虽然能够提供详细的动态信息,但由于计算资源限制,难以在可行的时间尺度内探索完整的折叠机制。增强采样技术和基于人工智能的方法虽有所突破,但仍面临计算效率与精度的权衡。特别是,生物大分子的折叠机制与动力学数据极为稀缺,这严重制约了AI模型的训练。
为解决这一难题,研究人员借鉴了在机器人领域取得巨大成功的世界模型(World Model)方法,开发了DreamFold。这是首个将生成式世界模型应用于生物分子模拟的框架,旨在通过构建一个低维的潜空间“梦境环境”,在其中训练智能体学习驱动蛋白质折叠的策略,从而以极低的计算成本获得高精度的折叠路径。该方法不仅能够加速折叠路径的计算,还能识别具有治疗价值的折叠中间态,为基于结构的药物发现(Structure-Based Drug Discovery, SBDD)提供了新的工具。
主要技术方法
DreamFold的核心构建流程包括五个关键步骤:
- 1.
训练数据生成:通过随机蒙特卡洛(Monte Carlo)模拟,对蛋白质主链二面角(Φ, Ψ)施加随机扭转,并进行能量最小化(Energy Minimization, EM)以消除原子冲突,从而生成用于训练模型如何编码结构和运动的轨迹数据。
- 2.
结构变分自编码器(VAE1)训练:训练一个变分自编码器(Variational Autoencoder 1, VAE1),将蛋白质的结构特征(Φ, Ψ二面角和Cα到天然态的距离)压缩成一个长度为10的低维潜向量?。
- 3.
动作变分自编码器(VAE2)训练:训练第二个变分自编码器(VAE2),将动作(A,即ΔΦ和ΔΨ)也编码为一个长度为10的潜向量α。
- 4.
前馈神经网络(FFN)训练:训练一个小型的前馈神经网络(Feed Forward Neural Network, FFN),使其能够在潜空间中根据当前的潜结构?(t)和潜动作α(t)预测下一个时刻的潜结构?(t+1)。该网络是DreamFold世界模型的核心,它构建了自身对结构转变的理解。
- 5.
控制器训练:在由训练好的FFN构成的“梦境环境”中,使用协方差矩阵自适应进化策略(Covariance Matrix Adaptation Evolution Strategy, CMA-ES)训练一个控制器。该控制器的任务是从任意展开态开始,为当前潜结构?(t)预测一个潜动作α(t),以使折叠轨迹向目标态(即天然态)靠近。
研究结果
- •
2.1 正则化(Regularization):为了减少策略进化过程中的过拟合,研究人员在控制器训练的奖励函数中引入了一个基于拉氏图(Ramachandran)的能量评分项。结果表明,该正则化项有效降低了折叠轨迹的累积拉氏图分数,并且在Fip35和hCRBP2两个案例中显著降低了轨迹的累积Rosetta能量,表明折叠路径遵循了更能量学有利的路线。
- •
2.2 折叠路径的计算与验证(Computation of folding pathways and validation):研究人员对多种蛋白质(如Fip35 WW结构域、TrpCage、Protein G、λ-repressor)进行了折叠路径计算。结果显示,DreamFold成功重现了文献报道的多种折叠机制,例如Fip35中两条主要路径的不同偏好性、TrpCage中疏水塌缩与螺旋形成的先后顺序等,证明了方法的定性准确性。
- •
2.3 性能(Performance):DreamFold的计算复杂度随原子数N线性增长O(N),远优于MD的O(NlogN)。在标准计算机集群上计算50条折叠轨迹,DreamFold相比纯MD模拟速度提升了数千至数万倍(TrpCage约3800倍,Fip35约8000倍,Protein G约30000倍),使其能够处理MD无法企及的大型体系(如449个氨基酸的人α微管蛋白)。
- •
2.4 路径相似性与结构形成分析(Path similarity and structure formation analysis):通过与DE Shaw Research的超长平衡态MD轨迹进行定量比较,研究人员计算了路径相似度(path similarity)和残基顺序参数(order of formation)。结果显示,DreamFold生成的轨迹在天然接触的形成顺序上与MD高度一致,尤其是在Fip35、Protein G和λ-repressor上表现优异,证明其具有很高的准确性。
- •
2.5 热力学(Thermodynamics):由于DreamFold生成的轨迹不满足细致平衡条件,无法直接提取热力学和动力学性质。但研究人员通过马尔可夫状态模型(Markov State Model, MSM),利用短时间MD弛豫模拟,成功重建了Fip35、Protein G和TrpCage的折叠自由能景观,识别出了天然态、中间态和展开态三个主要盆地,结果与平衡态MD定性相符。
- •
2.6 PrP折叠中间态(PrP folding intermediate):在对人朊病毒蛋白(Prion Protein, PrP)的研究中,DreamFold成功识别出了一个已知的治疗相关折叠中间态。该中间态具有天然态样结构,但螺旋1(H1)发生位移,暴露了一个隐藏的结合口袋。研究人员使用p2rank工具在该中间态上鉴定出了与文献一致的药理学靶点口袋,证明了DreamFold在识别药物靶点方面的潜力。
- •
2.7 泛素过渡态(Ubiquitin's transition state):通过对泛素(Ubiquitin)折叠过渡态(Transition State, TS)的分析,研究人员计算了残基对的Ψ值(一种衡量残基在TS中参与程度的实验指标)。与实验数据和DESRES MD模拟对比发现,DreamFold对短程接触的预测与实验吻合良好,而对长程接触的预测偏差与MD模拟类似,这可能源于力场本身的局限性。
- •
2.8 泛素展开态(Ubiquitin's unfolded state):研究人员分析了泛素展开态的残余结构。通过计算每个残基酰胺基团的埋藏度(buriedness)并与氢氘交换实验的保护因子(protection factor)进行比较,DreamFold成功捕捉到了实验中观察到的N端β发夹(β1, β2)和中心α螺旋(α1)区域的残余结构,但也错误地预测了其他区域存在残余结构,这反映了所用全原子力场倾向于产生过度塌缩展开态的固有偏差。
- •
2.9 hCRBP2的结构集合(Structural ensemble of hCRBP2):对人细胞视黄醇结合蛋白II(human Cellular Retinol Binding Protein II, hCRBP2)的研究中,DreamFold揭示了其折叠路径中的多种重要构象。研究发现了几种天然态样中间态,其视黄醇结合口袋处于开放状态,支持了“门户假说”(portal hypothesis)。此外,还观察到了一个类似于晶体结构中结构域交换二聚体的“开放单体”(open monomer)折叠中间态,为理解其生物学功能提供了结构基础。
总结与讨论
研究人员开发了DreamFold,这是首个将生成式世界模型应用于生物分子模拟的框架。通过在潜空间中进行策略进化,DreamFold克服了对真实全原子环境进行高计算量模拟的需求,成功计算了多种不同大小蛋白质的折叠路径,包括传统方法难以处理的较大蛋白。DreamFold展现出线性计算复杂度O(N),速度比MD快数个数量级,且在预测折叠机制、中间态和过渡态结构方面具有高精度。研究表明,通过引入基于结构的正则化项(如拉氏图得分)可以有效引导折叠路径趋向低能量途径。对hCRBP2的推理详细识别了与其生物学功能(如视黄醇结合和二聚化)相关的关键构象,这些构象此前仅基于有限的实验观测而被假设。
然而,该方法的主要局限在于无法直接计算动力学和热力学量,因为其控制器不满足细致平衡原理。因此,DreamFold更适合于获取折叠路径上的全原子中间态结构,而非获取动力学、热力学或自由能信息。此外,该方法继承了训练数据中全原子力场的偏差,例如对长程相互作用的低精度和对局部结构形成的偏好。未来发展方向包括将其改进为无需指定目标的非引导模拟,或生成热力学一致的轨迹以提供动力学和自由能见解。