《Journal of Chemical Information and Modeling》:Condensation of Force Field Parameters from Machine Learning Predicted Distributions for High-Throughput Virtual Screening Applications
编辑推荐:
可转移生物分子力场(Force Field, FF)是通过拟合与代表性分子相关的从头算或实验数据开发的,然后可用于模拟与它们开发时相似的化学实体。然而,一旦在给定数据集上参数化,当引入新的化学实体、传感方案或函数形式时,它们很难重新拟合。另一方面,机器学习力场
可转移生物分子力场(Force Field, FF)是通过拟合与代表性分子相关的从头算或实验数据开发的,然后可用于模拟与它们开发时相似的化学实体。然而,一旦在给定数据集上参数化,当引入新的化学实体、传感方案或函数形式时,它们很难重新拟合。另一方面,机器学习力场(Machine Learning Force Field, MLFF)最近因其准确性和易于扩展其适用域(Applicability Domain, AD)而受到关注。尽管如此,它们的预测时间使其与高通量虚拟筛选(High-Throughput Virtual Screening, HTVS)的要求不兼容。在这项工作中,研究人员遵循了可转移力场广泛采用的方法的逆过程,并提出了一种新的凝聚方法,利用机器学习算法大规模预测力场参数。然后,将生成的数值分布凝聚成一个单一值,该值以统计方式捕获共享该特定力场参数并产生该分布本身的底层分子的化学变异性,将计算效率提高了30倍,同时预测分子几何形状的准确性降低有限。当在公开的OpenFF Industry Benchmark Season 1 v1.1数据集上进行测试时,通过最小化用凝聚的力场参数构建的势能面(Potential Energy Surface, PES)优化的分子结构,与使用在运行时预测的分子特异性力场参数获得的分子结构相比,在均方根偏差(Root Mean Squared Deviation, RMSD)和扭转指纹偏差(Torsion Fingerprint Deviation, TFD)性能上仅显示出轻微下降。为了提供更多背景信息,将原始MLFF及其凝聚版本与几种广泛用于生物分子模拟的知名可转移力场进行了评估。
**论文解读:从机器学习预测分布中凝聚力场参数用于高通量虚拟筛选应用**
**研究背景与问题**
在计算化学与药物发现领域,分子力场(Force Field, FF)是模拟分子结构与相互作用的核心工具。传统可转移生物分子力场(如Amber、CGenFF、MMFF94)通过拟合代表性分子的从头算或实验数据开发,能够以较低计算成本模拟与训练集相似的化学实体。然而,这类力场一旦在特定数据集上完成参数化,便难以随着新化学实体、传感方案或功能形式的引入而重新拟合,限制了其适用域的扩展。近年来,机器学习力场(Machine Learning Force Field, MLFF)如Espaloma,凭借图神经网络(Graph Neural Network, GNN)架构,能够以接近量子力学(Quantum Mechanical, QM)方法的精度预测分子能量与力,且易于通过主动学习扩展其适用域(Applicability Domain, AD)。但MLFF的预测时间远慢于传统力场,在高通量虚拟筛选(High-Throughput Virtual Screening, HTVS)等需要快速处理数百万分子的场景中难以实用。因此,如何兼顾MLFF的准确性与传统力场的计算速度,成为该领域的关键挑战。
**研究内容与结论**
本研究提出一种新颖的凝聚(Condensation)方案,利用机器学习算法大规模离线预测力场参数,生成数值分布,再通过统计指标(如均值)将这些分布凝聚为单一参数值,并存入查找表。该方法在运行时仅需根据原子类型(采用MMFF94的100种原子类型)快速检索参数,从而绕开MLFF复杂的在线推理过程。研究人员以Espaloma 0.3.1模型为基础,分别装备了Class I(简谐函数)和Class II(含交叉项与非谐项)功能形式,并在OpenFF Industry Benchmark Season 1 v1.1数据集上对凝聚版本进行了全面评估。结果表明,凝聚后的Espaloma力场在分子几何预测精度(以RMSD和TFD衡量)上仅略有下降(例如RMSD均值从0.542升至0.607),但计算效率提升了约30倍,显著优于原始Espaloma模型。与多种传统力场(如MMFF94、OpenFF 2.0.0、Gaff 2.11、Opls4等)相比,凝聚版本在保持竞争力的同时,具备数据驱动、可快速重训练、易于集成主动学习等优势。该论文发表在《Journal of Chemical Information and Modeling》。
**关键技术与方法(不超过250字)**
本研究主要采用以下关键技术方法:
1. **机器学习力场模型**:基于Espaloma 0.3.1,其核心为图神经网络(GNN),通过分子拓扑图嵌入学习原子环境的连续表示,并预测Class I(简谐函数)或Class II(含交叉项与非谐函数,参照MMFF94)的价键参数。
2. **参数凝聚流程**:从五个训练子集(SPICE-PubChem、SPICE-DES-Monomers、SPICE-Dipeptide、Gen2-Opt、Gen2-Torsion,共17794个分子)中,用Espaloma预测每个分子的价键参数,生成按MMFF94原子类型分组的数值分布,再以均值作为中央趋势指标凝聚为单一参数值,最终存入查找表。
3. **分子势能面构建与优化**:将凝聚参数集成到LiGen-Pre软件中,使用LBFGS(有限内存Broyden–Fletcher–Goldfarb–Shanno)算法优化分子构象。
4. **基准评估**:在OpenFF Industry Benchmark Season 1 v1.1数据集上,以QM优化结构(B3LYP-D3BJ/DZVP水平)为参考,计算RMSD和TFD,并与原始Espaloma、MMFF94、OpenFF 2.0.0等力场比较。
**研究结果**
**4.1 力场计算性能比较**
通过将各力场集成到LiGen-Pre分子扩展流水线中,记录每批100个分子的执行时间(AMD EPYC 7282处理器,16核并行)。结果显示,采用间接化学传感(即原子类型查找表)的力场(MMFF94和凝聚Espaloma)显著快于需在线推理的原始Espaloma。凝聚Espaloma实现了约30倍的计算加速,主要得益于原子类型解析和C语言实现的表查找,而原始Espaloma依赖Python和PyTorch的全图神经网络推理。
**4.2 力场预测准确性比较**
按照D’Amore等人提出的评估方法,以QM优化的分子构象为金标准,计算各力场优化后结构的RMSD和TFD。结果表明:
- 原始Espaloma Class I表现最佳(RMSD均值0.542,TFD均值0.055),略优于MMFF94(0.598/0.055)和凝聚Espaloma(0.607/0.065)。
- 凝聚Espaloma的精度下降幅度较小(在累积密度曲线上最大偏差约0.1),但计算效率提升显著,使其在HTVS场景中更具实用性。
- 与OpenFF 2.0.0(0.540/0.046)、Gaff 2.11(0.650/0.061)、Opls4 cst(0.328/0.036)等传统力场相比,凝聚Espaloma的中位数和均值表现处于中等水平,但提供了数据驱动、易于更新的独特优势。
- 有趣的是,Espaloma Class II版本(含交叉项与非谐函数)表现反而较差(RMSD均值0.835,TFD均值0.071),研究认为这是由于Class II损失函数中参数量级差异导致训练病态问题,而Class I可借助线性分解策略有效解决。
**讨论与结论**
讨论部分指出,凝聚方案的优势包括:快速重训练以适应新功能形式、可结合主动学习(如Query-by-Committee)高效扩展适用域、能为蛋白质-配体系统开发一致力场、以及无需改变凝聚流程即可适配新原子类型或化学传感模型。此外,Class II功能形式虽理论上更精确,但机器学习训练中的病态条件限制了其实际表现,未来需探索更优的优化策略。
**翻译研究结论**
在这项工作中,研究人员评估了是否有可能利用预测的MLFF参数的准确性,同时保留与高通量虚拟筛选(HTVS)活动兼容的计算速度。研究人员使用Espaloma 0.3.1模型,根据预定义的Class I功能形式大规模预测力场参数。首先,研究人员评估了Espaloma Class II模型是否比其Class I对应模型提供更准确的分子结构。因此,研究人员为Espaloma模型配备了Class II功能形式,将生成的MLFF集成到Dompé的LiGen虚拟筛选软件中,并在OpenFF Industry Benchmark Season 1 v1.1上针对几种知名的生物分子可转移力场进行了评估。接着,研究人员利用Espaloma模型和MMFF94的原子类型,为原始Espaloma训练集的五个子集(SPICE-PubChem、SPICE-DES-Monomers、SPICE-Dipeptide、Gen2-Opt和Gen2-Torsion数据集)中每个价键力场参数生成数值分布。最后,通过提取每个数值分布的均值,将其凝聚为单一值。这一过程使研究人员能够从统计学意义上捕捉共享特定力场参数的分子中不同化学环境对该参数的影响。随后,研究人员在OpenFF Industry Benchmark Season 1 v1.1数据集上评估了使用凝聚Espaloma流程提供的力场参数生成的分子几何结构的准确性。与原始Espaloma模型相比,仅发现均方根偏差和扭转指纹偏差略有下降,同时计算效率提高了30倍。最后,为了提供更多背景信息,研究人员将使用凝聚流程生成的力场与几种知名的生物分子可转移力场进行了评估。该方法旨在提供经过统计验证的力场参数,这些参数可转移用于模拟不同的分子环境。研究人员相信,这一方法将为未来开发用于高通量虚拟筛选应用的机器学习力场铺平道路。