基于晶体学质子位置的互变异构体稳定性深度学习

《Chemical Science》:Deep learning of tautomer stability from crystallographic proton positionsOpen Access

【字体: 大 中 小 】 时间:2026年09月25日 来源:Chemical Science 8.1

编辑推荐:

  互变异构现象(tautomerism)在分子识别、理化性质和化学反应性中发挥着核心作用,然而快速识别稳定互变异构状态仍然是分子设计和基于结构的药物发现中的持续挑战。量子力学(quantum mechanics, QM)方法往往计算成本过高,难以应用于文库规模筛

  
互变异构现象(tautomerism)在分子识别、理化性质和化学反应性中发挥着核心作用,然而快速识别稳定互变异构状态仍然是分子设计和基于结构的药物发现中的持续挑战。量子力学(quantum mechanics, QM)方法往往计算成本过高,难以应用于文库规模筛选;而基于规则和依赖三维结构的机器学习方法在可迁移性或通量方面仍存在局限。本研究中,研究人员展示了剑桥结构数据库(Cambridge Structural Database, CSD)中实验解析的氢原子位置为学习互变异构体稳定性提供了大规模监督信息的强大来源。研究人员利用来源于质子解析晶体结构的超过110万个互变异构状态,训练了一个二维图神经网络(2D graph neural network),该网络直接从分子拓扑结构预测稳定互变异构状态,无需构象生成或量子计算。该模型在涵盖晶体结构、水溶液基准和类药分子的综合测试集上达到了0.97的召回率和0.88的精确率,在晶体和水溶液环境中均展现出令人鼓舞的性能。将该模型应用于具有多个互变异构状态的5075个PDBbind配体时,模型识别出126个指定互变异构状态可能错误的案例;在每个案例中,重新分配的稳定互变异构体均表现出改善的氢键模式以及更少的不饱和极性原子。研究人员进一步开发了开源工作流程Tautomer-Predictor,能够在单个GPU节点上约3.2小时内处理包含460万个化合物的Enamine化合物库。综上所述,这些结果确立了晶体学质子定位作为学习互变异构体稳定性的丰富且未被充分开发的化学知识来源,并为分子发现中的大规模互变异构体分配提供了实用途径。
**基于晶体学质子位置的互变异构体稳定性深度学习:研究解读**

**一、研究背景与问题提出**

互变异构现象(tautomerism)是结构异构的一种基本形式,涉及质子迁移和键重排,在分子识别、理化性质和化学反应性中发挥核心作用。对于小分子和生物分子构建单元而言,优势互变异构状态能够显著影响pKa、溶解度、亲脂性、氢键模式以及最终的生物学功能。在药物化学领域,互变异构转变可通过互换氢键供体和受体改变配体药效团,从而影响靶标结合和基于结构的建模结果。错误的互变异构体分配可能损害分子对接、自由能计算、虚拟筛选等基于结构的药物设计任务。

然而,快速可靠地识别稳定互变异构状态仍然面临挑战。高精度量子力学(QM)计算能提供物理意义上合理的溶液态互变异构能量学,但其计算成本使其难以应用于大规模化学文库筛选。基于规则和经验方法虽速度较快,但依赖预定义变换或基于有限实验/计算数据推导的片段启发式规则,降低了对新化学类型的可迁移性。近年来,人工智能方法提供了有前景的替代方案,如Auto3D、MolTaut等方法,但它们在能量计算前需要几何优化或分子模拟,限制了超高通量筛选应用。因此,开发同时具备快速性、实验依据和广泛化学空间可迁移性的方法仍是明确需求。

**二、研究内容与核心发现**

研究人员提出利用剑桥结构数据库(CSD)中实验解析的氢原子位置作为大规模监督信息来源。由于许多CSD结构包含明确分配的氢原子,这些数据提供了晶体环境中互变异构状态的直接实验信息。通过挖掘这些质子解析结构,研究人员构建了超过110万个互变异构状态的数据集,并训练了二维图神经网络,直接从分子拓扑结构预测稳定互变异构状态,无需构象生成或量子力学计算。该模型在晶体结构、水溶液和类药分子基准测试中均展现出良好性能,证明可从晶体学质子定位中学习到可迁移且化学意义明确的互变异构体稳定性规则。该研究的重要意义在于建立了大规模实验结构数据用于学习分子状态偏好的化学规则的新范式,为药物发现中的大规模互变异构体分配提供了实用框架。

**三、关键技术方法**

研究人员从CSD的“Best Hydrogen List”子集(主要来源于中子衍射研究的高可靠性氢原子位置结构)出发,使用CSD Python API提取晶体结构并转换为SMILES,经RDKit处理后去除无效或带电分子以及与测试集重叠的分子,最终获得1,131,426个条目。所有可能的互变异构体使用RDKit枚举,将CSD观测到的互变异构体标记为稳定形式,其余枚举形式标记为不稳定形式。训练集来源于CSD、Tautobase和Tautomer Database,验证集来源于Tautobase水溶液实验数据。研究人员训练了三种二维图模型MolMCL、AttentiveFP和D-MPNN,以及基线模型MorganFP-ANN(Morgan指纹结合多层感知器),在验证集上通过最大化F1分数优化概率阈值。在PDBbind v2020数据集应用中,使用RDKit评估配体电中性,排除了含金属离子配位和超过35个重原子的结构,并使用薛定谔Python API量化氢键和不饱和极性原子。

**四、研究结果**

**所有模型在所有测试集上的整体表现:** 研究人员将所有外部测试集合并为一个综合测试集进行整体性能评估。在验证集上通过最大化F1分数优化各模型概率阈值后,优先考虑验证集召回率选择最终部署模型,因为遗漏真正稳定的互变异构体(最可能的受体结合形式)可能影响下游对接、评分或自由能计算。在此标准下,AttentiveFP被选为最终模型,在验证集和综合测试集上分别达到0.90和0.97的最高召回率。值得注意的是,简单的Morgan指纹基线模型MorganFP-ANN也表现良好,召回率分别为0.83和0.92。

**AttentiveFP在不同化学环境中的表现:** AttentiveFP在CSD来源的“多互变异构体集合”上召回率和精确率分别为0.87和0.82。对Tautobase中625个水溶液稳定互变异构状态的分析显示与CSD中性有机分子集合有20.6%的重叠,为从晶体到水溶液的泛化提供了依据。在“100互变异构体集合”和“互变异构混合物集合”上,该模型分别达到0.87和0.91的召回率以及0.72和0.80的精确率。对于具有多个稳定互变异构状态的分子,模型能同时识别68.6%分子的所有稳定状态。在交叉引用CSD、DrugBank和LigandExpo构建的“重叠集合”和“类药集合”上,模型实现了近乎完美的分类性能(召回率1.00,精确率0.91)。然而,研究人员也分析了假阳性预测,发现最常见的错误发生在杂原子H迁移(N–O/S)、环内杂原子H迁移(环N–N)和酮-烯醇/硫酮-硫醇互变异构类别,表明互变异构偏好高度依赖环境,需开发考虑环境特异性偏好的更精确模型。

**应用以识别稳定互变异构状态:** 将模型应用于PDBbind数据集后,在6202个无带电官能团配体中,279个具有多个互变异构状态配体的原始和预测状态存在不一致。其中126个配体的重新分配同时增加了蛋白质-配体氢键数量并减少了不饱和极性原子数量(结构可解析集合)。对这部分结构进行Glide SP对接评分计算,重新分配的互变异构状态相比原始状态降低了实验结合亲和力与Glide SP评分之间的平均绝对误差(MAE = 1.65 kcal mol?1对比2.30 kcal mol?1),并产生更有利的预测结合自由能。DFT计算显示该集合94%的预测互变异构状态在能量上有利,98%的相对能量在2.76 kcal mol?1范围内。对于其余153个配体(结构不可解析集合),对接评分无显著差异,可能涉及受体诱导的高能结合态稳定化或溶剂暴露区域的互变异构变化。两个代表性案例分析(2BPM中配体529的3-氨基吡唑1H/2H互变异构和4BTX中WF8的哒嗪酮2H/1H互变异构)进一步说明,准确预测稳定互变异构状态可改善蛋白质-配体复合物中氢键网络的分配和解释。

**大规模化学文库上的运行时间:** 研究人员开发了开源工具Tautomer-Predictor,基于性能最优的AttentiveFP模型。在配备AMD 128核CPU和单个NVIDIA A100 GPU的系统上,处理Enamine化合物库(超过460万化合物)仅需3.19小时,ChEMBL(约285万化合物)需31.08小时,ChemDiv(约161万化合物)需0.97小时,Asinex(约57.5万化合物)需0.67小时,展现出处理大规模化学文库的高计算效率。

**五、讨论与结论总结**

在讨论部分,研究人员指出当前工作流程最适用于中性有机分子,未明确考虑离子体系、金属配位、受体诱导的互变异构体稳定化或RDKit互变异构体枚举的不完整性。特别是,开发能够同时解析耦合的质子化和互变异构状态的统一框架仍是未来研究的重要方向。

研究结论可概括为:本研究证明晶体学质子定位是学习互变异构体稳定性的强大可迁移监督来源。通过大规模挖掘剑桥结构数据库,研究人员训练了直接依据分子拓扑结构预测稳定互变异构状态的二维图神经网络,兼顾了强预测性能与现代分子发现所需的速度。模型在固态和水溶液基准测试及多样类药分子上展现出令人鼓舞的性能,其在PDBbind上的应用表明改进的互变异构体分配可直接增强蛋白质-配体结合模型的化学合理性。更广泛地,这些结果展示了如何将大规模实验结构数据重新利用以学习分子状态偏好的化学规则,为药物发现中的大规模互变异构体分配提供了实用框架。
相关新闻
生物通微信公众号
微信
新浪微博

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号