XenoSoM:一种用于预测外源性物质代谢部位的深度学习框架

《European Journal of Medicinal Chemistry》:XenoSoM: A deep learning framework for site of metabolism prediction of xenobiotics

【字体: 时间:2026年09月09日 来源:European Journal of Medicinal Chemistry 6.7

编辑推荐:

  •我们构建了一个包含超过30,000种底物的数据库,解决了代谢数据的稀缺问题。•AttentiveFP模型在第一阶段和第二阶段的代谢反应中表现最佳。•与现有的第一阶段和第二阶段SoM预测工具相比,XenoSoM表现出更优越的性能。引言研究药物代谢对于开发安全有效的药物至关重要。评

  
  • 我们构建了一个包含超过30,000种底物的数据库,解决了代谢数据的稀缺问题。
  • AttentiveFP模型在第一阶段和第二阶段的代谢反应中表现最佳。
  • 与现有的第一阶段和第二阶段SoM预测工具相比,XenoSoM表现出更优越的性能。

引言

研究药物代谢对于开发安全有效的药物至关重要。评估新候选药物的代谢特征对于优化其药代动力学/药效学(PK/PD)性质、识别前体药物或活性代谢物、最小化由于形成反应性或毒性物质而带来的安全风险,以及检测由代谢酶抑制或诱导引起的药物相互作用(这些相互作用可能影响药物的清除率和药理效应)至关重要[1]。
如今,各种先进的体外和体内方法结合强大的分析技术,使得能够以前所未有的细节来表征小分子的代谢过程,尽管这些过程仍然需要大量的时间和资源[2]。同时,随着代谢数据量的不断增加以及建模技术的进步,用于代谢评估的计算机模拟(in silico)工具的发展也得到了加速,这些工具可以作为初步筛选工具,淘汰那些具有不利代谢特征的化合物[3,4]。
计算方法通常通过预测以下三个方面来解决药物代谢问题:i) 某个特定代谢反应的发生[5], [6], [7];ii) 代谢位点(SoM)[8,9];iii) 生成的代谢物[10,11]。在这个背景下,计算机模拟预测SoM尤为重要,因为它可以识别出在代谢上不稳定的原子,使药物化学家能够适时修改分子的部分结构,从而优化其稳定性和安全性[12]。在这方面,已经发布了多种SoM预测工具。最初,这些工具主要关注由细胞色素P450(CYPs)介导的代谢过程,因为有关这些反应的实验数据量很大,而这些反应负责清除大约90%的FDA批准的药物[12]。例如SMARTCyp可以预测三种CYP异构体(3A4、2C9和2D6)的SoM[13]。其算法结合了从密度泛函理论(DFT)衍生的配体片段活性的估计值(存储在查找表中)以及该片段与目标原子之间的距离(作为可及性的近似值)[14]。随着更多代谢数据的出现,SoM预测工具也得到了扩展,能够预测第二阶段的代谢反应。其中,FAME 3[9]和MetaSpot[15]可以预测许多第一阶段和第二阶段的生物转化反应。这两种工具都基于MetaQSAR数据库[16],这是一个由我们团队开发的、人工精心策划的异生物质代谢数据资源。FAME 3是一个基于循环原子描述符和原子类型指纹的集成分类器,它输出一个原子成为SoM的概率,以及FAME分数,这是一个用于评估模型适用范围的基于原子的距离指标[9]。MetaSpot包含两个随机森林模型,分别基于结构、物理化学和立体电子描述符进行训练。第一个模型将所有非反应性原子视为负例,以筛选出无法进行特定生物转化的原子;而第二个模型仅考虑与SoM类型相同的非反应性原子,以识别真正的反应中心[15]。
近年来,深度学习方法,特别是图神经网络(GNNs),已成为预测分子、药理和ADMET相关性质的强大工具[17], [18], [19], [20], [21]。最近,发布了两种用于SoM预测的GNN,即GNN-SOM[22]和aweSOM[23]。这两种工具都能覆盖第一阶段和第二阶段的反应,其性能可与当前最先进的方法相媲美,展示了GNNs在这项任务中的潜力。然而,正如作者们最近指出的[23],它们受到可用数据量的限制,这阻碍了泛化能力,尤其是在较少见的生物转化过程中。为了解决这一问题,我们提出了一个大规模的计算框架(图1),该框架基于包含超过30,000种化合物的数据集进行SoM预测,这是迄今为止用于SoM建模的最大规模的集合。这种规模使得能够系统地探索深度学习策略,并更好地覆盖常见的和稀有的代谢反应。因此,本研究的主要目标是开发一个基于GNN的大规模SoM预测器,能够覆盖第一阶段和第二阶段的生物转化。在该框架内,我们的次要目标包括评估不同的GNN架构,研究单任务(ST)和多任务(MT)学习范式,从而评估反应特异性优化与共享化学知识之间的权衡,研究模型的可解释性,并将生成的模型与现有的SoM预测工具进行基准测试。所选的模型XenoSoM(ST和MT)在SoM预测方面表现出比FAME3R和GNN-SOM更优越的性能,在内部和外部基准测试中都显示出明显的改进。相比之下,MT方法在内部基准测试中表现最佳,而在外部数据上,主要在第二阶段反应中取得了进展。

部分摘录

代谢位点预测

SoM预测被构建为一个监督式的二元节点分类任务,正如先前在文献中为其他机器学习模型所报道的那样[12], [[24], [25], [26]]。这里的SoM被定义为分子中进行特定代谢反应的化学活性原子。在GNN中,每个分子表示为一个无向图G = (V, E),其中V是节点(原子)的集合,E是边(键)的集合[27]。具体来说,每个节点x ∈ V对应于一个

数据集分析

表1总结了每个代谢反应类别的数据集组成。对于每种生物转化,提供了分子总数、原子数(含氢和不含氢的原子)以及SoM的数量。正如预期的那样,第一阶段的反应(如去烷基化、氧化、水解和还原)最为常见。表1显示,所有数据集都存在严重的偏斜现象,SoM的比例从5.32%(磺化反应)到23.62%(谷胱甘肽结合)不等(仅基于

讨论

本文表明,基于大规模图的学习可以为第一阶段和第二阶段的生物转化提供稳健的SoM预测策略。XenoSoM的一个关键优势在于整合了超过30,000种底物,大大扩展了可用于模型训练的化学多样性和反应覆盖范围,相比于许多先前的方法[15,23,54]。对六种GNN架构(GCN、GIN、GATC等)进行了系统比较

结论

在这项研究中,我们开发并系统评估了一个全面的GNN框架,用于预测第一阶段和第二阶段的生物转化。利用包含超过30,000种带有注释SoM的化合物的庞大数据集,我们解决了计算机模拟代谢建模中的长期存在的问题,即数据稀缺和化学空间覆盖范围有限的问题。
在单任务(ST)和多任务(MT)学习环境下评估了六种基于图的深度学习架构。

CRediT作者贡献声明

Alessio Macorano:撰写——初稿、方法论、研究、形式分析。Serena Vittorio:撰写——初稿、形式分析。Filippo Lunghini:数据管理。Alessandro Pedretti:概念构思。Giulio Vistoli:撰写——审阅与编辑、监督、概念构思。Andrea Rosario Beccari:撰写——审阅与编辑、概念构思。

数据和软件可用性

本研究使用的数据来自公共和专有来源。公共数据来自ChEMBL,而额外的化合物则来自专有数据库(MetaQSAR、GOSTAR和Cortellis Drug Discovery Intelligence),因此不能公开披露。因此,用于模型训练的完整数据集并不完全公开。为了促进透明度和可重复性,本工作中使用的源代码可在以下链接公开获取:https://github.com/AlexMacor/XenoSoM-A-Deep-Learning-Framework-for-Site-of-Metabolism-Prediction-of-Xenobiotics.git

利益冲突声明

作者声明他们没有已知的可能会影响本文所报告工作的竞争性财务利益或个人关系。
Alessio Macorano|Serena Vittorio|Filippo Lunghini|Alessandro Pedretti|Giulio Vistoli|Andrea Rosario Beccari
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号