
-
生物通官微
陪你抓住生命科技
跳动的脉搏
整合多准则决策与机器学习优化分子指纹选择及预测乙酰胆碱酯酶抑制剂的虚拟筛选框架
《Journal of Cheminformatics》:Integrating multi-criteria decision-making and machine learning for fingerprint selection and virtual screening of Acetylcholinesterase inhibitors
【字体: 大 中 小 】 时间:2026年09月25日 来源:Journal of Cheminformatics 7.9
编辑推荐:
摘要乙酰胆碱酯酶(AChE)是神经退行性疾病和毒理学中的关键酶靶点,这推动了开发强大的计算方法来发现抑制剂。在此,我们提出了一种整合框架,将多准则决策(MCDM)与机器学习相结合,以优化分子指纹选择并预测AChE抑制剂。我们从ChEMBL数据库中检索了4,620个化合物,使用
乙酰胆碱酯酶(AChE)是神经退行性疾病和毒理学中的关键酶靶点,这推动了开发强大的计算方法来发现抑制剂。在此,我们提出了一种整合框架,将多准则决策(MCDM)与机器学习相结合,以优化分子指纹选择并预测AChE抑制剂。我们从ChEMBL数据库中检索了4,620个化合物,使用7种分子指纹和10种机器学习算法以及多种性能指标进行训练和评估。Friedman检验和Nemenyi事后分析以及临界差异(CD)图识别了具有统计学意义的显著差异,而MCDM排名始终选择Morgan计数指纹为最优。随机森林、LightGBM和Extra Trees成为表现最佳的模型。使用来自PubChem数据库的690个化合物进行外部验证,证明了随机森林在PR-AUC、ROC-AUC和BEDROC方面的优越性能。使用Platt缩放法进行模型校准显示了改善的一致性和预测可靠性,在鳗鱼数据集上AUC性能提升了10.6%,在人类数据集上提升了7.3%。跨直系同源靶点的额外验证显示ROC-AUC值为0.64–0.90,PR-AUC为0.62–0.88。对从ZINC数据库检索的1,000个ZINC化合物进行虚拟筛选,鉴定出四种候选化合物。所有化合物均满足Lipinski规则且零违规,并表现出混合的预测ADMET特征,具有若干有利性质和潜在风险。AutoDock Vina对接评分范围为?8.6至?10.3 kcal/mol,在使用相同对接方案获得的参考AChE抑制剂评分范围内(?7.9至?9.9 kcal/mol)。该框架展示了一种可靠且可推广的方法,用于优先筛选候选AChE抑制剂以进行进一步的实验研究。
科学贡献
本研究通过引入一种基于统计的多准则框架用于分子指纹选择,推进了基于机器学习的虚拟筛选,该框架综合考虑了早期富集、对类别不平衡敏感的性能以及整体辨别能力,而非依赖单一性能指标。与基于预定义分子表示或孤立模型选择策略的AChE筛选方法不同,该框架将统计模型比较、基于MCDM的指纹选择、概率校准和多源外部验证整合在统一的化合物优先筛选工作流中。这提供了一种可重复的策略,用于选择分子表示和校准预测模型以进行虚拟筛选,可适应具有适当生物活性数据的其他分子靶点。
乙酰胆碱酯酶(AChE)是神经退行性疾病和毒理学中的关键酶靶点,这推动了开发强大的计算方法来发现抑制剂。在此,我们提出了一种整合框架,将多准则决策(MCDM)与机器学习相结合,以优化分子指纹选择并预测AChE抑制剂。我们从ChEMBL数据库中检索了4,620个化合物,使用7种分子指纹和10种机器学习算法以及多种性能指标进行训练和评估。Friedman检验和Nemenyi事后分析以及临界差异(CD)图识别了具有统计学意义的显著差异,而MCDM排名始终选择Morgan计数指纹为最优。随机森林、LightGBM和Extra Trees成为表现最佳的模型。使用来自PubChem数据库的690个化合物进行外部验证,证明了随机森林在PR-AUC、ROC-AUC和BEDROC方面的优越性能。使用Platt缩放法进行模型校准显示了改善的一致性和预测可靠性,在鳗鱼数据集上AUC性能提升了10.6%,在人类数据集上提升了7.3%。跨直系同源靶点的额外验证显示ROC-AUC值为0.64–0.90,PR-AUC为0.62–0.88。对从ZINC数据库检索的1,000个ZINC化合物进行虚拟筛选,鉴定出四种候选化合物。所有化合物均满足Lipinski规则且零违规,并表现出混合的预测ADMET特征,具有若干有利性质和潜在风险。AutoDock Vina对接评分范围为?8.6至?10.3 kcal/mol,在使用相同对接方案获得的参考AChE抑制剂评分范围内(?7.9至?9.9 kcal/mol)。该框架展示了一种可靠且可推广的方法,用于优先筛选候选AChE抑制剂以进行进一步的实验研究。
科学贡献
本研究通过引入一种基于统计的多准则框架用于分子指纹选择,推进了基于机器学习的虚拟筛选,该框架综合考虑了早期富集、对类别不平衡敏感的性能以及整体辨别能力,而非依赖单一性能指标。与基于预定义分子表示或孤立模型选择策略的AChE筛选方法不同,该框架将统计模型比较、基于MCDM的指纹选择、概率校准和多源外部验证整合在统一的化合物优先筛选工作流中。这提供了一种可重复的策略,用于选择分子表示和校准预测模型以进行虚拟筛选,可适应具有适当生物活性数据的其他分子靶点。