
-
生物通官微
陪你抓住生命科技
跳动的脉搏
用于提升分子科学领域深度学习模型准确性的合成数据:蛋白质-配体结合亲和力预测的案例研究
《Journal of Cheminformatics》:Synthetic data for more accurate deep learning models in molecular science: a test case of protein-ligand binding affinity prediction
【字体: 大 中 小 】 时间:2026年08月14日 来源:Journal of Cheminformatics 7.9
编辑推荐:
摘要深度学习模型对数据需求量大,而在数据稀缺的情况下,合成(人工)数据显得极为重要。尽管这一方法已在某些技术领域得到应用,但在化学领域的机器学习应用中,除了部分预训练任务外,采用这种方式还是新的尝试。在药物发现中,预测蛋白质与配体之间的结合能至关重要。许多基于机器学习的研究试图利
深度学习模型对数据需求量大,而在数据稀缺的情况下,合成(人工)数据显得极为重要。尽管这一方法已在某些技术领域得到应用,但在化学领域的机器学习应用中,除了部分预训练任务外,采用这种方式还是新的尝试。在药物发现中,预测蛋白质与配体之间的结合能至关重要。许多基于机器学习的研究试图利用现有的实验数据来预测蛋白质-配体结合亲和力。然而,这些模型存在固有偏差。近期有研究提出了PLAS-20k,这是一个通过分子动力学模拟生成的多种蛋白质-配体复合物构象的合成数据集,可作为补充现有实验数据、提升结合亲和力预测的可行方案。在结合亲和力预测任务中,我们使用了深度卷积神经网络Pafnucy,并提出利用PLAS-20k中每个蛋白质-配体复合物的多种结构进行训练。我们还比较了四种不同的统计和基于机器学习的结果聚合方法。这项工作展示了动态数据集在提升结合亲和力预测方面的作用,为未来利用合成数据集以及更复杂的模型和方法预测类似蛋白质性质奠定了基础。我们认为,基于物理原理的合成数据集有望帮助开发出更精确的数据驱动方法。
科学贡献
本研究表明,引入合成分子动力学数据能够提升深度学习模型在预测蛋白质-配体结合亲和力方面的性能,其效果优于仅依赖静态实验结构的方法。通过系统地评估帧选择和预测聚合策略,我们证明了在多种构象快照上训练能够显著提高模型的泛化能力和准确性。我们的研究结果说明,动态合成数据集能够让深度学习模型在保持计算效率的同时,超越MM-PBSA等传统方法。
深度学习模型对数据需求量大,而在数据稀缺的情况下,合成(人工)数据显得极为重要。尽管这一方法已在某些技术领域得到应用,但在化学领域的机器学习应用中,除了部分预训练任务外,采用这种方式还是新的尝试。在药物发现中,预测蛋白质与配体之间的结合能至关重要。许多基于机器学习的研究试图利用现有的实验数据来预测蛋白质-配体结合亲和力。然而,这些模型存在固有偏差。近期有研究提出了PLAS-20k,这是一个通过分子动力学模拟生成的多种蛋白质-配体复合物构象的合成数据集,可作为补充现有实验数据、提升结合亲和力预测的可行方案。在结合亲和力预测任务中,我们使用了深度卷积神经网络Pafnucy,并提出利用PLAS-20k中每个蛋白质-配体复合物的多种结构进行训练。我们还比较了四种不同的统计和基于机器学习的结果聚合方法。这项工作展示了动态数据集在提升结合亲和力预测方面的作用,为未来利用合成数据集以及更复杂的模型和方法预测类似蛋白质性质奠定了基础。我们认为,基于物理原理的合成数据集有望帮助开发出更精确的数据驱动方法。
科学贡献
本研究表明,引入合成分子动力学数据能够提升深度学习模型在预测蛋白质-配体结合亲和力方面的性能,其效果优于仅依赖静态实验结构的方法。通过系统地评估帧选择和预测聚合策略,我们证明了在多种构象快照上训练能够显著提高模型的泛化能力和准确性。我们的研究结果说明,动态合成数据集能够让深度学习模型在保持计算效率的同时,超越MM-PBSA等传统方法。