DiffPPI:用于脑部特异性蛋白质-蛋白质相互作用预测的条件去噪扩散框架

《Journal of Computational Science》:DiffPPI: Conditional Denoising Diffusion Framework for Brain-Specific Protein-Protein Interaction Prediction

【字体: 大 中 小 】 时间:2026年10月04日 来源:Journal of Computational Science 4.0

编辑推荐:

   摘要 –蛋白质-蛋白质相互作用(PPI)构成了细胞组织与信号传导的分子基础,然而由于实验方法的局限性以及依赖于特定情境的变异性,脑特异性相互作用网络仍不完善。现有的计算方法大多将PPI预测建模为确定性的二分类问题,这限制了其对稀疏且依赖情境的生物数据进行不确定性建模的能力。为

摘要 –

蛋白质-蛋白质相互作用(PPI)构成了细胞组织与信号传导的分子基础,然而由于实验方法的局限性以及依赖于特定情境的变异性,脑特异性相互作用网络仍不完善。现有的计算方法大多将PPI预测建模为确定性的二分类问题,这限制了其对稀疏且依赖情境的生物数据进行不确定性建模的能力。为弥补这一空白,我们提出了DiffPPI——一个基于条件扩散的脑特异性PPI预测框架,该框架将基于图的蛋白质嵌入与生成式去噪相结合。在本研究中,一个经过筛选、包含数千种蛋白质及实验支持的相互作用的脑PPI网络被建模为无向图。节点级表示通过预训练的GraphSAGE模型学习,同时捕捉局部拓扑结构和关系上下文。成对特征通过拼接、逐元素交互和绝对差算子进行编码,并用于条件化一个具有200步扩散的去噪扩散模型。所提出的DiffPPI从含噪观测中学习重建干净的相互作用信号,从而实现不确定性感知的预测。该框架使用准确率、F1分数和ROC-AUC与经典机器学习模型和图神经网络基线进行了评估比较。所提出的DiffPPI取得了优越的性能,准确率为0.8397 ± 0.0019,F1分数接近0.8291 ± 0.0031,ROC-AUC约为0.9023 ± 0.0014,超越了所有在相同数据划分上训练的基线模型。此外,使用积分梯度进行的可解释性分析突出了嵌入差值特征的主导贡献。

引言

蛋白质-蛋白质相互作用(PPI)构成了控制整体细胞组织及其相关调节功能的基本分子机制。大多数生物学过程,包括信号转导、代谢调控、免疫应答和转录调控,都是通过蛋白质之间此类协调的相互作用来介导的[1]。总体而言,这些相互作用形成了蛋白质相互作用网络,也称为相互作用组。PPI网络的结构动力学为了解细胞在正常及病理条件下的行为提供了关键洞察。在人类大脑中,由于功能复杂性和细胞异质性,PPI起着至关重要的作用。然而,尽管经过数十年的实验努力,脑特异性PPI仍然是碎片化的,且偏向于仅针对某些特定蛋白质。虽然,诸如纯化质谱和邻近标记等多种实验技术已存在并已知显著推进了相互作用组图谱的绘制;然而这些技术往往成本高、劳动密集,且容易受到噪声的影响。
为解决这些局限性,人工智能(AI)和机器学习方法日益被采用用于计算PPI预测[2]、[3]。现有方法包括基于图的表示学习、图神经网络(GNNs)和网络扩散方法[4]。基于图的嵌入技术如node2vec和GNNs通过利用生物网络中的拓扑和关系信息来学习蛋白质的低维表示。这些学习到的表示在多种生物预测任务中展现了有效性,包括蛋白质功能注释和相互作用预测。类似地,图扩散方法通过网络连接传播信息,以识别功能相关的蛋白质并优先确定具有生物学意义的相互作用[5]。
最近,生成式扩散模型被提出作为有效的概率学习方法,通过迭代地添加噪声和去噪过程来捕捉复杂的数据分布。与传统判别模型不同,判别模型基于正或负相互作用的直接标签对蛋白质之间的相互作用进行分类,扩散模型则捕捉相互作用的分布并从含噪表示中生成信号。这一特性在生物数据集中非常有用,因为实验中观察到的相互作用往往是稀疏的、不完整的且存在不确定性的。通过渐进式去噪学习到的稳健表示,扩散模型可以更好地泛化并提供不确定性预测。
受这些优势启发,我们提出了一个用于脑特异性PPI预测的条件扩散模型,该模型结合了基于图的蛋白质嵌入和生成式去噪任务。与传统基于图的模型所使用的确定性方法不同,基于扩散的模型通过迭代的前向扩散和反向去噪过程学习蛋白质对表示上的概率分布。扩散过程不是向数据中注入噪声,而是渐进地破坏训练样本并学习恢复相互作用表示,使其能够在含噪扰动中识别生物相互作用模式。
该框架将相互作用预测建模为一个条件随机过程,其中相互作用的可能性基于网络拓扑和脑特异性分子上下文进行估计。通过将图表示学习与基于扩散的生成建模相结合,所提出的方法在保持对噪声或不完整相互作用数据鲁棒性的同时捕捉预测不确定性。所得到的框架提供了一种计算策略,用于识别潜在的脑特异性蛋白质相互作用并支持神经系统疾病和大脑相关分子机制的研究。

章节摘要

相关工作

由于网络表示学习和AI学习技术的近期发展,PPI预测模型已变得非常先进。传统上,预测脑PPI的计算方法主要依赖于蛋白质序列同源性、结构域共现以及其他某些物理特性。虽然这些方法被广泛使用,但它们在任何特定的实验室数据集上都没有有效工作。此外,它们无法捕捉

方法论

所提出的DiffPPI是一个基于扩散的框架,用于预测人类大脑中的蛋白质-蛋白质相互作用。该方法将脑特异性PPI网络建模为无向图,并将基于图的蛋白质嵌入与条件去噪扩散模型相结合。首先,构建并预处理一个经过筛选的脑PPI网络,并使用GraphSAGE获得节点级表示。然后生成并编码标记的蛋白质对为成对特征向量。这些

结果

本节对基于脑特异性蛋白质-蛋白质相互作用网络的所提出DiffPPI框架进行了全面评估。结果包括枢纽蛋白质的拓扑分析、与已建立基线的比较预测性能、评估关键模型组件的消融研究以及解释模型决策的可解释性分析。总之,这些发现展示了所提出方法的有效性、鲁棒性和生物学相关性。

讨论

所提出的DiffPPI框架将蛋白质-蛋白质相互作用预测视为一个基于条件扩散的去噪任务,与现有的基于判别的方法相比具有各种优势。对脑PPI网络的拓扑分析识别出了少数高度连接的枢纽蛋白质的存在,这是生物系统中无标度网络结构的典型特征。枢纽蛋白质可以执行重要的任务,包括信号整合和信息传递

结论

所提出的DiffPPI方法引入了一种条件去噪扩散框架,用于从图结构的生物数据中预测脑特异性蛋白质-蛋白质相互作用。该方法将相互作用推断建模为一个随机生成过程,在利用基于图的嵌入网络拓扑的同时,实现了对不确定性的显式处理。实验评估在一个包含数千种蛋白质及

CRediT作者贡献声明

Bhawna Saxena:写作 – 审阅与编辑,写作 – 初稿撰写,可视化,调查研究,形式化分析,数据整理。Pratibha Joshi:写作 – 审阅与编辑,写作 – 初稿撰写,可视化,验证,资源提供,方法论,调查研究,形式化分析,概念化。Adwitiya Sinha:写作 – 审阅与编辑,写作 – 初稿撰写,可视化,验证,指导监督,方法论,调查研究,形式化分析,概念化。

利益冲突声明

作者声明不存在已知可能影响本文所报告工作的竞争性经济利益或个人关系。
Pratibha Joshi|Bhawna Saxena|Adwitiya Sinha

订阅生物通快讯

订阅快讯:

最新文章

限时促销

会展信息

关注订阅号/掌握最新资讯

今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

版权所有 生物通

Copyright© eBiotrade.com, All Rights Reserved

联系信箱:

粤ICP备09063491号