PCIPG:基于概率图模型的蛋白质复合物识别综合框架

《PLOS Computational Biology》:PCIPG: A comprehensive framework for protein complex identification based on a probabilistic graphical model

【字体: 时间:2026年09月04日 来源:PLOS Computational Biology 3.7

编辑推荐:

  蛋白质复合物是执行必需细胞功能的分子机器,但其计算识别仍具挑战性。现有蛋白质复合物识别方法主要依赖蛋白质-蛋白质相互作用(PPI)网络拓扑、功能注释或蛋白质水平的生化证据。尽管这些方法已恢复许多具有生物学意义的组装体,但它们通常对不完整或含噪声的相互作用组较为

  
蛋白质复合物是执行必需细胞功能的分子机器,但其计算识别仍具挑战性。现有蛋白质复合物识别方法主要依赖蛋白质-蛋白质相互作用(PPI)网络拓扑、功能注释或蛋白质水平的生化证据。尽管这些方法已恢复许多具有生物学意义的组装体,但它们通常对不完整或含噪声的相互作用组较为敏感,并且在残基和界面水平上对复合物形成的决定因素提供的机制性见解有限。特别是,基于PPI的常规图表示仅表明蛋白质是否相互关联,但通常忽略蛋白质亚基如何通过空间组织的残基和结构界面进行物理相互作用。这些局限性推动了对连接残基尺度结构线索与相互作用组尺度组织的计算框架的开发。本文提出PCIPG,一种多尺度概率图框架,联合建模残基、蛋白质、相互作用和复合物。PCIPG在链内接触图上编码残基水平物理化学描述符,筛选信息性残基以构建结构感知的蛋白质表示,并在PPI图上传播这些表示以推断蛋白质-复合物归属矩阵。为将复合物归属与稀疏相互作用证据耦合,PCIPG使用零膨胀伯努利-指数似然重建网络,在缺失边和噪声情形下提供 principled 的学习信号。在五个酿酒酵母(*Saccharomyces cerevisiae*)基准数据集上,PCIPG相较于本研究所含代表性基线方法取得了更高的平均F1和准确率,平均提升分别为11.46%和3.64%。在评估的人类相互作用组中,PCIPG在HCT116和HEK293T上取得了所比较方法中最高的F1分数,而在HuRI上的表现低于AdaPPI和ClusterONE。嵌入引导的相互作用补全相对于在相应原始人类PPI网络上的结果提升了PCIPG的性能。除复合物识别外,PCIPG通过恢复已知核心并描绘组装体内部连贯的辅助模块来支持核心-模块挖掘;若干预测与先前报道的功能实体匹配,包括TRAPPII和PCNA装载因子相关复合物。在残基水平上,PCIPG优先排序的残基与实验定义的蛋白质结合界面在所评估结构中的重叠增加。在计算性CFTR案例研究中,该模型产生了状态依赖的相互作用预测,与实验剖析的野生型和F508相互作用网络部分重叠。综上,PCIPG连接了残基尺度结构线索与相互作用组尺度组织,实现了可解释且可扩展的蛋白质复合物识别。代码和数据可在https://github.com/hyx-1/PCIPG获取。
蛋白质复合物是细胞调控的核心,作为协调的分子机器维持生理稳态。尽管实验和计算方法取得了快速进展,但一个基本问题仍然存在:哪些蛋白质本质上倾向于组装成复合物,尤其是在现代测序和蛋白质组学技术产生的大规模蛋白质组图谱中。这一问题通常被称为蛋白质复合物识别,旨在从蛋白质库中确定共同发挥作用并组装成结构协同的大分子复合物的亚基集合。现有策略仍高度依赖专门的实验测定,包括亲和纯化、共分级和冷冻电镜。同时,大多数计算方法将蛋白质复合物识别视为蛋白质-蛋白质相互作用(PPI)网络中的模块发现,通常辅以基因本体论(GO)注释和多组学证据。通过强调共享的细胞定位和功能相似性,这些方法可以在蛋白质水平恢复具有生物学意义的复合物。然而,现有计算方法仍面临若干主要限制。首先,拓扑驱动方法高度依赖输入PPI网络的完整性和可靠性。但实验衍生的相互作用组常含有假阴性和假阳性相互作用,仅从网络连通性推断的复合物边界可能因缺失或噪声边而失真。其次,整合GO注释、共表达谱或其他组学衍生特征的方法通常在蛋白质水平运作。尽管这些数据源改善了功能连贯性,但它们不能直接解释驱动物理组装的分子决定因素。第三,常规PPI图表示将每个蛋白质抽象为节点、每次相互作用抽象为边,从而丢弃了残基水平物理化学性质、链内结构组织和界面相关信息。因此,这些方法可以识别相关蛋白质组,但通常对特定亚基如何相互作用以及为何特定组装在结构上合理提供的见解有限。然而,注意力正日益转向更精细的分辨率:定位亚基内机制性控制复合物形成的残基和界面。目前的复合物识别框架大多缺乏在残基尺度运作所需的粒度。一个理想的蛋白质复合物识别框架应满足三个要求:纳入残基水平结构和物理化学信息以捕获蛋白质关联的局部分子基础;在PPI网络上传播此类信息以考虑细胞相互作用背景;显式建模缺失或不确定的相互作用,而非假设观察到的相互作用组是完整的。满足这些要求对于大规模相互作用组尤为重要,因为在这些数据中结构信息日益可用,但相互作用证据仍然稀疏、含噪声且偏向于研究充分的蛋白质。基于这一空白,研究人员引入了一种残基信息表示学习视角,连接从氨基酸和蛋白质单体到蛋白质复合物和相互作用网络的多个生物学尺度。在此视角下,残基水平的物理化学和结构属性被整合到每个蛋白质的学习蛋白质表示中。这种残基信息蛋白质嵌入提供了局部结构组织、残基物理化学背景和潜在界面相关属性的紧凑表示。在复合物形成过程中,这些学习到的表示在PPI网络上进一步传播和整合,使PCIPG能够捕获与蛋白质复合物组装相关的高阶组织模式。基于这一概念框架,研究人员开发了PCIPG(概率图复合物识别),一种将残基水平决定因素与相互作用组尺度组织连接起来的概率图模型。在PCIPG中,研究人员区分了概念性概率图模型与实际训练实现。在生物学建模层面,蛋白质-复合物归属被视为可观测的生物学变量,因为蛋白质复合物原则上可以通过结构和生化测定来表征。相比之下,完整的底层相互作用网络被建模为潜在且不完整的变量,因为可用的PPI图谱代表了对真实相互作用组的含噪声且部分的观测。在训练期间,可用PPI网络被用作观测证据,既作为消息传递拓扑又作为重建目标。PCIPG随后从残基水平结构特征和可用PPI证据推断蛋白质-复合物归属矩阵,并通过零膨胀伯努利-指数重建似然将该矩阵耦合回相互作用网络。通过使用图神经网络学习这些变量之间的依赖关系,PCIPG旨在捕获从残基属性及其空间排布到蛋白质水平组装和网络水平连通性的级联过程。这一统一框架为蛋白质复合物识别提供了机制上有依据的途径。

与先前方法不同,PCIPG被设计为端到端的蛋白质复合物识别框架,在统一模型内整合残基水平结构编码、PPI水平图传播和概率网络重建。残基水平组件用于构建结构感知和残基信息的蛋白质表示,通过将复合物水平预测与残基水平结构信息联系起来,提高预测复合物的可解释性。PPI水平图模块在相互作用网络上传播这些表示,以捕获复合物相关的组织模式。概率图公式进一步通过网络重建将推断的蛋白质-复合物归属矩阵与观测到的相互作用证据耦合。因此,PCIPG的新颖性不在于孤立地使用任何单一组件,而在于将这些组件组合在统一概率框架中,以实现准确且可解释的蛋白质复合物识别。在五个酵母和三个人类基准数据集上,PCIPG相对于本研究所含代表性基线表现出总体较强的蛋白质复合物识别性能,尽管性能差异的大小和方向在不同数据集和指标间有所变化。PCIPG在大多数酵母基准比较中取得了较好结果,并在所评估方法中获得HCT116和HEK293T上的最高F1分数。但在HuRI上,其F1分数低于AdaPPI和ClusterONE。这些结果表明,PCIPG在异构相互作用网络中具有广泛竞争力,而非在每种评估设置下均表现统一优越。通过基因本体论(GO)富集进行的功能验证表明,预测的复合物具有生物学连贯性,并在相关过程中显著富集。在核心-模块挖掘中,PCIPG可靠地重现了已知核心组件,并进一步优先排序了用于后续研究的有前景的、先前未注释的候选对象。与先前报道一致,PCIPG恢复的与TRAPPII和PCNA装载因子相关的复合物参与必需细胞功能。PCIPG还受益于多尺度设计,使识别出的关键残基直接为分子相互作用提供信息。由核心位点识别模块优先排序的高分残基在所评估结构中与已知蛋白质结合界面的对应性增加,表明学习到的残基分数包含界面相关信息。在CFTR案例研究中,使用野生型和F508结构输入生成的预测显示出不同的相互作用模式,并与相应的实验剖析网络部分一致。这些计算观测说明了PCIPG在生成残基和网络水平假设方面的潜在应用。总体而言,这些结果确立了PCIPG作为有效且可解释的蛋白质复合物识别框架的地位。

在基准测试方面,为评估PCIPG的有效性,研究人员将其与15种代表性蛋白质复合物检测方法进行了基准比较。为确保公平且可解释的比较,研究人员从不同方法学家族中选择了基线方法,大致分为五类:基于经典拓扑的聚类方法(如MCODE和MCL);基于密度、种子或扩展的方法(如ClusterONE、CMC、PC2P和COACH);基于表示学习或矩阵分解的方法(如TADW-SC和GANE);基于图神经网络或图自编码器的方法(如DPCMNE、R-GMM-VGAE、Protein-AGC和HGC);以及近期深度学习或PPI增强方法(如PCGAN、AdaPPI和splp)。评估协议包括预测与参考复合物之间的基于归一化关联的匹配以及精确率、召回率、F1分数、PPV、敏感性和准确率的定义。在五个酿酒酵母基准数据集上,PCIPG在大多数评估基准上取得比所比较基线更高的F1分数、准确率、召回率和精确率。例如,在Collins和Krogan-core数据集上,PCIPG的F1分数分别为0.8330和0.8182,高于本比较中所含竞争方法。在更具挑战性的DIP和BioGRID网络上,PCIPG的F1分数分别为0.6932和0.6879。由于BioGRID被用作唯一的开发数据集进行性能信息的架构和残基特征选择,其报告结果应解释为开发数据集性能,而非完全独立的预留估计。在BioGRID上确定模型配置后,相同的架构、残基表示、训练设置和复合物生成程序被固定并应用于Collins、DIP、Krogan-core和Krogan14k,不再针对其参考复合物进行调整。在人类数据集上,PCIPG在HCT116和HEK293T上取得所比较方法中的最高F1分数,分别为0.6464和0.5637;在HuRI上取得0.4332的F1分数,低于AdaPPI(0.4709)和ClusterONE(0.4581),但高于其余方法。为评估预测复合物的功能可靠性,研究人员对精选复合物、PCIPG预测复合物和随机采样蛋白质集进行了GO语义相似性分析。随机复合物数据集的生成遵循已发表协议,从PPI网络中随机采样节点形成合成复合物,同时约束其大小分布遵循精选金标准复合物中观察到的幂律模式,随机复合物数量固定为金标准的五倍。结果表明,预测复合物在生物过程(BP)、细胞组分(CC)和分子功能(MF)方面均表现出显著高于大小匹配和大小-度匹配随机蛋白质集的GO语义相似性。

在消融研究方面,为系统量化各组件贡献,研究人员在酵母和人类数据集上进行了广泛消融实验,针对蛋白质表示模块、蛋白质相互作用模块、残基特征提取模块和网络增强学习模块。在蛋白质表示模块消融中,将GraphSAGE替换为GCN、GraphConv、ChebNet或LSTM后显示,基于图的编码器一致优于非图基线(LSTM),强调了用图神经网络显式编码结构拓扑的重要性,其中GraphSAGE取得最佳精确率和召回率。在相互作用模块消融中,将GAT替换为GATv2、GIN或GINE后表明,GAT在召回率和准确率之间提供了最有利的权衡。移除两个主要模块的变体(仅SAGE和仅GAT)均表现出F1分数和准确率的显著下降,表明精确描绘复合物边界需要将残基信息结构表示与相互作用组背景相结合。残基特征组消融分析显示,移除第二组(电子性质描述符)时获得最高识别准确率,这反映了电子性质描述符与氢键相关描述符之间的冗余性,因此最终模型排除了前者而保留其余六类。在残基表示策略比较中,虽然预训练嵌入取得了相当或略高的预测性能,但手工设计特征大幅减少了运行时间、内存占用和特征维度,在效率、可解释性和准确性之间提供了有利平衡。在人类PPI基准上,PCIPG的表现弱于在酿酒酵母上的表现,这与当前可用人类相互作用网络更大的稀疏性和不完整性一致。为部分缓解缺失边的影响,研究人员使用图注意力网络(GAT)学习的蛋白质嵌入进行网络补全,在嵌入空间中具有高余弦相似性的蛋白质对之间添加推定相互作用。为检验网络增强的性能增益是否来自PCIPG特定的嵌入引导而非通用图致密化,研究人员比较了四种网络设置:无增强、随机边添加、基于链路预测的添加和PCIPG引导增强。结果表明,PCIPG引导增强在所有三个人类PPI数据集上取得最佳性能,且GO功能评估进一步表明网络补全后预测的复合物显示更高的功能连贯性,表明中度嵌入引导补全为部分抵消人类PPI网络的不完整性提供了一种实用途径。

在模块和核心组件挖掘方面,研究人员采用Gavin等人提出的核心-模块-附件模型作为金标准,将其491个参考组装映射到BioGRID相互作用集上。将GAT衍生的蛋白质-复合物归属矩阵P作为样本-特征表示,应用层次聚类识别连贯模块。PCIPG预测了306个模块,其中187个与实验定义模块显示出强重叠;在122个金标准模块中,99个被成功恢复。为识别核心组件,PCIPG首先对异构体样组装进行聚类,然后应用基于频率的双样本Welch t检验检测每个聚类内的稳定亚基。在五个最显著命中(RNA15、CFT1、YSH1、YTH1和FIP1)中,四个(CFT1、YSH1、YTH1和FIP1)是聚腺苷酸化因子I的既定核心亚基。在另一个预测集(PRE2、PRE6、PRE8、PRE3和RPN5)中,四个蛋白质(PRE2、PRE6、PRE8和PRE3)是20S蛋白酶体核心颗粒的组分。对于线粒体核糖体小亚基,PCIPG在22个预测候选物中恢复了23个参考核心蛋白质中的15个;值得注意的是,一个预测蛋白质MRPS35——目前未被分类为核心亚基——与大多数已建立核心蛋白质显示出密集且功能连贯的相互作用,被提名为有前景的候选核心组分。

在生物学意义验证方面,研究人员检查了PCIPG恢复的复合物是否对应于参与必需生物学过程的功能特异性组装。在TRAPP复合物案例中,PCIPG识别出一个九亚基复合物,包含Bet3、Bet5、Trs20、Trs23、Trs31、Trs33、Trs120、Trs130和Trs65,恢复了全部六个TRAPP核心组件,并识别了四个TRAPPII特异性亚基中的三个(75%恢复率),其中包含功能重要性高的Trs120。在PCNA装载因子案例中,PCIPG识别的Ctf18-RFC复合物中,Ctf18亚基替换RFC复合物的Rfc1,形成由Ctf18-Rfc2-5组成的主ATP酶模块,Ctf18亚基C端尾部与Dcc1和Ctf8形成独立模块,这与近期结构和生化证据确认的Ctf18-RFC特异性将PCNA装载到前导链上的功能一致。研究人员进一步利用AlphaFold3建模预测的TRAPPII样复合物和Ctf-Rfc复合物结构,两者分别获得0.99和1.03的高IPTM+PTM置信度分数,支持这些预测复合物的结构合理性。

在残基水平分析方面,研究人员使用五个实验解析的复合物评估了PCIPG预测界面残基的能力,以交叉链Cα原子欧氏距离小于8?定义残基接触,以精确率量化预测性能。对于二元蛋白质-蛋白质相互作用,结合位点通过对SAGE池化选择的残基候选物应用Steiner森林图优化推断。与DeepPPISP、PGT和HN-PPISP三种已建立方法相比,PCIPG在75%的测试靶标上取得最高精确率。对于多蛋白质组装,5L52上PCIPG对YGL011C、YML092C、YGR135W和YMR314W实现了超过50%的精确率。进化保守性分析使用Collins数据集计算了残基水平保守性分数,排除残基保守性近均匀的蛋白质后,关键残基一致显示比非关键残基更高的保守性;全局水平上单侧双样本t检验确认关键残基的保守性分数显著升高,单蛋白质水平上43个蛋白质显示显著差异,关键与非关键位点的每蛋白质平均保守性分数之间显示强相关性(r=0.86),表明高分数残基捕获了进化受限位置。

在CFTR突变分析方面,研究人员使用实验剖析的F508 CFTR突变体和野生型(WT)CFTR的PPI网络数据集评估PCIPG建模单蛋白质突变重塑相互作用网络的能力。突变体和WT网络分别包含951和759个相互作用,其中511条边共享。使用WT CFTR结构结合511条突变稳定相互作用,PCIPG推断出149条不在共享集中但存在于实验确定的WT网络中的额外相互作用;使用突变体CFTR结构推断出309条额外相互作用。推断的WT和突变体相互作用集不同,总体Jaccard差异为0.112,表明PCIPG在提供不同CFTR结构状态时能产生可区分的相互作用预测。

在零膨胀伯努利-指数建模评估方面,研究人员将该模型拟合到HCT116和HEK293T两个具有定量边强度的人类相互作用数据集,变换后的指数分量与非零相互作用强度分布紧密匹配,伯努利分量自然捕获了过量零值。消融分析显示,完整伯努利-指数公式优于仅伯努利变体和余弦相似性重建基线,表明同时建模相互作用发生和非零相互作用强度为蛋白质复合物识别提供了更具信息量的重建目标。

在鲁棒性评估方面,研究人员考察了PCIPG对结构和网络扰动的稳健性。将五个酿酒酵母数据集中的所有蛋白质的天然结构替换为AlphaFold预测模型后,PCIPG性能仅发生微小变化,表明其对结构输入的来源和不确定性基本不敏感。在PPI网络扰动实验中,随机移除5%、10%或20%的真实相互作用边,或独立添加5%、10%或20%的假阳性边后,PCIPG在5-20%随机边删除或添加下保持韧性,大多数设置中相对未扰动网络的性能变化温和。与四种最先进方法比较显示,ClusterONE和PCGAN对网络扰动特别敏感,而PC2P受益于非参数设计,AdaPPI和PCIPG通过纳入辅助信号减少对任何单一网络拓扑的依赖。PCIPG的鲁棒性可能源于其多水平表示和约束的互补性:残基物理化学和结构几何为合理复合物边界提供了信息丰富的先验,帮助缓解拓扑噪声引入的局部连通性偏差。

在技术方法方面,PCIPG采用以下关键计算策略。首先,蛋白质被表示为图,节点对应氨基酸残基,基于8?阈值定义残基间接触矩阵。使用GraphSAGE算法在残基接触图上传播特征,并引入线性变换和归一化增强表示能力。为捕获残基水平变异(如突变)对蛋白质结构的动态影响,引入基于GraphSAGE构建的自注意力图池化模块(SAGPooling),通过top-K采样策略识别最具信息量的氨基酸节点,残基水平编码器包含三个SAGPooling层,每层保留50%的残基节点,最后通过全局均值池化获得紧凑的蛋白质水平表示。在PPI水平,构建无向图,使用图注意力网络(GAT)计算注意力系数并在PPI边上传播信息,采用多头注意力机制增强鲁棒性和泛化能力。在网络增强学习中,基于GAT嵌入空间中蛋白质对的余弦相似性矩阵确定相似性阈值,仅在无观测边的蛋白质对中添加候选边,然后使用增强网络重新训练模型。在训练策略上,采用混合精度策略,将激活、梯度和中间变量存储在FP16中,同时保持FP32主权重副本用于稳定更新,并通过损失缩放解决FP16训练的动态范围限制。模型使用零膨胀伯努利-指数分布作为重建目标:伯努利分量建模相互作用是否发生,变换的指数分布建模相互作用存在时的强度,通过最大化对数似然从蛋白质-复合物归属矩阵恢复相互作用矩阵。

在样本队列和数据集来源方面,研究评估了八个PPI网络基准,包括五个广泛使用的酿酒酵母网络(BioGRID、Collins、DIP、Krogan-core和Krogan14k)和三个近期发表的人类网络(HCT116、HEK293T和HuRI)。酿酒酵母参考复合物通过整合多个公共资源中包含至少3个亚基的精选模块构建,包括MIPS、CYC2008、Aloy、SGD和TAP06。人类数据集使用CORUM作为金标准参考集。结构数据从RCSB蛋白质数据银行(PDB)和AlphaFold蛋白质结构数据库获取。CFTR数据集来自已发表研究,实验剖析了F508 CFTR突变体和野生型CFTR的PPI网络。

研究结论部分指出,研究人员开发了PCIPG,在统一概率框架内整合结构和生化信息与网络背景进行蛋白质复合物识别。通过显式连接残基水平表示与蛋白质嵌入和复合物归属,并通过零膨胀伯努利-指数模型重建相互作用强度,PCIPG提供了一种将复合物共归属与PPI网络耦合的原则性方式。方法上,PCIPG利用链内接触图消息传递和池化突出相互作用相关残基,而PPI网络上的图注意力整合了全局相互作用背景并产生用于蛋白质复合物识别的概率蛋白质-复合物归属矩阵。实验表明,PCIPG在广泛使用的酿酒酵母基准上表现出强劲性能,其可解释性得到高分残基在结合界面富集以及推断的相互作用景观响应CFTR突变等扰动的案例证据支持。在人类相互作用组中——不完整性更为严重——基于余弦相似性的嵌入驱动边补全增加了网络连通性并一致改善了复合物识别结果。功能评估进一步表明,边补全后预测的复合物表现出更高的GO语义连贯性。总体而言,PCIPG通过连接残基尺度信号和相互作用组尺度结构推进了蛋白质复合物识别,同时为在不完整相互作用数据下优先排序界面残基和细化预测提供了可解释的途径。

研究人员指出,PCIPG的讨论涉及多个方面。零膨胀伯努利-指数建模有效捕获了蛋白质相互作用强度分布,拟合分析表明伯努利分量自然解释了PPI矩阵中的过量零条目,而变换的指数分量捕获了非零相互作用强度的右偏分布;消融比较显示完整伯努利-指数公式优于仅伯努利变体和余弦相似性重建基线。PCIPG在网络和结构扰动下维持稳健的复合物识别,对AlphaFold预测结构的替换基本不敏感,对5-20%随机边删除或添加保持韧性;与四种最先进方法的比较显示PCIPG在精确率和召回率之间取得了最佳平衡。PCIPG的局限性包括:性能依赖输入PPI网络和蛋白质结构信息的质量与覆盖度;嵌入引导的边补全可能引入假阳性边;生物学分析支持预测合理性但不能替代独立实验验证;多模块设计引入额外超参数和计算成本。未来工作将聚焦于更严格的归纳评估设置、实验验证的基准、更可扩展的图学习策略以及先进蛋白质语言模型或结构预测置信度测量的整合。
相关新闻
生物通微信公众号
微信
新浪微博

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号