基于经验贝叶斯与贝叶斯分层模型的蛋白质组缺失值建模与差异表达分析

《Molecular & Cellular Proteomics》:Empirical-Bayes and Bayesian Hierarchical Modelling for Missingness and Differential Expression in Proteomics

【字体: 大 中 小 】 时间:2026年10月09日 来源:Molecular & Cellular Proteomics 6.3

编辑推荐:

  基于质谱的无标记蛋白质组学数据常常存在缺失值,尤其是在低丰度蛋白质或某一条件下蛋白质完全缺失的情况下。这给可靠地估计倍数变化及进行下游分析带来了挑战。传统的插补方法在不同数据集上的表现往往不一致,并且通常将插补值视为固定值而非不确定值,这可能导致下游分析中变异

基于质谱的无标记蛋白质组学数据常常存在缺失值,尤其是在低丰度蛋白质或某一条件下蛋白质完全缺失的情况下。这给可靠地估计倍数变化及进行下游分析带来了挑战。传统的插补方法在不同数据集上的表现往往不一致,并且通常将插补值视为固定值而非不确定值,这可能导致下游分析中变异性的低估。为解决上述问题,研究人员提出了一种分层模型,该模型同时考虑已观测到的蛋白质强度与缺失数据的模式。缺失值被建模为低于蛋白质特异性检测限的左删失观测值,以反映仪器灵敏度的限制;或被建模为以依赖于潜在强度的概率发生缺失(强度依赖性缺失)。该模型在多个层面捕捉数据结构:强度水平测量、组水平效应(如实验条件)以及蛋白质水平变异。为估计模型参数,研究人员采用经验贝叶斯(EB)框架跨蛋白质推断超参数,并使用马尔可夫链蒙特卡洛(MCMC)方法从后验分布中抽样参数。该分析流程无需插补缺失值,旨在产生更可靠的倍数变化估计与不确定性度量。研究人员将该方法与现有方法进行基准比较,并证明其在差异表达分析中能够提供准确、稳定且稳健的估计结果。

论文解读

一、研究背景与问题

蛋白质组学是对蛋白质组进行大规模研究的学科,涵盖蛋白质表达、结构、功能、相互作用及修饰等方面,在疾病早期诊断、预后监测及药物研发中具有关键作用。基于液相色谱-串联质谱(LC-MS/MS)的蛋白质组学技术能够实现蛋白质的广泛检测与相对定量。然而,无论采用数据依赖性采集(DDA)还是数据非依赖性采集(DIA)策略,离子选择的随机性、仪器噪声以及谱图匹配错误等因素都会导致蛋白质组数据中出现大量缺失值,给下游分析带来显著挑战。
Rubin将缺失数据分为三类:完全随机缺失(MCAR)、随机缺失(MAR)和非随机缺失(MNAR)。在蛋白质组学中,缺失值主要呈现强度依赖性特征,即低强度肽段更可能未被检测到。简单地删除这些缺失值会导致估计偏向上偏移,因为每个缺失观测仍携带其潜在强度的信息。此外,某一条件下完全缺失的独特蛋白质无法进行倍数变化量化,也无法进行常规统计检验,构成额外的分析难题。
传统处理缺失值的常用策略是插补,包括k近邻(kNN)、随机森林(RF)和奇异值分解(SVD)等方法。然而,这些方法往往需要参数调优、计算强度大、依赖对缺失机制的假设,并可能扭曲数据分布。更重要的是,插补值通常被当作已观测值处理,插补步骤引入的不确定性无法传递到下游推断中,导致变异性被低估。因此,开发能够直接建模缺失机制并传播不确定性的方法具有重要的方法论意义。

二、研究内容与主要结论

针对上述问题,研究人员提出了missBayes,一种分层经验贝叶斯模型,在差异表达分析中显式考虑强度依赖性缺失值。对于每个蛋白质,missBayes报告后验中位数倍数变化、95%最高密度区间(HDI),以及上调(pGtROPE)、下调(pLtROPE)和无生物学意义变化(pInROPE)的后验概率。当蛋白质位于实际等价区域(ROPE)之外的后验概率超过用户指定阈值(默认95%)时,该蛋白质被判定为差异表达。ROPE定义了被认为生物学上可忽略的倍数变化范围,例如|log?FC| < 0.2。
研究人员通过多个数据集验证了模型的性能。在受控定量实验(CQE)中,已知混合比例使真实倍数变化明确可知,missBayes能够准确估计倍数变化。在UPS掺入基准数据集中,已知掺入蛋白浓度提供了评估差异表达分析精确率和召回率的强基准。在生物学感染数据集(phagoFACS)中,模型在复杂真实生物学变异条件下仍能保持稳健性。与现有方法相比,missBayes提供了更准确、稳定且稳健的差异表达估计,同时避免了插补带来的不确定性低估问题。

三、关键技术方法

研究人员主要采用了以下几项关键技术方法。其一,构建了蛋白质特异性检测截止值的左删失模型,将缺失值视为低于检测限的删失观测,同时评估了全局逻辑斯蒂缺失模型作为替代方案,并证明两种模型的结果高度一致。其二,采用经验贝叶斯(EB)框架跨蛋白质推断超参数,利用矩估计法按强度分箱估计逆伽马先验分布参数,以捕捉均值-方差趋势。其三,使用马尔可夫链蒙特卡洛(MCMC)方法从后验分布中抽样参数,实现模型参数估计与不确定性量化。其四,采用ROPE决策框架计算后验概率,直接量化蛋白质变化超过预定生物学意义阈值的概率。样本数据来源包括:混合肝脏数据集(PRIDE编号PXD072249)、phagoFACS数据集(PRIDE编号PXD062621)、CQE数据集(PRIDE编号PXD068192)、混合QC数据集(PRIDE编号PXD078753)以及UPS掺入数据集(PRIDE编号PXD009815)。

四、研究结果

数据分布特征。 研究人员分析了四个蛋白质组数据集,包括DDA和DIA数据。缺失值比例分别为21.4%(混合肝脏)、18.2%(phagoFACS)、11.7%(CQE)和1.1%(混合QC)。随着缺失比例降低,观测分布越来越接近正态分布,支持潜在真实分布服从正态模式的假设。缺失值集中于分布低端,证实缺失具有强度依赖性。
缺失模型比较。 研究人员比较了全局逻辑斯蒂缺失模型与蛋白质特异性截止值模型,发现两种模型产生的差异表达估计高度一致,表明下游推断对强度依赖性缺失的不同表示形式具有稳健性。鉴于这种稳健性,研究人员选择蛋白质特异性截止值模型作为默认缺失模型,因其解释直观且计算实现更为简单。
均值-方差趋势。 经验数据显示,组内标准差在较低平均强度时更大且更分散,在较高强度时更为集中。研究人员据此将蛋白质组按组内平均强度分箱,在每个箱内独立估计逆伽马先验参数,使相似平均强度的蛋白质共享相同的方差先验分布,同时保留蛋白质和组特异性方差。

五、讨论与结论

讨论部分指出,蛋白质特异性检测行为在生物学上是合理的,因为可检测性不仅取决于丰度,还取决于蛋白质或肽段特异性属性,如电离效率、色谱行为、碎裂效率及离子干扰等。然而,在典型蛋白质组学实验中,每个蛋白质仅有少量重复测量,可靠估计每个蛋白质的独立平滑缺失曲线较为困难。因此,研究人员采用两种实用缺失模型作为不完全观测检测过程的近似,不假设任一模型完全描述质谱检测过程,而是通过比较验证推断的稳健性。
研究结论表明,missBayes通过显式建模强度依赖性缺失值,避免了插补步骤及其带来的不确定性低估问题。该框架直接量化蛋白质变化超过预定生物学意义阈值的后验概率,为差异表达分析提供了准确、稳定且稳健的估计,在受控实验和生物学数据集上均表现良好。该方法为蛋白质组学差异表达分析提供了一种无需插补的替代方案,能够更可靠地估计倍数变化和不确定性度量,对蛋白质组学下游分析具有重要的方法论价值。

订阅生物通快讯

订阅快讯:

最新文章

限时促销

会展信息

关注订阅号/掌握最新资讯

今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

版权所有 生物通

Copyright© eBiotrade.com, All Rights Reserved

联系信箱:

粤ICP备09063491号