《Frontiers in Microbiology》:Omics data in relative values are almost subcompositionally coherent
编辑推荐:
摘要引言:组学数据是组合数据,通常通过总加和归一化(TSS)后以相对丰度表示。组合数据的一个重要统计问题是缺乏子成分一致性,即当移除或添加特征后重新归一化时,相对丰度会发生变化。虽然这一问题在小规模组合中已有充分记录,但在通常包含数百或数千个特征、子成分普遍存
摘要引言:组学数据是组合数据,通常通过总加和归一化(TSS)后以相对丰度表示。组合数据的一个重要统计问题是缺乏子成分一致性,即当移除或添加特征后重新归一化时,相对丰度会发生变化。虽然这一问题在小规模组合中已有充分记录,但在通常包含数百或数千个特征、子成分普遍存在的大型组学数据集中尚未被研究。例如,在使用不同参考数据集、不同测序深度或从数据库中过滤低丰度特征时,子成分就会出现。在这种情况下,高丰度特征优先被保留,而原始或完整组合与子成分之间的变异主要由低丰度特征驱动。该问题的标准解决方案是使用对数比变换,但这会导致解释复杂化,并需要处理零值,而零值在组学数据中频繁出现,其插补会引入虚假变异。方法:研究人员在五个代表性组学数据集中评估了子成分一致性:粪便16S宏基因组、瘤胃宏基因组(分类和功能水平)、肝脏转录组和血浆代谢组,同时考虑了无监督和监督学习场景。研究人员在丰度加权子成分方案下生成了100个包含原特征三分之一的随机子成分,并将其统计输出与完整组合进行比较。结果与讨论:原始组学数据表现出近乎完美的一致性:相对丰度、成对相关性和样本距离均显示出极高的(缩放)一致性(≥0.98–0.99)。常用监督模型(线性回归、PLS、随机森林和具有高斯核的线性混合模型)的输出也具有高度子成分一致性。研究人员得出结论:在考虑加权子成分方案时,以相对丰度表示的大型组学数据集几乎具有子成分一致性,从而挑战了在组学领域中使用相对数据而非对数比变换的批评之一。
**论文解读:相对值下组学数据子成分一致性的实证评估**
**研究背景、问题与意义**
组学数据(如微生物组学、宏基因组学、转录组学及半定量代谢组学)本质上是组合数据,其特征(如测序读段数、峰强度等)受限于实验流程中的多个步骤(如DNA提取、PCR扩增、文库制备及测序容量),导致绝对尺度丢失,仅保留相对信息。常用总加和归一化(TSS)将特征表达为相对丰度,但这一处理面临一个关键统计问题——子成分不一致性:当特征子集被移除或添加并重新归一化(即子成分)后,特征相对值会改变,从而影响统计结论。尽管该问题在小规模组合数据中已有经典例证(如Aitchison,1986),但在高维组学数据中尚未被系统研究。子成分在组学研究中普遍存在,例如:不同测序深度检测到不同稀有特征、使用不同参考数据库重新处理序列、或过滤低丰度/低流行度特征后重新归一化。在这些场景中,高丰度特征优先保留,而子成分与完整组合间的变异主要由低丰度特征驱动。传统解决方案是对数比变换(如加性对数比ALR、中心化对数比CLR),但该变换在组学应用中面临挑战:高维数据产生海量成对比值难以解释;零值(组学数据中常占80-90%)无法处理,插补引入虚假变异。因此,评估大型组学数据集在相对值下是否实际具有子成分一致性,对于指导正常化方法选择至关重要。
**研究内容与结论**
研究人员系统评估了五个代表性组学数据集在TSS归一化后相对值的子成分一致性:粪便16S宏基因组(199只兔子,19,205个ASV)、瘤胃宏基因组(359头牛,分类水平1,178个属、功能水平6,750个基因)、肝脏转录组(48只兔子,25,502个转录本)和血浆代谢组(48只兔子,997个代谢物)。通过丰度加权随机抽样生成100个子成分(每个包含原特征的三分之一),模拟最常见场景(高丰度特征优先保留),并在无监督和学习监督任务中比较统计输出。结果表明:所有数据集的相对丰度、成对相关性、样本距离均表现出极高缩放一致性(≥0.98-0.99);监督模型(线性回归、PLS、随机森林、高斯核线性混合模型)的系数、重要性、预测性能(RMSE)与完整组合几乎一致。结论:在丰度加权子成分方案下,大型组学数据集的相对值几乎具有子成分一致性,挑战了必须使用对数比变换的论点。该研究发表于《Frontiers in Microbiology》。
**关键技术方法**
研究人员使用了五个公开组学数据集:粪便16S宏基因组(199只兔子,来源Biada等,2025)、瘤胃宏基因组(359头牛,来自英国SRUC,详见Rooke等,2014/ Roehe等,2016/ Duthie等,2017)、肝脏转录组和血浆代谢组(48只兔子,来源Valdés-Hernández等,2025/ Zubiri-Gaitán等,2023)。主要方法包括:丰度加权随机抽样生成100个子成分(每个含原特征1/3);无监督方面计算特征一致性、Procrustes相关、成对距离/协方差/相关的缩放一致性;监督方面使用线性回归、PLS、随机森林、高斯核线性混合模型,比较差异丰度检验(Wilcoxon秩和检验、t检验)与预测任务的系数、VIP值、重要性排名及RMSE。所有分析通过R语言实现,函数unsuper_subco()和super_subco()公开于GitHub。
**研究结果**
**3.1 特征一致性**:特征一致性分析显示,所有数据集的缩放一致性中位数接近0.999。ASV、微生物属和代谢物数据因高丰度特征主导,严格一致性中位数达0.995-0.999;微生物基因和转录本因丰度分布更均匀,少数特征一致性较低,但缩放一致性仍≥0.958。子成分大小从10%增至90%时,平均缩放一致性始终>0.99。
**3.2 无监督学习中的一致性**:Procrustes相关均>0.995,表明特征整体几何结构高度一致。成对特征间的Pearson相关一致性中位数>0.989,距离和协方差的缩放一致性分别>0.998和>0.987。与自举样本相比,子成分引起的相关变异更小,且符号翻转比例极低(<4%)。样本间欧氏距离缩放一致性>0.998,Shannon和Simpson指数缩放一致性为1。
**3.3 监督学习中的一致性**:差异丰度分析中,全组合检测到的显著特征在子成分中几乎一致,不一致时p值接近阈值0.05。效应量估计值均落在全组合95%置信区间内。预测任务中,线性回归、PLS、随机森林和高斯核线性混合模型的结果均显示:标准化回归系数、VIP值、重要性排名、训练集和测试集RMSE在子成分与全组合间高度一致。例如,线性回归系数在子成分间变化极小(如Negativicoccus属系数从0.0499变化至0.0498-0.0499),而不同数据划分引起的变异更大。随机森林的特征重要性排名在子成分间比不同数据划分更稳定。高斯核线性混合模型中,估计的组学值与全组合的Pearson相关达0.997-0.999,RMSE范围几乎相同。
**讨论与结论**
讨论部分强调:TSS归一化后的组学相对值在丰度加权子成分方案下,子成分不一致性被极大削弱,实际表现出近一致行为。但需注意,该结论基于丰度加权抽样,模拟了最常见场景(高丰度核心特征优先保留)。研究人员指出,仍需进一步验证尺度不变性(对文库大小变化稳健)和扰动不变性(对特征特异性系统偏差稳健)。此外,相对丰度与绝对丰度之间的相关性存在负偏倚,该偏倚独立于子成分存在。结论部分翻译如下:
在本研究中,研究人员证明了TSS变换后的组学数据集相对值几乎具有子成分一致性,其衍生自一系列无监督和监督分析的结果也是如此。研究人员的结论受限于丰度加权子成分方案,该方案反映了组学分析中最常见的场景。通过在五个不同组学数据集中展示子成分一致性,研究结果提示对使用相对丰度的担忧可能比通常假设的要轻,从而挑战了常规使用对数比变换的一个重要论据。