基于Dreamlet的大规模单细胞转录组数据高效差异表达分析

《Nature Communications》:Efficient differential expression analysis of large-scale single-cell transcriptomics data using Dreamlet

【字体: 大 中 小 】 时间:2026年09月24日 来源:Nature Communications 18.1

编辑推荐:

  单细胞和单核转录组学(single-cell and -nucleus transcriptomics)的进展已经能够生成来自数百名受试者、数百万细胞的日益大规模数据集。这些研究有望为人类疾病的细胞类型特异性生物学提供前所未有的见解。然而,由于复杂研究设计的统

  
单细胞和单核转录组学(single-cell and -nucleus transcriptomics)的进展已经能够生成来自数百名受试者、数百万细胞的日益大规模数据集。这些研究有望为人类疾病的细胞类型特异性生物学提供前所未有的见解。然而,由于复杂研究设计的统计建模以及将分析扩展到大数据集所面临的挑战,跨受试者的差异表达分析仍然十分困难。研究人员开发的开源R包dreamlet(DiseaseNeurogenomics.github.io/dreamlet)采用基于精度加权线性混合模型(precision-weighted linear mixed models)的伪bulk(pseudobulk)方法,为每个细胞簇识别与受试者性状差异表达的基因。Dreamlet专为大规模队列数据设计,比现有工作流程明显更快且占用内存更少,同时支持复杂统计模型并控制假阳性率(false positive rate, FPR)。研究人员在已发表数据集以及一个包含150例阿尔茨海默病(Alzheimer’s disease, AD)病例和149例对照的死后脑组织1.4M单核的新数据集上,展示了其计算性能和统计性能。
单细胞与单核转录组学技术的进步使得研究者能够从数百名受试者、数百万细胞中生成大规模数据集,为揭示人类疾病中细胞类型特异性生物学提供了前所未有的机会。然而,跨受试者的差异表达分析仍然困难,原因在于复杂研究设计的统计建模以及大数据集分析扩展性的挑战。现有方法多针对中小规模数据集,在单细胞水平建模时统计功效与假阳性控制存在问题,而伪bulk方法在聚合reads时计算和内存开销大,且难以建模包含技术/生物学重复或样本多重标记所引入的高维批次效应等复杂设计。为此,研究人员开发了开源R包dreamlet,用于在大规模队列中高效进行差异表达分析,相关成果发表在《Nature Communications》。

在技术方法上,研究人员采用基于精度加权线性混合模型(precision-weighted linear mixed models)的伪bulk(pseudobulk)策略。Dreamlet利用H5AD磁盘存储格式和并行化计算,显著降低内存占用和计算时间;统计上先用泊松计数模型初始化精度权重,再估计经验均值-方差趋势以产生第二轮权重,并结合经验贝叶斯调节t统计量。该方法支持随机效应,可处理复杂研究设计。样本队列方面,除已发表的COVID-19(COMBAT Consortium,110例供者、674K细胞)和前列腺癌骨转移(Kfoury等)数据外,研究人员还自建了来自西奈山NIH神经生物库(Mount Sinai NIH NeuroBioBank)的死后脑组织AD队列,包括150例AD病例和149例对照、共1.4M个单核。

研究结果如下:

Dreamlet工作流程用于大规模差异表达分析
Dreamlet采用伪bulk方法,为每个基因和细胞簇拟合回归模型,以检验与受试者性状相关的差异表达。通过精度加权线性混合模型,可解释重复测量设计、样本多重标记导致的高维批次效应以及测序深度和细胞数的变异。两层精度权重结合经验贝叶斯调节统计量,在控制假阳性率的同时提高功效,并保持计算高效。

大规模数据集上的计算性能
在模拟的大规模数据上(1000个供者、8种细胞类型、410万细胞),Dreamlet仅用31分钟和26 GB内存完成伪bulk计算;与pegasus、muscat等工作流相比,Dreamlet显著更快、内存占用更小,而单细胞水平的广义线性混合模型等方法慢10至100倍或受内存限制。

大规模数据集上的统计性能
利用独立小组开发的模拟流程进行基准测试,Dreamlet在仅使用固定效应模型时,统计性能达到或超过当前最佳方法,并对模拟效应大小给出最准确的估计。在真实人脑死后单核数据中置换疾病状态后评估经验假阳性率,Dreamlet是唯一能在不同样本量下控制假阳性率并支持随机效应模型的方法。对于样本多重标记产生的高维批次效应,使用随机效应建模可在控制假阳性率的同时保留统计功效。

Dreamlet揭示与COVID-19严重程度相关的细胞类型特异性反应
研究人员对COMBAT Consortium的110例供者共674K个外周血单细胞数据进行分析,发现经典单核细胞中疾病状态是基因表达变异的主要来源(中位解释11.4%的变异)。在轻度COVID-19与健康对照的比较中鉴定出1824个差异表达基因;基因集分析显示TNFα信号经由NF-κB在COVID-19各疾病状态中激活,而胆固醇稳态、干扰素γ和氧化磷酸化通路仅在住院患者中激活。

Dreamlet在前列腺癌骨转移中识别稳健的转录变化
针对9例骨转移前列腺癌患者和7例非癌症患者的肿瘤、累及骨髓及远端骨髓样本,研究人员使用随机效应建模每位患者的多次测量。在单核细胞簇中,肿瘤与累及骨髓之间鉴定出157个差异表达基因;基因集分析显示MHC II类分子和蛋白折叠伴侣在肿瘤样本中上调。

在大型阿尔茨海默病队列中建模多种表达变异来源
自建AD队列包含来自299例60岁以上供者DLPFC脑区的586个样本,经多重标记后产生1.4M个单核,注释出22种细胞类型。方差分解分析显示,小胶质细胞中受试者效应中位解释38.4%的变异,AD状态效应较小;样本池批次效应与基因GC含量显著相关,提示PCR等技术的批次来源。每名受试者检测到的核数量增加会提高技术重复间的一致性,并增加可检测的差异表达基因数目。

阿尔茨海默病病例中小胶质细胞PTPRG的大效应上调
在AD病例与对照的比较中,小胶质细胞共有1037个差异表达基因,其中PTPRG的log2倍数变化为1.59,p值为2.94e-28,效应量显著高于其他基因,且上调主要局限于小胶质细胞。PDE10A则在多种神经元亚型中一致下调。基因集分析显示小胶质细胞中p38MAPK级联通路特异性上调,该通路与炎症反应相关。

讨论部分指出,Dreamlet解决了大规模分析中的计算和内存限制,并支持复杂随机效应模型从而控制假阳性率。在AD数据中,PTPRG上调与其他单核转录组研究高度一致,但其在疾病中的具体作用尚不明确。研究同时强调,技术批次效应和不同细胞簇测量精度的差异会影响统计功效和结果解释,因此对细胞类型特异性发现应谨慎解读。结论翻译如下:总之,研究人员推出了开源R包dreamlet(DiseaseNeurogenomics.github.io/dreamlet),该包解决了以往在大规模单细胞数据集中进行跨受试者高效差异表达分析所面临的挑战。Dreamlet比现有工作流程明显更快、占用内存更少,支持复杂统计模型并更好地控制假阳性率,为不断扩大的单细胞/核转录组数据集提供了重要工具。
相关新闻
生物通微信公众号
微信
新浪微博

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号