基于大规模Perturb-seq数据系统评估单细胞转录因子活性推断方法

《Briefings in Bioinformatics》:Benchmarking methods for inferring single-cell transcription factor activity using large-scale perturbation sequencing data

【字体: 大 中 小 】 时间:2026年09月18日 来源:Briefings in Bioinformatics 7.3

编辑推荐:

  转录因子活性(transcription factor activity, TFA)并非仅由转录因子(transcription factor, TF)基因本身的表达水平决定,还受一系列转录后调控过程的调节。尽管已有大量计算方法通过构建基因调控网络(gene

转录因子活性(transcription factor activity, TFA)并非仅由转录因子(transcription factor, TF)基因本身的表达水平决定,还受一系列转录后调控过程的调节。尽管已有大量计算方法通过构建基因调控网络(gene regulatory network, GRN)从单细胞转录组数据推断TFA,但该领域仍缺乏利用高质量实验数据对这些方法进行系统、统一评估的研究。在本研究中,研究人员利用大规模、高质量的单细胞扰动测序(Perturb-seq)数据集,对涵盖三种类别的八种主流TFA推断方法进行了全面评估:基于先验GRN、基于从头GRN以及基于整合GRN的方法。结果表明,采用整合GRN的metaTF在多个指标上表现最佳,包括TF覆盖率、对扰动细胞的预测准确性以及对扰动TF的预测准确性。在基于从头GRN的方法中,pySCENIC的预测准确性仅次于metaTF,但TF覆盖率较低;同时,基于先验GRN的decoupleR在所有评估指标中均排名靠前。进一步研究发现,重建的regulon在差异表达基因(differentially expressed genes, DEGs)中的富集程度、先验GRN和TFA评分算法的选择以及目标TF的扰动类型,都是影响TFA推断准确性的关键因素。该研究为TFA推断方法的应用与发展提供了实用建议。
单细胞转录因子活性推断方法的系统基准评测:基于Perturb-seq的大规模研究

**研究背景与意义**

转录因子(transcription factor, TF)是基因表达的关键调控因子,其活性(transcription factor activity, TFA)不仅取决于TF基因自身的mRNA水平,还受到翻译效率、翻译后修饰、亚细胞定位和蛋白质相互作用等一系列转录后调控机制的影响。因此,从转录组数据推断TFA主要依赖基因调控网络(gene regulatory network, GRN)的构建。GRN的基本单位是regulon,即特定TF与其靶基因之间的调控关系集合。虽然已有大量基于单细胞RNA测序(scRNA-seq)的TFA推断方法,但领域内缺乏使用高质量实验数据对这些方法进行系统、统一评估的研究。单细胞扰动测序(Perturb-seq)通过CRISPR递送靶向基因的sgRNA和条形码,可明确识别被遗传扰动的细胞,为TFA推断提供金标准。因此,研究人员利用大规模Perturb-seq数据对八种代表性TFA推断方法进行了系统基准评测,以填补这一空白,并为方法选择与发展提供依据。

**研究内容与主要结论**

研究人员从PerturBase数据库(2025年9月查询)筛选原始数据集,经严格质量控制后获得17个人源细胞系Perturb-seq数据集,包含174次单基因扰动,靶向135个独立TF。根据GRN信息来源,八种方法被分为三大类:基于先验GRN的decoupleR;基于从头GRN的pySCENIC、PISCES、hdWGCNA、scMINER;基于整合GRN的TIGER、metaTF、scRegulate。评估维度包括TF覆盖率、扰动细胞识别准确性、扰动TF识别准确性以及计算效率。结果表明,metaTF在TF覆盖率(99.4%)和多个预测准确性指标上均最优;pySCENIC预测准确性仅次于metaTF,但覆盖率仅47.7%;decoupleR在所有指标上排名靠前,且与metaTF预测相关性较低,具有互补性。进一步分析显示,regulon在DEGs中的富集程度越高,预测AUROC越高;先验GRN和评分算法的替换会显著改变预测性能;扰动方式和TF DNA结合域(DNA-binding domain, DBD)类别对基于从头GRN的方法影响较大,而decoupleR更为稳健。该研究为应用者提供了实用建议:资源充足时可优先选择metaTF;pySCENIC可作为不依赖先验知识的强选择;decoupleR使用ULM评分算法则具有低计算成本和稳健性优势。

**关键技术方法与数据来源**

样本队列来源为PerturBase数据库筛选得到的17个人源细胞系Perturb-seq数据集(174次单基因扰动,135个TF)。主要关键技术包括:使用scanpy和pertpy进行常规质量控制;使用mixscape算法排除扰动逃逸的假阳性细胞;使用E-test识别并去除弱效应扰动组;以AUROC、AUPRC、早期精确率(early precision, EP)和归一化秩(normalized rank, NRank)为评估指标;采用留一数据集分析排除数据集偏倚;用超几何检验评估regulon在DEGs中的富集;用多元线性回归和方差分析(ANOVA)控制扰动方式影响后检验TF DBD类别效应;同时记录各方法的运行时间和峰值内存。

**主要研究结果**

1. 基准数据集与TFA推断方法
研究人员基于PerturBase构建了包含17个高质量数据集的基准,涵盖135个TF的174次扰动,约占人类TF全谱的9.5%,DBD类别跨18类。扰动类型包括CRISPRa/ORF过表达产生的102个激活扰动和CRISPRi/CRISPR-KO产生的72个抑制扰动。统一预处理后,按GRN来源将八种方法分为先验、从头和整合三类。

2. TFA推断方法的性能
以AUROC/AUPRC评估扰动细胞识别,以NRank评估扰动TF识别。metaTF的平均AUROC为0.681,中位AUPRC为0.179,平均NRank为0.327,均显著优于其他方法。pySCENIC平均AUROC为0.645,中位AUPRC为0.146,平均NRank为0.352;decoupleR平均AUROC为0.597,中位AUPRC为0.102,平均NRank为0.413。留一数据集分析结果与全数据集一致。早期精确率分析中,仅metaTF、pySCENIC和hdWGCNA显著优于随机基线。相关性分析显示,metaTF与pySCENIC的预测准确性高度相关(相关系数0.80),而decoupleR与metaTF的相关性较低(相关系数0.29)。

3. Regulon富集分析
以TF IRF1为例,metaTF构建的IRF1 regulon在DEGs中的富集最显著(校正P=1.05e-11),高于pySCENIC(校正P=5.62e-08)和decoupleR(校正P=3.46e-06)。对全部regulon进行超几何检验后,metaTF通过检验的regulon数量最多、校正比值比(odds ratio, OR)最高。在metaTF、pySCENIC和decoupleR中,通过富集检验的regulon对应AUROC显著高于未通过者,表明regulon在DEGs中的富集是影响TFA推断准确性的关键因素。

4. 先验GRN的影响
对metaTF分别仅使用先验GRN或从头GRN时,AUROC均显著低于完整整合模型,说明两类信息对metaTF的最优性能缺一不可。对decoupleR,CollecTRI先验GRN显著优于TFLink;对scRegulate,ChIP-Atlas优于默认CollecTRI和TFLink;对TIGER,DoRothEA、ChIP-Atlas和CollecTRI之间无显著差异。因此,最优先验GRN的选择因方法而异。

5. 评分算法的影响
以CollecTRI为先验GRN,比较decoupleR内置的12种TFA评分算法及Ucell,ULM的AUROC与Consensus相当,且显著优于或相当于其他多数算法。将pySCENIC默认的AUCell和metaTF默认的VIPER替换为ULM后,两者的AUROC均显著提升,说明ULM可有效泛化到不同GRN类型的TFA推断方法。

6. 扰动方式与TF DBD类别的影响
metaTF和pySCENIC对TF激活扰动的预测AUROC显著高于抑制扰动,decoupleR无此差异。细分扰动方式后,metaTF对CRISPRa的预测优于ORF过表达和CRISPRi;pySCENIC对CRISPRa和ORF过表达优于CRISPRi;decoupleR仍无显著差异。多元线性回归控制扰动方式后,TF DBD类别显著解释metaTF和pySCENIC的AUROC方差(metaTF校正R2=0.351;pySCENIC校正R2=0.526),但decoupleR不显著(校正R2=0.028)。其中,其他C4锌指类因子和色氨酸簇类因子的预测性能显著高于总体平均。

7. 计算效率与资源消耗分析
在单核限制下,decoupleR(ULM)运行时间最短;hdWGCNA、pySCENIC和scRegulate运行时间中等;PISCES、scMINER、TIGER、metaTF和decoupleR(Consensus)运行时间较长。峰值内存方面,decoupleR(ULM)和scRegulate较低,metaTF和TIGER较高。metaTF虽然预测性能最优,但其运行时间和峰值内存比pySCENIC高数十至数百倍;decoupleR中ULM与Consensus预测准确性相当,但ULM在速度和内存上优势明显。

**讨论与结论**

讨论指出,基于先验GRN的方法具有高置信度但缺乏细胞类型特异性,从头GRN方法具备数据特异性但缺乏独立实验验证,整合GRN方法有望融合两者优势。metaTF的消融实验证实,先验GRN和从头GRN对最优性能均不可或缺。pySCENIC作为广泛使用的方法,准确率较高但TF覆盖有限;decoupleR对数据特异因素稳健,且ULM可作为通用TFA评分算法提升其他方法。未来方法开发应重视整合GRN策略、先验GRN选择与通用评分算法设计。该研究局限性包括:测试TF仅占人类TF全谱的9.5%,数据集扰动类型不平衡,主要基于体外细胞系和单基因扰动,未涵盖多TF协同调控,且未纳入基础模型;未来需扩展至更广TF类型、复杂体内环境及新兴多组学数据。

结论方面,该研究建立了基于17个精心筛选的Perturb-seq数据集的实验验证基准,覆盖靶向135个独立TF的174次单基因扰动,为TFA推断提供了稳健、可扩展且可复现的评估框架。系统评估了基于先验GRN、从头GRN和整合GRN三类主流方法,发现使用整合GRN的metaTF在TF覆盖率及扰动细胞/TF预测准确性上总体最优;基于从头GRN的pySCENIC准确性仅次于metaTF但TF覆盖率较低;基于先验GRN的decoupleR在所有评估指标中也排名靠前。研究进一步证明,regulon在DEGs中的富集、先验GRN和评分算法的选择以及目标TF的扰动类型是推断准确性的关键决定因素,为TFA推断方法的选择和方法学发展提供了实用指导。

订阅生物通快讯

订阅快讯:

最新文章

限时促销

会展信息

关注订阅号/掌握最新资讯

今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

版权所有 生物通

Copyright© eBiotrade.com, All Rights Reserved

联系信箱:

粤ICP备09063491号