《Nature Genetics》:Mapping enhancer–gene regulatory interactions from single-cell data
编辑推荐:
在特定细胞类型中绘制增强子及其靶基因对于理解基因调控和人类疾病遗传学至关重要。然而,从单细胞数据集中准确预测增强子-基因调控相互作用一直具有挑战性。为此,研究人员引入了一类分类模型,scE2G(单细胞增强子-基因模型),用于预测增强子-基因调控。这些模型使用来
在特定细胞类型中绘制增强子及其靶基因对于理解基因调控和人类疾病遗传学至关重要。然而,从单细胞数据集中准确预测增强子-基因调控相互作用一直具有挑战性。为此,研究人员引入了一类分类模型,scE2G(单细胞增强子-基因模型),用于预测增强子-基因调控。这些模型使用来自单细胞测定法检测转座酶可及染色质测序(ATAC-seq)或多组学RNA和ATAC-seq数据的特征,并在一个包含超过10,000个评估过的元件-基因对的CRISPR扰动数据集上进行训练。研究人员将scE2G模型与CRISPR扰动、精细定位的表达数量性状位点(eQTL)和全基因组关联研究(GWAS)变异-基因关联进行基准测试,并展示了在多个细胞类型和扰动类别中的预测任务上的最先进性能。研究人员应用scE2G在异质性组织中构建增强子-基因调控相互作用图谱,并解释与复杂性状相关的非编码变异,提名了将INPP4B和IL15与淋巴细胞计数联系起来的调控相互作用。scE2G模型将能够在数千种人类细胞类型中准确绘制增强子-基因调控相互作用图谱。
**论文解读:scE2G模型——从单细胞数据精准绘制增强子-基因调控图谱**
**研究背景与问题**
人类基因组编码数百万个被称为增强子(enhancer)的调控元件,它们在特定细胞类型中精细调节基因表达。识别增强子调控哪些基因(增强子-基因调控相互作用)对于理解基因调控机制以及疾病相关遗传变异的功能至关重要。然而,在大多数人类细胞类型中,这类调控图谱仍然缺失。此前,基于批量数据的计算模型(如Activity-by-Contact(ABC)和ENCODE-rE2G)虽能构建数百种细胞类型的全基因组增强子-基因图谱,但在复杂组织中,由于难以纯化单个细胞类型进行批量表观基因组检测,其分辨率有限。单细胞ATAC-seq(转座酶可及染色质测序)和RNA-seq技术的进步,使得获取异质性组织中的几乎所有细胞类型和状态成为可能。然而,从单细胞数据中准确预测增强子-基因调控相互作用一直面临挑战,主要因为缺乏稳健的基准测试数据集和流程。ENCODE联盟收集的增强子扰动黄金标准数据集,为评估和开发基于监督学习的模型提供了契机。
**研究内容与结论**
本研究引入了一类从单细胞数据预测增强子-基因调控相互作用的分类模型——scE2G(单细胞增强子-基因模型)。研究人员开发了两个版本:scE2G
ATAC(仅使用scATAC-seq数据)和scE2G
Multiome(使用配对scRNA和scATAC-seq数据)。这两个模型均为逻辑回归分类器,以单细胞数据为输入,预测染色质可及元件是否作为增强子调控特定基因。模型在K562细胞中基于CRISPR扰动数据(超过10,000个元件-基因对)进行训练,并应用于其他细胞类型的单细胞数据。通过基准测试,scE2G在CRISPR扰动、精细定位eQTL和GWAS变异-基因关联三个正交任务中均优于现有单细胞模型,性能与基于批量DNase-seq数据的ENCODE-rE2G模型相当。研究人员应用scE2G
Multiome在45种细胞类型(包括外周血单核细胞(PBMC)、骨髓单核细胞(BMMC)和胰岛)中构建了增强子-基因调控相互作用图谱,并展示了其在解释复杂性状风险变异中的效用,例如提名了调控INPP4B和IL15与淋巴细胞计数相关的相互作用。该研究发表在《Nature Genetics》上。
**主要关键技术方法**
scE2G模型的核心技术方法包括:1)从单细胞多组学数据(10x Multiome平台)中计算特征,包括从伪批量scATAC-seq数据衍生的ABC评分、基于单细胞中元件可及性与基因表达之间Kendall相关系数,以及启动子类别(基因是否普遍表达)等;2)采用最佳子集特征选择策略,训练逻辑回归分类器,并在K562细胞CRISPR扰动数据集上进行监督学习;3)应用训练好的模型于新细胞类型的单细胞数据,预测全基因组增强子-基因调控相互作用。样本队列来源包括K562细胞系(训练数据)、PBMC、BMMC、胰腺胰岛以及GM12878、HCT116、Jurkat、WTC11等细胞系(用于基准测试和验证)。
**研究结果**
**1. 从单细胞数据预测调控性增强子-基因相互作用**
研究人员开发了scE2G
ATAC和scE2G
Multiome两个模型,并应用后者在45种细胞类型中构建了增强子-基因调控图谱。预测结果捕获了细胞类型间的调控差异和相似性,例如对EBF1、CEBPB和SPTA1等谱系相关基因的预测,与已知的细胞类型特异性调控模式一致。
**2. scE2G模型的基准测试**
通过CRISPR扰动、精细定位eQTL和GWAS变异三个基准测试,scE2G模型在所有指标上显著优于其他现有单细胞模型(如ABC、Signac、ArchR等)。在K562 CRISPR数据集上,scE2G
Multiome的AUPRC(precision-recall曲线下面积)和精确度均高于scE2G
ATAC和ABC模型(P
bootstrap < 0.001)。在五细胞类型的留存CRISPR数据集中,scE2G同样表现最佳。在eQTL基准测试中,scE2G
Multiome在匹配细胞类型中实现了13.9%的召回率和14.9倍富集。在GWAS基准测试中,scE2G在识别因果基因方面达到了与批量模型相当的性能(召回率25-50%,精确度25-75%)。
**3. 模型解释**
特征重要性分析显示,ABC评分、Kendall相关系数和启动子类别是模型性能的关键贡献者。scE2G
Multiome中使用的Kendall相关系数(在单细胞内计算)优于跨细胞类型或元细胞计算的相关系数,表明单细胞内的随机变异有助于增强子-基因连接。此外,scE2G对远距离、效应量弱或靶向普遍表达基因的元件-基因对预测难度较大。
**4. 不同测序深度下的性能**
通过降采样实验,scE2G
Multiome在ATAC片段数≥200万且RNA UMIs≥100万(对应约100个细胞)时表现出稳健性能,AUPRC和召回率随测序深度增加略有提升,这得益于ARC-E2G评分(整合ABC评分和Kendall相关系数)的稳定性。
**5. scE2G预测的细胞类型分辨率**
scE2G预测在39种通过深度阈值的细胞类型中,平均预测获得48,758个增强子-基因连接。密切相关的细胞类型显示出最高的预测相似性。精细定位eQTL在匹配或谱系相关的细胞类型预测中富集更强。细胞类型特异性预测比聚合预测多识别出76%的独特增强子-基因连接,例如EBF1和CEBPB位点揭示了细胞类型特异的增强子使用模式。
**6. 将GWAS变异与靶基因连接**
scE2G
Multiome在40种细胞类型中用于解释17个相关性状的精细定位GWAS变异。例如,随机血糖变异在胰腺β细胞和多肽细胞增强子中富集显著,而平均红细胞体积(MCV)变异在红系谱系增强子中富集最强。通过scE2G,研究人员为1,892个非编码可信集提名了1,450个变异连接至1,351个基因。在4q31.21位点,scE2G预测变异rs7696969位于INPP4B内含子,并同时调控INPP4B和IL15,这两个基因均为淋巴细胞计数的合理调控因子,且独立优先化方法PoPS也将其列为前两位基因。
**总结与讨论**
scE2G模型通过监督学习策略整合了ABC评分、元件-基因相关性和启动子类别等特征,优于任何单一特征或模型。其关键创新在于使用单细胞内的Kendall相关系数,该系数反映了增强子可及性与基因表达之间的随机时间关系,优于跨细胞类型或元细胞的相关性。scE2G对测序深度和细胞数量具有稳健性,部分归因于ARC-E2G评分的设计。基准测试框架结合了CRISPR、eQTL和GWAS三个正交数据集,全面评估了模型的泛化能力。scE2G图谱提高了复杂性状非编码变异的解释能力,特别是通过细胞类型分辨率提升了变异-基因关联的富集和召回率。研究也指出了局限性:scE2G仅预测增强子效应,不适用于其他机制(如CTCF结合元件);训练数据局限于K562细胞且阳性样本少;未来可通过扩展CRISPR训练数据、整合eQTL数据或增加批量表观基因组数据以进一步提升性能。总之,本研究提出了一种最先进的模型,用于从单细胞数据预测增强子-基因调控相互作用,并证明了其在解释遗传变异功能方面的实用性。scE2G模型可应用于不同大小和测序深度的数据集,并能在人体数千种细胞类型和状态中构建全面准确的增强子-基因调控相互作用图谱。