可扩展联合非负矩阵分解用于配对单细胞基因表达与染色质可及性数据

《NAR Genomics and Bioinformatics》:Scalable joint non-negative matrix factorization for paired single cell gene expression and chromatin accessibility data

【字体: 时间:2026年09月04日 来源:NAR Genomics and Bioinformatics 3.0

编辑推荐:

  单细胞多模态技术为同时描绘细胞状态提供了强大手段。目前这些技术正被用于研究多种生物系统中的基因调控机制。针对这些数据的整合与分析,迫切需要定制化的计算方法,其理想特性包括:效率——以应对数据的高维性;可解释性——以支持下游生物学发现与假说生成;灵活性——以方便

  
单细胞多模态技术为同时描绘细胞状态提供了强大手段。目前这些技术正被用于研究多种生物系统中的基因调控机制。针对这些数据的整合与分析,迫切需要定制化的计算方法,其理想特性包括:效率——以应对数据的高维性;可解释性——以支持下游生物学发现与假说生成;灵活性——以方便纳入未来新增的模态。现有方法覆盖了上述部分特性,但未能同时满足有效整合与分析这些数据的全部要求。在此,研究人员提出一种高效方法q-intNMF,利用联合非负矩阵分解(non-negative matrix factorization, NMF)对单细胞多模态数据进行表示与整合,可促进在每个模态中发现相互关联的调控主题。研究人员使用大型公开数据集,与五种现有流行方法进行了全面基准测试。在一系列指标上,q-intNMF的性能与当前最先进方法相当。此外,q-intNMF在计算效率和原始特征空间中发现的调控主题的可解释性方面具有优势。研究人员展示了这种增强的可解释性如何为阿尔茨海默病相关的细胞状态变化提供见解。q-intNMF以Python包形式提供,包含广泛文档和使用案例,网址为https://github.com/wmorgans/quick_intNMF。
研究背景与问题:单细胞多模态技术可在同一细胞中同时测量多个组学层面,例如染色质可及性与转录组。随着10X Genomics Multiome平台的推广,配对ATAC–RNA数据量预计将显著增加。整合分析的关键步骤是从多个不同特征集中找到低维且信息丰富的联合嵌入。现有方法各有局限:度量学习方法如Seurat WNN速度快,但生成的细胞–细胞相似性矩阵难以将测量特征直接链接到嵌入;矩阵分解方法如MOFA+、scAI、scREG等,有的运行时间较长,有的内存消耗大,有的特征载荷不可直接解释。因此,亟需一种同时具备计算效率、生物学可解释性和扩展灵活性的方法。研究人员提出了q-intNMF,并发表在《NAR Genomics and Bioinformatics》上。

研究内容与结论:q-intNMF采用联合非负矩阵分解,将RNA表达矩阵和ATAC染色质可及性矩阵近似分解为共享细胞嵌入W与模态特异性特征载荷HRNA和HATAC,使用改进的加速分层交替最小二乘(accelerated hierarchical alternating least squares, acc-HALS)算法进行优化。研究人员在PBMC-Multiome数据集(约11 909个人外周血单核细胞)、BMMC-Multiome数据集(69 249个骨髓单核细胞,来自12个健康供体,GSE194122)以及阿尔茨海默病DLPFC数据集(105 332个细胞,7例阿尔茨海默病阳性与8例阴性,GSE214637)上进行了基准测试和应用。与Seurat WNN、scAI、scREG、MOFA+、jrSiCKLSNMF、Mowgli和MOJITOO等方法相比,q-intNMF在聚类性能上相当或更优,在运行时间和内存使用方面具有显著优势,并能提供更具细胞类型特异性的调控主题。

关键方法:研究人员主要使用了以下关键技术:联合非负矩阵分解模型,共享细胞嵌入并分别保留RNA和ATAC特征载荷;TF-IDF(词频-逆文档频率)变换进行数据预处理;基于块坐标下降的acc-HALS算法用于快速分解;L1正则化增强主题稀疏性;基于贝叶斯信息准则(BIC)和损失曲线膝点选择主题数;使用scIB框架中的调整兰德指数(ARI)、互信息(MI)、轮廓系数、图连通性、cLISI、iLISI等指标进行基准评估;通过UMAP可视化、PEGS空间富集分析、基因本体(GO)和疾病本体(DO)富集分析以及转录因子(TF)基序富集分析来验证主题的生物学意义。

研究结果:

基准测试计算方法用于多组学数据的联合嵌入(Benchmarking computational methods for joint embedding of multiome data):q-intNMF在PBMC-Multiome数据上表现出与现有方法相当或更优的聚类性能,尤其在轮廓系数上优于多数方法。在更大的BMMC-Multiome数据上,q-intNMF-l1(topic)在ARI指标上最佳,MOJITOO在MI指标上最佳,q-intNMF与MOFA+的轮廓系数相当。scREG、scAI和jrSiCKLSNMF在完整BMMC数据上出现内存错误。在资源消耗方面,q-intNMF的内存需求与MOJITOO和Seurat相近,运行时间显著短于MOFA+及其他NMF方法。q-intNMF在约70 000个细胞上的典型运行时间为3–23分钟,而MOFA+需要199分钟。

应用于背外侧前额叶皮层多组学数据(Application to dorsolateral prefrontal cortex multiome data):在阿尔茨海默病相关DLPFC数据上,q-intNMF生成的UMAP能清晰解析注释的细胞类型。q-intNMF主题比MOFA+因子更具细胞类型特异性,多数主题集中在一个或少数细胞类型上,而MOFA+因子常分散在多个细胞类型中。尽管两种方法都能识别细胞类型和亚型,但阿尔茨海默病阳性与阴性细胞之间的差异仍较难直接区分。

q-intNMF主题具有生物学意义并由相关RNA和染色质特征构成(q-intNMF topics are biologically relevant and comprise related RNA and chromatin features):q-intNMF的载荷矩阵H具有稀疏性,主题可主要由RNA、ATAC或两者共同驱动。PEGS分析显示,同一主题内高权重基因和基因组区域在空间上显著邻近,说明RNA和染色质特征具有一致性。与MOFA+相比,q-intNMF主题基因集富集到更多的GO生物学过程和疾病本体条目。典型标记基因如星形胶质细胞标记基因AQP4在相应主题中具有高权重。

q-intNMF主题揭示疾病相关生物学(q-intNMF topics elucidate disease-relevant biology):在阿尔茨海默病状态下,少突胶质细胞相关主题19、星形胶质细胞相关主题11和小胶质细胞相关主题18更活跃,而主题14、20、16、8更倾向于健康状态。例如,SAMD4A在阿尔茨海默病相关星形胶质细胞主题中的权重更高。主题的顶部基因富集到与细胞类型和疾病状态相关的GO和DO条目,例如神经元主题富集“突触组织”,小胶质细胞主题富集免疫相关疾病。ATAC特征的TF基序富集也符合细胞类型特征,如PU.1/SPI1基序在小胶质细胞主题中显著富集。在基因组区域层面,q-intNMF捕获了KANSL1启动子在阿尔茨海默病样本中失去可及性,以及APP基因座中潜在调控区域的开放状态变化。

讨论总结:q-intNMF基于块坐标下降框架,具有时间和内存效率优势。其使用L2损失是出于大规模数据下高效更新的实际考虑;采用KL散度等损失并未提升性能,反而显著增加资源消耗。q-intNMF的快速运行使其可扩展到迭代学习、一致性NMF、调控网络推断等方向,也可通过修改预处理和更新方程扩展到空间转录组、三模态数据或蛋白质与RNA配对数据。研究结论:总之,q-intNMF是一种快速且准确的分析单细胞多组学数据的方法,能够提供丰富的低维表示,促进自定义下游分析,并为进一步组合单细胞数据模态提供了方法学扩展空间。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号