scLTF:一种面向大规模单细胞RNA测序数据的自训练聚类框架

《PLOS One》:scLTF: A self-training clustering framework for large-scale single-cell RNA-Seq data

【字体: 大 中 小 】 时间:2026年09月25日 来源:PLOS One 2.8

编辑推荐:

  单细胞RNA测序(scRNA-seq)技术近年来发展迅速,推动了发育生物学、癌症研究和免疫学等相关领域的重大突破。然而,现有聚类方法在处理大规模scRNA-seq数据时仍面临性能瓶颈。为了应对这一挑战,研究人员提出了一种面向大规模单细胞RNA测序数据的自训练聚

  
单细胞RNA测序(scRNA-seq)技术近年来发展迅速,推动了发育生物学、癌症研究和免疫学等相关领域的重大突破。然而,现有聚类方法在处理大规模scRNA-seq数据时仍面临性能瓶颈。为了应对这一挑战,研究人员提出了一种面向大规模单细胞RNA测序数据的自训练聚类方法,称为scLTF(Single-cell Louvain-Transformer Framework for Large-scale Clustering,即大规模聚类单细胞Louvain-Transformer框架)。该方法首先利用快速Louvain算法生成初步聚类,然后基于自定义的“聚类代表性指数”(Cluster Representativeness Index)选择关键细胞,随后采用Transformer模型进行迭代表示学习和优化,以优化最终聚类结果。在多个真实数据集上的实验表明,与几种最先进的深度聚类方法相比,scLTF在聚类准确性方面总体达到更优或相当的性能,评估指标(ARI、NMI和ACC)平均提升约3.9%–24.1%;同时,其运行时间仅为现有基于深度学习方法的约6.7%–43.9%。scLTF融合了传统基于图的聚类与深度学习模型的优势,同时实现了高聚类性能与计算效率,从而为生物医学研究和细胞分析提供了一种实用且可靠的工具。
单细胞RNA测序(scRNA-seq,一种在单细胞水平检测基因表达的技术)的发展推动了发育生物学、肿瘤学和免疫学等领域的重大进展。然而,现有聚类方法在处理大规模、高维、稀疏且含噪声的单细胞数据时面临性能瓶颈:传统距离度量在高维空间易出现“距离浓度现象”,大量dropout零值破坏局部邻域结构,技术噪声和批次效应进一步干扰真实细胞类型识别。已有方法如K-means、层次聚类、高斯混合模型、Louvain、Leiden、DBSCAN、谱聚类及SC3等在不同场景下各有局限;深度学习方法虽能提取非线性特征,但计算资源消耗大、运行时间长,且初始伪标签质量影响后续训练。为此,研究人员提出了一种自训练聚类框架scLTF(Single-cell Louvain-Transformer Framework for Large-scale Clustering),以兼顾聚类准确性、稳定性和计算效率。该框架首先利用改进的快速Louvain算法(FLA,一种基于模块度优化的快速社区发现算法)生成初步聚类;随后基于自定义的聚类代表性指数(CRI,度量细胞与所在簇主要结构一致性的指标)选择代表性细胞;最后使用Transformer(一种基于自注意力机制的深度学习模型)在伪标签监督下迭代优化特征表示与聚类划分。在多个真实公共数据集上的实验验证了其有效性,为大规模单细胞数据分析提供了高效、可扩展且具有生物学可解释性的工具。

在技术方法上,研究人员构建了四阶段流程。数据预处理包括低表达基因过滤(去除在少于5个细胞中表达的基因)、log归一化及高变基因选择(取方差最大的前2,000个基因)。初始聚类阶段,对预处理后的表达矩阵进行主成分分析(PCA,一种线性降维方法)并保留前50个主成分;通过候选细胞数量p0=min(10p,N)经K-means生成p个锚点,为每个细胞选择k个局部邻近锚点,利用局部尺度高斯核构造细胞-锚点稀疏二部图权重矩阵,再输入Louvain算法进行社区检测,时间复杂度由O(N2)降至O(N·p)。代表性细胞选择阶段,基于二部图权重矩阵计算每个细胞的CRI,在每个簇内选取CRI最高的一定比例(至少1个)细胞。最终聚类阶段,采用Transformer编码器(含多头自注意力机制和前馈网络)进行非线性表示学习,以代表性细胞的初始簇标签为伪标签,通过最小化交叉熵损失训练模型,最后对全部细胞预测标签。样本来自NCBI、10x Genomics和Figshare等公共数据库的8个真实数据集,涵盖人类和小鼠多种细胞类型,细胞数量从数万到30余万不等。

**聚类性能评估(Clustering performance evaluation)**:在8个数据集上,研究人员比较了FLA与四种传统方法(Seurat、Scanpy、Leiden、K-means)以及scLTF与四种深度学习方法(scMAE、scDeepCluster、scVI+Leiden、scTPC)的调整兰德指数(ARI,衡量聚类结果与真实标签相似度)、归一化互信息(NMI,衡量聚类标签与真实标签的互信息归一化值)和聚类准确率(ACC,聚类标签与真实标签匹配的准确度)。结果显示,FLA在多数数据集上优于传统方法,平均ARI、NMI、ACC较Seurat提升2.5%、2.8%、3.5%,较Scanpy提升1.7%、1.8%、2.2%,较Leiden提升2.2%、1.6%、1.8%,较K-means提升12.6%、6.1%、9.0%。scLTF在所有数据集上均优于深度学习方法,平均较scMAE提升13.3%、7.7%、8.7%,较scDeepCluster提升24.1%、9.4%、18.7%,较scVI+Leiden提升17.1%、10.5%、11.5%,较scTPC提升4.4%、3.9%、5.1%,并较FLA进一步提升。运行时间方面,FLA运行时间为Seurat、Scanpy、Leiden的约45.2%、42.6%、44.5%;scLTF运行时间仅为scMAE、scDeepCluster、scVI+Leiden、scTPC的约6.7%、32.2%、21.3%和43.9%。

**稳定性分析(Stability analysis)**:在GSE220195数据集上独立运行10次,FLA和scLTF的ARI、NMI和ACC分布集中,中位数高、四分位距小,变异性低于多数对比方法;scLTF在保持稳定的同时进一步提升了聚类准确率。

**聚类结果可视化(Visualization of clustering results)**:对GSE223414数据集进行t-SNE(一种非线性降维可视化方法)二维嵌入显示,scLTF的簇内紧凑性和簇间分离度优于FLA及其他方法,与定量指标一致。

**表达模式可视化(Expression pattern visualization)**:基于GSE198868数据集的亚群标记基因热图,FLA能较集中地呈现各亚群标记基因表达,scLTF进一步增强了亚群间分离,标记基因在簇内更集中,减少误分和混合。

**参数分析(Parameter analysis)**:系统评估了锚点数p(250–1500)和邻域数k(2–10),p在1000左右、k在5–8时性能较优;候选细胞比例p0/p增大至约10后NMI趋于稳定;分辨率参数在0.75–1.25时聚类数与真实细胞类型数接近;代表性细胞比例在5%–20%时ARI达到较优水平;Transformer编码层数2–3层和注意力头数4–8头获得平衡且稳定的性能。

**细胞–锚点标签一致性分析(Cell–Anchor label consistency analysis)**:在8个数据集上,细胞与其最近锚点的社区标签平均一致率为95.55%。显式进行标签修正仅带来平均NMI相对提升0.56%,且部分数据集性能下降,因此FLA无需额外修正步骤。

**消融研究(Ablation study)**:将基于CRI选择的代表性细胞与随机抽样比较,CRI在所有数据集上均更优,平均ARI提升约8.8%;将Transformer替换为多层感知机(MLP,一种全连接神经网络)后,Transformer在所有数据集上平均NMI提升约4.0%,证明CRI和Transformer模块的有效性。

**讨论与结论**:本研究表明,scLTF通过融合快速图聚类与Transformer自训练,有效应对了高维、稀疏、大规模和噪声干扰等挑战。与现有方法相比,scLTF在聚类准确性和计算效率上均具有优势,且在不同规模和噪声水平的数据集上表现稳定。尽管性能仍在一定程度上依赖初始聚类参数设置和代表性细胞选择策略,但该框架为大规模scRNA-seq数据分析提供了高效、可扩展且具有生物学可解释性的方案。未来工作可聚焦自适应参数选择、增强跨数据集泛化能力,并探索与多组学数据整合。由于scLTF的高效性和稳定性,它有望在疾病亚型分型、细胞状态识别和精准医学等生物医学研究中得到应用。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号