PySimi:用于谱聚类中相似性度量评估的统一框架及其在组学数据中的应用

《Frontiers in Genetics》:PySimi: a unified framework for similarity measure evaluation in spectral clustering with applications to omics data

【字体: 时间:2026年08月12日 来源:Frontiers in Genetics 3.0

编辑推荐:

  高通量组学技术产生日益庞大和复杂的数据集,对能够识别有意义生物学模式的聚类方法需求不断增长。谱聚类被广泛用于分析高维组学数据,但其性能强烈依赖于相似性矩阵的构建。尽管已提出众多相似性度量,大多数现有谱聚类工具仅支持有限的相似性构建策略,使得系统评估和比较困难。

  
高通量组学技术产生日益庞大和复杂的数据集,对能够识别有意义生物学模式的聚类方法需求不断增长。谱聚类被广泛用于分析高维组学数据,但其性能强烈依赖于相似性矩阵的构建。尽管已提出众多相似性度量,大多数现有谱聚类工具仅支持有限的相似性构建策略,使得系统评估和比较困难。本文提出PySimi,一个用于灵活构建相似性矩阵和谱聚类的开源Python框架。PySimi在一个统一且可扩展的框架内整合了经典、自适应和基于邻域的相似性度量,并提供了构建、比较和评估相似性矩阵的一致工作流。该框架还支持下游分析,包括降维和可视化,并提供一个交互式Web应用程序用于探索性分析。研究人员使用多个批量(bulk)与单细胞RNA测序(scRNA-seq)数据集对PySimi进行了评估。结果表明,相似性度量的选择能显著影响聚类结果和下游生物学解释。虽然没有单一方法在所有数据集上持续取得最佳性能,但自适应和基于邻域的方法通常表现出比经典方法更强的性能。通过提供一个统一的相似性矩阵构建、比较和评估平台,PySimi能够对相似性度量进行系统研究,并促进其在不同组学数据集上的应用。
PySimi:用于谱聚类相似性度量评估的统一框架及其组学应用

高通量转录组技术(包括批量RNA测序和单细胞RNA测序)已成为研究复杂疾病和细胞系统生物学异质性的重要工具。高维组学数据的快速积累迫切需要能够识别有意义生物学模式的计算方法。聚类在疾病亚型、细胞类型鉴定和探索性分析中发挥核心作用。谱聚类(spectral clustering)因其捕捉非线性和复杂数据结构的能力,被广泛用于高维生物数据分析。与K-means等传统算法不同,谱聚类基于数据的图表示,其中样本间的成对关系编码在相似性矩阵(similarity matrix)中。相似性矩阵定义了图结构,进而导出图拉普拉斯矩阵和谱嵌入,因此是聚类过程的关键组成部分。然而,大多数现有谱聚类工具仅提供少量预定义相似性函数(如高斯核或k近邻图),研究者常采用默认相似性设置而不系统评估其他定义。此外,许多自适应和基于邻域的相似性度量分散在不同软件包或研究代码库中,难以在统一分析工作流中访问、比较和评估。在组学研究中,最合适的相似性度量可能因数据集和生物学应用而异,因此亟需一个统一框架。

针对上述挑战,研究人员开发了PySimi,一个开源Python框架,用于灵活构建相似性矩阵和进行谱聚类。PySimi集成了14种相似性构建方法,涵盖经典、自适应和基于邻域三大类,并通过一致的工作流支持相似性矩阵的构建、比较和评估。框架还支持下游分析(如降维和可视化),并提供交互式Web应用程序。研究人员在多个批量与单细胞RNA-seq数据集上系统评估了PySimi,结果表明相似性度量的选择显著影响聚类结果和下游生物学解释;没有单一方法在所有数据集上持续最优,但自适应和基于邻域的方法通常优于经典方法。PySimi为相似性度量的系统研究提供了统一平台,促进了其在多样化组学数据集上的应用。该论文发表在《Frontiers in Genetics》。

在技术方法上,PySimi采用模块化架构,基于Python实现,依赖NumPy、SciPy、scikit-learn、pandas和UMAP等科学计算库。其核心功能是相似性矩阵构建,输入数据矩阵X后,所有方法生成对称相似性矩阵S。经典方法包括Pearson相关、Spearman相关、高斯RBF核、余弦、多项式和sigmoid核;自适应方法包括自适应邻域、核自适应邻域和局部密度自适应;基于邻域的方法包括k近邻(kNN)、自调优(self-tuning)、iSNN、nSNN和cSNN。谱聚类流程统一:计算度矩阵D,构建归一化图拉普拉斯矩阵Lsym = I - D-1/2SD-1/2,进行特征分解,取c个最小特征向量构成嵌入矩阵U,再对U的行进行K-means聚类。评估数据来源包括三个TCGA批量RNA-seq数据集(LIHC、KIRP、LUAD)和三个单细胞RNA-seq数据集(in-house、PBMC10k、CBMC8k)。批量数据用生存显著性评分Ssurvival和临床参数富集评分Eclinical评估;单细胞数据用归一化互信息(NMI)、调整兰德指数(ARI)、聚类准确率(ACC)和纯度(purity)评估。

研究结果如下:

4.3.1 Bulk RNA-seq results(批量RNA-seq结果)
在三个TCGA数据集上,不同相似性度量的聚类性能存在显著差异。自适应和基于邻域的方法通常实现更强的生存分离,同时保持相当或更好的临床参数富集。在LIHC中,仅部分方法(Spearman、self-tuning、nSNN)获得统计学显著的生存分离;在KIRP中,kernel-adaptive、adaptive、nSNN和cSNN获得最高生存显著性评分;在LUAD中,这些方法同样表现优越,而Pearson、cosine、多项式和sigmoid等经典方法虽也显著,但跨数据集一致性较差。Kaplan-Meier生存曲线显示,nSNN和cSNN在不同聚类数(k=3、4、5)下保持相对一致的生存分离,表明相似性构建策略可显著影响下游生物学解释。

4.3.2 Single-cell RNA-seq results(单细胞RNA-seq结果)
在三个单细胞RNA-seq数据集上,使用NMI、ARI、ACC和纯度评估,自适应和基于邻域的方法一致地比经典方法更接近注释细胞类型。kernel-adaptive、adaptive、nSNN和cSNN在数据集和评估指标上表现稳定。在PBMC10k上,iSNN、nSNN、cSNN和kNN优于多数经典方法;在CBMC8k上,自适应和基于共享最近邻的方法获得更高的ACC和纯度。邻域大小敏感性分析显示,当k从10变化到50时,多数方法性能相对稳定。计算成本方面,经典方法耗时最短,邻域和自适应方法因额外邻域构建和局部相似性估计而耗时较长。t-SNE、UMAP和LPP低维可视化显示,自适应和基于邻域的方法产生更紧凑、分离更好的簇结构,经典方法则导致相关细胞群重叠较多,进一步验证了定量评估结果。

讨论部分指出,相似性矩阵构建是谱聚类的关键步骤,其影响超过聚类算法本身。不存在普遍最优的相似性度量,度量选择应结合数据特征和分析目标。PySimi的目的不是确定通用最优度量,而是提供评估不同相似性定义在特定数据集和场景中影响的环境。自适应方法能适应局部密度变化,基于邻域的方法能保留局部邻域关系,因此对于具有高度异质性或有限细胞类型可分性的组学数据更为有效。经典方法主要依赖全局成对关系,在复杂数据上可能效果欠佳。研究还强调,在生物学数据集上应用谱聚类时,系统比较相似性度量应被视为聚类分析不可或缺的部分。局限性方面,当前研究主要聚焦转录组数据,其他组学模态(如蛋白质组、代谢组和多组学数据集)因特征维度、稀疏性、噪声和异质性不同,需要进一步评估;未来工作可探索将PySimi生成的相似性矩阵用于其他基于图的学习和聚类方法,以及开发自动化相似性度量推荐和参数优化策略。结论部分翻译为:研究人员提出了PySimi,一个开源Python框架,用于灵活构建相似性矩阵和进行谱聚类。通过在一个统一平台内集成多种相似性构建方法,PySimi实现了跨组学数据集对相似性度量的系统比较和评估。该框架提供编程和交互式界面,是聚类分析、方法评估和探索性组学研究的实用工具。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号