两样本共聚类检验及其应用

《Pattern Recognition Letters》:Two-sample Co-cluster Test and Its Applications

【字体: 大 中 小 】 时间:2026年09月25日 来源:Pattern Recognition Letters 3.5

编辑推荐:

   •提出了一种新的显著性检验方法,即双样本同簇检验。•所提出的检验旨在量化两个样本是否属于同一个簇。•通过两个实际应用演示了所提出的检验方法的使用。引言在数据挖掘和机器学习领域,聚类分析是一个关键的研究领域。作为一种无监督学习方法,其目标是根据数据样本的相似性对其进行分组,从而

  
  • •
    提出了一种新的显著性检验方法,即双样本同簇检验。
  • •
    所提出的检验旨在量化两个样本是否属于同一个簇。
  • •
    通过两个实际应用演示了所提出的检验方法的使用。

引言

在数据挖掘和机器学习领域,聚类分析是一个关键的研究领域。作为一种无监督学习方法,其目标是根据数据样本的相似性对其进行分组,从而发现复杂数据集中的潜在模式和结构。近几十年来,越来越多的方法从假设检验的角度探索聚类研究,解决了相关的研究问题,如评估可聚类性[1]、[2]、确定簇数[3]、[4]、评估整个聚类划分的统计显著性[5]、[6],以及验证单个簇的显著性[7]、[8]。
尽管聚类分析的假设检验取得了这些进展,但一个关键挑战仍未得到解决:确定两个样本是否属于同一个簇。虽然在一些方法中已经提出了检验统计网络分析领域中两个或多个节点是否属于同一社区的方法[9]、[10]、[11],但它们在解决上述显著性检验问题方面的潜力尚未得到研究。为了填补这一空白,我们提出了一种新的显著性检验方法,称为双样本同簇检验。
研究样本对的共享簇归属具有重要的实用价值和理论价值。判断两个样本是否属于同一个簇的简单方法是应用一种聚类算法并相应地解释结果。然而,这种方法本质上依赖于所选算法及其基本假设,不同的方法在同一组样本对上经常产生不同的结果。因此,开发一种能够直接判断两个样本是否属于同一个簇的方法既是实际的需要,也具有理论意义。
所提出的检验方法会产生与样本对相关的p值,使我们能够量化任何给定的一对样本是否具有相同的簇归属。除了解决这一特定问题外,我们的方法还可以应用于解决上述聚类分析的显著性检验任务。此外,我们的检验方法还可以应用于解决其他数据挖掘问题,如异常检测和分类。
我们提出了一种显著性检验方法,用于确定两个样本是否属于同一个簇。我们首先构建一个图及其相应的加权邻接矩阵来表征样本之间的相似性。对该矩阵应用谱嵌入,使我们能够提取其特征值和特征向量,并利用它们开发检验统计量。更具体地说,两个样本在谱嵌入空间中的统计距离被用作检验统计量。在假设所构建的图是广义随机点积图[11]的前提下,当零假设(即它们属于同一个簇)为真时,该统计量服从卡方分布。
为了展示我们的检验方法的实际应用,我们将其应用于几个不同的模式识别问题:异常检测、聚类验证、簇数估计和分类。实验结果表明,这样的检验方法是通用的,且其部署在上述应用中均能取得具有竞争力的性能。
本文的主要贡献总结如下:
  • •
    我们提出了一种新的显著性检验方法,用于确定两个样本是否属于同一个簇。
  • •
    该方法提供了用于评估样本对统计显著性的解析p值。通过一系列实验,我们证实所提出的方法既有效又实用。
  • •
    除了判断两个样本是否属于同一个簇这一基本任务之外,我们的方法还具有更广泛的应用潜力。
本文的结构组织如下:第2节概述了问题以及我们提出的方法。第3节介绍了在合成数据集和真实数据集上的实验结果,以及在几个模式识别问题中的应用。第4节总结了全文。

章节摘要

方法

在本节中,我们介绍了主要的理论结果以及我们要解决的问题。为了确定数据集中的两个样本是否具有相同的簇归属特征,我们开发了一种新的显著性检验方法,称为双样本同簇检验。在以下各节中,我们将详细描述该检验方法的理论基础和方法学。

数据集与性能指标

实验中使用来自 https://cs.uef.fi/sipu/datasets/ 的六个合成数据集和来自UCI仓库[12]的十二个真实数据集。具体而言,六个合成数据集为:Flame、Pathbased、Jain、Compound、R15和Aggregation;十二个真实数据集为:Iris、Wine、Seeds、Glass Identification、New-thyroid、Statlog、Haberman、Ecoli、Liver Disorders、Auto MPG、Exasens和User Knowledge。对于每个数据集,均应用min-max归一化对所有数值

结论

在本文中,我们提出了一种基于假设检验的新方法,用于确定两个样本是否属于同一个簇。为了验证我们方法的有效性,我们在各种合成数据集和真实数据集上进行了实验。此外,我们将该方法应用于异常检测和分类等任务。实验结果表明,所提出的检验方法在这些相关应用中具有潜力。
然而,由于所提出的方法依赖于成对计算

CRediT作者贡献声明

刘欣颖:撰写——审阅与编辑,撰写——初稿撰写,软件,资源,方法论,形式化分析,数据管理,概念化。胡联宇:验证,方法论,数据管理。江牧迪:可视化,资源,概念化。何曾友:撰写——审阅与编辑,监督,资源,方法论,调查,经费获取,形式化分析。

利益冲突声明

作者声明,他们不存在任何已知的竞争性财务利益或个人关系,这些利益或关系可能影响本文所报道的工作。

致谢

本研究得到国家自然科学基金的资助,项目编号为62472064。
刘欣颖|胡联宇|江牧迪|何曾友
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号