游程纯度加权最近收缩质心特征选择用于高维基因表达分类

《Machine Learning with Applications》:A run purity weighted nearest shrunken centroid feature selection for high-dimensional gene-expression classification

【字体: 时间:2026年07月08日 来源:Machine Learning with Applications 6.1

编辑推荐:

  高维基因表达分类数据集通常包含不相关、噪声和弱判别特征,这会降低分类准确率并增加计算成本。本文提出一种用于高维基因表达分类的运行纯度加权最近收缩质心特征选择方法(run purity weighted nearest shrunken centroid, RP

高维基因表达分类数据集通常包含不相关、噪声和弱判别特征,这会降低分类准确率并增加计算成本。本文提出一种用于高维基因表达分类的运行纯度加权最近收缩质心特征选择方法(run purity weighted nearest shrunken centroid, RPWNSC)。该方法结合两个互补准则:基于游程的纯度分数(run based purity score),该分数通过按每个特征排序样本后评估类标签的紧凑性;以及标准化最近收缩质心分数(standardized nearest shrunken centroid score),该分数衡量类质心相对于类内变异的分离程度。最终特征分数计算为游程纯度分数与缩放质心分数的乘积;因此,高排名特征必须同时具备紧凑的类标签排序和强烈的类判别能力。随后直接选择排名靠前的特征,无需聚类、包装器搜索或分类器依赖训练。研究人员在七个高维基因表达数据集上,使用重复分层训练/测试实验,结合k最近邻(k-Nearest Neighbors, kNN)和支持向量机(Support Vector Machine, SVM)分类器对该方法进行了评估。研究人员将其与六种特征选择方法在不同排名靠前特征子集上进行比较,使用分类误差、Cohen’s kappa和F1分数。结果表明,在所研究的基因表达数据集上,所提方法为高维基因表达分类中选择信息性特征提供了一种有效且计算高效的过滤方法。
## 论文解读:游程纯度加权最近收缩质心特征选择方法在高维基因表达分类中的应用

### 研究背景与问题

高维基因表达分类是机器学习、生物信息学和医学决策支持中的重大挑战。在基因表达和癌症分类等生物医学应用中,测量特征数量远多于可用样本数量。这种“小样本、大特征”的设置使分类困难,因为许多特征可能不相关、含噪声、弱判别或冗余,从而增加过拟合风险并削弱学习模型的泛化能力。特征选择作为关键的预处理技术,旨在挑选少量信息变量并消除冗余变量,以提高分类准确率、降低计算复杂度并增强模型可解释性。然而,现有方法大多基于全局类分离、统计依赖、质心距离或优化搜索,但忽略了一个重要方面:一个特征可能展现良好的类分离,但在按该特征排序样本后仍产生混合的类标签。这种标签混合会削弱特征的判别信息,尤其在多类问题中。因此,有必要设计一种同时考虑类质心分离和类标签顺序紧凑性的特征选择方法。

### 研究内容与结论

研究人员提出了一种名为“游程纯度加权最近收缩质心”(Run Purity Weighted Nearest Shrunken Centroid, RPWNSC)的过滤式特征选择方法。该方法通过乘法评分机制整合两个互补准则:游程纯度分数(run purity score)评估按特征排序样本后类标签的紧凑性;标准化最近收缩质心分数(nearest shrunken centroid score)衡量类质心相对于类内变异的分离程度。高排名特征必须同时具备紧凑的类标签排序和强烈的判别能力。在七个高维基因表达数据集上,使用重复分层训练/测试(500次重复,70%训练、30%测试)结合kNN和SVM分类器进行实验,并与六种对比方法(PAMNSC、CEI、CNC、Fisher score、RFTOPSIS、MRMR)在5至30个不同特征子集大小上比较。结果显示,RPWNSC在多数数据集中优于或媲美对比方法,尤其在中小型特征子集上表现突出。统计检验(配对Wilcoxon符号秩检验经Holm校正)表明差异显著。消融实验证实乘法组合优于单独组分或加法组合。运行时分析显示RPWNSC在保证性能的同时具备良好的计算效率。该论文发表在《Machine Learning with Applications》。

### 主要技术方法

研究人员主要采用了以下关键技术:1) **游程纯度分数**:对每个特征排序样本后,将有序类标签序列划分为连续同类的“游程”,并计算类内游程长度平方和与样本数平方的比值,再求所有类的均值,以量化类标签的紧凑性。2) **最近收缩质心分数**:借鉴微阵列预测分析(Prediction Analysis for Microarrays, PAM)中的标准化质心差异,计算每个特征下各类质心与总体质心的标准化距离平方和,并缩放至[0,1]区间。3) **乘法组合评分**:将游程纯度分数与缩放质心分数相乘作为最终特征分数。该方法为过滤式,不依赖分类器训练、聚类或包装器搜索。实验使用7个来自公开数据库(datamicroarray和OpenML)的高维基因表达数据集,如Huntington’s disease、ALLAML、乳腺癌等,包含二类和多类问题。

### 研究结果

#### 4.1 比较分类性能

- **D1数据集(Huntington’s disease)**:对于kNN分类器,RPWNSC在所有选定特征子集大小上取得最低分类误差(0.043至0.040)和最高Cohen’s kappa及F1分数。对于SVM,RPWNSC在5、10、15个特征时表现最佳,更大子集时CNC、Fisher score和RFTOPSIS具有竞争力。
- **D2数据集(Tumors–C7)**:kNN下RPWNSC持续所有子集性能最优(误差从0.389降至0.335);SVM下在10-30特征时最佳,仅5特征时PAMNSC略优。
- **D3数据集(ALLAML)**:kNN下RPWNSC在5、10特征时最佳或并列最佳,15-30特征时MRMR更强;SVM下5特征时RPWNSC最佳,更大子集时MRMR最优。
- **D4数据集(Breast cancer–Chowdary)**:kNN下RPWNSC在5-20特征时所有指标最佳,25-30特征时MRMR有竞争力;SVM下在5、10特征时最强。
- **D5数据集(Breast cancer–Chin)**:kNN下PAMNSC多数子集最优,但RPWNSC在20、25特征时并列最低误差;SVM下RPWNSC在所有子集取得最佳或并列最佳误差。
- **D6数据集(Leukemia–37)**:kNN下RPWNSC在5、10特征时最佳,更大子集时RFTOPSIS和PAMNSC更强;SVM下5特征时最佳,10-30特征时PAMNSC最优。
- **D7数据集(Leukemia–47)**:kNN下RPWNSC在所有子集上分类误差最低(0.191降至0.141),kappa和F1也最高;SVM下除5特征外MRMR略优,其余子集RPWNSC最佳。

#### 4.2 误差分布与统计显著性

使用配对Wilcoxon符号秩检验(经Holm校正)对比RPWNSC与各对比方法在500次重复中的平均分类误差。对于kNN,除与PAMNSC在D5数据集上不显著(p=0.057)外,其余比较均显著(p<0.05);对于SVM,同样除D5数据集上PAMNSC外(p=0.152),其余均显著。表明RPWNSC在多数数据集和分类器下显著优于或不同于对比方法。

#### 4.3 消融研究

比较四种变体:游程纯度分数Rj、缩放质心分数?j、等权重加法分数0.5Rj+0.5?j和乘法分数Rj?j。在全部七个数据集上使用10折交叉验证,平均分类误差显示乘法分数对kNN(0.096)和SVM(0.089)均最低,证实乘法组合优于单独组分或加法组合。

#### 4.4 计算运行时分析

在相同环境下测量特征排名阶段平均运行时间(秒)。RPWNSC的平均运行时间为2.193秒,快于CEI(11.655秒)、RFTOPSIS(16.029秒)和MRMR(11.804秒),但慢于PAMNSC(0.379秒)、CNC(0.386秒)和Fisher score(0.391秒)。表明RPWNSC在性能与计算效率之间实现了良好平衡。

### 讨论与结论

讨论部分指出了RPWNSC作为过滤式方法的局限性:未显式去除冗余特征,可能保留高度相关的基因;游程纯度分数可能受噪声和类不平衡影响;特征独立于最终分类器。未来工作可加入冗余减少步骤、鲁棒预处理或类加权游程纯度,以及作为初始筛选后接轻量级优化步骤。结论部分翻译如下:

**结论**:本文提出了一种用于高维基因表达分类的游程纯度加权最近收缩质心(RPWNSC)特征选择方法。该方法通过乘法评分方案整合两个互补准则:基于游程的纯度分数(评估按特征排序后类标签的紧凑性)和缩放最近收缩质心分数(衡量标准化类质心分离)。RPWNSC将更高排名分配给同时提供紧凑类标签排序和强判别能力的特征。在七个基准高维基因表达数据集上,使用重复分层训练/测试实验和kNN及SVM分类器进行评估,并与六种竞争方法(PAMNSC、CEI、CNC、Fisher score、RFTOPSIS、MRMR)在不同特征子集大小上比较。实验结果表明,RPWNSC取得了有竞争力且经常优越的分类性能,尤其在中小型基因子集上。统计检验、运行时比较和消融研究进一步支持了RPWNSC的有效性。因此,RPWNSC为高维基因表达特征选择提供了一种简单、分类器独立且计算高效的过滤方法。实证结果表明,结合类标签紧凑性和标准化质心分离可以产生一种有效且可解释的特征排名策略,用于基因表达分类。

订阅生物通快讯

订阅快讯:

最新文章

限时促销

会展信息

关注订阅号/掌握最新资讯

今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

版权所有 生物通

Copyright© eBiotrade.com, All Rights Reserved

联系信箱:

粤ICP备09063491号