摘要
在现实世界的数据集中,类别不平衡现象非常普遍。少数样本的数量远远少于多数样本。传统的分类器设计通常假设数据是平衡的,这导致分类器在面对不平衡的数据集时偏向于多数类别。因此,在医疗和金融等关键领域,少数类别的误分类代价非常高。大多数现有的用于处理不平衡问题的过采样方法(如SMOTE(合成少数样本过采样技术))存在一些局限性,比如对噪声的敏感度、未能考虑少数类别的子聚类结构以及适应样本分布异质性的能力较差。本文提出了一种新的过采样算法——自适应加权合成少数样本过采样技术(AW-SMOTE),以解决这些问题。该算法包含三个逐步执行的阶段:在第一阶段,DBSCAN(含有噪声的基于密度的空间聚类)算法识别少数样本的分布结构,并在去除噪声干扰的同时发现潜在的子聚类,为后续的采样工作奠定了坚实的基础。在第二阶段,使用每个簇中最具代表性的边界样本来评估该簇的权重,并根据这些权重将合成样本的总数分配给不同的簇,从而实现全局样本质量的提升。在第三阶段,在每个簇内部进行自适应样本生成,同时考虑边界紧密性和局部密度的两个因素,并利用Sigmoid函数动态调整权重比例。最后,在关键区域合成新的样本,以保持分布特征的同时提高分类的区分能力。通过对KEEL仓库中的标准数据集进行实验,验证了该算法的可行性和有效性。


