《Knowledge-Based Systems》:SWARM : A novel Sample Weighting Approach for Rare Minority data classification in imbalanced and evolving data streams
编辑推荐:
摘要在流式数据中,类别不平衡与概念漂移同时存在,给分类算法带来了严峻的挑战。那些分散在大量多数类数据中的稀有少数类样本,距离密集的少数类区域较远,使得此类场景下的学习更加困难。本文提出了SWARM方法,这是一种用于处理不平衡且持续变化的流式数据中稀有少数类数据分类的样本加权策略。
摘要
在流式数据中,类别不平衡与概念漂移同时存在,给分类算法带来了严峻的挑战。那些分散在大量多数类数据中的稀有少数类样本,距离密集的少数类区域较远,使得此类场景下的学习更加困难。本文提出了SWARM方法,这是一种用于处理不平衡且持续变化的流式数据中稀有少数类数据分类的样本加权策略。该方法采用一种名为WIRE(加权实例重采样引擎)的新颖实例加权与重采样技术,该技术利用误分类成本来处理难以学习的稀有少数类样本,通过邻域分析制定权重策略以重点关注稀有少数类数据,并引入衰减因子使权重能够适应数据流的动态变化。此外,该方法还采用考虑类内稀有性及多数类数据的重采样策略,从而生成平衡的训练数据集。R3D集成组件负责管理并优化集成模型,它通过基于分类器多样性和加权召回率的多目标优化方法,对分类器进行筛选并调整集成模型中的样本数量。实验在57个具有类别不平衡、稀有少数类样本及概念漂移特征的数据流上进行,与10种现有先进方法相比,结果表明所提方法在提升召回率及获得更高G-Mean分数方面具有显著优势。
引言
数据流作为一种高级数据形式,广泛应用于各种现实场景,如Web服务器日志、金融交易记录、传感器网络等。传统的机器学习算法适用于离线或静态数据,但难以适应数据流的动态特性,从而导致性能不佳。因此,有必要为非静态数据环境开发专门的算法。在有历史标注数据的场景下,监督式数据流分类方法可有效解决许多实际问题,例如垃圾邮件过滤或网络传感器故障检测[1]、[2]。
在监督式数据流分类面临的诸多挑战中,类别不平衡和概念漂移会降低算法性能。类别不平衡指的是少数类数据占比过低,导致学习算法难以察觉到这些数据,进而更关注数量众多的多数类数据。针对这一问题,可通过设计数据级重采样策略、采用成本敏感型算法以及运用集成方法来解决。另一方面,数据流中概念的不断变化会使学习算法逐渐过时。为应对这一情况,相关研究提出了主动式(检测并调整)和被动式(按预定间隔重置)解决方案。也有不少方法致力于解决同时存在类别不平衡和概念漂移条件下的数据流监督分类问题[3]。
不断变化的失衡数据所带来的复杂性及数据难度因素,给算法带来了巨大的学习挑战。这些数据难题包括少量分布零散的少数类样本、边界案例、重叠的多数类数据以及极为稀少的少数类样本。其中,稀有少数类样本尤其难以处理——它们数量稀少,与其他少数类样本相隔较远,且深埋在密集的多数类数据区域之中[4]、[5]、[6]、[7]、[8]、[9]。近期有一些研究致力于解决这些复杂问题。例如,Pro-IDD[5]提出了一种重采样机制,可用于处理失衡且非静态数据环境中的少量少数类样本及重叠的多数类数据。类似地,基于流式聚类的合成少数类过采样方法(SMOClust)[6]则利用聚类技术,在少数类数据的微集群中生成合成样本,以覆盖其密集分布区域。其他相关方法还包括用于处理高度失衡数据的EMRIL[7]、用于处理伴随类别不平衡的概念漂移问题的ICIL[8],以及用于解决失衡环境中信息缺失问题的Bin.INI[9]。然而,这些方法均未能有效处理稀有少数类样本问题。研究表明,当面对稀有少数类样本时,现有方法的性能往往不尽如人意。由于数据平衡常采用过采样手段,这可能会掩盖样本的真实稀有性,进而增加误分类的风险。此外,现有的成本敏感型方法在为样本分配成本时并未考虑稀有数据带来的难度因素,从而导致性能不佳[3]、[7]。
鉴于上述挑战,本文提出了SWARM方法,这是一种基于集成的样本加权策略,旨在提升失衡且持续变化的数据流中稀有少数类数据的分类性能。首先,WIRE(加权实例重采样引擎)组件提供了一种实例加权与重采样策略。在批量/窗口式处理模式下,可通过误分类成本来计算被误分类的少数类样本的权重。同时,会对当前批次中的每个少数类样本进行分析,并根据其周围预定义半径范围内的邻域结构为其分配权重。此外,还会根据样本的稀有程度为每个批次中的样本分配权重,优先考虑那些较为稀少的少数类样本。与此同时,WIRE会在关键区域进行重采样操作,以确保训练数据集的平衡性。这些措施提升了少数类数据,尤其是稀有样本的可见度。R3D集成组件则负责管理集成模型,它包含一个优化过程,用于根据三种多样性指标及历史加权召回率表现来选择合适的分类器,从而构建集成模型。这些组件共同使得所提方法能够有效应对类别不平衡和概念漂移问题,尤其是在涉及多种类型稀有少数类数据的场景中。在57个数据流上进行的广泛实验表明,与10种现有先进方法相比,该方法的召回率有显著提升,对应的G-Mean分数也更为优异。综上,本文的主要贡献如下。
- 1.
提出了一种用于数据流中二分类监督学习的新型模型,该模型能够同时解决概念漂移和类别不平衡问题。
- 2.
设计了一种创新的实例加权策略,能够根据动态环境中的误分类模式及少数类样本的稀有程度,自适应地为批量样本分配权重。此外,该方法还引入了一种针对性的重采样技术,通过在数据的具体区域结合欠采样与过采样操作,构建出平衡的训练集。
- 3.
设计了一个动态的集成模型剪枝组件,该组件通过解决多目标优化问题,依据三种多样性指标及历史加权召回率表现来选择合适的分类器。
- 4.
在57个数据流上进行了全面评估,这些数据流被特意设计为涵盖多种不同场景,包括稀有少数类样本、静态与动态的类别不平衡比例,以及各类概念漂移情况。
本文的其余结构如下:第2节将对相关文献进行简要综述;第3节介绍所提出的方法;第4节阐述为验证该方法有效性而开展的实验;第5节对全文进行总结,并指出未来可能的研究方向。
章节要点
相关工作
目前仅有少数研究致力于解决失衡且持续变化的数据流中的分类问题。
SWARM:一种用于稀有少数类数据分类的样本加权方法
本节将通过详细介绍其各组成部分来阐述所提出的方法。图1展示了该方法的流程图。所提方法主要由两个部分构成,即WIRE和R3D集成组件。WIRE的功能是为批量样本分配权重,并对数据进行重采样,从而为集成模型中的分类器准备平衡的训练数据。R3D集成组件的作用则是管理集成模型,包括添加/删除分类器以及对模型中的样本进行剪枝,以此构建最终的集成模型。
实验与分析
本节旨在通过实验验证所提方法的有效性。该方法在52个合成数据流和5个真实数据流上与10种现有先进方法进行了对比测试,实验结果以表格和图表形式呈现。
局限性及未来工作
尽管所提方法需要更高的计算时间,但其相比其他算法具备更高的G-Mean性能,这体现了其在实现平衡分类方面的显著优势。在那些对检测质量,尤其是少数类样本的检测质量要求极高的应用场景中,较高的性能足以弥补额外的计算成本。不过,在对处理速度要求极高的场景中,则需仔细权衡性能与计算时间之间的关系。未来仍可进一步开展相关研究。
结论
本研究提出了一种全新的实例加权与重采样方法,用于在失衡且非静态的数据环境中对稀有少数类数据进行分类。WIRE组件负责在批量处理模式下计算样本权重,随后利用这些加权样本来训练分类器。权重是根据样本的误分类情况及其稀有程度来确定的,最终这些加权数据会被用于分类器的训练。
CRediT作者贡献说明
Muhammad Usman:撰写原始稿件、软件开发、方法设计、正式分析、概念构思。Muhammad Usman:参与稿件审阅与编辑、项目指导、资源协调。
利益冲突声明
作者声明,他们不存在任何可能影响本文研究结果的已知财务利益关联或个人关系。
Muhammad Usman|Muhammad Usman