具有边缘方差正则化特征重构的注意力增强自编码器,用于不平衡的保险单所有权分类

《Entropy》:Attention-Enhanced Autoencoder with Marginal-Variance-Regularized Feature Reconstruction for Imbalanced Insurance Policy-Ownership Classification

【字体: 时间:2026年09月04日 来源:Entropy 2.1

编辑推荐:

   摘要

  

摘要

在严重不平衡的表格数据中识别持有特定保单的少数客户群体是保险分析中的一个常见筛选问题。本研究基于COIL 2000基准数据集,探讨了二分类问题,其中阳性类别的占比低于6%。该数据集为单一横截面数据,因此标签表示当前的消费情况而非未来的购买行为。我们提出了一种基于注意力机制的对称自动编码器(ASAE),该模型结合了辅助的对称重构分支、通道注意力门以及针对32维潜表示的边际对数方差正则化机制。该正则化机制作用于各个潜在变量的方差,并被视为一種启发式方法,而非联合差分熵的估计器。在统一的调整和评估协议下,ASAE与五种传统的机器学习方法及七种神经模型进行了对比。经过五次独立运行,其F1分数为0.6008 ± 0.0115,接收者操作特征曲线下面积(AUC)为0.8584 ± 0.0034。与作为最强基线的TabNet相比,ASAE在F1分数上的平均优势为0.064(95%置信区间0.043–0.085),AUC上的平均优势为0.032(95%置信区间0.017–0.048)。这种优势在五种不同的数据分层方式、四种不平衡处理配置以及完整的类型一致性预处理流程中均得到保持;在这一流程中,名义属性通过one-hot编码处理,使用SMOTENC进行过采样,并通过分类交叉熵损失进行重构(F1分数为0.6241 ± 0.0074,AUC为0.8702 ± 0.0050)。所有报告的结果均基于COIL 2000数据集的分层随机划分得出。由于27%的记录与其他记录具有相同的预测向量,因此还定义了额外的官方分离方式和分组划分方式,以便将完全重复的记录与社会人口统计特征的重叠部分从主要数据集中分离出来。用于生成报告表格的训练代码、数据划分索引及每次运行的预测结果均可供公开获取。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号