《Journal of Computational Science》:Missing Mechanisms Respectful Data Amputation (MMRDA) : A new strategy to realistically assess imputation techniques on tabular datasets with unknown missing data mechanisms
编辑推荐:
在数据科学中,缺失数据(Missing Data, MD)的处理方法涵盖从基础插补(如均值插补)到复杂方法(如机器学习(Machine Learning, ML))。评估这些方法通常包括截肢数据后再插补截肢值以与真实值比较。现有截肢方法多为随机截肢(Rando
在数据科学中,缺失数据(Missing Data, MD)的处理方法涵盖从基础插补(如均值插补)到复杂方法(如机器学习(Machine Learning, ML))。评估这些方法通常包括截肢数据后再插补截肢值以与真实值比较。现有截肢方法多为随机截肢(Random Amputation, RA)或基于已知缺失数据机制(Missing Data Mechanisms, MDM)的参数化方法。现实世界数据集中的MD可能遵循复杂模式,且具体MDM往往无法确切判定,导致现有截肢方法难以在真实数据集上恰当应用。研究人员提出缺失机制尊重型数据截肢(Missing Mechanisms Respectful Data Amputation, MMRDA)作为生成合成MD的新方法,并研究数据截肢方法对插补技术评估结果的影响。MMRDA与RA在开放数据集上比较,显著优于RA(性能提升+7%至+44%,p<0.001)。使用四种知名插补技术比较MMRDA后与RA后的插补性能,差异显著,且针对给定数据集,最佳插补性能并非总由同一插补器在两种截肢下同时取得。这表明MDM影响插补,复杂机制的归属仍待探索。研究人员建议所有研究者在插补技术评估或比较中密切关注所用截肢方法,尤其在真实世界数据集上。
研究背景与问题提出
在电子健康记录(Electronic Health Record, EHR)、调查数据等真实表格数据集中,缺失数据(Missing Data, MD)普遍存在,若直接删除含MD样本会引入偏倚。插补(Imputation)技术从均值法演进至基于生成对抗网络(Generative Adversarial Networks, GAN)、变分自编码器(Variational Autoencoders, VAE)或扩散模型的方法,但其性能评估依赖将稠密子集“截肢”后重新插补并与真值比对。传统随机截肢(Random Amputation, RA)默认完全随机缺失(Missing Completely At Random, MCAR)机制,而现实MD常混合MCAR、随机缺失(Missing At Random, MAR)与非随机缺失(Missing Not At Random, MNAR),且同一变量内亦可并存多机制,人工判定机制分布极难。已有pyampute等工具需预置MDM与权重,无法自动适配未知场景。因此,截肢策略若脱离实际MD情境,会使插补评估失真,甚至错选最优插补器。为回答“无机制先验下能否忠实截肢”“RA是否为未知MDM下的默认最优”“截肢方式是否显著改变插补评估”三个问题,研究人员设计MMRDA。
主要研究内容与结论意义
研究人员将截肢转化为二元分类任务(预测单元缺失状态0/1),提出MMRDA:以稀疏数据集各列实际缺失状态为监督信号,按缺失量排序后逐列训练树基模型(最终选Random Forest, RF),用稠密列及已处理列的二值缺失状态作特征,学习真实缺失位置分布;推理时对稠密子集逐列预测缺失概率,按原列缺失率Rj截取概率最接近0的样本置为MD,从而在不显式推断MDM前提下复现原数据集缺失格局。论文发表于《Journal of Computational Science》。实验在急诊科(Amiens-Picardy University Hospital, APUH)EHR(EM)及Diabetes130、Stroke、Adult、Titanic等9个开放集上展开,MMRDA(RF后端)截肢状态预测AUROC达0.575–0.938(RA恒为0.5),p<0.001;原缺失率保真度δ≤0.35%。在后续插补评估中,连续变量整体RA后RMSE略低,类别变量MMRDA后准确率更高,且“最优插补器”随截肢法切换而变(如Simulated集连续变量GAIN在MMRDA下最优、IterativeImputer在RA下最优),证明截肢位置分布显著干扰评估结论。该研究意义在于:首次给出无需MDM标注、资源节约(frugal)的自动截肢器,揭示RA在真实集上的评估偏差,呼吁插补基准测试须报告截肢协议。
主要关键技术方法(≤250字)
研究人员采用10折分层交叉验证,稠密子集截肢率严格对齐原列Rj;分类后端比选XGBoost、KNN、GaussianNB、RF后定RF;缺失状态经MMRDAbinarization转为0/1,按列缺失数降序(Desc)或升序(Asc)迭代训练TrainMMRDAcolumn,推理用ApplyMMRDAcolumn按概率截断。插补端选用IterativeImputer、KNNImputer(k=10)、miceforest版MICE、hyperimpute版GAIN,固定随机种子;连续变量用min–max归一化RMSE、类别用Accuracy,配对t检验(p≤0.05)判显著。样本含APUH急诊2018–2023年EHR(n=319,460)及9个公开队列。
研究结果
3.1 主要问题:截肢即缺失状态分类,MMRDA以二值化稀疏集训树模,免生成式高耗,适配未知MDM。
3.2 插补评估形式化:定义amputator与imputator算子,RA按Rj随机抽删,MMRDA按学习分布置缺。
3.3 MMRDA全局流程:无稠密列时createDenseColumn融合观测数值与类别频次秩并min–max归一;MMRDAtrain学位置,MMRDAapply施于稠密部。
3.4 详细流程:训练阶段MMRDAbinarization(式1)将Xi,j映为X?i,j∈{0,1},按缺量排序后逐列TrainMMRDAcolumn以实际状态防误差传播;应用阶段隔离Xdense,逐列ApplyMMRDAcolumn预测,截R%最似0者为缺(式2还原数值)。
4.1 数据来源:EM集+Diabetes130、Stroke、Adult、Titanic、Simulated、Fashion、Water、Freelancers、Retail Product共10集,含全稀疏Retail集作边界测试。
4.2 评估指标:截肢质量用AUROC/AUPRC;插补用归一RMSE与Accuracy;保率δ为次要结局。
4.3 实验条件:Python 3.11,HPC与MacBook M2双环境,10折90/10划分,scipy.ttest_rel配对检验。
4.4.1 截肢结果:RF版MMRDA全面胜RA(p<0.001),Desc/Asc无显著差异;RA保率稍优但AUROC=0.5;训练耗时随样本与类别基数升而增。
4.4.2 插补评估结果:连续变量平均RMSE RA略优(MMRDA平均0.207 vs RA 0.204,IterativeImputer例),但EM、Stroke等集MMRDA显著优;类别变量MMRDA后IterativeImputer在Stroke集准确率0.575 vs RA 0.535(p<0.001),而Freelancers集反是RA优;最优插补器因截肢法而异,证实截肢位置分布构成评估协变量。
讨论与结论翻译
讨论指出MMRDA不显式输出MDM标签,借列序(Desc/Asc)与树模泛化捕获真实缺失格局,在EM等临床大数据上AUROC仅0.575说明即便学习器亦难完全复原高度混杂缺失,但已远胜MCAR假设;RA虽保率精确,却因机制错配致插补评估偏向MCAR情境,可能高估/错配插补器。局限含二值化丢数值幅值信息、逐列顺序敏感、未显式分拆MNAR。未来可融多模态与因果发现。
结论部分原文意译:研究人员提出MMRDA,一种无需先验缺失机制即可在稀疏表格集稠密部生成合成MD的截肢法;相较于RA,其截肢位置保真度显著提升(p<0.001,+7%至+44%),且截肢协议的选择会显著改变四款主流插补器的评估名次,故在真实世界插补基准中必须声明截肢策略,否则结论存偏。