《Healthcare》:Leakage-Controlled and Survey-Weighted Machine Learning for Neonatal Mortality Risk Prediction Using NFHS-5 Data
编辑推荐:
背景:新生儿死亡率在印度各邦之间仍不均衡,而利用调查数据进行预测的研究常受限于类别不平衡、数据泄漏、校准不足以及对复杂调查设计考虑不充分。本研究开发并严格评估了使用NFHS-5?数据的调查感知机器学习模型,用于新生儿死亡风险预测。方法:分
背景:新生儿死亡率在印度各邦之间仍不均衡,而利用调查数据进行预测的研究常受限于类别不平衡、数据泄漏、校准不足以及对复杂调查设计考虑不充分。本研究开发并严格评估了使用NFHS-5?数据的调查感知机器学习模型,用于新生儿死亡风险预测。方法:分析了来自比哈尔邦、恰蒂斯加尔邦和北阿坎德邦的33,338名儿童的数据。采用了家庭分组开发/测试分割、重复分组嵌套交叉验证、DHS抽样权重、折叠内预处理、社会经济聚类、粒子群优化、重采样和折叠外特征增强。比较了逻辑回归、随机森林、直方图梯度提升(HGB)和人工神经网络,以PR-AUC为主要指标。进行了校准、家庭bootstrap置信区间、决策曲线分析、预测时间点分析和留一州验证。结果:HGB在重复交叉验证中取得了最高的PR-AUC(0.189)和ROC-AUC(0.778)。在未触及的测试集上,ROC-AUC为0.755(95% CI 0.718–0.796),PR-AUC为0.202(0.138–0.267),敏感度为0.813,特异度为0.517,阳性预测值(PPV)为0.063,阴性预测值(NPV)为0.989。聚类、PSO、SMOTE(合成少数类过采样技术)和特征增强贡献甚微。产前预测性能较弱,各州间可迁移性存在差异。结论:调查加权HGB提供了最强的预测性能,但较低的PPV和异质性的州级结果限制了其仅适用于低成本筛查。在部署前需进行前瞻性验证。
**论文解读:基于NFHS-5数据的泄漏控制与调查加权机器学习在新生儿死亡风险预测中的应用**
**研究背景与意义**
新生儿死亡率是全球公共卫生的重要指标,印度在2024年的新生儿死亡率约为每千活产17例,但各邦间差异显著。比哈尔邦、恰蒂斯加尔邦、北阿坎德邦等地区的新生儿死亡率超过每千活产30例,且母婴健康服务可及性存在严重不平等。传统统计建模方法虽能识别部分风险因素,但在处理调查数据时面临类别不平衡、数据泄漏、校准不足以及对复杂调查设计(如分层多阶段整群抽样)的忽视等局限。近年来,机器学习(ML)和深度学习(DL)方法在健康结局预测中展现出潜力,但早期研究在预处理、特征选择、重采样等步骤中常未严格限制于训练数据,导致乐观的性能估计;同时,评估指标过度依赖准确率和ROC-AUC,而忽视罕见事件所需的PR-AUC、校准和不确定性估计。此外,简单随机分割可能将同一家庭或母亲的子女分配到训练和测试集,忽略了DHS抽样权重和聚类结构。为此,本研究旨在开发一个家庭分组、泄漏控制、调查感知的建模框架,利用NFHS-5
?数据评估新生儿死亡风险预测模型的真实性能,并比较不同学习器及复杂组件(如社会经济聚类、粒子群优化(PSO)、SMOTE、特征增强)的边际贡献。该研究发表于《Healthcare》。
**关键技术方法**
研究人员使用了2019–2021年印度国家家庭健康调查第五轮(NFHS-5
?)中来自比哈尔邦、恰蒂斯加尔邦和北阿坎德邦的33,338名儿童记录。主要技术方法包括:家庭分组开发/测试分割(确保同一家庭或母亲不跨组)、重复分组嵌套交叉验证(内层进行预处理、聚类、PSO、重采样、特征增强等,外层评估性能)、DHS抽样权重(用于非重采样模型的训练与加权评估)、折叠内预处理(所有变换仅基于训练折叠)、社会经济聚类(K均值聚类,仅基于训练数据拟合)、二进制粒子群优化(PSO)特征选择(12个粒子、12次迭代,以PR-AUC为准则)、SMOTE(合成少数类过采样)重采样(仅对训练折叠进行)、折叠外特征增强(通过一级模型预测四个中间结局的概率作为二级特征)、概率校准(基于开发折叠预测)、阈值选择(目标约80%加权敏感度)、决策曲线分析、家庭分组bootstrap置信区间以及留一州验证(跨三州内部地理验证)。
**研究结果**
**3.1 研究人群与分析完整性**
最终分析数据集包含33,338名儿童记录:比哈尔邦21,040条(736例新生儿死亡),恰蒂斯加尔邦8,514条(252例死亡),北阿坎德邦3,784条(104例死亡)。调查加权新生儿死亡率分别为3.43%、3.06%和3.31%。家庭分组划分将26,652条记录用于开发,6,686条用于最终测试,无家庭或母亲跨组。
**3.2 所选模型的整体预测性能**
通过重复家庭分组嵌套交叉验证,以PR-AUC为主要选择指标,直方图梯度提升(HGB)被选为最终学习器。在未触及的最终测试集上,模型ROC-AUC为0.755(95% CI: 0.718–0.796),PR-AUC为0.202(95% CI: 0.138–0.267)。在完全嵌套的开发折叠预测中选定的筛查阈值下,敏感度为0.813(95% CI: 0.782–0.890),特异度为0.517(95% CI: 0.512–0.540),阳性预测值(PPV)为0.063(95% CI: 0.052–0.074),阴性预测值(NPV)为0.989(95% CI: 0.984–0.992)。Brier得分为0.033,校准截距为0.922,校准斜率为1.242,期望校准误差为0.017。
**3.3 候选学习器比较**
在相同的重复家庭分组验证下,HGB的平均PR-AUC最高(0.189),其次为逻辑回归(0.164)、人工神经网络(0.159)和随机森林(0.152)。对应的平均ROC-AUC分别为0.778、0.757、0.753和0.771。HGB与基线逻辑回归的校正配对比较显示平均PR-AUC差值为0.037(校正95% CI: 0.007–0.068;校正p=0.019)。
**3.4 框架组件的边际贡献**
基线逻辑回归的平均PR-AUC为0.151。添加社会经济聚类后为0.152,PSO特征选择为0.161,聚类与PSO组合为0.164,进一步添加SMOTE为0.162,添加折叠外特征增强也为0.162,完整逻辑回归管道为0.159。所有组件相对于基线逻辑回归的校正置信区间均包含零,表明无显著改进。
**3.5 不同信息时间点的预测性能**
产前模型的ROC-AUC为0.688,PR-AUC为0.081,敏感度0.802,特异度0.423。分娩时间模型(增加分娩时及产后即刻信息)的ROC-AUC为0.778,PR-AUC为0.184,敏感度0.846,特异度0.545。回顾性上限模型(使用全部特征)的ROC-AUC为0.771,PR-AUC为0.196,敏感度0.768,特异度0.593。所有时间点的NPV均较高(0.983–0.989),但PPV较低(0.050–0.067)。
**3.6 地理可迁移性**
留一州验证显示性能存在异质性:当比哈尔邦被留出时,ROC-AUC为0.731,PR-AUC为0.147,敏感度0.949,特异度0.241;恰蒂斯加尔邦被留出时,ROC-AUC为0.823,PR-AUC为0.295,敏感度0.746,特异度0.692;北阿坎德邦被留出时,ROC-AUC为0.786,PR-AUC为0.184,敏感度0.806,特异度0.645。NPV在所有情况下均较高(≥0.989)。
**3.7 调查加权关联分析**
在调查加权惩罚逻辑回归中,早产(OR=1.235,95% CI: 1.158–1.312)、低出生体重(OR=1.319,95% CI: 1.228–1.414)和机构分娩(OR=1.552,95% CI: 1.421–1.712)与新生儿死亡率正相关;产后儿童护理(OR=0.674,95% CI: 0.539–0.855)负相关。未成年或高龄妊娠、失败妊娠史、四次及以上产前检查、18岁前结婚的置信区间包含零。
**讨论与结论**
讨论部分指出,所选HGB模型在区分新生儿死亡与存活者方面表现中等,高敏感度和NPV使其适用于低成本初步筛查,但低PPV导致大量假阳性警报,不适合作为诊断或自动转诊工具。校准结果总体可接受,但截距估计不精确,提示在部署前需重新校准。学习器比较显示HGB优于其他模型,而人工神经网络未优于简单模型,表明在结构化表格数据、稀有事件背景下,树集成方法更具优势。社会经济聚类、PSO、SMOTE和特征增强未带来显著增益,强调模型选择比组件堆叠更重要。产前预测性能弱于分娩时间模型,提示早期干预需额外数据源。地理验证显示性能差异,尤其比哈尔邦特异度低,需州级重新校准和阈值调整。调查加权关联分析中,早产和低出生体重与新生儿死亡正相关,机构分娩的正相关可能反映病情严重程度选择偏倚,产后护理负相关提示早期评估价值,但均为关联而非因果。研究优势包括家庭分组分裂、严格泄漏控制、综合评估指标等;局限性包括数据依赖回忆、罕见事件导致宽置信区间、无独立外部验证、产前预测弱、未评估前瞻性实施等。未来需在常规HMIS数据中前瞻性验证,评估公平性、成本效益和工作流程整合。
**结论翻译**:本研究开发并评估了一个基于NFHS-5
?数据(来自比哈尔邦、恰蒂斯加尔邦和北阿坎德邦)的家庭分组、泄漏控制、调查感知的新生儿死亡风险预测框架。在所评估的学习器中,直方图梯度提升(HGB)取得了最强的整体性能,在未触及的最终测试集上表现出中等区分能力、可接受的校准、高敏感度和极高的阴性预测值。然而,低阳性预测值表明存在大量假阳性警报,限制了该模型目前仅适用于低成本风险筛查,而非诊断、自动转诊或治疗决策。控制消融分析显示,社会经济聚类、PSO特征选择、SMOTE和折叠外特征增强未提供显著额外预测益处。性能更强烈地依赖于所选学习器和信息可获取的时间点。分娩时间预测比产前预测更具信息量,而地理验证显示三个州间存在显著差异,尤其在特异度方面。这些发现支持进一步开发新生儿风险筛查框架,但未证明因果效应、改善的新生儿结局或已完全实施的决策支持系统。在操作部署前,需要在常规临床或HMIS环境中进行前瞻性验证,在更多人群中进行外部评估,进行州级重新校准,并评估工作流程负担、公平性、安全性和成本效益。