神经重症监护患者住院死亡率早期预测的可解释机器学习模型开发与外部验证

《Frontiers in Neurology》:Development and external validation of an interpretable machine learning model for early prediction of in-hospital mortality in neurocritical care

【字体: 大 中 小 】 时间:2026年09月25日 来源:Frontiers in Neurology 3.3

编辑推荐:

  背景:早期风险评估是神经重症监护的常规组成部分,然而死亡率预测仍然困难,因为神经损伤常与呼吸、循环、肾脏和炎症功能障碍并存。本研究旨在开发和外部验证一种可解释机器学习(ML)模型,利用重症监护病房(ICU)入院后最初24小时内可获得的变量,预测神经重症监护患者

  
背景:早期风险评估是神经重症监护的常规组成部分,然而死亡率预测仍然困难,因为神经损伤常与呼吸、循环、肾脏和炎症功能障碍并存。本研究旨在开发和外部验证一种可解释机器学习(ML)模型,利用重症监护病房(ICU)入院后最初24小时内可获得的变量,预测神经重症监护患者的住院死亡率。

方法:研究人员开展了一项回顾性队列研究,使用了两个公共重症监护数据库。重症监护医学信息市场IV数据库(MIMIC-IV)用于模型开发和内部测试,eICU协作研究数据库(eICU-CRD)用于独立外部验证。该报告遵循个体预后或诊断的多变量预测模型透明报告(TRIPOD)声明。通过预定义的国际疾病分类编码识别成年ICU神经重症监护诊断患者。候选预测因子仅限于ICU入院后最初24小时内记录的信息,包括人口统计学、合并症、生命体征、实验室结果、神经系统状态、器官支持治疗和严重程度评分。使用最小绝对收缩和选择算子(LASSO)回归进行特征选择。训练了逻辑回归、随机森林、XGBoost、LightGBM、CatBoost和多层感知器模型。通过受试者工作特征曲线下面积(AUROC)和精确率-召回率曲线下面积(AUPRC)评估判别性能。使用校准、决策曲线分析(DCA)和SHapley加法解释(SHAP)评估概率可靠性、潜在临床效用和可解释性。用于分类指标的运行阈值在内部和外部评估之前于MIMIC-IV开发数据中固定。

结果:MIMIC-IV队列包括6,842名患者,其中1,014名在住院期间死亡;留出的内部测试集包含1,368名患者和203例死亡。外部验证队列包括5,236名eICU-CRD患者,其中686例死亡。LightGBM显示出最佳总体性能。在内部测试队列中,其AUROC为0.841(95% CI:0.821–0.861),AUPRC为0.518(95% CI:0.486–0.552)。在外部验证中,AUROC为0.801(95% CI:0.779–0.824),AUPRC为0.413(95% CI:0.380–0.449),敏感性为72.8%,特异性为73.9%,阳性预测值为30.3%,阴性预测值为94.7%,F1评分为0.428。因此,在该运行点被分类为高危险的患者中约70%存活至出院。外部队列的校准可接受,Brier评分为0.101,校准截距为0.050,校准斜率为0.84。SHAP分析确定GCS总分、有创机械通气、年龄、乳酸、SOFA评分、血管升压药使用和肌酐是预测死亡风险的主要贡献因素。

结论:基于常规收集的ICU首日数据的模型为神经重症监护中的住院死亡率提供了经过外部验证且可解释的风险分层。其报告运行点的低阳性预测值排除了作为预后悲观、限制治疗或撤除生命维持治疗的独立依据。在临床实施之前,需要在不同国家和卫生系统中进行前瞻性验证。
神经重症监护患者常同时存在脑损伤与多器官功能障碍,早期死亡风险预测具有挑战性。尽管格拉斯哥昏迷量表(GCS)、序贯器官衰竭评估(SOFA)和急性生理与慢性健康评估II(APACHE II)等传统评分广泛使用,但其预设变量和相加结构难以充分捕捉神经损伤、实验室异常、治疗强度与器官功能障碍间的非线性关系。既往机器学习(ML)研究大多局限于单一数据库,存在预测时点不明、校准评估不完整及临床效用评价不足等问题。为此,研究人员利用两个公共重症监护数据库,开发和外部验证了一种基于ICU入院后24小时固定时点、可解释的ML模型,用于神经重症患者住院死亡率预测。

研究人员从重症监护医学信息市场IV数据库(MIMIC-IV)纳入6,842例患者(其中1,014例死亡)用于模型开发和内部测试,从eICU协作研究数据库(eICU-CRD)纳入5,236例患者(其中686例死亡)用于独立外部验证。预测变量限定为ICU入院后24小时内的信息,涵盖人口统计学、合并症、生命体征、实验室指标、神经状态、器官支持治疗和严重程度评分。研究遵循TRIPOD声明,使用最小绝对收缩和选择算子(LASSO)回归筛选特征,训练了逻辑回归、随机森林、XGBoost、LightGBM、CatBoost和多层感知器六种模型。模型判别性能通过受试者工作特征曲线下面积(AUROC)和精确率-召回率曲线下面积(AUPRC)评估,校准采用Brier评分、校准截距和校准斜率,临床效用采用决策曲线分析(DCA),可解释性采用SHapley加法解释(SHAP)。主要关键技术方法包括:两个数据库间的变量映射与单位统一;仅以MIMIC-IV训练集拟合链式方程多重插补后应用于内部测试和外部验证集;在训练集内独立完成LASSO特征选择并固定运行阈值,避免信息泄漏。

### 3.1 队列选择与研究人群

MIMIC-IV最终纳入6,842例符合条件的神经重症监护患者,院内死亡率为14.8%;eICU-CRD外部验证队列共5,236例,死亡率为13.1%。MIMIC-IV按8:2分层划分为训练集(5,474例,约811例死亡)和内部测试集(1,368例,203例死亡)。非幸存者年龄更大,GCS评分更低,SOFA评分更高,且有创机械通气、血管升压药使用比例更高,乳酸、肾功能标志物更差。

### 3.2 特征选择与保留预测因子

跨数据库统一后共保留64个候选变量,LASSO在开发队列中筛选出27个预测因子,覆盖神经状态、呼吸支持、循环功能、肾功能、炎症、凝血和早期治疗强度。经常保留的变量包括年龄、GCS总分及运动成分、SOFA评分、机械通气、血管升压药使用、平均动脉压、呼吸频率、血氧饱和度、乳酸、肌酐、血尿素氮、血小板计数、白细胞计数、血糖、钠、国际标准化比值和主要神经诊断。

### 3.3 内部测试队列模型性能

所有模型在内部测试集均表现出有临床意义的判别能力。LightGBM综合性能最佳,AUROC为0.841(95% CI:0.821–0.861),AUPRC为0.518(95% CI:0.486–0.552)。在预设阈值下,敏感度为77.2%,特异度为76.0%,阳性预测值(PPV)为37.0%,阴性预测值(NPV)为94.9%,F1评分为0.501,意味着63.0%被标记为高危险的患者最终存活出院。

### 3.4 eICU-CRD外部验证

在完全未重新拟合的外部验证中,LightGBM保留了中到良好的判别能力,AUROC为0.801(95% CI:0.779–0.824),AUPRC为0.413(95% CI:0.380–0.449)。同一阈值下敏感度72.8%,特异度73.9%,PPV 30.3%,NPV 94.7%,F1评分为0.428;约69.7%的外部高危险患者存活至出院,表明该运行点存在较高的假阳性负担,不能单独用于预后或治疗限制决策。

### 3.5 校准与临床效用

内部测试集Brier评分为0.090,校准截距0.024,校准斜率0.91;外部验证Brier评分为0.101,校准截距0.050,校准斜率0.84,校准曲线显示最高风险十分位存在轻度高估,但低中风险区间一致性好。DCA显示模型在内部阈值概率约0.09–0.58、外部约0.11–0.51范围内净获益大于“全部治疗”和“全部不治疗”策略,提示潜在临床效用,但该曲线属探索性分析,尚不能确立真正的临床获益。

### 3.6 模型解释

SHAP分析显示,GCS总分、有创机械通气、年龄、乳酸、SOFA评分、血管升压药使用、肌酐、呼吸频率、平均动脉压和血氧饱和度是最主要的预测因子。低GCS、机械通气、乳酸升高、血管升压药暴露、肾功能不全、低血压、呼吸急促和低氧均与预测死亡风险升高相关;GCS、乳酸和平均动脉压呈现近似单调的风险梯度。由于SOFA与多个组成变量相关,其SHAP值应视为拟合模型的风险分配而非独立因果效应。

### 3.7 亚组分析

模型在年龄、性别、主要诊断、机械通气状态和GCS分层中的AUROC大多高于0.76;在脑出血和创伤性脑损伤亚组中表现最强,在癫痫持续状态和中枢神经系统感染等样本量较小或异质性较高的组中表现较低,这些亚组估计被视为探索性结果。

### 3.8 敏感性与消融分析

改变缺失率阈值时,外部AUROC变化范围为0.789–0.807。消融分析显示,仅用神经变量建模时外部AUROC为0.716,仅用生命体征和实验室指标的模型为0.760,结合神经与全身变量后升至0.792,完整模型达0.801,支持脑特异性与颅外生理信息整合的必要性。

讨论部分指出,固定24小时预测窗口有利于临床可操作性和避免信息泄漏。模型的可解释性和外部验证支持其作为风险分层工具,但低阳性预测值意味着大多数高危险患者能够存活,不能作为预后悲观、限制治疗或撤除生命维持治疗(WLST)的独立依据。自证预言偏倚和不同数据库间的诊疗实践差异是需要警惕的重要局限。研究结论部分翻译为:一种使用常规可获得的ICU首日数据的可解释ML模型,能够对神经重症监护患者的住院死亡风险进行分层,并在外部验证中保持判别能力。鉴于其低阳性预测值以及医疗限制实践未被解析的影响,该模型不应作为预后悲观、限制治疗或WLST的独立依据。前瞻性验证应纳入以患者为中心的神经和功能结局,并应在包括拉丁美洲在内的不同国家和卫生系统中开展。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号