《Frontiers in Nutrition》:A machine-learning-derived online prediction model based on inflammatory and nutritional composite indicators for acute kidney injury in sepsis patients with multiple myeloma
编辑推荐:
背景:急性肾损伤(AKI) frequently 并发于多发性骨髓瘤(MM)脓毒症患者,然而目前尚无经过验证的预测工具能够整合这一双重疾病人群特有的炎症与营养紊乱状态。研究人员旨在开发并外部验证一个可解释的机器学习(ML)模型——基于炎症-营养复合指标——用于
背景:急性肾损伤(AKI) frequently 并发于多发性骨髓瘤(MM)脓毒症患者,然而目前尚无经过验证的预测工具能够整合这一双重疾病人群特有的炎症与营养紊乱状态。研究人员旨在开发并外部验证一个可解释的机器学习(ML)模型——基于炎症-营养复合指标——用于预测MM脓毒症患者住院期间AKI,并将其部署为基于网络的就医现场工具。
方法:在这项回顾性队列研究中,从陕西省人民医院(2020–2025年)纳入362例MM脓毒症患者(开发队列:253例训练,109例内部测试)和71例时间验证患者。此外,从另一所三级医院(西安市第三医院,n=118)收集了独立外部验证队列。候选预测因子包括8个复合指标(如NLR、SII、LAR、AAPR)以及常规临床和实验室变量。Boruta和递归特征消除(RFE)确定了精简的预测因子集。比较了六种ML算法(逻辑回归、SVM、MLP、LightGBM、XGBoost、随机森林),使用AUC、校准和决策曲线分析进行评估。最终模型通过SHAP进行解释,并作为公开的Streamlit应用程序实现。
结果:362例患者中206例(56.9%)发生AKI。筛选出8个预测因子:NLR、LAR、肌酐、SII、PTA、胱抑素C、CRP和AAPR。随机森林表现出最稳健和可泛化的性能,时间验证AUC为0.8574(准确率0.7465,灵敏度0.8205,特异度0.6562)。此外,随机森林在外部验证中AUC达0.9650(准确率0.8983,灵敏度0.9000,特异度0.8971),校准良好且净临床获益一致。SHAP分析确定较高的NLR、LAR、SII、胱抑素C、肌酐和CRP,以及较低的PTA和AAPR是模型中最具影响力的预测因子。该模型可在(https://gftcs94ast7omb44cg2izq.streamlit.app/)免费获取。
结论:一个采用八项常规可用指标的可解释随机森林模型能够准确预测MM脓毒症患者的AKI,弥合了算法复杂性与床旁适用性之间的差距。该工具可促进这一高危人群的早期风险分层和个体化肾脏保护。
**论文解读:基于炎症-营养复合指标的机器学习模型预测多发性骨髓瘤脓毒症患者急性肾损伤**
**一、研究背景与问题提出**
脓毒症是全球危重症患者发病和死亡的主要原因之一,急性肾损伤(acute kidney injury, AKI)是其最常见且最严重的并发症之一,约40–50%的脓毒症患者会发生AKI,并显著增加不良预后风险。脓毒症相关AKI的发病机制涉及系统性炎症、微血管功能障碍、代谢重编程和免疫失调等多重因素。在易感人群中,多发性骨髓瘤(multiple myeloma, MM)患者构成了一个尤其高危的亚群。MM以浆细胞克隆性增殖和单克隆免疫球蛋白过量产生为特征,直接导致肾小管管型肾病、肾小管损伤和间质炎症。当脓毒症叠加发生时,血流动力学不稳定、肾毒性药物暴露及既存的恶性疾病微环境等协同性肾毒性损伤会急剧放大AKI的发生风险。然而,目前缺乏专门针对MM脓毒症患者的稳健、个体化风险预测工具。
传统统计模型和通用危重症评分(如序贯器官衰竭评估(Sequential Organ Failure Assessment, SOFA)评分)难以捕捉这一双重疾病人群中炎症标志物、营养状态和肾脏易感性之间复杂的非线性交互作用。机器学习(machine learning, ML)凭借其利用高维数据发现超越传统回归范畴的复杂模式的能力,已成为临床预测的有力工具。基于常规实验室参数合成的复合指标——如中性粒细胞/淋巴细胞比值(neutrophil-to-lymphocyte ratio, NLR)、系统性免疫炎症指数(systemic immune-inflammation index, SII)和白蛋白相关营养指标——已显示出作为宿主炎症和营养状态替代标志物的潜力,并与脓毒症及血液系统恶性肿瘤的不良结局相关。然而,尚无研究系统评估这些炎症-营养复合指标对MM脓毒症患者AKI的预测价值,也没有可解释的ML工具被转化为临床可部署的格式。该研究发表于《Frontiers in Nutrition》。
**二、研究目的与意义**
针对上述空白,研究人员旨在:(1)开发和比较多种ML算法以预测MM脓毒症患者住院期间AKI;(2)通过严谨的特征选择识别最具信息量的炎症和营养复合预测因子;(3)构建一个可解释的、基于网络的预测模型,通过Streamlit部署以在床旁提供个体化风险估计。通过整合Shapley加法解释(Shapley Additive Explanations, SHAP),该框架旨在弥合算法复杂性与临床透明度之间的差距,促进这一高危人群的早期风险分层和靶向肾脏保护策略。
**三、主要技术方法**
该研究为多中心回顾性队列研究,开发队列来自陕西省人民医院(2020年1月–2024年10月,253例训练、109例内部测试),时间验证队列为同一医院2024年11月–2025年12月收治的71例患者,外部验证队列来自西安市第三医院(2023年11月–2025年12月,118例)。研究采用两步特征选择流程(Boruta算法结合递归特征消除(recursive feature elimination, RFE))精简预测因子;比较六种监督学习算法(逻辑回归、支持向量机、多层感知机、LightGBM、XGBoost、随机森林),以AUC、校准曲线和决策曲线分析评估性能;采用SHAP实现模型可解释性;最终模型部署为Streamlit在线应用。
**四、研究结果**
**4.1 基线特征**:共纳入362例患者(开发队列),AKI发生率为56.9%(206/362)。AKI组患者合并症负担更重(高血压、糖尿病、COPD、肝硬化、ARDS、心力衰竭和呼吸衰竭),基线估算肾小球滤过率(estimated glomerular filtration rate, eGFR)更低,PTA显著降低,NLR、SII和LAR显著升高,PNI、LMR和AAPR降低,SOFA评分更高。
**4.2 特征选择**:Boruta算法结合RFE确定8个最优预测因子:NLR、LAR、肌酐(Cr)、SII、PTA、胱抑素C、CRP和AAPR。各队列间仅NLR存在显著差异,其余变量在各队列间具有可比性,支持外部验证策略的合理性。
**4.3 模型性能比较**:随机森林在时间验证队列中AUC达0.8574(准确率0.7465,灵敏度0.8205,特异度0.6562),在外部验证队列中AUC达0.9650(准确率0.8983,灵敏度0.9000,特异度0.8971),Brier评分分别为0.156和0.083,校准良好且净临床获益一致。相比之下,LightGBM和XGBoost在训练集上表现过优但在时间验证中性能下降明显,提示过拟合。随机森林的AUC显著优于单独SOFA评分(时间验证:0.857 vs. 0.652,p=0.009;外部验证:0.965 vs. 0.570,p<0.001)。
**4.4 SHAP分析**:较高的NLR、LAR、SII、胱抑素C、Cr和CRP值,以及较低的PTA和AAPR值,与较高的AKI预测概率相关。SHAP特征重要性与逻辑回归系数排序基本一致,验证了所选预测因子的稳健性。
**4.5 在线工具**:最终随机森林模型已部署为免费公开的Streamlit网络应用,输入8项指标即可即时获得个体化AKI概率及SHAP力图可视化解释。
**五、讨论与结论**
八个预测因子共同涵盖了驱动MM背景下脓毒症相关AKI的相互交织的病理生理轴:NLR、SII和CRP反映系统性炎症;LAR整合组织低灌注与营养炎症储备;AAPR反映营养状态和肝胆完整性;PTA提示免疫血栓形成和微血管内皮损伤;Cr和胱抑素C反映既存肾脏功能储备和亚临床肾小管损伤。尽管模型未直接纳入MM特异性变量(如血清游离轻链),但所选指标能够捕捉骨髓瘤和脓毒症所致肾损伤的功能后果和最终共同通路,作为一种务实的统一风险分层工具,可在明确病因检查完成前启动及时的肾脏保护措施。
该研究的局限性包括:时间验证队列来自同一机构可能引入机构偏倚;AKI定义依赖血清Cr变化可能漏检非少尿型事件;缺乏入院前真实基线Cr可能造成AKI误分类;回顾性数据无法明确区分AKI的具体病因;样本量限制亚组分析效能;需要前瞻性实施研究评估真实世界影响。
研究结论:研究人员开发、外部验证并部署了一个基于八项炎症和营养复合指标的可解释随机森林模型,用于预测MM脓毒症患者住院期间AKI。该模型表现出稳健的区分能力、满意的校准和正向净临床获益,并封装为免费可访问的网络应用。通过SHAP可解释性,该框架弥合了算法复杂性与临床透明度之间的差距,为这一高危人群的个体化肾脏保护策略奠定了基础。