《World Journal of Pediatrics》:Machine learning model for intravenous immunoglobulin resistance in Kawasaki disease: model development and validation study
编辑推荐:
摘要翻译:
背景:川崎病(KD)中的静脉注射免疫球蛋白(IVIG)耐药会增加冠状动脉风险。早期预测对于改善预后至关重要。本研究旨在开发并验证一种用于预测KD患儿IVIG耐药的机器学习(ML)模型。
方法:采用KD患者回顾性队列进行模型开发,并纳入来自福
摘要翻译:
背景:川崎病(KD)中的静脉注射免疫球蛋白(IVIG)耐药会增加冠状动脉风险。早期预测对于改善预后至关重要。本研究旨在开发并验证一种用于预测KD患儿IVIG耐药的机器学习(ML)模型。
方法:采用KD患者回顾性队列进行模型开发,并纳入来自福州和扬州的外部验证队列以及一个前瞻性验证队列。临床和实验室变量从电子病历中提取。研究人员评估了12种算法,并选择支持向量机(SVM)以获得最佳性能。采用SHapley Additive exPlanations(SHAP)值评估特征重要性,随后进行逐步特征消除。模型性能通过受试者工作特征曲线下面积(AUC)、校准曲线和决策曲线分析(DCA)进行评估。同时开发了一个基于网页的计算器。
结果:回顾性开发队列共纳入2371例KD患者,福州队列443例,扬州队列198例,前瞻性验证队列253例。SVM模型在内部验证中的AUC为0.782,在福州和扬州外部验证队列中分别为0.746和0.759,在前瞻性验证中为0.799。最终模型纳入8个预测因子,SHAP分析提供了特征贡献的全局和局部解释。该模型还表现出良好的校准性能,并在DCA中于临床相关阈值范围内显示出良好的净获益。
结论:基于SVM的ML模型利用常规临床数据显示出预测KD中IVIG耐药的潜力,并可能支持早期风险分层。
论文解读文章:
## 研究背景与目的
川崎病(KD)是一种主要影响儿童的急性发热性血管炎,是发达国家获得性心脏病的主要原因。若不及时治疗,约20%–25%的患者会发生冠状动脉病变(CALs),可能导致管腔狭窄、心肌缺血甚至坏死。高剂量静脉注射免疫球蛋白(IVIG)是标准初始疗法,但仍有10%–20%的患者出现IVIG耐药,且这些患者发生严重心脏并发症的风险显著增加。早期识别IVIG耐药对于采取强化治疗策略(如IVIG联合糖皮质激素或免疫抑制剂)至关重要。然而,现有的预测模型(如Egami、Kobayashi、Sano和San Diego评分系统)依赖线性统计方法,难以处理临床数据中固有的复杂非线性交互作用,且常受限于样本量小、连续变量二值化导致的偏倚以及内外部验证不足等问题,其泛化能力和临床应用价值受限。近年来,人工智能(AI)和机器学习(ML)的发展为预测建模提供了新方法,能够整合多源临床数据、实现自动化特征选择并灵活捕捉非线性模式。但ML模型常因“黑箱”特性而影响临床信任。为此,可解释AI技术如SHapley Additive exPlanations(SHAP)被引入以阐明特征贡献,增强可解释性。本研究旨在利用全面电子病历(EMR)数据开发并验证预测KD患儿IVIG耐药的ML模型,通过两个外部验证队列和一个前瞻性验证队列评估其性能,并借助SHAP提供全局和局部解释,同时构建网络计算器以支持实时个体化风险评估。
## 研究方法概述
研究人员从苏州(2018年12月–2024年6月)纳入KD患者组成回顾性开发队列,并从福州(2012年5月–2024年5月)和扬州(2019年1月–2024年12月)收集外部验证队列,另在苏州(2024年7月–2024年12月)开展前瞻性验证。研究遵循美国心脏协会(AHA)诊断标准,IVIG耐药定义为IVIG治疗(2 g/kg)后36小时内发热持续或复发,CALs采用Dallaire Z评分(Z≥2.0)定义。所有预测变量在治疗前采集。数据预处理包括基于链式方程的多重插补(MICE)处理缺失值、Spearman相关分析评估多重共线性,最终纳入38个变量。模型开发采用重复10折交叉验证(10折、5次重复)训练12种ML算法,以受试者工作特征曲线下面积(AUC)为主要指标选择最终模型。特征选择基于SHAP排序、递归特征消除和AUC比较。模型性能通过区分度(AUC、敏感性、特异性、阳性预测值、阴性预测值)、校准曲线、Brier评分和决策曲线分析(DCA)评估。此外,研究依据TRIPOD+AI指南进行报告,并使用PROBAST+AI评估偏倚风险。
## 研究结果
### 基线特征
最终开发队列共2371例KD患儿,其中305例(12.9%)为IVIG耐药。福州外部验证队列443例,扬州队列198例,前瞻性苏州队列253例。IVIG耐药组男性比例(67.5% vs. 59.9%,P = 0.011)、CALs发生率(52.1% vs. 24.7%,P < 0.001)、皮疹(83.0% vs. 73.6%,P < 0.001)和肢端水肿(54.8% vs. 44.3%,P = 0.001)均显著高于IVIG敏感组。不完全川崎病(iKD)在耐药组中较少见(18.4% vs. 24.3%,P = 0.023)。耐药组的白细胞(WBC)、中性粒细胞百分比(NEU%)、C反应蛋白(CRP)、尿白细胞(UWBC)、丙氨酸氨基转移酶(ALT)、天冬氨酸氨基转移酶(AST)、碱性磷酸酶(ALP)、γ-谷氨酰转肽酶(GGT)、肌酐(CR)、血尿素氮(BUN)和血糖(GLU)等实验室指标均显著升高(P < 0.05)。训练集(n = 1661)与测试集(n = 710)的基线特征无显著差异。
### 模型开发与特征选择
在12种算法中,表现最好的五种为梯度提升机(GBM,AUC = 0.773)、自适应增强(AdaBoost,AUC = 0.765)、随机森林(ranger算法,AUC = 0.756)、支持向量机(SVM,AUC = 0.750)和弹性网络广义线性模型(GLMnet,AUC = 0.742)。基于AUC及敏感性/特异性平衡,研究人员选择GBM、SVM和RF ranger进一步优化。通过逐步消除低影响特征,SVM在特征缩减过程中始终保持最高AUC,最终被选为最终模型。最优八特征模型在AUC上优于十四特征模型(0.782 vs. 0.756;DeLong检验,P = 0.025)及最小二特征模型(0.782 vs. 0.736;P = 0.009)。最终SVM模型纳入的八个特征为:CALs、CRP、发病年龄、NEU%、WBC、总胆固醇(TC)、血小板(PLT)和血清白蛋白(ALB)。SHAP散点图显示,CRP、NEU%、WBC和CALs与耐药风险正相关,而年龄较大、TC、PLT和ALB升高为保护因素。例如,WBC > 21.15 ×10
9/L及存在CALs时SHAP值为正,提示风险增加;年龄> 65个月时SHAP值多为负值。局部SHAP解释显示不同患者的风险因素和保护因素组合各异。全局交互强度分析表明,ALB具有最高的交互强度,其次为CRP、PLT和TC,说明模型捕捉了预测因子之间的非加性关系。
### 网络计算器与验证性能
研究团队通过Shiny开发了交互式网络计算器,用户输入八项特征值即可获得个体化耐药风险估计。通过Youden指数确定最佳分层阈值为14.9%,对应敏感性0.648和特异性0.606。小提琴图显示IVIG耐药组的预测概率分布整体上移且上尾更长。在外部验证中,模型在福州队列的AUC为0.746,扬州队列为0.759,在前瞻性苏州队列中AUC为0.799,表明跨中心的中等预测性能。校准分析显示预测概率与观测概率良好一致,Brier评分分别为福州0.099、扬州0.097、前瞻性队列0.068。DCA表明在福州的阈值概率范围0.05–0.32、扬州0.05–0.31、前瞻性队列0.05–0.40内,模型较“全部治疗”或“不治疗”策略具有更高的净获益。
### 亚组与比较分析
年龄亚组分析显示,0–5个月患儿仅NEU%和TC有显著差异;6–11个月患儿CALs、CRP和NEU%显著;1–2岁患儿多项变量显著;3–4岁患儿七个特征(CALs、CRP、NEU%、WBC、TC、ALB和PLT)与耐药显著相关;而> 5岁患儿仅CALs和TC具有统计学意义。与采用相同八特征的传统逻辑回归(LR)模型相比,SVM的AUC(0.782,95% CI 0.739–0.824)略高于LR(0.732,95% CI 0.680–0.784),但差异无统计学意义(DeLong检验,P = 0.145)。与传统评分系统相比,Kobayashi、Egami、Sano、Formosa和Li评分的AUC分别为0.655、0.653、0.672、0.619和0.674,均低于本研究的SVM模型(0.782),且SVM在敏感性(0.735)和特异性(0.721)上表现更均衡。
### 排除冠状动脉病变后的模型性能
为便于无法及时行超声心动图的患者进行早期风险评估,研究人员重建了不含CALs的模型。在评估的算法中,SVM kernlab、LASSO和GLMnet的AUC相当(分别为0.739、0.740和0.739)。逐步变量减少后,五变量模型优于二变量模型(0.762 vs. 0.704;DeLong检验,P < 0.001),也优于八变量模型(0.762 vs. 0.719;P = 0.012),故确定五变量模型为最优解。含CALs的SVM模型(AUC = 0.750)与不含CALs的SVM kernlab模型(AUC = 0.739)无显著差异(P = 0.393)。不含CALs的模型在外部和前瞻性队列中同样表现出稳定的区分能力,校准曲线和DCA结果支持其临床净获益。
### 报告与偏倚风险评估
研究遵循TRIPOD+AI指南进行报告。PROBAST+AI评估显示,参与者领域因回顾性设计被评为高偏倚风险;预测因子领域因无法确保预测因子评估对结局状态设盲而被评为高风险;分析领域因未正式评估样本量考虑也被评为高风险;结局领域评为低风险。适用性方面,参与者、预测因子和结局领域均评为低关注。
## 讨论与结论
传统风险评分系统在本研究人群中预测性能有限,可能因人群异质性所致。基于SHAP特征选择构建的SVM模型在内部测试(AUC = 0.782)、福州外部验证(0.746)、扬州外部验证(0.759)和前瞻性验证(0.799)中均显示出中等预测性能,支持模型的泛化能力。CALs是最重要的预测因子,但排除CALs后模型区分度保持稳定,增强了在无法立即进行超声心动图环境中的适用性。年龄与生物标志物的关系存在异质性,未来可采用年龄分层或交互建模方法。实验室标志物(如CRP、NEU%、WBC升高,PLT、ALB、TC降低)与耐药相关,其机制涉及中性粒细胞介导的血管损伤、血小板消耗及低白蛋白血症反映的血管通透性增加等。研究还指出,校准漂移是时间异质性下模型应用的重要问题。SHAP提高了模型透明度,网络计算器便于临床使用,最佳阈值(14.9%)位于DCA确定的临床相关概率范围内,可作为早期风险分层的参考而非严格治疗截断值。
本研究存在局限性:回顾性设计可能引入偏倚,KD诊断存在临床主观性,年龄作为单一变量可能无法完全捕捉年龄相关异质性,且分析仅依赖结构化EMR数据,缺乏遗传、多组学或影像学生物标志物,超声心动图解读的观察者间变异也可能影响结局评估。未来需要倾向性评分匹配的前瞻性试验验证模型引导决策是否能改善临床结局,并应更严格遵循TRIPOD+AI和PROBAST+AI指南,整合多组学数据以进一步提升模型性能和临床适用性。
结论:本研究开发并验证了一种基于SVM的机器学习模型,用于预测川崎病患者的IVIG耐药。该模型纳入八个关键特征,其中CRP、NEU%、WBC和CALs与耐药正相关,而年龄较大、TC、PLT和ALB水平升高为保护因素。模型表现出可接受的区分度、良好的校准性能和DCA评估的良好临床效用。未来研究应更严格遵循TRIPOD+AI和PROBAST+AI指南,并整合多组学数据以进一步提高模型性能和临床适用性。