《Frontiers in Neurology》:Predicting 3-month prognosis of cerebral venous thrombosis: a machine learning approach incorporating inflammatory markers
编辑推荐:
本研究旨在探索一种用于预测脑静脉血栓(Cerebral Venous Thrombosis, CVT)长期预后的机器学习(Machine Learning, ML)模型。研究人员对2020年1月1日至2023年12月31日入住福建医科大学附属福州总医院和厦门大
本研究旨在探索一种用于预测脑静脉血栓(Cerebral Venous Thrombosis, CVT)长期预后的机器学习(Machine Learning, ML)模型。研究人员对2020年1月1日至2023年12月31日入住福建医科大学附属福州总医院和厦门大学附属中山医院的CVT患者进行了全面的回顾性分析。由350例患者组成的回顾性队列用于模型开发,采用5折嵌套交叉验证框架。为解决类别不平衡问题,在内部训练折中应用了Borderline-SMOTE技术。共评估31个临床和实验室变量作为潜在预测因子。采用Lasso和弹性网络(cv-Enet)进行初步变量筛选,两法交集得到11个关键变量。随后应用随机森林进一步降维,得到最终5个关键变量。使用SHapley加性解释(SHapley Additive exPlanation, SHAP)分析按重要性排序。在嵌套交叉验证内部验证中,支持向量机(Support Vector Machine, SVM)模型受试者工作特征曲线下面积(area under the receiver operating characteristic curve, AUROC)达0.870,灵敏度0.784,特异度0.897。在山西医科大学第一医院2023年1月1日至2025年12月31日独立前瞻性收集的152例外部队列中得到印证,AUROC为0.862(95% CI: 0.829–0.884)。但校准分析显示风险轻微高估(calibration-in-the-large≈9%),提示该模型目前最适合作为风险分层辅助工具而非确定性结局预测器。Bootstrap重采样确认区分度稳定。探索性亚组和公平性分析提示各人口学亚组性能稳定。本研究聚焦开发并验证基于ML的CVT长期预后预测模型,突出炎症标志物的显著作用,表明经进一步校准和前瞻性验证后,SVM模型可作为CVT风险分层的实用辅助工具。
研究背景与立项依据
脑静脉血栓(Cerebral Venous Thrombosis, CVT)是一种临床意义独特的脑血管疾病亚型,约占所有卒中病例的0.5%–1%,多发于中青年且女性偏多,西方人群发病率约1.3–1.6/10万,亚洲和中东数据更高。CVT累及硬脑膜窦或皮质静脉,临床表现多样(头痛、癫痫、局灶神经功能缺损)。尽管MRI和MRV诊断进步,约13%患者3个月改良Rankin量表(modified Rankin Scale, mRS)>2(即≥3)遗留残疾或死亡。炎症既是CVT的诱发因素也是加重因素,可致局部高凝与内皮损伤;C反应蛋白(C-reactive Protein, CRP)、白细胞计数、血小板淋巴细胞比(Platelet to Lymphocyte Ratio, PLR)、中性粒细胞淋巴细胞比(Neutrophil to Lymphocyte Ratio, NLR)、淋巴细胞单核细胞比(Lymphocyte to Monocyte Ratio, LMR)、格拉斯哥预后评分(Glasgow Prognostic Score, GPS)、系统免疫炎症指数(Systemic Immune-inflammation Index, SII)、CRP/白蛋白比、中性粒血小板评分(Neutrophil–Platelet Score, NPS)等炎症标志物与预后相关,但缺乏整合这些标志物的可靠长期预后预测模型。机器学习(Machine Learning, ML)在医疗预测中潜力大,支持向量机(Support Vector Machine, SVM)以高准确度与低计算成本适合实时临床,SHapley加性解释(SHapley Additive exPlanation, SHAP)可提升可解释性。因此研究人员开展多中心回顾—前瞻混合研究,首次将GPS和NPS纳入CVT预后模型,构建并外部验证SVM预测3个月功能结局。
主要关键技术方法
研究人员构建350例回顾性开发队列(福建两中心,2020–2023)与152例前瞻性外部验证队列(山西医科大学第一医院,2023–2025);结局为出院3个月mRS≤1(良好)vs>1(不良),电话盲法随访。31个候选变量含人口学、合并症、体征、治疗及血生化炎症标志物。预处理建缺失指示变量并以均值/众数填补,嵌套交叉验证内仅对训练折用Borderline-SMOTE处理不平衡;Lasso与弹性网络(cv-Enet)交集获11变量,随机森林降维至5变量(CRP、PLR、SII、NPS、GPS),XGBoost配SHAP解释。最终以RBF核SVM建模,内循环网格寻优C与gamma,外循环5折嵌套交叉验证报AUROC/灵敏度/特异度,独立外部队列一次性验证并做等渗回归校准、Bootstrap(2000次)置信区间、亚组与公平性logistic交互分析。
研究结果
基线特征:初筛730例,排除急性缺血卒中、心梗、肝肾衰、恶性肿瘤、深静脉血栓/肺栓塞、明确自身免疫病、急慢性感染、4周内抗炎药、拒采血/腰穿后,开发350例(不良32.0%)、外部152例(不良30.3%)。两队列年龄、性别、高血压、抗凝/取栓/去骨瓣比例无差异,但CRP、血小板、凝血酶时间、乳酸、LDH、AST、LMR、NLR、PLR、SII分布有中心偏移(KS距离0.18–0.35)。
特征筛选与重要性:Lasso选18、Enet选15,交集11,随机森林bootstrap稳定选出5个(CRP、PLR、SII、NPS、GPS),VIF均<5,SHAP均值绝对贡献CRP最高、GPS最低;CRP与GPS存在结构重叠但边际独立。
模型开发与评价:按SHAP序贯加变量,5变量SVM内验AUROC 0.873(0.842–0.904)、灵敏0.784、特异0.897;内嵌嵌套交叉验证整体AUROC 0.870(0.840–0.900)。外部队列AUROC 0.862(0.829–0.884)、灵敏0.750、特异0.824;校准斜率1.142、截距?0.113、calibration-in-the-large 0.09(高估约9%),等渗校准后斜率略偏>1;平均精度0.841。Bootstrap 2000次外部AUROC 95%CI 0.829–0.884。CRP单变量AUROC 0.889但特异仅0.750,DeLong检验与5变量差不显著(p=0.182),NRI 4.8%、IDI 0.009,多变量特异度更高(0.897 vs 0.750)。SVM较惩罚逻辑回归、随机森林、XGBoost内验AUROC微优(0.870 vs 0.861/0.855/0.863),Brier最低(0.105)。
公平性分析:外部队列按性别(男AUROC 0.86、女0.85)、年龄(<50岁0.87、≥50岁0.84)分层AUROC重叠显著;Age×PP、Sex×PP、治疗×PP交互项均不显著(p>0.05),主效应仅Sex显著,提示模型跨亚组判别稳定、无系统偏差。
讨论浓缩
炎症在CVT起病与进展中核心,但预测模型稀缺。研究人员以多中心回—前混合框架首纳GPS与NPS,证得5个常规血检炎症标志物(CRP、PLR、SII、NPS、GPS)支撑的SVM模型内/外验AUROC 0.870/0.862。CRP单用灵敏度高但特异低,复合指标提升特异与平衡性;PLR反映炎症-凝血平衡,SII整合血小板-中性粒-淋巴,GPS合CRP与白蛋白,NPS合中性粒与血小板,均契合CVT高凝-炎症机制。Borderline-SMOTE仅内折使用避免泄漏,嵌套CV与Lasso-Enet-RF三级筛选控过拟合。外部校准斜率>1示新中心概率偏自信,post hoc逻辑回归重校准可改善但属同队列乐观估计,故模型宜作风险分层辅助而非绝对概率器。公平性交互无显著异质,但女性校准稍差源于样本小。局限含男多于女(62%)异于典型CVT、EPV≈3.6低于10–20、外部152例偏小、回顾设计选择偏倚。
结论翻译
本研究开发并外部验证了基于SVM、使用5个炎症标志物预测CVT 3个月功能结局的预后模型。该模型AUROC与CRP单用相当,但特异度更高且保留多标志物炎症画像。鉴于样本量适中、事件每变量比低及残余校准漂移,模型应视为风险分层的探索性辅助工具而非确定性临床工具。需进一步大规模多中心前瞻性研究确认其增量价值与泛化性。论文发表于《Frontiers in Neurology》。