基于可解释机器学习与外部验证的中国北方老年动脉瘤性蛛网膜下腔出血患者2年功能结局预测模型研究

《Frontiers in Neurology》:Explainable machine learning for 2-year functional outcomes in older adults with aneurysmal subarachnoid hemorrhage in North China: external validation and health-system context

【字体: 大 中 小 】 时间:2026年09月25日 来源:Frontiers in Neurology 3.3

编辑推荐:

  背景: 老年动脉瘤性蛛网膜下腔出血(aneurysmal subarachnoid hemorrhage, aSAH)患者具有异质性的长期结局,治疗路径和医院能力的差异可能使早期风险分层复杂化。 方法: 这项多中心队列研究纳入了中国北方年龄≥60岁的aSAH成

  
背景: 老年动脉瘤性蛛网膜下腔出血(aneurysmal subarachnoid hemorrhage, aSAH)患者具有异质性的长期结局,治疗路径和医院能力的差异可能使早期风险分层复杂化。 方法: 这项多中心队列研究纳入了中国北方年龄≥60岁的aSAH成人患者。2017年1月至2023年9月期间,四家医院共收治1,132例,其中914例完成2年随访的患者按7:3比例分为训练队列(n = 640)和内部验证队列(n = 274)。独立队列筛选了2017年1月至2021年1月期间的602例入院患者,最终纳入499例。不良结局定义为2年改良Rankin量表(modified Rankin Scale, mRS)3–6分。采用带10折交叉验证的最小绝对收缩和选择算子(least absolute shrinkage and selection operator, LASSO)回归筛选预测因子,并比较了10种机器学习算法。评估了区分度、校准度、决策曲线分析和SHapley Additive exPlanations(SHAP)。 结果: 在1,413例患者中,583例(41.3%)出现2年不良结局。梯度提升机(gradient boosting machine, GBM)在训练队列、内部验证队列和外部验证队列中的受试者工作特征曲线下面积(area under the receiver operating characteristic curve, AUC)分别为0.863(95% CI,0.835–0.891)、0.834(0.785–0.883)和0.791(0.749–0.833)。外部验证的准确率为0.752,敏感性为0.661,特异性为0.808,精确率为0.683,F1得分为0.672。GBM具有最高的外部AUC点估计值,但并未在每项分类指标中均居首位。SHAP将Hunt–Hess分级、年龄、世界神经外科联合会(World Federation of Neurosurgical Societies, WFNS)分级和治疗列为最具影响力的特征。未经调整的生存率在不同治疗和医院能力分层间存在差异(对数秩检验p均<0.0001)。 结论: 可解释的GBM在外部验证中保持了中等区分度,可能支持老年aSAH患者入院阶段的风险分层。卫生系统相关发现为关联性结论,在临床或公共卫生部署之前,需要进行前瞻性再校准、公平性评估和影响评价。

可解释机器学习预测中国北方老年动脉瘤性蛛网膜下腔出血患者2年功能结局:外部验证与卫生系统背景

一、研究背景与研究目的

动脉瘤性蛛网膜下腔出血(aneurysmal subarachnoid hemorrhage, aSAH)是一种神经外科急症,具有较高的早期死亡率和幸存者中持续存在的残疾。随着人口老龄化,老年aSAH患者数量不断增加,此类患者需要同时考虑衰弱状态、合并症、生理储备、治疗选择以及获得专科神经血管诊疗的途径。对于患者和家属而言,关键问题不仅限于能否度过急性住院期,发病后数月乃至数年的功能恢复概率是医患共同决策和康复规划的核心。现有的结局评分和预后模型通常强调年龄、神经功能分级、影像学发现和急性并发症,但机器学习方法可能捕捉传统回归模型难以发现的非线性和交互效应。然而,模型的表现可能因过拟合、单中心取样、数据泄漏或事后模型选择而被高估,因此在临床特征不同的人群中进行外部验证至关重要。此外,可解释性同样重要,因为无法与可识别的临床或系统层面信息相关联的风险估计难以审计和实施。卫生系统背景在时间敏感的神经血管疾病中尤为关键,医院病例量和专科能力与aSAH结局相关,但受转诊模式和病例组合影响。在中国北方,医院能力、转诊路径以及显微手术或血管内治疗的可及性差异可能同时影响预测模型所面对的数据分布和高风险预测后可供采取的后续行动。研究人员因此开发并外部验证了用于预测中国北方≥60岁aSAH患者2年不良功能结局的机器学习模型,比较了10种算法,使用SHapley Additive exPlanations(SHAP)对梯度提升机(gradient boosting machine, GBM)模型进行解释,并探索了治疗方式和医院能力类别的生存模式。

二、研究设计与主要技术方法

这是一项多中心观察性队列研究。模型开发人群来自2017年1月至2023年9月期间四家医院的aSAH入院患者,外部验证队列为2017年1月至2021年1月期间一家石家庄三级甲等大学附属区域转诊中心医院的499例患者,该医院拥有362张神经外科床位,89.4%的外部参与者为院间转诊。研究共纳入1,413例患者,其中训练队列640例、内部验证队列274例、外部验证队列499例。主要结局为2年后的功能状态,以改良Rankin量表(modified Rankin Scale, mRS)评估,mRS 3–6定义为不良结局。候选预测因子涵盖人口统计学特征、居住地和转诊信息、合并症、动脉瘤特征、入院神经功能严重程度、治疗方式和卫生系统背景。研究人员采用最小绝对收缩和选择算子(least absolute shrinkage and selection operator, LASSO)回归结合10折交叉验证进行特征选择,并进行了Boruta敏感性分析以检验线性筛选是否遗漏了非线性重要的预测因子。随后比较了10种机器学习算法,包括逻辑回归、支持向量机(support vector machine, SVM)、GBM、神经网络、随机森林、XGBoost、k近邻(k-nearest neighbors, KNN)、AdaBoost、LightGBM和CatBoost。模型评估包括区分度(AUC)、准确率、敏感性、特异性、精确率、F1得分、校准曲线和决策曲线分析。使用SHAP进行全局和个体层面的模型解释,并计算了成对SHAP交互值。此外,研究人员在合并队列中拟合了多变量Cox比例风险模型,以评估调整基线严重程度和病例组合后的生存差异。

三、研究结果

3.1 研究人群与2年结局

研究共纳入1,413例参与者。2年不良功能结局在训练队列中发生266/640例(41.6%),内部验证队列中125/274例(45.6%),外部验证队列中192/499例(38.5%),总体583/1,413例(41.3%)。三个队列中不良结局患者的年龄均更大(训练队列71.07±7.55岁对67.09±4.84岁,内部验证71.38±7.62岁对66.87±5.13岁,外部验证70.44±6.34岁对66.79±4.98岁,p均<0.001)。高Hunt–Hess分级(IV–V级)在不良结局患者中占50.8%、48.8%和42.2%,而良好结局患者中仅占8.6%、10.1%和7.8%。高WFNS分级(IV–V级)在不良结局患者中占60.5%、66.4%和56.3%,良好结局患者中占16.3%、18.1%和17.9%。治疗分布在各队列中均与2年结局显著相关。既往卒中史在不良结局组中更常见。外部验证队列中所有患者均在高能力医院治疗,无法对医院能力分布进行对比。

3.2 特征选择

10折交叉验证的LASSO在λ.min处保留14个预测因子,在λ.1se处保留9个。最终用于GBM分析的14个预测因子包括年龄、性别、Hunt–Hess和WFNS分级、治疗、动脉瘤大小和位置、入院张压指数(Admission Tension-Pressure Index, ATPI)、医院能力、既往卒中、高血压、肿瘤史、吸烟史和饮酒史。Boruta敏感性分析确认了7个预测因子为稳健重要:WFNS分级、Hunt–Hess分级、治疗方式和年龄,其次是医院能力、动脉瘤位置和卒中史。所有Boruta确认的预测因子均被LASSO选中,且LASSO额外保留了7个Boruta未确认的预测因子,表明线性筛选并未丢弃任何被非线性方法独立识别为重要的变量。

3.3 模型比较性能

训练集AUC范围为AdaBoost的0.794至随机森林的0.948。随机森林、KNN和LightGBM具有很高的训练AUC(0.948、0.940和0.936),但内部验证AUC较低(0.839、0.794和0.773),外部验证AUC更低(0.787、0.752和0.693),提示有限的迁移性或过拟合。GBM的区分度相对稳定:训练AUC 0.863(95% CI,0.835–0.891),内部验证0.834(0.785–0.883),外部验证0.791(0.749–0.833)。在外部验证中,GBM在10个候选模型中具有最高的AUC和准确率点估计值(0.791和0.752),敏感性0.661,特异性0.808,精确率0.683,F1得分0.672。但GBM并未在所有分类指标中领先:SVM具有最高的敏感性(0.734),KNN具有最高的特异性和精确率(0.896和0.752),XGBoost具有最高的F1得分(0.675)。GBM的AUC置信区间与若干替代模型重叠,因此不主张统计学优越性。

3.4 校准与决策曲线分析

校准曲线显示在中风险范围内观测和预测事件率大致相似,尾部偏差较大。决策曲线提示多个模型在临床相关阈值范围的部分区间具有正向标准化净收益。外部曲线紧密聚集,在高阈值处变得不稳定,GBM在中段范围常位于上方曲线之列,但未显示明确优势。

3.5 GBM的可解释性

全局SHAP重要性将Hunt–Hess分级、年龄和WFNS分级列为三个主导贡献因素,其次是治疗。动脉瘤大小、ATPI、医院能力、既往卒中、高血压、动脉瘤位置、性别、肿瘤史、吸烟和饮酒的平均贡献显著较小。较高的Hunt–Hess和WFNS编码值以及较高年龄通常将预测向不良结局方向移动。SHAP交互值确认Hunt–Hess×年龄是GBM中最强的成对交互(平均|SHAP交互值|≈0.11),领先于年龄×治疗、Hunt–Hess×ATPI和年龄×WFNS。年龄×Hunt–Hess交互依赖图显示随年龄增长按严重程度类别的系统性分歧:低Hunt–Hess分级患者中交互值在整个年龄范围内接近零,而高Hunt–Hess分级患者中交互值在较年轻年龄时强正向,在约75–80岁之后变为负向。按四个年龄-严重程度组分层显示,两个年龄-严重程度一致的层携带正平均交互值并具有最高的不良结局率:年轻低Hunt–Hess分级患者(n = 701;不良结局20.3%;平均交互+0.068)和老年高Hunt–Hess分级患者(n = 159;不良结局90.6%;平均交互+0.170)。两个年龄-严重程度不一致的层携带负平均交互值——年轻高Hunt–Hess分级患者(n = 189;不良结局70.4%;平均交互?0.208)和老年低Hunt–Hess分级患者(n = 364;不良结局45.1%;平均交互?0.074)——表明当两者不一致时,模型部分抵消了单独归因于年龄或严重程度的风险。

3.6 探索性生存分析

合并生存分析在时间零点包括399例手术治疗、762例血管内治疗、248例保守治疗和4例联合治疗患者;医院能力组包括179例低能力、475例中能力和759例高能力患者。未经调整的生存率在不同治疗方式和能力类别间存在差异(全局对数秩p均<0.0001)。保守治疗和低医院能力与较低的观测生存率相关。多变量Cox比例风险模型在调整后显示,年龄(调整后风险比[aHR] 1.08/年,95% CI 1.04–1.13)、高Hunt–Hess分级(aHR 1.60,1.38–1.84)、高WFNS分级(aHR 2.45,1.78–3.39)、后循环动脉瘤位置(aHR 1.83,1.38–2.43)和动脉瘤大小≥5 mm(aHR 1.16,1.03–1.32)仍与死亡独立相关。与血管内治疗相比,手术治疗在调整后仍独立相关于更高的死亡风险(aHR 1.68,95% CI 1.43–1.97)。医院能力在调整后不再与生存显著相关(中能力对高能力:aHR 0.92,0.63–1.35;低能力对高能力:aHR 0.56,0.25–1.29)。

四、讨论与结论

这项研究有四个最重要的发现:第一,2年不良功能结局常见,总体占41.3%;第二,可解释的GBM在内部和外部验证中保持了中等区分度,AUC从训练的0.863降至0.834和0.791;第三,神经功能严重程度和年龄主导模型解释,治疗和卫生系统变量贡献较温和;第四,治疗方式和医院能力与未经调整的生存率相关,但数据不能确定因果效应。外部验证实质性改变了模型比较结果,随机森林、KNN和LightGBM在训练和外部AUC之间显示出较大差距,而GBM损失的区分度较少。外部队列并非来自同一分布的更大样本:所有外部参与者均在高中能力医院治疗,近90%为转诊患者,而开发数据涵盖低、中、高能力环境。这种域偏移具有信息量:模型保留了区分度,但医院能力的独立贡献和校准无法在外部得到检验。值得注意的是,在调整Cox模型中,医院能力类别的粗略生存梯度大幅减弱且不再显著,提示未经调整的关联在很大程度上反映了病例严重程度和转诊病例组合的差异,而非能力本身的独立效应。手术治疗在调整后仍与更高的死亡风险相关,但这是观察性调整而非随机化比较,不能推断因果治疗效应。SHAP交互分析进一步表明,模型对Hunt–Hess分级的权重随年龄变化而非固定不变,这一发现具有假设生成性质。研究的局限性包括观察性设计易受选择偏倚、指征混杂、未测量的衰弱和合并症以及中心聚类影响;306例筛查患者失访可能造成损耗偏倚;外部队列仅限于高能力医院且日历期较早且重叠;二分类mRS终点丢失了残疾谱系中的信息;详细的校准估计、前瞻性时间验证、调整后生存效应、决策分析置信区间、公平性评估以及模型使用改善护理的证据均不可用。未来工作应使用前瞻性指定的分析方案,报告校准截距、斜率和Brier得分及其不确定性,并检查低能力和非转诊环境中的表现。时间性和地理性验证、亚组公平性评估以及前瞻性影响研究是确定模型引导的升级或随访是否能改善以患者为中心的结局而不增加不公平性所必需的。
结论: 可解释的GBM在外部中国北方队列中预测老年aSAH患者2年不良功能结局具有中等区分度。入院神经功能严重程度和年龄是主要的模型贡献因素,而治疗和医院能力将预测置于更广泛的照护系统背景中。该模型可能支持分诊、转诊、沟通和纵向护理规划,但不应被用于推断治疗效果或拒绝提供照护。在实施之前,需要进行前瞻性再校准、公平性评估和临床影响测试。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号