低能量跌倒老年人常规CT前临床变量对创伤性颅内出血的有限预测能力:一项回顾性双中心队列中的系统性基准研究

《Diagnostics》:Limited Predictability of Traumatic Intracranial Hemorrhage from Routine Pre-CT Clinical Variables in Older Adults with Low-Energy Falls: A Systematic Benchmarking Study in a Retrospective Bicentric Cohort

【字体: 时间:2026年09月04日 来源:Diagnostics 3.8

编辑推荐:

  背景/目的:老年人低能量跌倒(LEF)后的创伤性颅内出血(tICH)是急诊科(ED)中常见且具有诊断挑战性的情况,在计算机断层扫描(CT)之前预测损伤仍然困难。机器学习(ML)已被提出用于支持CT决策,但在这一特定人群中利用常规可获得的CT前临床变量的可行性仍

  
背景/目的:老年人低能量跌倒(LEF)后的创伤性颅内出血(tICH)是急诊科(ED)中常见且具有诊断挑战性的情况,在计算机断层扫描(CT)之前预测损伤仍然困难。机器学习(ML)已被提出用于支持CT决策,但在这一特定人群中利用常规可获得的CT前临床变量的可行性仍不清楚。本研究针对明确的老年人急诊患者LEF后回顾性队列,对用于CT前tICH预测的ML管线配置进行了系统性探索性基准测试。方法:研究人员对来自两所大学医院ED的回顾性观察性双中心研究进行了二次分析,纳入2250例年龄≥65岁、LEF后就诊并接受头颅CT的患者。临床数据从电子健康档案(EHRs)中手动提取。根据常规可获取性和≤10%缺失率,选取了从电子健康档案中获得的18个CT前临床特征。总体而言,1224个有效的ML管线配置——结合九种分类算法、六种插补策略、四种类别平衡方法以及可选的超参数调优——在训练集上通过10折分层交叉验证进行评估。排名前20的配置按交叉验证AUC排序,随后在先前检查过的探索性保持测试集(n = 563)上进行评估;在20个配置中,有17个可评估训练衍生的排除操作点,因为三个调优的SVM配置缺少存储的折外预测。结果:tICH患病率为7.0%(n = 158)。在排名前20的配置中,保持集AUC范围为0.517至0.585,马修斯相关系数接近零,平衡准确率约为50%,表明差异在于操作点而非判别能力。部分排名靠前的管线达到了较高的交叉验证AUC(最高0.679),但在默认0.5阈值下未检测到任何病例——这是类别不平衡下决策阈值的影响,而非模型排序判别能力的体现,后者本身有限(保持集AUC为0.517–0.585)。结论:尽管对1224个ML管线进行了全面的探索性基准测试,常规可获得的CT前临床特征并未提供足够的判别信号,无法在该队列(CT影像检查的LEF后老年人)中开发出临床有用的tICH预测模型。这些发现表明,所评估的配置均未产生临床充分的性能;这种接近随机的表现在所有管线中持续存在,最可能反映了有限的特征信号、低结局患病率以及在该事件率下低于可靠模型开发所需水平的样本量的组合效应。未来研究应针对更大规模的前瞻性多中心队列,并评估额外的特征域,包括结构化临床检查发现、即时检测生物标志物和影像特征。
**论文解读:基于常规CT前临床变量的老年人低能量跌倒后创伤性颅内出血预测——一项双中心回顾性系统基准研究**

**一、研究背景与研究目的**

随着人口老龄化进程,急诊科(ED)日益频繁地接诊跌倒后的老年患者。看似轻微的头部创伤,尤其是在老年人中,也可能导致创伤性颅内出血(tICH),这主要与年龄相关的脑萎缩、桥静脉脆弱、多重共病及抗血栓药物的广泛使用有关。低能量跌倒(LEF),通常定义为从站立高度或更低处跌落,是老年人头部损伤的主要机制,其tICH发生率在急诊队列中约为5%至7%。及时的头颅计算机断层扫描(CT)对于避免遗漏出血至关重要,但宽松的扫描策略却导致了影像学的过度使用、资源消耗和辐射暴露。当前的临床决策规则如加拿大CT头颅规则等,虽改善了轻微头部损伤患者的评估,但这些规则在老年人群中特异性往往较低,导致大量不必要的CT扫描。尽管机器学习(ML)被提出可通过整合多项床边变量生成个体化的tICH概率估计以辅助CT决策,但在这一特定老年LEF人群中,系统性地评估常规可获得CT前临床变量是否包含足够的判别信号尚未得到验证。本研究旨在通过系统探索性基准测试,评估基于常规电子健康档案(EHRs)的CT前临床特征在双中心回顾性队列中对tICH的预测可行性及其性能极限。

**二、研究方法与队列概况**

研究数据来源于瑞士巴塞尔大学医院和德国慕尼黑LMU大学医院两个急诊科的双中心回顾性观察性研究,纳入2016年1月1日至12月31日期间,年龄≥65岁、LEF后48小时内接受头颅CT的2250例患者(tICH患病率7.0%,n=158)。研究严格遵守《赫尔辛基宣言》和STROBE指南,并获得两机构伦理委员会批准。临床数据由两名经过培训的独立观察者从完整的电子健康档案中手动提取,所有差异由第三名观察者裁定。研究人员最初识别出34个候选预测特征,基于常规可获取性和≤10%缺失率的实用标准,最终保留18个CT前临床特征,涵盖人口学特征(年龄、性别)、分诊参数(格拉斯哥昏迷量表[GCS]、急诊严重度指数[ESI])、跌倒机制、临床发现(意识丧失、锁骨上损伤征象)、抗凝和抗血小板状态、多重用药及实验室值(血清钠、血小板计数、凝血酶原时间[Quick])。分析队列按75%:25%分层随机分为训练集(n=1687)和保持测试集(n=563)。研究人员采用mlr3生态系统构建ML管线,组合六种数值插补策略、四种分类插补策略、四种类别平衡策略(包括合成少数类过采样技术[SMOTE])及九种分类算法,并可选配超参数调优。在排除72个不兼容组合后,共有1656个配置提交基准测试,其中1224个配置成功完成,由10折分层交叉验证评估CV-AUC,排名前20的配置在保持测试集上评估。为评估样本量充分性,研究应用Riley等提出的最小样本量标准作为量级参考。

**三、主要研究结果与分析**

**3.1 研究人群与基线特征。** 在单变量组间比较中,七个特征名义上与tICH相关(p<0.05),但经Benjamini-Hochberg多重比较校正后,仅GCS(tICH组较低,p<0.001)、血小板计数(211.2 vs. 236.6×103/μL,p<0.001)和意识丧失(13.9% vs. 7.0%,OR 2.16,95%CI:1.27–3.52,p=0.004)保持显著关联。

**3.2 系统性管线基准测试框架。** 在1728个理论配置中,72个因组件不兼容而排除,432个在运行中因算法数据完整性要求而自动跳过,最终1224个配置成功完成基准测试,总计算时间为10天22小时43分钟。

**3.3 交叉验证管线评估。** 边际模式分析显示:均值插补实现最高中位CV-AUC(0.619),无插补性能最低(0.547);随机过采样在类别平衡策略中表现最佳(中位CV-AUC 0.619),无平衡策略最低(0.548);随机森林获得最高中位CV-AUC(0.646),弹性网络次之(0.641),决策树(0.561)和k最近邻(0.586)最低;超参数调优对弹性网络(+1.4%)和随机森林(+1.2%)有改善,但对极限梯度提升(?3.6%)和决策树(?2.6%)产生负面影响。

**3.4 保持集评估。** 排名前20的配置在保持测试集上,AUC范围为0.517至0.585,平衡准确率49.9%–51.7%,马修斯相关系数(MCC)接近零,表明差异在于操作点而非判别能力。11个配置(八个随机森林和三个弹性网络管线)在默认0.5阈值下交叉验证灵敏度为0%,反映类别不平衡下决策阈值效应。以具有非零交叉验证灵敏度的最高CV-AUC管线为例(随机森林、越界插补、SMOTE、无调优),保持集AUC仅0.517(95%CI:0.430–0.604),灵敏度7.5%,特异性96.0%,40例tICH中仅识别3例。训练衍生排除操作点(≥95%交叉验证灵敏度)分析中,17个配置均无法同时实现充分灵敏度与临床有用的特异性(特异性0–13%)。

**3.5 分中心分析。** 巴塞尔(n=1299)与慕尼黑(n=951)的tICH患病率分别为6.3%和8.0%,差异无统计学意义(OR 1.29,95%CI:0.93–1.78,p=0.13)。由于保持集中各中心事件数少于25例且未选择任何模型,分中心操作点性能无法可靠估计。

**3.6 tICH病例的临床特征分析。** 保持集中40例tICH病例中,23例(61%)GCS为15分,35例(92%)GCS为14或15分;仅1例记录意识丧失,34例(85%)分诊为ESI 3级或4级。在所有20个配置中,这些病例被分配的中位预测概率仅为0.102,表明无论算法、预处理或类别平衡策略如何,模型均将tICH病例判定为低风险。

**四、讨论与结论**

本研究的核心发现是:尽管对1224个ML管线配置进行了全面、系统的基准测试,常规可获得的CT前临床特征在老年人LEF后tICH预测中的判别能力始终接近随机水平。这一结果最可能反映了有限的特征信号、低结局患病率(7.0%)以及在此事件率下训练样本量(n=1687,118例事件)远低于可靠模型开发所需规模的综合效应。应用Riley等的最小样本量标准,达到预期AUC 0.65所需样本量估计约为8500名患者(594例事件),约为本研究训练样本的五倍。样本量不足导致过拟合和乐观的交叉验证估计,表现为CV-AUC至保持集AUC下降0.155。当保持模型固定而重复200次分层随机分割时,保持集AUC在0.507至0.694之间波动(中位0.606),跨度近0.19 AUC单位,而固定分割仅改变模型随机种子时波动仅0.039,表明保持集估计受分割方式影响远大于模型本身。值得注意的是,针对老年人LEF特异性开发的跌倒决策规则(Falls Decision Rule, FDR)在相似患病率(6.1%)人群的前瞻性外部验证中,以31.9%的特异性达到了97.9%的灵敏度和99.5%的阴性预测值,可减少约三分之一的CT使用,与本研究形成了鲜明对比。这一对比表明,局限性在很大程度上源于可用特征集的判别内容不足,而非ML方法本身的能力限制。未来研究应建立更大规模的前瞻性多中心队列,纳入结构化临床检查发现、即时检测生物标志物和影像特征等额外特征域,并采用严格的预指定验证设计。在现阶段,包括专门针对LEF老年人开发和验证的FDR在内的既定临床决策规则,可能仍是为该人群CT决策提供循证框架的适当选择。本研究通过透明、完全可复现的基准测试方式,系统量化了常规EHR特征集在这一真实世界急诊队列中预测性能的局限,为临床机器学习领域提供了重要的方法学参考和审慎实施的警示。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号