可解释机器学习用于二元伤亡预测:来自新南威尔士州的证据

《Results in Engineering》:Explainable Machine Learning for Binary Casualty Prediction: Evidence from New South Wales

【字体: 时间:2026年08月11日 来源:Results in Engineering 9.4

编辑推荐:

  撞车条件性二元伤亡评估可支持事后分诊和道路安全筛查,然而许多机器学习研究仍受限于单一模型报告、不完整的校准评估以及解释稳定性验证的薄弱。本研究开发了一个可解释机器学习框架,利用澳大利亚新南威尔士州2020年1月至2024年12月期间记录的92,189起警方报告

  
撞车条件性二元伤亡评估可支持事后分诊和道路安全筛查,然而许多机器学习研究仍受限于单一模型报告、不完整的校准评估以及解释稳定性验证的薄弱。本研究开发了一个可解释机器学习框架,利用澳大利亚新南威尔士州2020年1月至2024年12月期间记录的92,189起警方报告事故。通过贝叶斯超参数搜索优化了随机森林(Random Forest)、XGBoost、LightGBM和CatBoost,并在一个由18,438起事故组成的保留测试集上进行了评估。使用十二个区分度、分类和校准指标评估性能,并辅以自助法置信区间(bootstrap confidence intervals)、DeLong AUC检验和McNemar检验。XGBoost取得了最高的AUC-ROC(0.839)和平均精度(0.921),而随机森林产生了校准最佳的概率估计。各模型之间AUC-ROC的窄范围(0.004)表明,进一步的提升可能更依赖于更丰富的暴露、行为、车辆和伤害结果数据,而非算法替换。SHAP TreeExplainer确定街道照明(street lighting)、弱势道路使用者参与(vulnerable road user involvement)、道路使用者动向代码(Road User Movement code, RUM code)、已定义碰撞动作代码(Defined Crash Action code, DCA code)和速度限制(speed limit)为最主要的预测信号。街道照明被解释为一个复合的背景指标,而非独立效应。跨模型斯皮尔曼相关系数(Spearman correlations)范围为0.874至0.987,表明特征排序稳定,而亚组分析揭示了地理、时间和道路使用者背景下的不同归因模式。由于若干碰撞过程变量可能仅在报告或初步编码后才能获得,该框架最好被解释为撞车条件性伤亡评估,而非碰撞前风险预测。SHAP值解释的是拟合模型行为,而非建立因果干预效应。因此,研究结果为后续的工程、灵敏度和因果评估提供了筛查证据和可检验假设。
**论文解读文章**

**研究背景与问题**
道路交通事故是全球范围内导致过早死亡和重伤的主要原因之一,每年超过100万人丧生。尽管各国持续投入道路安全资源,但在许多地区减少严重事故进展缓慢。新南威尔士州(New South Wales, NSW)是澳大利亚人口最多的州,拥有最大的州经济,其道路网络涵盖密集的城市主干道、区域高速公路和偏远乡村道路,在速度环境、道路功能、照明、基础设施、紧急救援及弱势道路使用者暴露方面差异显著。传统的事故严重程度建模多依赖统计和计量经济学方法(如逻辑回归、有序Probit等),这些方法虽提供透明参数估计,但需预设函数形式和交互项,难以捕捉大型行政事故数据库中的非线性关系和高阶交互。树集成方法(如Random Forest、XGBoost、LightGBM、CatBoost)能自动表示复杂非线性模式,但面临若干挑战:强区分度不一定保证良好校准概率;模型常被视为“黑箱”,缺乏可解释性;现有研究多仅报告最佳模型,未评估特征归因的跨模型稳定性;校准、不确定性和配对统计检验常被忽视;亚组层面的解释有限;且使用了碰撞过程变量(如RUM、DCA)的模型应被解释为撞车条件性伤亡评估,而非碰撞前风险预测。因此,本研究旨在开发一个可解释机器学习框架,用于二元伤亡预测,以填补上述空白。

**研究内容与结论**
本研究利用2020年1月至2024年12月新南威尔士州警方报告的92,189起事故,开发并评估了一个可解释机器学习框架。通过贝叶斯超参数优化了Random Forest、XGBoost、LightGBM和CatBoost四个树集成分类器,并在18,438起事故的保留测试集上进行评估,使用了区分度、分类、校准、自助法不确定性及配对统计检验等12个指标。XGBoost取得了最高AUC-ROC(0.839)和平均精度(0.921),而Random Forest实现了最佳校准(最低Brier得分和Log Loss)及最高伤亡召回率。四个模型AUC-ROC范围仅0.004,表明算法替换本身难以带来显著提升。SHAP TreeExplainer应用于XGBoost,识别出街道照明、弱势道路使用者参与、RUM代码、DCA代码和速度限制为主要预测信号。跨模型特征排序的Spearman相关系数介于0.874至0.987,表明排序高度稳定。亚组分析显示,城市事故中街道照明和弱势道路使用者变量更突出,乡村事故中速度限制、接触树木和永久道路特征更重要,夜间事故中照明和速度变量更关键,弱势道路使用者与仅车辆事故的归因结构截然不同。该研究强调,SHAP值解释的是模型行为而非因果关系,街道照明应视为复合背景指标而非独立效应。论文发表在《Results in Engineering》。

**主要关键技术方法**
研究人员使用了以下关键技术方法:1) **数据获取与链接**:从新南威尔士州道路安全开放数据门户获取92,189起警方报告事故记录和170,962条交通单元记录,通过唯一事故标识符链接。2) **特征工程**:包括交通单元聚合(生成13个二元指标和2个综合变量)、稀疏特征二值化、时间与速度特征处理(如连续小时中点、周末标识、高速度区标识),并排除目标泄漏变量。3) **模型开发**:四种树集成分类器(Random Forest、XGBoost、LightGBM、CatBoost),均通过模型内部权重处理类别不平衡(2.1:1伤亡比)。4) **贝叶斯超参数优化**:使用Optuna实现,每模型50次试验,基于5折交叉验证的AUC-ROC优化。5) **解释性框架**:SHAP TreeExplainer计算全局和个体特征归因,并评估跨模型Spearman相关性及亚组SHAP模式。6) **评估框架**:包括区分度、分类、校准、自助法置信区间、DeLong检验和McNemar检验。

**研究结果**
**4.1 二元伤亡模式的描述性分析**
通过描述性统计展示了伤亡事故(67.9%)与非伤亡事故(32.1%)的分布、年度趋势(2020至2024年事故量从约18,900降至17,200再升至19,000),以及月份、星期、道路环境(如速度限制、自然光照、城市化、首次碰撞类型、天气、道路位置)下的未调整伤亡率。例如,100-110 km/h区域伤亡率较高,行人碰撞伤亡率99.8%,乡村非城市区域致命率更高但总体伤亡率较低。

**4.2 模型性能比较**
交叉验证显示所有模型五折AUC-ROC集中在0.832-0.845。保留测试集上,XGBoost获得最高AUC-ROC(0.8390)和平均精度(0.9214),LightGBM紧随其后(0.8387)。Random Forest在0.50阈值下取得最高准确率(0.7537)、召回率(0.7402)和F1得分(0.8033),但特异性最低(0.7824);校准方面Random Forest最佳(Brier得分0.1628,Log Loss 0.4826)。DeLong检验显示XGBoost与LightGBM的AUC-ROC无显著差异,但二者均显著高于Random Forest。McNemar检验显示XGBoost与LightGBM分类无显著不对称,与其他模型有显著差异。

**4.3 全局SHAP特征归因**
对XGBoost应用SHAP TreeExplainer,街道照明(φ?=0.860)为最重要特征,其次为弱势道路使用者参与(0.490)、RUM代码(0.253)、DCA代码(0.139)、摩托车参与(0.126)、速度限制(0.095)和自然光照(0.091)。蜜蜂图显示主动街道照明与正向SHAP值关联,弱势道路使用者参与基本呈单向正向贡献,RUM代码双向贡献,速度限制在80-110 km/h区域正向贡献更明显。

**4.4 选定预测变量的SHAP依赖分析**
对速度限制、小时、弱势道路使用者参与、重型车辆参与、单车事故、永久道路特征六个变量绘制依赖图,揭示交互作用。例如,速度限制在50 km/h附近SHAP贡献接近零,70 km/h以上增加,80-110 km/h正向贡献显著;弱势道路使用者参与中行人碰撞占据正向分布上部;单车事故在高速环境下SHAP值更接近零或正向。

**4.5 跨模型稳定性与亚组SHAP分析**
跨模型Spearman相关性均超过0.87,XGBoost与LightGBM最高(ρ=0.987),街道照明、弱势道路使用者参与、RUM和DCA在所有模型中均居前列。亚组分析显示:城市事故中街道照明和弱势道路使用者变量主导;乡村事故中速度限制、树木接触和永久道路特征更重要;白天事故与全样本类似,夜间事故中自然光照、街道照明、速度限制和时间变量更突出;弱势道路使用者事故中行人、自行车、摩托车指标领先,仅车辆事故归因分布更平坦,涉及街道照明、RUM、DCA、速度限制等多种变量。

**总结讨论与结论**
讨论部分指出,模型性能高度集中,算法替换难以带来显著提升,未来应注重数据整合(如交通暴露、车辆安全特性、医院确认伤害)。街道照明的高SHAP归因应解释为复合背景信号(关联城市化、道路功能、基础设施密度、弱势道路使用者暴露等),而非独立照明效应。RUM和DCA等变量适合撞车后评估,不适合碰撞前预测。亚组模式支持上下文特异性筛查,但需通过工程诊断和因果评估验证。研究局限性包括:二元结局合并了所有伤害等级、缺乏财产损失事故数据、未包含暴露和行为变量、SHAP不解释因果、未进行特征消融或敏感性分析。未来应扩展至序数或多类结局,链接医院和交通量数据,开发前瞻性模型,并进行跨时间和跨地区验证。

结论部分翻译:本研究利用2020年1月至2024年12月新南威尔士州记录的92,189起警方报告事故,开发并评估了一个用于撞车条件性二元伤亡预测的可解释机器学习框架。通过贝叶斯超参数优化了四种树集成分类器(Random Forest、XGBoost、LightGBM和CatBoost),并在保留测试集上使用区分度、分类、校准、自助法不确定性和配对统计检验进行评估。SHAP TreeExplainer用于解释最佳模型、评估跨模型特征排序稳定性并检查亚组特定归因模式。四个模型产生紧密聚集的区分度结果。XGBoost取得最高AUC-ROC(0.8390)和平均精度(0.9214),LightGBM表现几乎相同。Random Forest区分度略低但实现了最佳校准(最低Brier得分和Log Loss)以及最高伤亡召回率。这些发现表明模型选择应反映预期分析目的。XGBoost和LightGBM更适合按相对伤亡概率对报告事故进行排序,而Random Forest在需要校准概率或更高伤亡召回率用于事后评估时可能更优。街道照明获得最大SHAP归因,但该发现不应被解释为照明独立导致更高伤亡概率的证据。该变量可能代表一个涉及照明、城市化、道路功能、基础设施密度、报告背景和弱势道路使用者暴露的复合背景信号。弱势道路使用者参与也对模型分类贡献显著,并具有更清晰的实质性解释,因为行人、自行车和摩托车驾驶人在碰撞中物理保护有限。RUM和DCA同样具有影响力,但其使用确认该框架最适合于事故信息报告或编码后的事后或近实时伤亡评估。因此,该模型不应被解释为碰撞前发生或网络风险预测系统。亚组SHAP分析显示模型归因模式随事故背景变化。城市分类与街道照明、弱势道路使用者参与和运动相关变量关联更强。乡村分类相对更重视速度限制、树木接触和永久道路特征,而夜间分类强调照明、速度和时间变量。涉及弱势道路使用者的事故与仅车辆事故也呈现不同的归因结构。这些模式为识别可能需进一步工程评估的事故背景提供了筛查证据。它们并不证明任何特定基础设施、执法或速度管理干预措施必然减少伤亡。若干局限性界定了研究范围。二元结局合并了致命、重伤、中等伤害和轻伤事故,因此不代表完整伤害严重程度梯度。财产损失事故被排除,因为它们在开放数据发布中未被系统捕获。行政记录也缺乏交通暴露、车辆安全特性、乘员属性、驾驶员损伤、分心、疲劳、紧急响应和医院确认伤害的详细信息。此外,SHAP值解释的是拟合模型行为而非因果效应。由于未对街道照明进行特征消融或敏感性分析,其直接可见性贡献无法与城市化、道路功能、基础设施密度和弱势道路使用者暴露等关联因素分离。未来研究应在数据充分完整和平衡时,将框架扩展至序数和多类伤害严重程度结局。将警方记录与医院、交通量、道路库存、车辆和实时监控数据链接将改善伤害分辨率和操作相关性。还应使用排除RUM、DCA、首次碰撞类型及其他碰撞过程变量的简化特征集开发前瞻性模型。需要特征消融、分组特征敏感性分析和因果研究设计来阐明街道照明及相关背景变量的作用。最后,时间和跨管辖区验证应确定观察到的性能和SHAP归因模式在本NSW数据集之外是否保持稳定。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号