基于随机森林和SHAP分析的防控措施与基孔肯雅热发病率之间的预测关联

《PLOS Pathogens》:Predictive association between control measures and chikungunya fever incidence based on random forest and SHAP analysis

【字体: 时间:2026年09月04日 来源:PLOS Pathogens 4.9

编辑推荐:

  背景:研究人员利用2025年佛山市禅城区基孔肯雅热(chikungunya fever, CHIK)暴发数据,应用随机森林(random forest, RF)回归模型结合SHapley Additive exPlanations(SHAP)方法,探讨环境-社

  
背景:研究人员利用2025年佛山市禅城区基孔肯雅热(chikungunya fever, CHIK)暴发数据,应用随机森林(random forest, RF)回归模型结合SHapley Additive exPlanations(SHAP)方法,探讨环境-社会因素与村/社区级累积发病率之间的预测关联、非线性关系及潜在阈值,为蚊媒疾病的分层控制提供依据。

方法学/主要发现:这项横断面生态学研究涵盖143个村/社区,结局变量为累积发病率,评估了9个候选协变量,包括住院隔离率、建筑工地密度和人口密度。使用方差膨胀因子(variance inflation factor, VIF)检查多重共线性。模型拟合度通过袋外(out-of-bag, OOB)R2、均方根误差(root mean squared error, RMSE)和平均绝对误差(mean absolute error, MAE)评估,变量重要性通过%IncMSE评估。通过100次重复运行、SHAP依赖图的bootstrap阈值以及排除内生性隔离率的敏感性分析检验稳健性。在log(1+发病率)尺度上,OOB R2为0.206,且高发病率区域被低估。住院隔离率具有最高重要性(%IncMSE=18.43),与预测值呈负相关(ρ= ?0.749),但这可能反映反向因果,仅具有预测性。建筑工地密度呈强正相关(ρ=0.855),在约12.8个/km2处存在稳定阈值;在去除隔离率后仍是最稳健的预测因子(%IncMSE=8.54)。

结论/意义:建筑工地密度是最稳健的环境预测因子,而人口密度贡献甚微。这些探索性的预测关联——而非因果效应——应指导风险分层,并需使用时间匹配的纵向数据进行前瞻性验证。

作者总结:基孔肯雅热是一种蚊媒疾病,引起发热和长期关节痛。近年来,全球暴发规模不断增大,构成严重公共卫生挑战。2025年,中国南方的佛山市经历了该国迄今记录的最大规模本土获得性基孔肯雅热暴发。研究人员聚焦于佛山城区核心禅城区,该区143个村/社区共报告1404例病例。研究问题是:即使在同一行政区内,为何部分社区的病例数远高于其他社区?通过一种可解释的机器学习方法(随机森林结合SHAP分析),研究人员检验了哪些环境和社会因素预测了社区级发病率。小型建筑工地的密度——这些工地容易积累废弃的盛水容器,成为蚊子繁殖地——是最稳定的环境预测因子:风险仅在跨越明确阈值(约每平方公里13个工地)后才急剧上升,而非逐渐上升。相比之下,在已经拥挤的环境中,总体人口密度的预测价值很小,表明精细尺度下的环境暴露比人口规模更重要。住院隔离率与较低发病率表现出最强的统计学关联,但研究人员对此持谨慎态度:成功控制疫情的社区往往达到更高的隔离率,因此这更可能反映对流行病的应对,而非隔离减少传播的证据。作为基于单一时间点数据的探索性分析,研究指出了对标记高风险社区和分配有限控制资源有用的预测关联——而非因果效应——并需要通过前瞻性研究加以确认。
基孔肯雅热(chikungunya fever, CHIK)是由基孔肯雅病毒(chikungunya virus, CHIKV)引起的急性传染病,主要通过伊蚊传播。近年来全球CHIK暴发规模不断扩大,且与登革热和寨卡病毒共享媒介,常呈7~8年周期性流行,给公共卫生带来严峻挑战。中国自2008年广东省报告首例输入性CHIKV病例后,多数病例为散发输入,未形成持续本地传播。2025年7月,广东省佛山市暴发了中国迄今最大规模的本地获得性CHIK疫情,累计报告实验室确诊25,517例,其中佛山市10,847例,核心城区禅城区报告1,404例,占全市12.94%。该疫情基本再生数(basic reproduction number, R0)高达16.3(95% CI: 15.0–17.5),倍增时间仅3.5天,远高于2010年东莞疫情。现有蚊媒疾病控制措施评估方法主要包括基于传播动力学的机制模型(如SEIR模型)和依赖历史数据的统计/机器学习模型,但机制模型对传播参数敏感、依赖先验假设,传统统计模型假定线性关系,难以捕捉复杂非线性交互。为此,研究人员采用随机森林(random forest, RF)回归模型结合SHapley Additive exPlanations(SHAP)分析,以禅城区143个村/社区为分析单元,探索环境-社会因素与村/社区级累积发病率的预测关联、非线性关系和潜在阈值,为分层控制提供依据。该研究发表于《PLOS Pathogens》。

研究采用横断面生态学设计,以143个村/社区为分析单元。结局变量为村/社区累积发病率(‰),对log(1+累积发病率)进行变换。候选协变量包括住院隔离率、建筑工地密度、人口密度等9项,其中沃尔巴克氏体(Wolbachia)生物干预因仅覆盖5个村/社区(3.50%)仅作描述性分析,不纳入模型。随机森林模型以袋外(out-of-bag, OOB)R2、均方根误差(RMSE)和平均绝对误差(MAE)评估拟合;变量重要性以%IncMSE衡量。采用方差膨胀因子(VIF)和Spearman相关检验多重共线性。通过100次重复建模评估重要性稳定性,SHAP依赖图结合bootstrap(100次)估计阈值型交点,并构建排除住院隔离率的七变量模型进行敏感性分析。所有分析均在R 4.5.2中完成。疫情数据来自中国疾病预防控制信息系统,
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号