机器学习的COVID-19传播动力学、人口统计学风险因素及接触者追踪结局分析——以尼日利亚为例

《Discover Public Health》:Machine learning analysis of COVID-19 transmission dynamics demographic risk and contact tracing outcomes in Nigeria

【字体: 时间:2026年09月04日 来源:Discover Public Health 1.3

编辑推荐:

  冠状病毒2019(COVID-19)大流行给尼日利亚等发展中国家带来了巨大挑战,原因是其资源有限。准确预测疾病传播对于采取有效遏制措施至关重要。本研究探讨了统计学和机器学习(machine learning,ML)技术在尼日利亚COVID-19病例建模与预测中

  
冠状病毒2019(COVID-19)大流行给尼日利亚等发展中国家带来了巨大挑战,原因是其资源有限。准确预测疾病传播对于采取有效遏制措施至关重要。本研究探讨了统计学和机器学习(machine learning,ML)技术在尼日利亚COVID-19病例建模与预测中的应用,使用了2020年1月至2021年12月期间的数据。通过分析人口统计学数据(年龄、性别、地点)、症状模式和接触者追踪信息,研究人员旨在识别与疾病传播相关的相关性和时间趋势。从尼日利亚国家疾病控制中心(National Centre for Disease Control,NCDC)获取的数据集经清洗后,采用皮尔逊相关(Pearson's Correlation)、方差分析(Analysis of Variance)和克莱默V相关(Cramer's V Correlation)进行统计分析。预测采用随机森林(random forest,RF)分类模型,该模型在Python的scikit-learn库中实现。主要发现包括:(1)94.97%的确诊接触者检测呈阳性,突显了高传播率;(2)医护人员和学生等职业属于高风险群体;(3)RF模型在源头病例分类方面达到了90.8%的准确率,但在少数类别的分类上仍存在困难。这些发现可为基于证据的政策制定提供参考,并有助于减轻未来疫情暴发的影响。本研究的一个主要局限性在于其依赖于NCDC数据的准确性。
**尼日利亚COVID-19传播动态的机器学习分析:研究解读**

**一、研究背景与意义**

自2019年底新型冠状病毒病(COVID-19)疫情暴发以来,这场全球性公共卫生危机对各国的医疗体系、社会经济和治理能力提出了前所未有的挑战。与发达国家相比,尼日利亚等发展中国家因人力、财力和物力资源的限制,面临的困境更为严峻。在这场疫情中,尼日利亚独特的人口结构、社会经济状况和环境因素深刻影响了COVID-19的传播格局。其高城市人口密度、年轻化的人口构成、参差不齐的医疗基础设施以及特定的社会文化习俗,共同塑造了疫情在该国的演进轨迹。准确预测疾病传播对于采取有效的遏制措施至关重要;然而,尼日利亚的医疗体系在疫情早期面临病例低报、检测能力有限以及难以执行遏制措施等多重挑战,这使得追踪和建模COVID-19传播变得尤为困难。尽管全球范围内针对COVID-19传播动力学的机器学习建模研究方兴未艾,但聚焦尼日利亚独特国情的系统性研究仍存在显著空白。现有研究多集中于非洲整体趋势或依赖其他地区数据,难以准确反映尼日利亚的具体状况。弥合这一研究空白,对于制定有针对性的干预措施、识别国别特异性风险因素、优化当前及未来大流行的资源配置具有重要的现实意义。为此,本研究利用尼日利亚国家疾病控制中心(NCDC)2020年1月至2021年12月的数据,采用统计学和机器学习技术,旨在回答三个核心问题:(1)人口统计学与症状学风险因素是什么?(2)传播的时间趋势如何演变?(3)源头病例与接触者之间存在怎样的关联?研究成果发表在《Discover Public Health》期刊上。

**二、主要技术方法**

研究人员在获得尼日利亚国家健康研究伦理委员会(NHREC)伦理批准后,从NCDC获取了疫情监测数据集。该数据集共包含100,627条个体记录,涉及病例分类、接触者分类、人口学信息、地理位置、职业类型及临床症状等信息。研究中,对缺失值采用了多种插补策略:分类变量以"Unknown"标记,数值变量以均值填补,位置信息以众数填补,症状信息采用前向填充法处理。在统计建模方面,应用了皮尔逊相关(Pearson's Correlation)分析连续变量间的线性关系、方差分析(ANOVA)检验组间均值差异、克莱默V相关(Cramer's V Correlation)衡量分类变量间的关联强度,并采用克鲁斯卡尔-沃利斯H检验(Kruskal-Wallis H test)比较多组间分布差异。在预测建模中,使用Python scikit-learn库构建了随机森林(RF)分类模型,以分层70:30比例划分训练集和测试集,设置100棵决策树并采用类权重平衡策略处理数据不平衡问题,以预测源头病例分类。

**三、研究结果**

**3.1 随机森林模型预测结果**

RF模型在源头病例分类预测中总体准确率达90.8%。分类报告显示,模型对"确诊病例"(占总样本绝大部分)表现出色,精确率达93%、召回率达97%,F1分数为0.95。然而,模型在少数类别的预测上存在明显不足:对"疑似病例"的精确率为67%但召回率仅56%;对"可能病例"的表现尤其薄弱,召回率仅10%(F1分数0.11),这归因于该类别的极低样本量(42例)。模型对"未分类"(精确率80%、召回率69%)和"非病例"(精确率68%、召回率70%)类别的预测表现中等。加权平均精确率、召回率和F1分数均为0.91。

**3.2 特征重要性分析**

通过SHAP(SHapley Additive exPlanations)方法量化各特征对模型预测的贡献。结果表明,接触者分类是最具影响力的预测特征,其次是责任州(responsible state)、最后接触日期(date of last contact)和责任地方政府区域(responsibleLGA)。地理特征(州、地方政府区域和区)合计占模型总影响的重要比例,凸显了空间聚集和区域报告模式在分类结果中的核心作用。时间变量也显著贡献于决策,表明模型对报告时间线和接触者追踪动态具有敏感性。相比之下,年龄和性别等人口统计学变量贡献较低但不可忽视;而临床症状变量(如发热、头痛、咳嗽等)因数据稀疏性,其SHAP值接近零,对模型预测几乎无贡献,这反映了监测数据中临床信息缺乏的结构性局限。

**3.3 性别与体温的多元分析**

箱线图分析显示,无论是否为确诊病例,男性和女性的体温分布高度相似,中位数均为36.2°C,典型范围在35°C至38°C之间。男性群体中存在少数体温超过39°C的异常值,这些高体温案例在确诊病例中明显减少,提示高于39°C的发热可能并非COVID-19的典型表现。皮尔逊相关系数约为-0.0027,表明性别与体温之间几乎不存在线性关系;ANOVA检验p值为0.716,进一步证实性别间平均体温无显著差异。

**3.4 性别与职业的相关性**

职业分布统计显示,"其他"类别、学生/中小学生和医护人员在男女两性中均占据最高比例。大多数职业中男性人数略高于或接近女性,但医护人员和家庭主妇职业中女性人数明显更多。相关性矩阵显示,各职业中男性和女性人数存在强正相关(r=0.89),表明某职业中女性人数较多时,男性人数也往往较多。此外,年龄分布分析显示,确诊COVID-19病例主要集中在10至39岁年龄段,与该国年轻化人口结构一致。

**3.5 职业与体温的关联分析**

箱线图显示,大多数职业的体温中位数介于36°C至37°C之间。"与动物接触工作者"的体温中位数较低,而"商人/女商人"、"学生/中小学生"和"农民"的体温值分布离散程度较高。"运输从业者"、"传统/精神治疗师"、"屠夫"和"狩猎/野味贸易者"的体温中位数略高于其他职业。克鲁斯卡尔-沃利斯H检验得到p值为3.28×10?2?,表明不同职业类别间的体温分布存在统计学显著差异。

**3.6 各年龄组和职业的症状频率分布**

在有症状记录的确诊病例中,最常见的报告症状包括发热、咳嗽、疲劳或全身无力以及呼吸困难/呼吸困难。其他报告症状包括头痛、咽喉痛、肌肉疼痛和味觉或嗅觉丧失。发热在0-18岁和36-50岁年龄组中更为常见;咳嗽在66岁以上年龄组中占比最高;头痛在0-18岁年龄组中报告频率较高。职业分布分析表明,"其他"类别占确诊的18.5%,学生/中小学生占13.6%,医护人员占9.39%,商人/女商人占4.59%,家庭主妇占2.62%。值得注意的是,职业字段存在大量缺失(约46%)。

**3.7 分类变量的克莱默V相关分析**

克莱默V相关分析揭示了变量间的关联强度:地理位置相关变量间呈极强关联,如责任州与责任LGA(V=0.998)、责任LGA与责任区(V=0.993);报告与分类变量间呈中等关联,如接触者分类与报告日期(V=0.422)、接触者分类与责任州(V=0.393);人口统计学变量间的关联普遍较弱,如性别与职业类型(V=0.170)、性别与接触者分类(V=0.017)。部分变量由于变异性不足未能纳入分析。

**3.8 变量的方差分析**

ANOVA结果显示,年龄和体温在不同职业类型和管理区域中差异显著:职业类型中年龄差异(F=480.00, p<0.001)和体温差异(F=12.86, p<1.52×10?3?)均达高度显著水平;责任州、责任LGA和责任区在体温方面亦表现出显著差异(F=33.70-17.50, p<5.37×10?1?2)。接触者状态、源头病例分类、随访状态和年龄组对体温也有较小但统计学显著的效应。这些结果强调职业和行政因素对年龄和体温变异的实质性贡献。

**四、讨论与结论**

讨论部分指出,尼日利亚独特的 socio-demographic(社会人口学)格局——以年轻人口为主(中位年龄36.8岁)、高城市密度和不均衡的医疗资源可及性——塑造了COVID-19病例的不均匀分布。与全球老年人高风险模式不同,尼日利亚10-39岁年龄组感染集中,这与其超过60%人口在30岁以下的人口特征以及城市拥挤、非正规就业依赖和遏制措施依从性降低等因素相关。医护人员和学生作为高暴露群体的高风险地位得到验证。SHAP特征重要性结果具有重要的流行病学意义:接触追踪系统信息的主导地位说明监测基础设施在病例判定中的核心作用,空间变量的重要性反映了区域传播强度、检测策略和报告实践的异质性,而症状变量的微弱贡献则暴露了临床数据收集的缺口。94.97%的密切接触者检测阳性率强有力地验证了接触者追踪措施的有效性;而"非接触者"类别中存在的309例确诊病例则提示社区传播的普遍性,可能与农村地区低报和检测不足有关。正如Ojokoh等人[20]所指出,这些发现对制定精准化公共卫生干预策略具有重要意义。

研究结论部分总结如下:这项研究利用统计分析和机器学习,围绕资源有限环境中COIVD-19传播轨迹的独特性的三个关键研究问题,为尼日利亚的COVID-19传播动态提供了洞见。首先,人口学分析揭示,年轻年龄组(10-39岁)以及医护人员(占病例的9.39%)和学生(占病例的13.6%)等职业面临较高风险,这可能归因于尼日利亚年轻化的人口密度以及在学校和医院等高接触环境中的暴露风险。症状模式进一步突显了筛查方案中的不足,发热和咳嗽在报告中占主导地位,而嗅觉丧失等非典型标志物未被充分认识。其次,时间趋势识别出两个明显的波次:2020年中期的一次高峰,峰值超过4000例,可能与早期大流行准备不足有关;以及2021年一次较小规模的疫情复燃,恰逢变异株出现和限制措施放宽。到2022年初,病例数急剧下降,反映出疫苗接种和既往感染所积累的群体免疫。第三,利用随机森林模型对源头病例与接触者之间的关系进行了严格分析,该模型在确诊病例分类中达到了90.8%的准确率。然而,其在少数类别预测中的局限性(例如,"可能病例"的召回率仅为10%)突显了不平衡数据带来的挑战。值得注意的是,94.97%的已确认接触者检测为阳性,这验证了接触者追踪的有效性,而"非接触者"类别中的309例病例则标志着广泛的社区传播。这些发现通过优先识别高风险人群、将传播高峰与政策空白相关联并展示机器学习在大流行预测中的潜力(尽管存在数据限制),为尼日利亚特异性大流行应对提供了先进见解。实际意义包括优先对医护人员和学生进行检测、在病例激增期间动态调整公共卫生措施,以及改进数据质量以完善预测模型。未来工作应整合流动性模式、基因组监测和社会经济变量以增强实时建模能力,同时社区参与活动可以解决农村地区的低报问题。通过弥合本地化传播分析的空白,这项研究强调了量身定制、数据驱动策略在减轻资源有限环境中COVID-19负担方面的价值,为未来大流行防范提供了框架。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号