基于NanoString全血免疫应答谱的COVID-19树模型分类:全数据集与留一交叉验证嵌入式特征选择的比较
《Viruses》:Tree-Based Classification of COVID-19 Using NanoString Whole-Blood Immune-Response Profiles: Comparison of Full-Dataset and LOOCV-Embedded Feature Selection
【字体:
大
中
小
】
时间:2026年09月14日
来源:Viruses 3.5
摘要
背景:全血转录组图谱分析可捕获与 COVID-19 相关的全身免疫反应改变,并可能支持基于宿主反应的分类。然而,关于靶向免疫基因面板的鉴别价值证据仍然有限,且在小规模、高维数据集中,特征选择的时间点可能会严重影响模型性能和解释性。目的:本研究旨在评估 NanoString 人类免疫学面板图谱是否能区分 COVID-19 与健康对照测量值,并比较全数据集特征选择(FDFS)与留一法交叉验证(LOOCV)嵌入特征选择(LEFS)。方法:分析了公开可用的 E-MTAB-8871 数据,包含 579 个基因和 32 个全血转录组图谱。该数据集包括来自三名参与者的 22 项纵向 COVID-19 测量值和来自 10 名健康对照的 10 项测量值。使用弹性网络正则化进行特征选择。使用样本级 LOOCV 评估了随机森林、XGBoost 和 LightGBM 分类器。使用基于阈值、判别和概率的指标评估模型性能。使用 SHapley 加和解释(SHAP)分析了一个单独的探索性 LightGBM 模型,以表征特征贡献。结果:FDFS 确定了一个固定的 40 个基因集,而 LEFS 每次折叠平均选择 42 个基因(范围:40–47)。LightGBM 在两种框架下均正确分类了所有 32 个测量水平图谱(源自 13 名唯一参与者:10 名健康对照和 3 名纵向采样的 COVID-19 参与者),在 FDFS 和 LEFS 框架下分别达到了 1.000 的受试者工作特征曲线下面积(ROC-AUC)和精确率 - 召回率曲线下面积(PR-AUC)值,以及 0.005 和 0.006 的 Brier 分数。随机森林的准确率分别为 0.969 和 1.000,而 XGBoost 在两种框架下的准确率均为 0.969。SHAP 分析一致地将 AICDA 确定为模型预测的主要贡献者,其次是 ARHGDIB。结论:这项探索性分析表明,靶向 NanoString 免疫反应图谱包含一种紧凑的转录组信号,能够在所分析的数据集中区分 COVID-19 与健康对照测量值。这些发现提供了内部测量水平鉴别的概念验证证据。然而,由于 COVID-19 图谱仅由三名参与者的重复测量组成,样本级 LOOCV 并不构成独立的参与者级验证。需要在包含独立采样参与者的大规模队列中进行外部验证。鉴于 COVID-19 组仅包含三名独立参与者,这些生物学发现应被视为假设生成性的,并需要在规模大得多的独立队列中进行验证。
生物通微信公众号
生物通新浪微博
今日动态 |
人才市场 |
新技术专栏 |
中国科学人 |
云展台 |
BioHot |
云讲堂直播 |
会展中心 |
特价专栏 |
技术快讯 |
免费试用
版权所有 生物通
Copyright© eBiotrade.com, All Rights Reserved
联系信箱:
粤ICP备09063491号