《Journal of Molecular Evolution》:Classification of SARS-CoV-2 Variants Through the Epistatic Circos Plots with Convolutional Neural Networks
COVID-19大流行已深刻影响全球健康,其驱动力来自SARS-CoV-2病毒显著的传播性与突变适应能力。尽管已识别出5种需关注变异株(variant of concern, VOC),即Alpha、Beta、Gamma、Delta和Omicron,但本研究中的分类任务被构建为4个类别:Alpha、Delta、Omicron和Else,这一设定反映了数据集的序列可用性及时间覆盖范围。研究人员在此构建了一种整合性框架,将直接耦合分析(direct coupling analysis, DCA)、基于Circos的可视化以及卷积神经网络(convolutional neural networks, CNNs)相结合,用于从大规模SARS-CoV-2基因组序列中表征谱系特异性的上位性特征。由DCA推断得到的成对突变耦合被转换为Circos图像,并进一步作为基于CNN的分类模型输入。所提出框架实现了稳健的变异株分类,其中表现最佳的模型取得了加权平均 \(F1\)-score 为 \(98.68\pm 0.75\%\),且AUC接近1。附加的时间保留(temporal holdout)分析显示,该框架在跨越进化时间后仍保有合理的预测能力,加权平均 \(F1\)-score 为87.85%。
COVID-19大流行已深刻影响全球健康,其驱动力来自SARS-CoV-2病毒显著的传播性与突变适应能力。尽管已识别出5种需关注变异株(variant of concern, VOC),即Alpha、Beta、Gamma、Delta和Omicron,但本研究中的分类任务被构建为4个类别:Alpha、Delta、Omicron和Else,这一设定反映了数据集的序列可用性及时间覆盖范围。研究人员在此构建了一种整合性框架,将直接耦合分析(direct coupling analysis, DCA)、基于Circos的可视化以及卷积神经网络(convolutional neural networks, CNNs)相结合,用于从大规模SARS-CoV-2基因组序列中表征谱系特异性的上位性特征。由DCA推断得到的成对突变耦合被转换为Circos图像,并进一步作为基于CNN的分类模型输入。所提出框架实现了稳健的变异株分类,其中表现最佳的模型取得了加权平均 \(F1\)-score 为 \(98.68\pm 0.75\%\),且AUC接近1。附加的时间保留(temporal holdout)分析显示,该框架在跨越进化时间后仍保有合理的预测能力,加权平均 \(F1\)-score 为87.85%。
这篇发表于《Journal of Molecular Evolution》的论文围绕SARS-CoV-2变异株的自动识别问题展开,核心目标是将病毒基因组中的上位性(epistasis,指不同突变位点之间的非加性相互作用)结构信息转化为可由深度学习识别的视觉模式,从而建立一种面向病毒进化分析与变异株分类的整合框架。研究背景在于,COVID-19大流行期间SARS-CoV-2表现出高度传播性和快速适应能力,Alpha、Beta、Gamma、Delta和Omicron等主要VOC相继出现。传统的变异株识别通常依赖单个位点突变或系统发育关系,但随着大规模基因组数据的积累,仅关注单突变已经难以充分解释病毒适应性变化,因为病毒进化常由协同突变网络驱动。尤其是上位性作用不仅影响病毒适应度,还可能关联免疫逃逸、受体结合能力及致病性改变。因此,如何从海量序列中高效提取谱系特异性的协同突变模式,成为病毒进化监测中的关键问题。
研究人员开展本研究的原因,在于现有DCA方法虽然能够从多重序列比对(multiple sequence alignment, MSA)中推断位点间直接耦合关系,并常以Circos图进行可视化,但这类图像通常依赖人工观察或常规统计分析,面对大规模、多时相、跨变异株数据时效率和可扩展性明显不足。与此同时,卷积神经网络(CNN)在图像识别中具备从复杂空间结构中自动提取特征的能力,因此研究人员尝试把DCA推断出的全基因组上位性网络可视化结果视为结构化图像,再借助CNN实现变异株自动分类。论文的核心贡献正是在统计物理启发的共进化建模与人工智能视觉识别之间建立了方法学桥梁。
在研究设计上,研究人员使用GISAID数据库中截至2022年8月23日的高质量、全长SARS-CoV-2基因组序列,共计5,465,988条,时间覆盖2019年末至2022年8月、共962天。由于Beta和Gamma在可用数据中的样本量较少且流行时间较短,难以支撑单独建模,因此最终将分类任务设定为四类:Alpha、Delta、Omicron和Else。经过按天分层、样本量筛选和序列质量过滤后,保留了906,292条Alpha序列、119,855条Delta序列、414,728条Omicron序列以及4,016,078条Else序列用于后续分析。所有序列均以“Wuhan-Hu-1”为参考进行MSA比对,并对位点与序列实施基于阈值 \(\phi\) 的两阶段过滤,以去除过于保守的位点和信息含量不足的序列。研究人员系统评估了 \(\phi =0.90\) 至0.99的效果,最终结合 \(\phi =0.95\) 与0.96两个阈值下的数据表示,以兼顾数据完整性和变异信息密度。
方法概括:研究人员以GISAID来源的大规模SARS-CoV-2全基因组序列为样本基础,先进行MAFFT多重序列比对(MSA)和位点/序列质量过滤,再采用伪似然最大化(PLM)的直接耦合分析(DCA)推断位点间成对耦合参数 \(J
ij\),选取前200个高分位点对并生成Circos上位性图像;在此基础上,构建约1,984张平衡抽样图像数据集,使用VGG13、VGG16、MobileNetV3、DenseNet121和EfficientNet_B0进行分类训练,并结合迁移学习、交叉验证和时间保留评估框架稳健性。
在理论与方法层面,论文详细介绍了DCA的统计模型基础。研究人员将比对后的基因组数据表示为Potts模型形式的Gibbs-Boltzmann分布,其中局部场 \(h
i\) 反映单个位点效应,耦合项 \(J
ij\) 反映位点间相互作用。由于精确极大似然估计在高维数据中计算代价极高,因此研究采用伪似然最大化(pseudo-likelihood maximization, PLM)估计参数,并将推断得到的 \(J
ij\) 作为上位性适应度参数的代理指标。论文还将该推断框架与拟连锁平衡(quasi-linkage equilibrium, QLE)联系起来,为从群体遗传学视角解释DCA参数提供了理论依据。随后,研究人员对每个数据子集提取耦合得分最高的200个位点对,通过Circos软件将其绘制成圆形基因组互作图,其中前50条高强度连接以颜色突出显示,较短和较长距离的连接也以不同颜色区分。最终,研究人员为各类别随机抽取约500张图像,形成CNN训练用的平衡图像数据集。
研究结果部分具有较清晰的层次结构。
Data Collection
该部分说明研究样本的来源和时间分布特征。研究人员基于GISAID收集大规模全长SARS-CoV-2基因组,并按日分层组织数据。结果显示,Alpha、Delta和Omicron分别对应明显的时间流行波峰,而Beta与Gamma始终处于较低水平,这一事实直接支持了后续四分类而非五分类的任务设置。
Data Preprocessing
在这一部分,研究人员通过清洗、对齐与过滤构建高可信度MSA,并进一步为DCA和图像生成做准备。结果表明,不同变异株在时间分布与可用样本量上差异明显,Omicron数据最丰富,Else涵盖持续低水平存在的其他谱系。该步骤为后续时序分层分析与类别平衡抽样奠定了基础。
Sequence Alignment and loci Filtering
研究人员在该部分分析过滤阈值 \(\phi\) 对保留位点数量的影响。结果显示,随着 \(\phi\) 从0.90升高至0.99,各变异株保留位点数单调增加,且当 \(\phi > 0.96\) 时增长明显加快。Omicron在所有阈值下均保留最多位点,提示其核苷酸变异性最高,而Alpha最保守。基于这一分析,研究人员选择结合 \(\phi =0.95\) 与0.96的多分辨率表示策略,以获得更适合上位性推断与后续图像分类的数据表征。
Direct Coupling Analysis
这一部分说明如何从MSA中推断位点耦合并生成Circos图。研究人员采用PLM-DCA估计Potts模型中的 \(J
ij\),并以Frobenius参数范数为位点对打分标准,提取前200个最显著耦合对。由此得到的Circos图描绘了各日期、各变异株特异性的全基因组上位性网络。研究结果显示,这些图像在内部弦线的分布、密度和拓扑布局上呈现明显谱系差异,从而为视觉分类提供了基础。
Methods for Image Classification
研究人员比较了多种代表性CNN架构,包括VGG13、VGG16、MobileNetV3、DenseNet121和EfficientNet_B0。不同模型代表了不同深度、连接方式和计算效率设计路线。该部分主要建立了公平比较的模型框架,为后续性能分析提供结构基础。
Model Training Configuration
该部分总结了统一训练策略,包括TensorFlow 2.12实现、ImageNet预训练权重初始化、输入图像统一缩放至 \(224\times 224\times 3\)、归一化和数据增强,使用随机梯度下降(SGD)优化器、动量0.9及分段衰减学习率。DenseNet121训练曲线显示训练损失快速下降且验证准确率长期稳定在98%以上,说明该训练配置能够支持稳定收敛并避免明显过拟合。
Performance from Scratch
在随机初始化训练条件下,所有CNN模型均取得较高分类性能,说明Circos图中确实蕴含可识别的谱系特异性上位性模式。其中,VGG13的加权平均 \(F
1\)-score 为 \(89.68\pm 2.41\%\),略优于VGG16的 \(88.88\pm 0.73\%\);MobileNetV3提升至 \(95.98\pm 1.83\%\);DenseNet121达到 \(96.26\pm 0.87\%\),AUC为 \(0.9989\pm 0.00019\);EfficientNet_B0表现最佳,加权平均 \(F
1\)-score 达 \(97.3\pm 1.22\%\),AUC为 \(0.9994\pm 0.00014\)。这一结果说明轻量高效或具备密集连接结构的模型更适合捕捉此类图像中的复杂全局模式。
Performance from Transfer Learning
在引入ImageNet迁移学习后,所有模型均出现更快收敛和更高稳定性。研究人员指出,即便Circos图不同于自然图像,预训练模型早期卷积层所学习到的边缘、纹理与几何轮廓等通用视觉特征仍然具有可迁移性。DenseNet121和EfficientNet_B0在迁移学习后提升尤为明显,其中最佳模型的加权平均 \(F
1\)-score 达到 \(98.68\pm 0.76\%\)。这表明基于通用视觉先验的初始化有助于增强对上位性图像复杂空间结构的识别能力。
Comparative Analysis between Random Initialization and Transfer Learning
该部分直接比较随机初始化与迁移学习。结果显示,迁移学习使所有模型的加权平均 \(F
1\)-score 普遍提升约2%–3%,AUC均超过0.99。DenseNet121受益最为显著,说明密集连接架构更能高效适配预训练特征并完成任务特异性微调。
Dropout Ablation Study
在迁移学习条件下进一步引入Dropout后,整体性能反而下降或仅有个别模型出现轻微改善,表明预训练本身已提供较强正则化作用。对这类依赖全局弦线结构和长程依赖信息的Circos图像而言,随机失活可能破坏关键判别特征,因此最终模型微调过程中未采用Dropout。
Confusion Matrix and ROC Curves
混淆矩阵显示模型预测几乎呈理想对角结构,仅Alpha与Delta之间存在轻微相互混淆,而Omicron和Else的区分极为准确。ROC曲线中各类别曲线均逼近左上角,micro-average与macro-average曲线高度重合,AUC接近1,说明模型在不同决策阈值下均具有卓越判别能力。这些结果共同证明,不同变异株对应的上位性Circos图在视觉拓扑上具有很高可分性。
Robustness and Temporal Generalization Analyses
研究人员进一步通过5折和8折交叉验证评估模型对随机划分的敏感性,结果表明不同k值下准确率、精确率、召回率和加权平均 \(F
1\)-score 波动很小,证明性能并非依赖特定数据划分。更具挑战性的时间保留分析中,训练集使用较早样本,验证集和测试集为后期样本,且后两者仅包含Omicron。此时EfficientNet模型准确率为78.86%,加权平均 \(F
1\)-score 为87.85%。虽然低于随机划分结果,但仍提示该框架在时间分布漂移下保留了中等程度的预测能力,也揭示了病毒持续进化对模型泛化带来的困难。
Discussion
讨论部分强调,本研究表明大规模SARS-CoV-2序列中蕴含的上位性互作模式包含丰富的生物学信息,可用于区分主要变异株。论文同时谨慎指出,DCA推断的耦合结构虽然与已知生物学互作在定性上相符,但并不等同于已被实验验证的因果机制,因此模型成功识别的也可能是统计规律而非直接机制本身。时间保留评估进一步提示,随机划分可能高估模型性能,而真实前瞻预测仍受到时间分布漂移限制。研究人员还指出,Alpha与Delta间少量误分可能与趋同进化有关,即不同谱系在免疫选择压力下独立获得部分功能相似的突变组合,从而在上位性图谱上产生局部重叠。总体而言,结果支持SARS-CoV-2适应性进化具有较强模块化特征,不同主流谱系占据适应度景观中的不同区域,而DCA得到的成对耦合已能捕获其中相当一部分选择结构。
研究结论翻译如下:研究人员在本研究中开发了一种整合框架,将群体遗传学理论、统计上位性推断与深度学习结合起来,通过上位性互作特征对SARS-CoV-2基因组变异株进行分类。通过在拟连锁平衡(QLE)近似下应用直接耦合分析(DCA),研究人员获得了能够表征病毒进化历史中协同突变依赖关系的谱系特异性耦合模式。基于Circos的上位性网络可视化提供了紧凑且具有可解释性的全局互作结构表示,CNN则能够从中提取稳健的判别特征。跨多种网络架构的结果表明,迁移学习显著提高了分类精度,其中DenseNet121和EfficientNet_B0取得了极具竞争力的性能。混淆矩阵和ROC分析进一步证实,不同SARS-CoV-2变异株的上位性景观具有很强的可分离性,表明主要谱系占据了由协同进化突变模块塑造的不同适应度景观区域。这些结果不仅验证了所提方法的预测能力,也支持DCA推断的上位性耦合作为描述病毒进化约束的有效指标。该方法学框架还为未来基因组监测和进化推断提供了多个潜在方向,包括对新出现变异株的实时识别、对更高阶互作模块的挖掘,以及向流感病毒、HIV和虫媒病毒等其他快速进化病原体的推广应用。总体而言,该研究通过整合基于统计物理的推断与现代计算机视觉方法,为实时基因组监测、进化预测和突变景观功能解释提供了有力工具。