
-
生物通官微
陪你抓住生命科技
跳动的脉搏
ESM-embedR:一种用于拉沙病毒和埃博拉病毒序列的比较突变分析及计算异常性评分的蛋白质语言模型框架
《BMC Bioinformatics》:ESM-embedR: a protein language model framework for comparative mutation analysis and computational atypicality scoring of Lassa and Ebola virus sequences
【字体: 大 中 小 】 时间:2026年08月10日 来源:BMC Bioinformatics 4.4
编辑推荐:
摘要背景具有大流行潜力的病毒病原体的出现和再次出现,需要强大的计算框架来在进化和功能背景下解读序列变异。拉沙病毒(LASV)属于沙粒病毒科,埃博拉病毒(EBOV)属于丝状病毒科,这两种病毒代表了不同的进化模式:拉沙病毒在西非地区表现出极高的遗传多样性,而埃博拉病毒的疫情历史上则表
具有大流行潜力的病毒病原体的出现和再次出现,需要强大的计算框架来在进化和功能背景下解读序列变异。拉沙病毒(LASV)属于沙粒病毒科,埃博拉病毒(EBOV)属于丝状病毒科,这两种病毒代表了不同的进化模式:拉沙病毒在西非地区表现出极高的遗传多样性,而埃博拉病毒的疫情历史上则表现为相对有限的遗传变异。了解这些病毒不同的突变限制机制,对于疫情监测、疫苗设计以及治疗方法的开发具有重要意义。
本研究构建了一个全面的端到端计算框架,将比较病毒学与实际应用相结合。分析涵盖了来自NCBI GenBank的2,502个糖蛋白序列(780个拉沙病毒糖蛋白序列,1722个埃博拉病毒糖蛋白序列),这些序列来自1976年至2024年所有记录在案的埃博拉病毒疫情,以及经过整理的拉沙病毒序列库。通过参考序列引导的对齐技术(MAFFT),从全基因组序列中提取出埃博拉病毒糖蛋白序列,从而实现直接、基于蛋白质结构的比较。该框架通过保守性和熵分析对MAFFT对齐后的序列位点进行约束分类,同时结合替换负担量化,以描述病毒的突变特征。此外,还利用ESM-2蛋白语言模型对序列进行嵌入空间分析,通过中心点几何结构、异常值检测以及PCA可视化等方法,提供补充性的描述性分析。在监督分类和实际应用方面,该框架采用简单且易于理解的组成特征(如序列长度和氨基酸频率),而非ESM-2嵌入向量,这一设计选择旨在提升部署效率与可解释性。分类器还与一个计算异常性评分层相结合,用于量化序列与训练集中心点的偏差程度。
比较分析显示,这两种病毒的突变结构存在显著差异。埃博拉病毒糖蛋白序列的位点约束几乎完全,其中94.7%的对齐位点被归为“关键型”,5.3%被归为“保守型”;而拉沙病毒糖蛋白序列则具有较高的灵活性,92.0%的位点为“热点型”,5.3%为“中间型”,2.2%为“保守型”,仅有0.5%为“关键型”。ESM-2嵌入分析结果也支持了这一发现。在经过匹配的糖蛋白序列上,逻辑回归分类器的性能极为理想(准确率、精确率、召回率、F1值以及ROC-AUC值均为1.000),这表明两种病毒可以很好地区分开来,但需注意,这一性能并不能直接推广到所有独立的埃博拉病毒或拉沙病毒变种,还需进一步验证。该模型还与一个可解释的异常性评估层相结合,生成具有明确解释范围的异常性指数、异常性z分数以及自然语言描述,这些内容可通过公共的Streamlit应用程序进行展示。
本项工作的创新之处在于,它将多种成熟的方法(位点级约束分析、替换负担量化、蛋白语言模型嵌入分析、可解释的分类方法以及异常性评分)整合到一个可重复、可公开部署的流程中,用于拉沙病毒与埃博拉病毒的序列比较分析。虽然这些方法单独使用都有先例,但将它们整合在一个统一的框架中,能够把静态的比较结果转化为动态且易于使用的序列分析功能,这才是这项研究的主要贡献。
具有大流行潜力的病毒病原体的出现和再次出现,需要强大的计算框架来在进化和功能背景下解读序列变异。拉沙病毒(LASV)属于沙粒病毒科,埃博拉病毒(EBOV)属于丝状病毒科,这两种病毒代表了不同的进化模式:拉沙病毒在西非地区表现出极高的遗传多样性,而埃博拉病毒的疫情历史上则表现为相对有限的遗传变异。了解这些病毒不同的突变限制机制,对于疫情监测、疫苗设计以及治疗方法的开发具有重要意义。
本研究构建了一个全面的端到端计算框架,将比较病毒学与实际应用相结合。分析涵盖了来自NCBI GenBank的2,502个糖蛋白序列(780个拉沙病毒糖蛋白序列,1722个埃博拉病毒糖蛋白序列),这些序列来自1976年至2024年所有记录在案的埃博拉病毒疫情,以及经过整理的拉沙病毒序列库。通过参考序列引导的对齐技术(MAFFT),从全基因组序列中提取出埃博拉病毒糖蛋白序列,从而实现直接、基于蛋白质结构的比较。该框架通过保守性和熵分析对MAFFT对齐后的序列位点进行约束分类,同时结合替换负担量化,以描述病毒的突变特征。此外,还利用ESM-2蛋白语言模型对序列进行嵌入空间分析,通过中心点几何结构、异常值检测以及PCA可视化等方法,提供补充性的描述性分析。在监督分类和实际应用方面,该框架采用简单且易于理解的组成特征(如序列长度和氨基酸频率),而非ESM-2嵌入向量,这一设计选择旨在提升部署效率与可解释性。分类器还与一个计算异常性评分层相结合,用于量化序列与训练集中心点的偏差程度。
比较分析显示,这两种病毒的突变结构存在显著差异。埃博拉病毒糖蛋白序列的位点约束几乎完全,其中94.7%的对齐位点被归为“关键型”,5.3%被归为“保守型”;而拉沙病毒糖蛋白序列则具有较高的灵活性,92.0%的位点为“热点型”,5.3%为“中间型”,2.2%为“保守型”,仅有0.5%为“关键型”。ESM-2嵌入分析结果也支持了这一发现。在经过匹配的糖蛋白序列上,逻辑回归分类器的性能极为理想(准确率、精确率、召回率、F1值以及ROC-AUC值均为1.000),这表明两种病毒可以很好地区分开来,但需注意,这一性能并不能直接推广到所有独立的埃博拉病毒或拉沙病毒变种,还需进一步验证。该模型还与一个可解释的异常性评估层相结合,生成具有明确解释范围的异常性指数、异常性z分数以及自然语言描述,这些内容可通过公共的Streamlit应用程序进行展示。
本项工作的创新之处在于,它将多种成熟的方法(位点级约束分析、替换负担量化、蛋白语言模型嵌入分析、可解释的分类方法以及异常性评分)整合到一个可重复、可公开部署的流程中,用于拉沙病毒与埃博拉病毒的序列比较分析。虽然这些方法单独使用都有先例,但将它们整合在一个统一的框架中,能够把静态的比较结果转化为动态且易于使用的序列分析功能,这才是这项研究的主要贡献。
生物通微信公众号