《Nature Microbiology》:Phylogeny-agnostic strain-level prediction of phage–host interactions from genomes using machine learning
编辑推荐:
Bacteriophages(噬菌体和细菌病毒,phages)为治疗耐药感染和工程化微生物组提供了替代抗生素的有前景方案,但应用受限于筛选可感染特定细菌菌株噬菌体的困难。研究人员提出一种系统发生(phylogeny)无关的机器学习(machine learni
Bacteriophages(噬菌体和细菌病毒,phages)为治疗耐药感染和工程化微生物组提供了替代抗生素的有前景方案,但应用受限于筛选可感染特定细菌菌株噬菌体的困难。研究人员提出一种系统发生(phylogeny)无关的机器学习(machine learning,ML)框架,仅根据基因组序列在多个细菌属间预测菌株水平噬菌体-宿主互作(phage-host interactions)。该工作在6个数据集(115,037条互作、949个细菌菌株、518种噬菌体)上系统优化工作流程,完成1320万次训练运行,取得与物种特异性方法相当的性能和AUROC 0.67–0.94,同时消除系统发生约束。研究人员对1240条预测的Escherichia coli噬菌体-宿主互作进行实验验证,确认可泛化性(AUROC 0.84);全基因组random barcode transposon-site sequencing(RB-TnSeq)筛选显示,68.6%的实验鉴定感染介质被计算识别。模型引导的鸡尾酒设计用5种噬菌体可达97.5%细菌覆盖,单噬菌体选择较基于promiscuity的选择提升最高3.1倍。该平台支持理性噬菌体治疗设计及精准微生物组工程,可应用于临床、农业和工业场景。
研究背景方面,噬菌体因宿主特异性可在靶向病原菌时减少对有益菌群影响,是应对抗生素耐药感染的重要方向。但菌株水平噬菌体-宿主互作受受体、细胞壁结构和防御系统共同影响,现有数据多来自单一实验室、单一系统发生群,且阳性互作比例低,常仅2%–5%,数据不平衡且规模有限。已有物种特异性模型依赖已知受体结合蛋白、K-locus或尾丝基因等先验知识,难以推广到未见菌株与未见噬菌体。因此,研究人员希望构建不依赖系统发生、不需先验感染机制知识、仅用基因组即可预测菌株对菌株-噬菌体互作概率的框架。
本研究由研究人员在《Nature Microbiology》发表,核心结论是:蛋白质家族存在-缺失特征、递归特征消除与CatBoost集成梯度提升树可在多属数据上实现菌株水平预测;模型对未见噬菌体具外部泛化能力,AUROC达0.84;RB-TnSeq验证显示68.6%遗传鉴定宿主决定因子与计算预测特征一致;模型引导鸡尾酒设计显著优于基于promiscuity的基线。
关键技术方法方面,研究人员整合6个已发表数据集,包括Escherichia coli ECOR与BASEL相关队列、Klebsiella spp.与Klebsiella pneumoniae临床分离株队列、Pseudomonas aeruginosa队列及Vibrionaceae大矩阵;用MMSeqs2构建protein-family(蛋白质家族)存在-缺失特征,以recursive feature elimination(RFE,递归特征消除)筛选特征,采用CatBoost(gradient-boosted decision trees,梯度提升树)并设per-phage class weighting;通过20折交叉验证、leave-one-genus-out(LOGO,留一属外)验证、HDBSCAN(hierarchical density-based spatial clustering of applications with noise,层次密度聚类)活动组分群指导鸡尾酒设计;并以spotting assay、efficiency of plating(EOP,噬斑效率)和genome-wide RB-TnSeq(全基因组随机条形码转座子位点测序)做实验验证。
研究结果如下。
A diverse compendium of phage–host interactions:研究人员汇总6个数据集,共115,037条互作、949个细菌菌株、518种噬菌体,阳性比例2.1%–36.2%,说明数据规模与不平衡程度差异大,为跨系统发生建模提供基础。
Building a phylogeny-agnostic modelling workflow:研究人员比较200余种参数设置、训练超1320万模型,最终采用protein-family特征、RFE与CatBoost。结论是该流程可处理高维、稀疏、类别不平衡的基因组特征表,且不依赖宿主或噬菌体系统发生。
Accurate strain-level prediction across bacterial genera:在预测未见细菌菌株感染已知噬菌体时,AUROC为0.67–0.94,Matthews correlation coefficient(MCC,马修斯相关系数)为0.13–0.54,normalized area under the precision–recall curve(AUPR,标准化精确率-召回率曲线下面积)为0.07–0.60;Escherichia coli模型AUROC 0.87,接近已有物种特异性方法。数据集越大性能越稳定,Pearson r为0.60(AUROC)和0.47(MCC)。合并Klebsiella数据集可小幅提升性能;但跨属合并无显著提升,LOGO验证接近随机,说明跨属预测仍受属特异性互作决定因子限制。
Model-guided design of effective phage cocktails:研究人员用HDBSCAN将噬菌体按互作特征聚为activity groups(活动组),再按预测概率选代表噬菌体。单噬菌体选择较promiscuity基线在Escherichia coli、Klebsiella、Vibrionaceae分别提升1.1、3.1、2.7倍;5噬菌体鸡尾酒覆盖率达97.5%、87.8%、57.5%,证明模型引导选择优于启发式广宿主噬菌体策略。
Validation on unseen phages and host genes:研究人员用52种未见BASEL噬菌体对25株Escherichia coli ECOR测试1300条互作,清晰表型1240条,AUROC 0.84。RB-TnSeq在Escherichia coli ECOR27中用19种噬菌体筛出51个高得分基因,其中35个与预测特征直接、邻近或经STRING-DB关联,占68.6%,表明模型捕获的是受体、孔蛋白、脂多糖(lipopolysaccharide,LPS)、O-antigen和荚膜合成通路等真实生物学决定因子。
Predictive features recover infection determinants:经SHAP(SHapley Additive exPlanations,沙普利加性解释)分析,Escherichia coli前25个预测特征涉及细胞壁合成、可移动遗传元件、restriction modification(RM,限制修饰)系统、病毒来源基因及防御/抗防御系统;防御系统多降低感染概率,抗防御系统多增加感染概率。研究还提示putrescine catabolism与fepA调控等未充分表征机制可作为后续方向。
讨论部分总结:研究人员指出该框架不依赖受体生物学先验,性能匹敌物种特异性方法,并通过未见噬菌体与RB-TnSeq给出实验和遗传验证。其创新在于用全基因组数值表征提取信号,以动态特征过滤降低过拟合,并将概率预测转化为鸡尾酒选择。模型常识别通路中的调控基因而非全部组分,说明可捕获pathway-level regulatory mechanisms(通路水平调控机制)。RB-TnSeq主要验证非必需且适应度效应强的基因,必需基因需CRISPRi等方法补充。数据量尤其阳性互作数仍限制应用;同属不同团队数据可合并,但跨属预测受属特异性决定因子与protein-family特征表达极限影响。未来可加入环境参数、protein language model embeddings(蛋白质语言模型嵌入)和active learning(主动学习)提升迁移与筛选效率。
研究结论部分翻译:最近研究推进了噬菌体宿主范围预测的机器学习方法,但多数仍限于单属、固定受体机制或分类任务,且缺乏对预测决定因子的实验或遗传验证。相比之下,研究人员的框架在多个属间预测任意噬菌体-宿主对的二值感染结果,无需受体生物学或感染机制先验,性能与现有物种特异性方法相当。关键在于,研究人员展示了对未见噬菌体的外部泛化(AUROC 0.84)以及与全基因组RB-TnSeq检测的机制一致性:68.6%遗传验证的宿主决定因子基因与计算预测特征一致。该工作流程的创新在于将复杂全基因组数据转为捕捉充足生物学信息的数值特征表示,同时通过动态特征过滤与选择降低过拟合;分析表明机器学习实现中的算法选择比基因组表示策略对性能影响更大。与鸡尾酒设计策略整合将这些概率预测转化为可操作的治疗选择。对预测特征的生物学解释揭示了已确立和此前未表征的噬菌体易感性遗传决定因子,并提供感染过程的机制见解。该框架为理性噬菌体治疗设计和精准微生物组工程建立了计算基础设施。