《Genome Biology》:Decoding the cancer microbiome: multi-omics, AI, and translational opportunities
编辑推荐:
多组学(multi-omics)技术,结合人工智能(AI)技术,有望通过揭示互补数据集中的信息性模式和关联,实现对复杂癌症微生物组生物学的系统研究。在此,研究人员回顾了现有和新兴的癌症微生物组数据,讨论了AI模型的开发、解释和验证作为其整合与分析的关键考量,并
多组学(multi-omics)技术,结合人工智能(AI)技术,有望通过揭示互补数据集中的信息性模式和关联,实现对复杂癌症微生物组生物学的系统研究。在此,研究人员回顾了现有和新兴的癌症微生物组数据,讨论了AI模型的开发、解释和验证作为其整合与分析的关键考量,并提出了提高AI驱动发现的可靠性和生物学相关性的实用建议。研究人员进一步强调了将这些发现转化为临床实践的机遇与挑战,重点阐述了弥合研究导向模型与临床实施之间差距的策略。
**Introduction**
癌症是全球性健康问题,每年新增约2000万例,预计到2050年将增至3050万例。癌症的发生、进展、治疗反应和毒性受肿瘤内在因素(如突变、代谢和信号通路失调)以及肿瘤外在因素(如肿瘤微环境(TME)和肿瘤宏观环境(TMaE)中的非癌成分)共同影响。本综述聚焦癌症微生物组这一关键外在因素,涵盖肠道微生物组和肿瘤相关微生物组。早期研究集中于结直肠癌(CRC),随后发现肠道微生物组可通过全身作用调节宿主免疫和代谢。肠道微生物组参与肿瘤发生、进展、治疗反应和免疫相关不良事件(irAEs),饮食调节对其组成具有重要影响。肿瘤相关微生物组则局部作用于TME,其组成具有癌症类型特异性,可定位于肿瘤细胞和免疫细胞的胞外或胞内,并呈现空间组织。实验模型和人类数据已将其与多种癌症的进展、预后和治疗反应相关联。计算方法在癌症微生物组研究中至关重要。早期研究使用经典统计工具(如LEfSe、metagenomeSeq)识别与癌症风险、生存和治疗反应相关的类群,但高维、稀疏、零膨胀和组成性特征降低了可重复性。网络方法(如SparCC、CoNet、SPIEC-EASI)可建模微生物互作,但难以捕捉非线性关系。近来,人工智能(AI)模型尤其是深度学习,实现了微生物组与多组学数据的整合,提升了非线性高阶相互作用建模能力。然而,数据层面缺乏标准化方案,技术变异和批次效应削弱了可重复性;肿瘤相关微生物组研究面临区分真实信号与污染的挑战;模型层面存在高维小样本导致的过拟合风险,且深度学习的半黑箱特性限制了区分虚假关联与因果机制。本综述提出了一个整合框架,涵盖数据生成、预处理、AI建模、生物学解释和临床转化五个阶段。
**Cancer microbiome data resources**
**Microbiome omics data**:癌症微生物组研究通过互补的实验和计算方法产生多样数据类型。基因组学方面,16S rRNA基因测序(部分或全长)用于分类学分析,宏基因组测序(shotgun metagenomic sequencing)提供功能和组成信息。宏转录组学(metatranscriptomics)检测RNA以反映实时基因表达,但受RNA不稳定和样本处理要求限制。宏蛋白质组学(metaproteomics)直接分析表达蛋白,可鉴定蛋白标志物和代谢途径,但在癌症微生物组中的应用尚少。代谢组学(metabolomics)测量小分子,可结合参考数据库(如MiMeDB、NPAtlas、MASST)识别微生物来源代谢物,空间代谢组学还可绘制肿瘤内代谢异质性。
**Advances in intratumoral microbiome detection**:肿瘤相关微生物信号通常低丰度、稀疏且异质。早期肿瘤测序研究重新分析非人类读段,但易受污染影响。CSI_Microbe、SAHMI等计算流程可提取微生物读段,INVADEseq通过单细胞RNA测序(scRNA-seq)直接检测细胞内微生物。空间蛋白质组学(如成像质谱流式)和空间代谢组学(如DESI-MSI)可绘制微生物与宿主细胞的共存定位。
**Multi-omics and matched host–microbiome datasets**:多组学与匹配的宿主-微生物组数据集保留了样本级对应关系,支持识别微生物标志物和机制。但此类研究成本高、队列小,公共数据集多为回顾性,异质性平台整合困难。
**Preparing cancer microbiome data for AI**
**Quality control and decontamination**:肠道微生物组数据质控常用规则性过滤,AI方法(如DeepCheck、CheckM2、Deepurify)可评估基因组完整性和污染。去污染在肿瘤相关微生物组中至关重要,方法包括基于统计概率的策略(如SCRuB、CroCoDeEL)以及利用阴性对照。
**Host-read removal and taxonomic profiling**:标准流程使用Bowtie2、BWA比对去除宿主读段,Kraken2等分类微生物序列。AI方法(如DeepMicrobes、MetaTransformer)采用表示学习提高对未知或低丰度类群的泛化能力。肿瘤相关数据需严格宿主减法,PathSeq、PRISM等专用流程提高低信号环境下的分类精度。
**Practical standards for credible tumor-associated microbial signals**:可信信号应满足阴性对照、保守宿主减法、批次评估和正交验证等标准。可通过qPCR/RT-qPCR验证DNA/RNA信号,原位杂交或免疫组化确认空间定位。文献提出了综合报告清单,强调污染预防和多证据支持。
**Normalization and batch correction**:常用归一化方法包括相对丰度转换、稀化、Hellinger转换和对数比转换。归一化选择显著影响统计推断。跨研究批次校正方法如ConQuR和DEBIAS-M旨在保留与表型相关的微生物变异。肿瘤相关数据需经验评估归一化和批次校正策略,原始数据与校正数据应对比分析。
**AI modeling for cancer microbiome analysis**
**Modeling frameworks**:经典机器学习(逻辑回归、正则化模型、支持向量机、随机森林、梯度提升)强调可解释性和小样本鲁棒性,基准研究显示正则化逻辑回归和随机森林表现优异。深度学习(MLP、CNN、Transformer、图神经网络、自编码器)可建模非线性高阶相互作用,但需控制过拟合和可解释性。基础模型(如GenomeOcean、Evo2)通过自监督预训练提供可迁移表示,但在癌症微生物组应用中仍处于早期阶段。
**Functional applications of AI models**:预测癌症状态和治疗结果方面,深度学习方法(如MV-CVIB、GDmicro)区分转移性CRC、提高跨队列鲁棒性;基础模型MGM缓解数据稀缺。治疗结果预测整合微生物组和多组学特征提升预后能力。多组学整合方法(如VTrans、MOCO-GCN)建模宿主-微生物互作,但需警惕复杂化导致过拟合。模型可解释性方面,SHAP、集成梯度用于特征归因,图模型识别微生物群落(如Micah);因果推断框架(如DAG-deepVASE)有望识别非线性因果关系,但需明确假设和敏感性分析。
**Validation and reliability of AI models**:严格验证需无泄漏设计,所有数据自适应步骤仅在训练折内拟合;嵌套交叉验证、分组验证(如留一患者/批次/队列)可减少泄漏。性能评估需任务适配指标(如AUROC、PR-AUC、C-index、RMSE),并伴随置信区间和不确定性估计。独立外部验证是金标准,无法获得时用内部稳定性证据,但不能替代外部验证。实用流程包括严格质控、无泄漏管道、混淆因素调整、任务适配指标、外部验证和生物学验证。
**Cancer microbiome biology across levels of evidence**
**Cancer microbiome and tumor initiation and progression**:关联研究识别特定微生物和代谢物与肿瘤发生相关(如微生物胆碱代谢与CRC进展)。AI辅助多组学可筛选候选相互作用。实验研究提供机制证据,如胞内Fusobacterium nucleatum通过免疫调节促进肿瘤进展,产肠毒素Bacteroides fragilis通过毒素介导炎症促进乳腺癌转移。
**Cancer microbiome and treatment response**:化疗方面,关联研究显示肠道菌群多样性和特定类群预测化疗毒性及反应。机制研究证明微生物(如F. nucleatum、B. fragilis)促进化疗耐药,细菌酶(如β-葡萄糖醛酸酶)介导伊立替康毒性。免疫治疗方面,肠道和肿瘤内微生物与免疫检查点抑制剂(ICI)疗效相关,抗生素使用降低反应率;粪菌移植(FMT)实验支持功能性因果。肠道微生物也参与irAEs,但益生菌效应存在情境差异,需进一步研究。
**Clinical translation of cancer microbiome discoveries**
**Biomarker readiness and clinical utility**:翻译需经历分析验证、临床验证和临床效用三个阶段。多数癌症微生物组标志物仍处于发现阶段。粪便宏基因组分类器用于CRC最成熟,跨队列AUC约0.8;肿瘤内在微生物信号受污染问题争议;ICI预测标志物组间泛化性差。干预方面,FMT和活体生物治疗产品(如CBM588)显示初步疗效,但存在安全性风险(如耐药菌传播)。需标准化报告(STORMS)和前瞻性试验。
**AI systems for clinical decision support and translational microbiome research**:智能体AI(如Eubiota)可整合异构资源支持假设生成,但自主性受限。人类在环框架提供实例级专家干预,提高可靠性,但在癌症微生物组研究中的应用有限。数字孪生类框架有望整合纵向数据支持动态模拟,但应作为辅助工具而非替代验证。
**Conclusions and future directions**
癌症微生物组研究正从描述性关联转向整合性宿主-微生物互作分析。临床转化受限于低生物量、污染风险、队列异质性和缺乏前瞻性验证。未来需标准化流程、严格跨队列验证、纵向采样、扰动研究和多模态数据整合。口腔作为临近生态位具有潜力,如基于基因组的益生菌联合体设计。AI应被视为优先候选微生物和引导迭代转化的工具,最终推动精准肿瘤学的临床应用。