《Advanced Science》:Livestock Multi-Omics Integration: A Systematic Framework From Statistical Association to Causal Interpretation
编辑推荐:
家畜多组学整合是解析复杂性状调控的关键,然而系统的、家畜特异性的策略仍然稀缺。本文综述了从单组学积累到多维度整合的进展,强调了大规模基因组学(genomics)、表观基因组学(epigenomics)和转录组学(transcriptomics)项目如何为功能解
家畜多组学整合是解析复杂性状调控的关键,然而系统的、家畜特异性的策略仍然稀缺。本文综述了从单组学积累到多维度整合的进展,强调了大规模基因组学(genomics)、表观基因组学(epigenomics)和转录组学(transcriptomics)项目如何为功能解析奠定基础。研究人员识别出核心障碍:极端的物种多样性、显著的数据异质性、有限的样本量,以及将多组学数据普遍简化为简单的差异筛选,导致转化效率低下。研究人员批判性地评估了四种常见陷阱——过度解读相关性为因果、将蛋白质组学(proteomics)降级为转录组学(transcriptomics)的佐证、缺乏环境背景的不完整微生物组(microbiome)-宿主整合,以及系统性忽视代谢通量组学(fluxomics)——并展示了暴露组学(exposomics)和通量组学如何增加必要的因果和动态维度。针对这些问题,研究人员提出一个适用于家畜的三层分析框架:(1)跨组学协变模式的统计关联(statistical association);(2)机器学习(machine learning)驱动的特征挖掘和整合建模;(3)因果解释,包括孟德尔随机化(Mendelian randomization)、先验知识引导的网络推断,以及通过通量组学和代谢控制分析(Metabolic Control Analysis)获得的物理因果证据。研究人员进一步讨论了多模态测序(单细胞、空间、时间)和生成式人工智能如何从根本上缓解异质性并增强因果证据。最后,研究人员概述了数据库标准化、家畜特异性基准测试和转化管线方面的未来优先事项,规划了一条从相关性导向的报告到机制性因果和精准育种的路径。
1 引言
家畜支撑全球粮食安全,同时为人类医学研究和非模式生物遗传学研究提供宝贵资源。多组学技术的持续进步,以中心法则为核心概念框架,全面拓展了研究人员对家畜遗传调控原理的理解。整合多组学分析旨在通过整合基因组学(genomics)、表观基因组学(epigenomics)、转录组学(transcriptomics)、蛋白质组学(proteomics)、代谢组学(metabolomics)、通量组学(fluxomics)以及单细胞和空间组学等新兴技术的数据,获得对生物表型的因果洞见。这些多维数据的系统整合对于解析家畜复杂表型背后的潜在调控机制至关重要。然而,专门针对家畜的综合性和系统性多组学整合策略及分析方法的讨论仍然显著缺乏。有限的现有文献要么停留在单组学方法的技术介绍层面,要么讨论多组学研究中普遍遇到的通用困难。一个突出的核心挑战是家畜物种的高度多样性,不仅包括主要生产动物如牛、猪、鸡、山羊和绵羊,还包括鸭、骆驼、鹿等特化经济动物。即使在同一物种内,也存在众多遗传背景显著不同的品种。此外,从大型动物获取目标组织样本的困难、测序的高成本,以及不同研究采用的测序平台和分析方法存在显著差异,这些都加剧了困难。这些问题集中表现为显著的数据异质性和不平衡的样本量分布,以及公共数据库中经常缺乏平台标准化的矩阵数据,增加了家畜多组学数据整合的分析复杂性。随着人工智能的进步和测序技术的持续发展,开发适应家畜研究场景的新型多组学整合方法是一个非常有前景的方向。对这些方法进行系统综述和讨论,对于定义家畜多组学数据的最佳整合路径至关重要。在本综述中,研究人员系统追溯了农场动物多组学研究从单组学数据积累到多维度系统整合的演化轨迹。研究人员全面剖析了多组学整合中普遍存在的认知误区与核心科学挑战,并将讨论延伸至暴露组学(exposomics)和通量组学(fluxomics)在家畜育种研究领域的核心价值与场景适用性。在此基础上,研究人员深入讨论了多组学整合策略的方法谱系以及适用于家畜表型功能解析的核心生物信息学工具。研究人员实施了一个适用于家畜的三层整合分析框架,包括统计关联、机器学习驱动的特征选择和因果推断。同时,研究人员探讨了人工智能在家畜多组学数据分析中的应用前景,并考察了单细胞、空间和纵向多模态测序技术如何为因果机制的阐明提供稳健的数据支持。最后,研究人员对家畜多组学研究的未来发展路径进行了系统展望,涵盖多组学数据库标准化、育种场景适应型工具与算法开发、多组学成果产业转化等多个核心方向。研究人员的目的是为推进家畜复杂性状遗传解析和分子育种技术的创新发展提供系统的理论参考,从而为全球家畜产业的高质量和可持续发展做出贡献。
2 农场动物基于组学的发展和数据积累过程
基因组学(genomics)是农场动物遗传研究的核心工具,持续积累和扩展的组学资源构成了整个领域持续发展的基础。受人类基因组计划及其衍生项目的影响,测序技术的快速迭代和国际科学合作的发展,使主要农业家畜物种——牛、猪、鸡和绵羊——逐步建立了包括参考基因组构建、群体遗传变异分析和全基因组功能元件注释在内的完整技术体系。例如,1000牛基因组计划、动物泛基因组研究项目以及测序技术的持续突破,尤其使得以往难以处理的结构变异(structural variants,SVs)——包括缺失、重复、拷贝数变异和染色体倒位——得以系统性发现,这些已成为解析家畜品种分化和复杂性状遗传基础的关键变异来源。此外,端粒到端粒(telomere-to-telomere,T2T)无间隙完整基因组的组装,使猪、牛、绵羊等物种的高度重复和复杂基因组区域得到全面解析,补充了传统参考基因组中缺失的众多基因和序列信息。值得注意的是,猪的T2T无间隙基因组完全解析了复杂的重复富集区域,增加了超过一千个先前参考基因组中缺失的新基因。牛和绵羊Y染色体的T2T完整组装首次精确揭示了它们的长度差异、结构特征和基因分化模式,阐明了扩增基因家族变异是物种间Y染色体大小分化的核心驱动因素。这为了解反刍动物性染色体进化和家畜父本遗传改良提供了关键资源。此外,在此基础上,FarmGTEx项目通过大规模多组织转录组测序,鉴定了大量组织特异性的系统性顺式表达数量性状位点(cis-expression quantitative trait loci,cis-eQTLs)。这项工作目前覆盖牛、猪和鸡的核心组织,研究正逐步扩展到其他家畜物种,包括绵羊、山羊、马、骆驼、兔子和鸭。这些关键项目为解析家畜复杂经济性状的遗传调控机制提供了重要的公共资源。在功能注释层面,国际合作项目推动家畜基因组研究完成了从序列解读到功能阐明的关键转变。动物功能基因组注释(Functional Annotation of Animal Genomes,FAANG)联盟整合了包括ATAC-seq、ChIP-seq和Hi-C在内的多组学数据,系统绘制了主要家畜物种全基因组调控元件的综合图谱。同时,地方家畜种质资源的组学表征也取得了显著进展。从Butuo黑绵羊和固原牛等特色地方品种的全基因组分析,到各类特种畜禽遗传资源库的构建,农场动物基因组数据资源的覆盖面和丰富度得到了全面提升。随着基因组数据资源的不断完善和丰富,农场动物组学研究不再局限于单一基因组层面,而是逐步向多组学整合分析扩展,从而开启了从单组学到多组学的探索阶段。这些持续积累的资源也推动了针对单个家畜物种和跨物种整合的专业化多组学数据库的开发,以及承载原始和处理后组学数据的核心公共存储库的发展。它们共同构成了支撑后续章节讨论的多组学整合策略的数据基础设施。家畜多组学数据的逐步积累和关键技术里程碑在图1中进行了总结。
3 从单组学到多组学的初步探索与挑战
随着测序技术的不断发展,可获取的信息维度已从基因组学扩展到表观基因组学(epigenomics)、转录组学(transcriptomics)、蛋白质组学(proteomics)、代谢组学(metabolomics)等层面。再加上单细胞和空间组学等新兴技术的应用,农场动物研究领域现已积累了丰富的遗传数据资源。因此,整合多个组学层面以解析动物遗传表型背后的机制,是当前动物遗传学的一个主要焦点。在这些方法中,结合转录组学和代谢组学的整合分析是最具代表性的模型。具体而言,在泰和乌骨鸡的研究中,整合转录组和代谢组揭示了不同年龄肉味化合物(ω-3多不饱和脂肪酸、肌肽等)的动态变化及其与黏着斑和MAPK等通路的关联,从而揭示了年龄依赖的肉味分子网络。类似地,一项对黔东南小香鸡的研究利用整合分析鉴定了性别特异性代谢物及其与MAOA等基因的关联,阐明了组氨酸和烟酸代谢是核心的性别相关通路,揭示了肉品质性别差异的分子基础。在一项关于藏羊的养分调控研究中,整合分析揭示日粮联合添加白藜芦醇和HMB诱导肝脏中钙信号和NF-κB通路基因的上调,这些基因与富马酸、白三烯B4等代谢物在精氨酸合成和PPAR通路中共同富集;同时,血清IgM和抗氧化酶活性显著增加。这阐明了养分干预通过基因-代谢物网络调控免疫和抗氧化功能的系统机制。这些研究充分展示了整合转录组和代谢组数据分析在解析家畜复杂性状中的核心应用价值。目前,大多数其他多组学分析流程要么借鉴,要么直接采用转录组-代谢组联合分析的方法。根据生物信息流,多组学整合可分为两大范式:垂直整合和水平整合。垂直整合遵循中心法则,结合基因组学、转录组学、蛋白质组学和翻译组学(translatomics),系统解析从DNA到蛋白质的线性信息流。在此主轴上,代谢组作为基因功能的最终表型表现和物质基础,被作为垂直扩展纳入,形成从基因型到代谢终点的完整链条。水平整合则向上游扩展,专注于功能元件,如表观基因组学、三维基因组构象和非编码RNA。该范式从调控层面阐明时空特异性基因表达的分子机制。除了以中心法则为核心的垂直整合,功能元件的多组学整合是解析动物遗传机制的另一主要研究方向。具体而言,这涉及基因序列、表观遗传修饰和三维基因组构象等多维数据的联合分析。例如,Cui等人使用CUT&Tag技术鉴定了猪未成熟支持细胞中ZBTB16的基因组靶点。CUT&Tag是一种新一代DNA-蛋白质互作技术,主要用于探索组蛋白修饰区域、转录因子结合状态和全基因组DNA-蛋白质相互作用。这体现了新技术与传统基因组学分析的整合。此外,非编码RNA和RNA修饰(如m6A甲基化)的调控近年来也成为家畜多组学整合的新研究方向。除了上述两种整合视角,测序分辨率提高和额外维度带来的信息利用构成了家畜多组学研究中另一个非常有前景的领域,例如单细胞测序和空间组学等新兴技术。单细胞转录组学解决了批量测序无法区分组织内异质性细胞群的核心局限性。例如,传统的批量测序只能以批量方式检测猪胚胎骨骼肌组织中的基因表达和染色质状态,无法解析肌生成过程中的细胞类型异质性和分化动态。相比之下,整合单细胞转录组学与scATAC-seq技术,系统生成了猪胚胎体节和肌管发育的单细胞多组学图谱,构建了猪骨骼肌生成的分化轨迹,并鉴定了EGR1和RHOB等调控猪胚胎肌源性分化的关键转录因子。这为解析猪骨骼肌发育的细胞动力学和分子调控机制提供了高分辨率的核心资源。空间转录组学技术凭借其完全保留组织内原位空间信息的优势,克服了传统单细胞测序丢失细胞空间微环境信息的技术局限。这为解析家畜繁殖和疾病等重要性状的表型机制提供了新的研究思路和技术手段。例如,Jin, H.等人使用Stereo-seq空间转录组学技术,首次构建了牛睾丸组织在犊牛和成年公牛两个发育阶段的空间转录组图谱。他们鉴定了4种生殖细胞亚型和5种体细胞亚型,系统解析了牛精子发生过程中的动态转录变化,并阐明了不同发育阶段细胞间的功能差异和生殖细胞间的通讯网络。这项工作为了解大型哺乳动物精子发生机制和家畜雄性繁殖性能遗传改良奠定了核心数据基础。
4 家畜组学数据积累与转化效率低下
尽管与家畜遗传资源相关的组学数据已经全面丰富和积累,但目前畜牧业领域的组学研究仍面临数据整合效率低下和产业转化率严重不足的核心瓶颈。丰富的多组学数据资源远未实现其应有的科学价值和育种应用潜力。该领域普遍存在的一个负面倾向是将高通量组学数据降格为简单的初步筛选工具,导致数据信息的大量浪费。在已发表的家畜组学研究中,绝大多数情况下,多组学分析被转化为基于经典统计差异分析进行候选分子初步筛选的方法。以转录组和代谢组联合分析为例,研究人员通常仅通过简单的组间比较识别显著差异表达基因或差异丰度代谢物,然后宣布核心数据分析流程完成。在此过程中,原本包含多层次、丰富生物学信息的高通量数据——如转录调控动态、可变剪接事件、信号通路串扰和代谢过程变化模式——被压缩成一个简化的差异分子列表。这种简化分析模型完全忽视了组学数据在解析家畜产肉、产奶、繁殖和抗病性等复杂经济性状调控网络中的核心价值。数据中包含的绝大多数生物学信息被直接丢弃,从根本上制约了从组学数据到功能机制阐明和育种应用的路径。此外,偏颇的生物学知识和统计关联的过度解读只是部分原因。更深层次的原因是,当前的多组学整合方法常常是单组学分析模块的简单移植。这在很大程度上源于许多研究人员倾向于选择易于运行、依赖现成代码并提供用户友好型可视化的分析流程,而不是统计上更严谨、生物学适应性更好的方法。同时,足够专业的同行评审人员数量有限,这使得不太严谨的分析实践在该领域被广泛接受为“默认惯例”。更根本的是,并非每一种看起来合理的方法都能直接移植到家畜场景中——即使研究目标看似与人类相同。人类工具链依赖于大规模参考图谱、组织特异性eQTL数据库等基础设施,其标准化程度远超家畜目前可用的水平。因此,必须谨慎应用“流水线式”的大规模多组学数据整合方法,避免将不适用的工具强行移植到家畜数据上。尽管基因组学已进入以大群体和泛基因组学为特征的成熟发展模式,但非基因组组学数据受限于测序成本和动物实验费用。在已发表的大多数研究中,实验组和对照组的总样本量主要为6或12个;只有少数研究能达到较大的样本队列,勉强满足统计功效的最低要求。在某些情况下,仅为了降低测序成本,甚至存在不同测序批次样本量不一致的情况——例如,通过抽样或合并策略减少成本较高的蛋白质组学测序的样本数(仅满足最低生物学重复)。小样本量的直接后果是统计功效不足。一方面,个体家畜间固有的遗传背景异质性和饲养环境的微小波动容易掩盖真实的生物学处理效应,导致与性状强相关的核心功能分子作为假阴性结果被遗漏。另一方面,当在预设的严格统计阈值下无法识别足够数量的差异分子时,存在随意放宽统计标准的做法:从多重检验校正后的FDR值降级为未校正的原始P值,并可能进一步放宽倍数变化(Log2FC)和显著性水平等核心筛选阈值,直到获得预期数量的候选分子。这种非严谨的统计策略直接导致结果中假阳性比例大幅增加。最终,除了极少数能在后续验证中幸存的分子外,绝大多数以此方式筛选出的候选分子缺乏生物学可重复性。即使是选出的潜在候选分子,在具备转化为育种分子标记的最初潜力之前,仍然需要大量的功能验证——在细胞和分子生物学水平以及活体动物水平。漫长的验证周期加上极高的验证失败率,最终导致家畜育种靶标转化效率低下的行业困境。
5 系统多组学整合中的常见问题
5.1 相关性的过度解读
首先,相关性分析为农场动物多组学整合分析提供了一条便捷且易于理解的途径。然而,这里存在一个常见的误解:一些研究将相关性等同于因果,或将相关性视为直接相互作用的同义词。这些都是经典错误。例如,一项研究可能发现基因A与代谢物B显著相关,然后在结果中报告:“基因A与代谢物B相互作用,导致表型变化。”这样的陈述很容易被证伪。基因A与代谢物B的显著相关性可能是结果而非原因,这就是观察到相关性的原因。此外,基因和代谢物属于不同的分子维度;基因A如何影响代谢物B尚不清楚。在一个仅包含6-16个样本的数据集中,这种相关性的普适性也尚未得到证明。也就是说,仅基于数据,这构成一个研究假设而非研究结论。
5.2 蛋白质组学功能的利用不足
作为遗传信息的最终执行分子,蛋白质是家畜性状表型解析的核心靶点,也可以为精准育种提供功能性分子标记。然而,在目前的家畜多组学研究中,蛋白质组学长期被降格为辅助角色,仅用于证实转录组学的发现。无论是在与肉嫩度相关的蛋白质丰度变化研究、应激条件下关键酶活性调控分析,还是通过疾病进展中炎症通路激活筛选性状相关生物标志物,这种基于转录-蛋白质丰度相关性或一致性的分析策略被普遍采用。尽管直观简单,但这种方法导致核心遗传信息的大量丢失。研究表明,只有30%–40%的蛋白质变异可由相应的转录本水平解释。从mRNA到蛋白质的生物学过程远不止中心法则定义的线性翻译过程;它们之间存在一个复杂而动态的翻译调控层。翻译组学(translatomics)正是解析这一核心过程的关键技术。以核糖体图谱分析(ribosome profiling,Ribo-seq)等技术为核心,翻译组学专注于翻译起始、延伸和终止的整个动态过程。它可以精确解析核糖体占用、翻译延伸速率、共翻译折叠效率、上游开放阅读框(upstream open reading frame,uORF)调控和核糖体停滞等核心翻译事件。翻译组学是连接转录组和蛋白质组的关键中间桥梁,是解释转录本与蛋白质丰度不一致的核心切入点。然而,目前的家畜多组学研究几乎完全忽略了翻译组层面的调控信息,仅通过mRNA-蛋白质丰度相关性提供简单证实,完全跳过了对翻译过程本身的分析。然而,翻译效率的动态变化正是决定蛋白质最终丰度和功能的核心环节。此外,多个层面的转录后调控也显著影响蛋白质表达和功能,包括mRNA的可变剪接、非编码RNA的靶向调控,以及翻译完成后的磷酸化、乙酰化、泛素化等翻译后修饰。细胞微环境的氧化还原状态、代谢物浓度、pH等因素可以通过影响蛋白质-配体相互作用和复合物组装来动态调节蛋白质功能;甚至蛋白质构象变化可以在不改变表达丰度的情况下导致功能获得或丧失。这种仅将蛋白质组视为转录组佐证的应用模式,不仅完全丢失了翻译调控和翻译后修饰等核心调控层的遗传信息,而且导致选出的候选分子缺乏直接的功能支持。这大幅增加了后续功能验证的失败率,进一步加剧了家畜育种靶标转化效率低下的行业困境。本质上,将蛋白质组学降级为转录组学的被动验证者,系统性地丢弃了在翻译和翻译后水平编码的丰富调控信息。这不仅削弱了候选分子的功能相关性,也切断了从分子变化到表型结果的因果链。
5.3 微生物组多组学整合的视角需要完善
微生物组学(microbiomics)是分析家畜微生物群-宿主互作的核心。其技术工具箱包括16S rRNA基因测序、宏基因组学(metagenomics)、宏转录组学(metatranscriptomics)、宏蛋白质组学(metaproteomics)和代谢组学,为研究家畜胃肠道(瘤胃/肠道)微生物群落的组成、功能潜力和代谢活性提供了全面的工具。它已成为家畜营养、健康管理和性状分析的关键焦点。然而,目前大多数研究仅仅建立了微生物组、宿主内源调控系统与经济性状之间的关联,缺乏基于深度生物学洞察的系统性策略。微生物群-宿主互作常被简化为横截面统计相关性,缺乏清晰的因果调控链。大多数发现需要严格的干预实验和机制验证才能应用于实践,这使得微生物组与宿主多组学数据之间描绘的生物学联系不稳定。暴露组学(exposomics)提供了一个更广泛、更系统的框架。这一概念由Christopher Paul Wild于2005年首次提出,涵盖个体从受孕到死亡所经历的非遗传环境暴露的总和,以及这些暴露与宿主生物系统之间的动态相互作用。从暴露组学视角出发,分析微生物群-宿主功能互作,通过连接上游环境驱动因素、中间微生物介导和下游宿主反应来整合多维组学数据,更符合真实的生物学过程。采用这种方法得出的结论具有更强的因果解释力,能够更精确地解析家畜复杂经济性状的调控机制。一个值得注意的方法学范例是Valdés-Mas等人在《Cell》上发表的研究,作者在暴露组学框架内系统分析了饮食暴露、肠道微生物群和宿主肠道生理学之间的三方相互作用。在家畜环境中,暴露组学框架已展现出具体可操作性。在环境暴露层面,Seok等人对育肥猪进行了纵向多组学分析,整合粪便宏基因组学、全血转录组学和免疫细胞反卷积,追踪了热应激暴露下肠道微生物群和宿主转录组的动态变化。研究发现,热应激显著降低平均日增重和采食量,减少短链脂肪酸产生菌(如Prevotella)的同时增加Clostridium sensu stricto 1,并鉴定了516个差异表达基因,富集于造血、黏着斑、细胞骨架重塑和甲状腺激素信号相关通路。网络分析进一步将细胞骨架基因(ACTB、MYL9、ACTN4、COL4A4)确定为核心调控节点。这项工作系统构建了从环境暴露(高温)到肠道微生物群重塑、到宿主基因表达变化、最终到生产性能下降的完整暴露-反应因果链。在饮食暴露层面,另一项研究以替代日粮作为Nellore青年公牛的上游扰动变量,整合瘤胃和粪便微生物组与宿主多组织转录组学。通过基因共表达网络和微生物共丰度网络分析,研究揭示了常规日粮与替代日粮下甲烷排放与不同的微生物-宿主基因模块相关:在常规日粮下,甲烷排放与42个宿主基因和真杆菌属(Eubacterium)相关;在替代日粮下,则与18个不同的宿主基因和红蝽菌属(Ruthenibacterium)相关。该研究不仅证明了饮食暴露以日粮特异性方式重塑微生物组和宿主基因表达,而且建立了从饮食暴露到微生物代谢变化、到宿主转录反应、再到环境表型(甲烷排放)的完整响应链。在暴露组学框架的指导下,研究人员可以设计可控的暴露实验,结合纵向采样和系统多组学整合,在从暴露到微生物群、从微生物群到宿主、从宿主到表型的完整链条中识别干预节点,从而为精准营养、环境调控和抗逆育种提供决策依据。
5.4 代谢通量组学在家畜多组学整合中的利用不足
上述讨论的问题主要集中于静态组学(转录组学、蛋白质组学、代谢组学)——对相关性的误解、转录本与蛋白质之间的信息丢失,以及缺乏环境背景的微生物组关联——而忽视了细胞代谢的动态性。代谢通量组学(metabolic fluxomics)通过稳定同位素示踪结合数学建模,量化代谢网络中碳、氮等元素的真实流速,是连接静态丰度与功能表型的关键桥梁。然而,代谢通量组学在家畜研究中严重利用不足,导致研究人员对“代谢如何运作”的理解停留在静态快照水平。代谢通量组学的独特性在于其因果证据的基础与静态组学存在根本差异。静态组学测量分子浓度;其数据本质上是“观察”,从中得出的因果推断依赖于统计相关性、先验知识网络或遗传工具变量等间接推理路径。代谢通量组学则完全不同:其数据来自稳定同位素示踪剂的物理检测——质谱(mass spectrometry,MS)或核磁共振(nuclear magnetic resonance,NMR)直接测量原子核从一种同位素状态到另一种的物理转移。当13C标记的碳原子从葡萄糖移动到丙酮酸再到柠檬酸时,质谱检测到的不是“相关性”,而是原子核的物理位移——示踪剂的位置和丰度受质量守恒、化学计量平衡和热力学可行性等物理化学定律的约束。因此,示踪剂检测是物理层面的直接观察,而非统计层面的间接推断。基于13C的代谢通量分析(13C?MFA)输出的通量值是在质量平衡和同位素异构体分布约束下通过确定性数学方程计算得出的。这意味着通量数据提供的因果证据独立于统计相关性——它不回答“基因A是否与代谢物B相关”,而是直接回答“碳原子从底物X到产物Y的净流速是多少”。这一特性赋予了通量组学在本综述三层框架中的独特地位:它是特别有价值的物理层面因果证据来源,在很大程度上独立于统计先验,可用于交叉验证统计关联和机器学习识别的候选代谢节点。Bartman等人系统总结了在活体哺乳动物中测量通量的三种实用方法:动静脉差异(器官净通量)、标记示踪剂输注(全身周转通量),以及测量示踪剂原子在下游代谢物中的去向。通量测量可以揭示静态组学无法捕捉的调控现象。例如,代谢物的周转率可能变化数倍而浓度保持不变——如果仅测量丰度,这将是一个盲点。Wolfschmitt等人使用13C通量分析猪休克模型,发现高氧抑制了粒细胞中的三羧酸(tricarboxylic acid,TCA)循环通量,而常规呼吸和功能测试未检测到异常。Beckett等人将通量组学与蛋白质组学结合用于牛肾细胞,表明丙酮酸羧化酶水平决定糖异生能力——当饱和脂肪酸抑制该酶时,细胞被迫依赖氨基酸回补。从因果推断的角度来看,代谢通量组学与代谢控制分析(Metabolic Control Analysis,MCA)同属因果推断框架家族。Fell(2024)指出,MCA的核心特征是“使用数学以演绎方式推理生化途径的性质”。通过量化控制系数——衡量代谢通量对酶活性微小扰动的响应,MCA直接回答反事实问题——例如“如果抑制某种酶10%,通量会变化多少?”——这体现了在干预和反事实层面的因果推断操作化。总之,通量组学的缺失是多组学整合中的一个系统性缺陷。Bartman等人提出的三种方法完全可转移至家畜,但由于技术难度,它们很少被采用。通量信息无法被静态组学替代,应该作为独立维度与常规组学层并列纳入。研究人员建议在家畜营养、免疫、应激和育种研究中建立标准化通量示踪协议,并将通量数据整合到多组学模型中,以推动从“丰度关联”到“代谢因果”的范式转变。
5.5 家畜多组学整合当前面临的困难与挑战
家畜缺乏组学规模的扰动数据库,限制了针对各组学层开展大规模基准测试及相应方法开发的能力。虽然人类和小鼠拥有丰富的扰动资源——CRISPR筛选数据库、基因敲除表型数据库和药物扰动多组学数据库——但这类资源在家畜物种中长期严重匮乏。这种情况正在逐渐改变:猪全基因组CRISPR/Cas9敲除文库(PigGeCKO,包含85,674个sgRNA,靶向17,743个蛋白质编码基因)的开发为猪功能基因组学提供了高通量筛选平台,该文库已被用于识别与日本脑炎病毒复制相关的多个宿主因子。在牛中,已构建了全基因组CRISPR敲除文库(btCRISPRko.v1,靶向牛基因组中所有蛋白质编码基因),并成功应用于筛选参与牛疱疹病毒1型(BoHV-1)复制的宿主因子,鉴定了包括GARP和EARP在内的多个促病毒和抗病毒候选因子。CRISPR敲除文库技术也已扩展到家禽,全基因组sgRNA文库为禽流感病毒感染的宿主因子鉴定提供了新工具。这些进展共同表明,家畜扰动资源正从“几乎不存在”走向“逐步可及”。尽管如此,家畜多组学研究中的验证仍高度依赖生化实验,且大多数情况下,一项研究只能实验验证一两个核心通路,大规模系统验证受限于缺乏可靠的数据资源。此外,功能元件的定性表征仍是多组学整合中的一个关键问题。携带核心调控信息的大量功能组学数据——包括来自ATAC/scATAC-seq的染色质可及性、来自空间转录组学的空间定位、来自修饰特异性蛋白质组学的翻译后修饰、转录因子结合基序以及来自Hi-C的三维染色质构象——由于缺乏标准化的整合方法,通常仅进行粗粒度的定性分析。不同的定性分类策略可能导致完全不同的结论。最近的家畜特异性研究产生了丰富的功能基因组数据,但也暴露了严重缺乏标准化定性分类的问题。在3D基因组学层面,整合覆盖6个猪品种和5个组织的71个Hi-C数据集,构建了包含65,843个拓扑关联结构域(topologically associating domains,TADs)的猪全基因组三维染色质互作图谱。保守的TAD边界比品种特异性边界表现出更强的绝缘性,动态TAD内的基因发挥组织特异性作用。猪肝脏和肌肉的高分辨率3D基因组研究进一步表明,组织特异性3D结构的空间重叠有限,且组织特异性染色质环的形成与染色质可及性、活跃组蛋白修饰和协作转录因子富集相关。猪肌纤维类型特化的多组学整合显示,约6%的基因组在品种间发生A/B区室转换,从非活跃B区室转换到活跃A区室的基因富集于钙离子跨膜转运等通路。随后,Tan等人整合了猪慢肌和快肌的转录组学、表观基因组学和3D基因组学数据,表明增强子-启动子相互作用的全局重塑驱动了与肌肉收缩和葡萄糖代谢相关的转录重编程,并鉴定了组织特异性超级增强子。在染色质可及性层面,一项对牛、猪和小鼠8种成年组织的比较分析,在猪和牛中分别鉴定了306,304和273,594个活跃调控元件,其中71,478个猪元件和47,454个牛元件表现出高度组织特异性,最普遍的可及性基序为CTCF,提示其广泛参与3D染色质组织。牛的全器官ATAC-seq峰目录汇编了976,813个顺式调控元件,并估计约三分之一的调控变异落入ATAC-seq峰内。一个包含20个猪组织的ATAC-seq图谱鉴定了557,273个合并峰,并优先确定了肌肉中多不饱和脂肪酸含量的潜在因果变异。在单细胞层面,猪大脑皮层和小脑的首个单细胞染色质可及性图谱鉴定了9个主要细胞类型,并表明猪的调控元件与人类比与小鼠更保守。整合山羊、猪、猕猴和人类早期性腺发育的单细胞转录组和染色质可及性数据,揭示了进化上保守和物种特异性的顺式调控元件及关键转录因子。在更广泛的功能元件层面,超级增强子(super-enhancers,SEs)及其3D基因组组织已在猪骨骼肌和脂肪组织中得到系统研究。将SE注释与ATAC-seq、Hi-C和GWAS信号整合,鉴定了组织特异性SE及其远端靶基因,并在猪群体中验证了调控KLF6(100kg日龄)、MXRA8(瘦肉率)和TAF11(眼肌深度)的功能变异。综上所述,家畜功能元件的定性分析面临根本性的方法论空白。虽然Hi-C、ATAC-seq和scATAC-seq已在多个组织、品种和发育阶段产生了大量高维功能基因组数据,但提取标准化、可比较且可重复的结论——例如TAD边界是否保守、差异可及性区域是否为真正的阶段特异性调控元件、SE是否为组织特异性候选育种靶点——的统一、层级性定性分类标准仍然缺乏。不同研究组使用不同的峰识别阈值、保守性标准和TAD识别算法参数,导致对同一生物学问题得出不同结论。家畜功能基因组数据的日益丰富与定性分析框架的缺失形成了鲜明对比。因此,优先开发整合结构、空间、分子相互作用和蛋白质构象信息的新型整合策略,对于推动功能元件的定性分析从“图谱报告”走向“标准化分类”至关重要。表3总结了当前家畜多组学数据整合中的常见问题和挑战。上述核心挑战和常见误区在图2中进行了可视化总结。
6 多组学分析策略的方法谱系
研究人员在此提出一个适用于家畜的多组学整合三层分析框架,如图3所示。相当大比例的家畜多组学研究从这类方法开始。
6.1 初级整合:基于统计关联的跨组学协变模式识别
作为入门级的探索层,初级整合旨在识别与目标性状相关的跨组学协变模式,并筛选用于进一步机制验证的候选分子或通路。目前,相当大比例的家畜多组学研究从这类方法开始。其优势包括逻辑清晰、直观易懂、计算成本低,且易于标准化为统一的分析流程。该层还为解析不同平台研究间相同表型的异质性来源提供了便捷框架。