《Scientifica》:A Systematic Review: Deep Learning for Analyzing Genomic Data to Discover Evolutionary Patterns
随着基因组数据集规模和复杂性的增长,深度学习已越来越多地应用于进化基因组学。然而,文献涵盖了异质的生物学目标、建模假设和评估标准,尽管存在重要的概念差异,却常被视作一个统一领域。本研究对2016年至2025年间发表的关于使用深度学习识别基因组数据中进化模式的研究进行了系统综述。经过结构化筛选流程,最终选定50篇研究进行定性综合。所综述的应用可被组织为三个部分重叠但概念上不同的领域:(i) 群体遗传推断(population genetic inference),(ii) 系统发育重建(phylogenetic reconstruction),以及(iii) 使用DNA和蛋白质语言模型(language model)进行的序列表示学习(sequence representation learning)。在群体遗传学中,深度学习主要被用于基于模拟的推断框架(simulation-based inference frameworks)。在系统发育学中,神经网络架构被用于在特定条件下近似或加速树和模型推断。在表示学习中,模型专注于提取可迁移的序列特征,用于下游进化或功能分析。跨领域而言,深度学习提供了对复杂基因组输入的灵活建模。然而,反复出现的局限性包括可解释性方面的挑战、对训练假设的敏感性(尤其是在基于模拟的设置下)、异质的评估协议以及巨大的计算需求。通过使用领域对齐框架组织文献,本综述阐明了领域特定的优势、局限性和研究空白,为进化基因组学未来的方法发展提供了结构化基础。
**1. 引言**
基因组数据是生物学和医学的关键资源,有助于深入理解生物过程,包括物种进化。准确分析这些数据支持识别进化模式,如随时间发生的遗传变化、突变和适应以及系统发育关系,进而为遗传学、个性化医学、生物技术和生物资源管理提供信息。新一代测序技术(next-generation sequencing, NGS)的快速普及使得大量基因组数据广泛可用,加速了发现过程,同时也带来了分析和解释的实践挑战。高维度、异质进化体制和测量噪声可能使推断复杂化。经典统计流程和传统机器学习方法仍然必不可少,但在某些高维或高异质环境下可能面临局限,尤其是当强模型假设被违反或需要灵活表示学习时。
深度学习扩展了分析复杂、高容量数据的计算工具,并已越来越多地应用于计算生物学和基因组学。在进化基因组学中,深度学习方法已被探索用于选择检测、种群历史推断、混合与杂交表征以及系统发育重建等任务。重要的是,跨研究报告的证据往往是情境依赖的:性能和计算可行性取决于所选的输入表示、训练规程和评估设计。
尽管取得了进展,但由于模型错误设定风险、计算需求和进化异质性,从基因组数据中准确推断进化模式仍然具有挑战性。许多群体遗传学应用依赖于基于模拟的监督学习,其中外部有效性取决于模拟训练规程对经验复杂性的逼近程度;因此,分布偏移以及种群或重组错误设定可能降低泛化能力。此外,关于预测准确性与可解释性之间的权衡,以及训练数据或生成假设不确定时模型的鲁棒性,仍存在持续争论。
基于这些挑战,本综述采用领域对齐视角,将生物学上不同的目标和评估实践分开。深度学习在进化基因组学中的应用可分为三个部分重叠但概念上不同的领域:(i) 群体遗传推断,(ii) 系统发育重建,以及(iii) 通过自监督DNA和蛋白质语言模型进行的序列表示学习。虽然这些领域共享计算基础,但它们针对不同的生物学问题,并依赖于不同的建模和验证框架;在综述文献中,群体遗传推断在经验应用中占主导地位,而语言模型代表了一种补充性和新兴范式。
本系统综述旨在批判性评估应用于发现基因组数据中进化模式的深度学习方法,重点关注方法选择、验证实践、优势、局限性和可操作的研究空白。通过综合跨不同研究和任务的证据,本综述力求将计算进展与领域特定的生物学问题对齐,并支持更原则性的方法选择和发展。
本综述对文献的贡献如下:(1) 领域特定结构化:将文献组织为群体遗传推断、系统发育重建和语言/表示模型,以减少跨领域混淆并澄清目标、数据表示和评估标准的差异。(2) 比较方法综合:总结每个领域的典型输入、训练范式(包括基于模拟的训练,如适用)和评估实践,强调这些选择如何塑造报告结果。(3) 优势与局限的平衡评估:整合反复出现的局限性,如分布偏移、计算需求和可解释性约束,并确定证据对建模假设最敏感的地方。(4) 基准意识展望:强调需要透明报告和更可比较的评估设计,以提高可重复性和跨研究可解释性,并激发未来稳健且生物学可信的部署方向。
本系统综述遵循PRISMA指导的结构化选择流程,分析了2016年至2025年间发表的50篇研究。其余部分组织结构如下:第2节描述方法论;第3节报告领域特定结果;第4节提供批判性综合;第5节讨论启示、局限和未来方向;第6节总结综述。
**2. 方法论**
本研究采用结构化系统综述方法,以识别和综合关于深度学习在进化基因组学中应用的研究。综述遵循既定的报告标准,以确保研究选择的透明度和可重复性。
**2.1. 研究问题**
本综述的主要研究问题是:深度学习方法如何被应用于识别基因组数据中的进化模式,以及它们的方法论优势、局限和新兴方向是什么?该问题通过聚焦于深度学习架构、基因组数据分析和进化推断任务的搜索词进行操作化。
**2.2. 搜索策略与数据库**
在PubMed/MEDLINE、Web of Science Core Collection、Scopus、IEEE Xplore、bioRxiv、arXiv和Google Scholar中进行了系统文献检索,以识别2016年至2025年间发表的相关研究。应用布尔运算符(AND, OR)和主题过滤器,检索聚焦于深度学习在进化基因组学中应用的研究。符合条件的研究需将深度学习架构(如卷积、循环、残差、生成或混合神经网络)应用于进化基因组学任务,包括系统发育重建、自然选择检测、混合推断、突变率预测或面向进化的功能基因组分析。仅依赖传统机器学习方法、缺乏经验验证或未直接涉及进化基因组学的研究被排除。通过数据库检索共识别176条记录,另通过引文链检索获得140篇研究。去除49篇重复文献和18篇通过自动筛选识别的不合格记录后,剩余249篇进行标题和摘要筛选。其中118篇因不符合纳入标准被排除,剩余131篇进行全文评估。6篇无法获取,75篇基于相关性和方法学质量被排除。最终,50篇研究纳入最终定性综合。详细选择过程如图1所示。
**2.3. 数据提取与编码**
对于每篇纳入研究,系统提取以下信息:模型架构、基因组数据表示、目标进化任务、评估指标、计算特征(训练和推断考虑因素)、可解释性策略以及报告的对进化复杂性的鲁棒性。分析采用定性和主题方法,侧重于方法学趋势、比较优势和跨研究局限,而非定量荟萃分析。偏倚风险评估结果见附录A。
**3. 结果**
本系统综述的结果综合了所选研究的发现,并强调了深度学习在进化基因组学中应用的主要方法论和实证趋势。总体而言,分析显示模型准确性、可扩展性和鲁棒性方面取得了显著进展,同时也揭示了如可解释性和泛化性等持续存在的挑战。以下子节详细呈现结果,从描述性概述开始,继之以批判性综合和主题分析。
**3.1. 描述性分析**
本节概述了关于使用深度学习发现基因组数据中进化模式的研究文献格局,涵盖了一系列应用不同深度学习架构于进化基因组学问题的多样化研究。综述的工作涉及使用卷积、循环、残差和生成神经网络进行系统发育推断、自然选择检测、突变率预测和功能基因组元件识别等应用。比较分析突出了方法论趋势,包括基于模拟训练的整合、多样化的数据表示以及提高可解释性和鲁棒性的努力。这种结合对于解决关于模型能力、可解释性和进化复杂性管理的研究问题至关重要,从而指导未来方法论发展。
纳入的研究可大致分为进化基因组学中的三个主要领域。第一领域,群体遗传学,包括使用深度学习方法检测自然选择、推断种群历史、混合、基因渗入和多基因适应的研究。第二领域,系统发育学,包括旨在推断进化关系、重建树拓扑结构、估计替代模式和建模多样化过程的工作。第三领域,此处称为语言和表示学习模型,包括应用基于序列的深度学习架构(通常包括自监督或大规模模型)从DNA或蛋白质序列中学习表示,用于基序发现、功能元件识别、保守性分析和序列到功能预测等任务。虽然这些领域共享方法论基础,但它们针对不同的生物学问题并依赖于不同的评估框架。表1显示了研究的描述性分析。如表1所示,本系统综述中综述的研究属于三个主要领域:群体遗传学、系统发育学和语言/表示模型。这些领域的研究分布说明了深度学习在进化基因组学中应用的广度不断增长。(1) 群体遗传学研究在表中占主导地位,反映了深度学习方法在分析选择、种群历史和基因流等进化过程中的广泛使用。这些研究主要关注使用遗传数据推断种群结构和检测选择信号,其中许多利用基于模拟的模型。(2) 系统发育学研究是第二大类别,专注于通过重建系统发育树来推断进化关系。这些研究强调深度学习如何提高树构建和替代模型估计的准确性,尤其是在处理大规模和复杂数据集时。(3) 语言/表示模型作为进化基因组学中一个不断增长的领域出现。这些研究利用深度学习模型,特别是自监督学习方法,从基因组序列中学习表示。虽然这些模型不直接推断进化关系,但它们在序列到功能任务中起着关键作用,如基序发现和蛋白质结构预测。总体而言,表1突出了该领域应用的多样性以及每个领域处理的不同生物学问题。以下各节将更深入地探讨每个领域的优势、局限和趋势。
**3.2. 批判性分析与综合**
虽然进化基因组学中的深度学习方法共享计算基础,但综述的研究针对生物学上不同的目标。为避免跨领域混淆,表2综合了四个类别(群体遗传学、系统发育重建、语言/表示模型和跨领域研究)的领域特定目标、输入表示、训练范式、评估标准、优势和局限。以下分析直接基于这些结构化维度展开。
**3.2.1. 群体遗传推断**
如表2所总结,归类为群体遗传学的研究主要关注推断任务,如选择检测、种群历史重建、混合和基因渗入检测、多基因适应和种群结构分析。这些研究通常操作于单核苷酸多态性窗口(SNP windows)、单倍型(haplotypes)、等位基因频率轨迹(allele-frequency trajectories)、分歧矩阵(divergence matrices)、祖先重组图(ancestral recombination graph, ARG)衍生摘要或其他群体遗传编码。此类表示旨在捕捉种群水平上进化过程产生的结构化信号。该领域一个定义性的方法论特征是训练基于模拟。大多数模型使用合并或正向时间模拟器生成标记的进化场景,随后进行监督分类或回归。在某些情况下,会纳入有限的经验校准。评估通常强调场景分类或参数估计的准确性、跨模拟进化体制的鲁棒性,以及某些研究中训练后的推断时间效率。深度学习提供了将异质群体遗传表示映射到推断进化输出的灵活性。一旦训练完成,模型通常相对于重复的似然基础程序提供快速推断。核心挑战是泛化性。模型性能强烈依赖于模拟训练规程对真实进化复杂性的逼近程度。模拟与经验数据之间的领域偏移会降低外部有效性。可解释性通常局限于事后特征归因。此外,该领域的计算成本通常由模拟生成和超参数调优主导,因此区分训练成本和推断成本至关重要。该领域的批判性评估应优先考虑模拟器参数化的透明度、对错误设定场景下鲁棒性的评估,以及训练与推断计算需求的明确报告。
**3.2.2. 系统发育重建**
根据表2,系统发育领域包括解决树拓扑结构推断、替代模式建模、多样化过程和基于树的流行病动力学的研究。输入通常包括多重序列比对(multiple sequence alignments, MSAs)、比对衍生张量、编码的系统发育树以及性状加树特征。许多方法依赖于使用模拟或基准系统发育数据集的监督学习。神经网络经常充当经典似然基础推断步骤的近似器或加速器。评估通常集中在拓扑准确性、对替代异质性或偏倚倾向体制的鲁棒性、推断速度比较以及模型衍生置信度的可靠性。深度学习模型一旦训练完成,可以加速推断,并可能在对某些经典假设具有挑战性的体制(如异质替代过程)中表现出鲁棒性。局限是领域特定的。某些架构受限于固定输入结构(例如,限制的分类单元数量),并且可扩展性到大型系统发育可能受限。性能可能对比对属性和分类单元采样敏感。此外,不同研究的基准测试协议各不相同,使报告结果的直接比较复杂化。该领域有意义的评估需要标准化的基准测试条件、训练和推断成本的明确分离,以及对置信度指标相对于经典系统发育不确定性度量的谨慎解释。
**3.2.3. 语言和表示学习模型**
表2中的第三个领域包括语言和表示模型,其专注于学习序列级嵌入,而非直接估计进化参数或重建树。典型任务包括基序发现、功能元件识别、保守性相关分析、序列到功能预测,以及在某些情况下的多组学序列建模。模型操作于原始DNA或蛋白质序列,通常通过独热编码或嵌入表示,并可能整合保守性、结构、表观遗传或单细胞测定特征。许多方法采用自监督或迁移学习策略,随后进行下游监督任务。在数据可用性允许的情况下,使用大规模预训练。评估通常依赖于任务特定的预测指标(如分类或回归准确性)、跨数据集或任务的迁移性,以及可解释性分析(如基序可视化)。该领域受益于从大型序列语料库中强大的特征学习,以及支持多样化下游分析的可重用嵌入的开发。这些模型本身并不构成进化推断框架,除非明确整合进化建模假设。它们的评估指标与群体遗传学或系统发育学中使用的指标无法直接比较。大型模型的可解释性可能具有挑战性,并且预训练可能产生大量计算成本。表示模型应被解释为增强序列级理解和下游分析的补充工具,而非群体遗传或系统发育推断的直接替代品。
**3.2.4. 跨领域研究与整合机会**
表2还识别了跨领域研究,包括综述、基准测试、整合流程和生成建模框架,这些研究跨越多个基因组子领域。这些工作通常旨在提供结构化比较、开发通用流程或提出旨在跨异质基因组输入操作的方法。方法论差异很大,包括基准测试研究、整合建模方法和生成数据增强框架。评估通常强调覆盖广度和方法比较。跨领域研究有助于描绘方法论格局并突出可转移的思想,如可解释性框架、表示学习策略和生成增强技术。一个关键风险是过度概括:异质的评估设置和领域特定目标使得“一刀切”的结论不可靠。生成方法还需要谨慎验证以确保生物学合理性。虽然领域分离对于分析清晰是必要的,但领域之间的方法论转移——例如将预训练表示与基于模拟的框架相结合——代表了一个有前景的未来整合方向,而不会混淆生物学目标。
**3.3. 文献主题综述**
虽然第3.2节按生物学领域分析了文献,但本节重新组织跨领域同一批工作的主题。因此,此处讨论的主题可能跨越多个领域,但根据上述澄清的区别进行解释。鉴于将深度学习应用于基因组数据分析以发现进化模式的跨学科性质,先前研究已从多种方法探讨了这一问题。主题综述使我们能够构建现有文献结构,识别深度学习使用的主要领域,并突出先前研究中出现的概念趋势。关于深度学习应用于发现基因组数据中进化模式的文献揭示了几个主导主题。主要焦点是开发和评估多样化的深度学习架构——如卷积、循环和残差神经网络——旨在从基因组序列推断进化关系和检测选择信号。另一个关键主题涉及将基于模拟的训练与经验基因组数据整合,以增强模型鲁棒性和可解释性。此外,研究基因组数据表示和预处理技术以提高预测准确性似乎至关重要。与模型可解释性、可扩展性以及处理复杂进化场景(如杂交和多倍性)相关的挑战也经常被讨论,同时生成模型和大规模数据整合的不断演变角色也在讨论之列。表3提供了所选研究的主题综述,表明该领域的研究可归为几个主要类别。可以看出,大多数研究集中在深度学习架构的开发和应用,用于进化推断(例如,系统发育树构建、选择检测和基因组序列分类)。这表明研究人员主要寻求用更准确和可扩展的架构替代传统方法。另一方面,使用模拟数据与实验数据并行被视为研究中一个主要的重复主题。这种方法允许研究复杂的进化场景,但同时也对泛化到真实数据提出了挑战。表中综述的另一个重要主题是数据表示和预处理方法,这些方法在提高模型性能方面起着关键作用。使用创新表示,如序列的单字母编码、SNP矩阵,甚至结构和保守性信息,提高了模型的准确性。关于模型可解释性和鲁棒性的部分也表明,尽管已做出一些努力来阐明网络决策,但这一领域仍然是生物学中深度学习的最大挑战之一。其他研究集中于复杂的进化现象(如杂交、基因渗入和多基因性状),并表明深度学习比经典统计方法能更好地建模这些非线性模式。展望未来,生成模型和降维以及多组学数据整合领域代表了新兴机遇,可以为进化过程提供更深入的理解,尽管它们仍处于发展的早期阶段。总体而言,表3表明,尽管该领域已探索了多种研究路径,但三个主要轴——开发架构、模拟和表示数据以及提高可解释性——在推动深度学习在进化基因组学中的进展方面发挥了最重要的作用。图2显示了所选研究的主题分布。显然,研究重点最多的是深度学习架构的开发(23.1%),这表明模型设计创新对于分析进化基因组数据的重要性。之后,数据模拟(18.5%)和模型可解释性(16.7%)贡献最大;这表明,除了模型准确性之外,表示复杂进化场景和阐明结果的能力是研究人员的主要优先事项之一。数据表示(13.9%)和复杂进化现象(11.1%)等主题也构成了努力的重要组成部分,并有助于提高模型在实际条件下的准确性和适用性。相比之下,生成模型(9.3%)和多组学数据整合(7.4%)等新兴主题所占份额较小,但鉴于近期趋势,预计未来几年将受到更多关注。总体而言,这一分布表明,研究已逐渐从关注改进架构和数据模拟转向更新、更多层次的主题,如多组学和生成模型。
**3.4. 基于时间的文献综述**
尽管文献的时间演变反映了深度学习在进化基因组学中的持续扩展,但特定领域的主导地位随时间而变化。早期,基础性的基于序列和表示的研究更为突出,而后期看到群体遗传推断和系统发育重建的快速扩张。最近,语言和生成模型在特别是多组学和大规模基因组应用中获得了可见性。表4显示了基于出版年份的综述论文描述。早期年份(2016-2017)重点在于测试神经网络(尤其是卷积神经网络)识别序列基序和保守元件的初始能力,这一时期更具基础性。2018-2019年,应用范围扩大,深度网络被用于系统发育推断和群体遗传分析。在此阶段,使用模拟数据训练模型并检测自然选择或预测突变率成为焦点。2020-2021年,研究重点转向架构多样化(包括循环神经网络和ResNet)以及提高模型可解释性。在此期间,将随机模拟与深度学习相结合以估计进化参数并将其应用于新任务(如选择基因组学和变异调用)也得到增长。2022年起,实验和模拟数据与生成和多分支模型的整合得到扩展。生成模型特别用于降维和生成新数据。同时,对多组学和跨物种预测的关注度增加,表明正向更多层次和现实的应用迈进。最后,最近几年(2024-2025)以对可扩展性、自动化以及大型语言模型和高级生成模型的使用为特征。这一过程表明,深度学习在进化基因组学领域已达到相对成熟的阶段,其未来路径将朝向更广泛的应用、更高效的模型和更可解释的框架。图3显示了2016年至2025年同行评审文章数量的增长趋势。早期(2016年和2017年)研究数量非常有限,仅发表一或两篇文章。自2018年以来,研究出版趋势加速,尤其是自2019年以来,文章数量显著增加。2022年和2023年被认为是该领域研究活动的峰值,这一时期发表的文章数量最多。这一增长可归因于计算工具的进步、大规模生物数据获取的增加以及深度学习在进化基因组学中应用的日益关注。近年来(2024年和2025年),尽管文章数量相比2023年峰值略有下降,但科学活动水平仍然很高。这表明深度学习在该领域的地位已巩固,研究正从定量增长阶段逐渐转向定性深化和更实际的研究。图4显示了2016-2025年期间综述文章主题分布的趋势。早期(2016-2018年)研究重点非常有限,主要集中在模型架构和一定程度上数据表示。自2019年起,数据模拟和可解释性等较新领域也进入研究文献。转折点发生在2020-2022年,当时除了研究数量增加外,主题范围也扩大,复杂进化现象和生成模型等领域也被考虑。2022年和2023年显示出最大的主题多样性和研究数量;特别是,对多组学整合的同时关注表明研究正朝着多层次分析和组合数据迈进。近年来(2024-2025年),尽管主题多样性得以保持,但研究数量略有下降。这可能反映了从定量增长阶段转向对新兴主题(如生成模型和多组学)更定性关注的转变。总体而言,该热图说明了研究从早期对架构的狭窄关注到近年来主题范围拓宽的演变,这一趋势反映了深度学习在进化基因组学中使用的成熟度和复杂性。
**3.5. 基于一致性与分歧的研究分析**
在综述的研究中,广泛共识是深度学习模型,特别是卷积和残差神经网络,在从基因组数据中发现复杂进化模式方面显示出巨大潜力,并且在准确性和可扩展性方面通常优于传统方法。大多数研究同意基于模拟的训练数据在捕捉进化复杂性方面的优势,以及需要可解释模型来提供生物学见解。然而,关于特定任务的最佳架构、判别式与生成式方法之间的权衡,以及如何处理异质进化过程(如诱导和选择)存在分歧。这些分歧通常源于研究重点、数据类型和建模的进化场景的差异,以及计算效率与可解释性不同优先级的差异。综述文献既展示了实质性一致也展示了显著分歧,但这些模式是领域依赖的。因此,一致性和分歧在两个层面进行了检查:(i) 领域内共识和 (ii) 跨领域方法学差异。表5显示了关于深度学习在进化基因组学中应用研究的共同和不同观点。跨群体遗传学研究,广泛共识是深度学习模型——特别是基于卷积神经网络和混合架构——在复杂进化模拟下检测选择信号、种群模式和混合场景方面是有效的。大多数研究依赖于基于模拟的训练并承认其对于建模非线性进化过程的必要性。普遍共识是一旦模型训练完成,推断时间通常是高效的。然而,许多研究认识到模拟与经验数据之间领域偏移的风险以及训练网络的可解释性有限。在系统发育应用中,共识是深度学习可以在某些体制下近似或加速拓扑推断和替代建模。研究集中在鲁棒性对替代异质性和偏倚参数区域的重要性。然而,可扩展性到更大系统发育和标准化基准测试仍然是反复出现的担忧。语言建模领域的研究一致认为深度神经网络架构在学习序列级表示方面非常有效,可用于基序发现、调控预测和序列到功能任务。也一致认为迁移学习和大规模预训练增强了跨任务的泛化能力。然而,许多承认有限的直接可解释性和大多数架构中缺乏显式进化建模。尽管共享计算基础,跨领域存在显著分歧:(1) 目标分歧:群体遗传学寻求参数推断;系统发育学寻求树重建;表示模型专注于特征学习。(2) 评估分歧:指标跨领域不可直接比较。(3) 训练范式分歧:基于模拟的监督在群体遗传学中占主导;自监督学习在表示模型中更常见。(4) 可解释性分歧:生物学可解释性在不同领域具有不同含义。(5) 计算权衡:训练成本结构差异显著。这些分歧表明,深度学习在进化基因组学中不应被视为一个单一的统一方法论领域,而应被视为一组计算相关但生物学上不同的研究项目。
**4. 理论与实际启示**
深度学习整合到进化基因组学并不代表单一的方法论转变,而是跨群体遗传学、系统发育重建和序列表示学习的一系列领域特定适应。如表2所结构化并在第3节讨论的,这些领域在生物学目标、输入表示、训练范式和评估标准上存在差异。因此,它们的理论和实际启示必须在领域适当的背景下进行解释。
**4.1. 理论启示**
**4.1.1. 群体遗传推断**
在群体遗传学中,深度学习主要嵌入基于模拟的推断框架。通过学习模拟进化场景与推断目标之间的映射,神经网络模型在显式似然难以指定或计算昂贵的设置中提供了灵活近似。理论启示并非取代群体遗传建模,而是向摊销推断策略(amortized inference strategies)的转变:模型在训练期间学习场景到参数的映射,随后快速应用。然而,这一范式也将认知责任转向模拟规程的真实性和覆盖范围。如果训练模拟不能充分代表进化异质性,学到的映射可能缺乏外部有效性。因此,深度学习在该领域的理论贡献关键取决于模拟假设如何构建、验证和压力测试。
**4.1.2. 系统发育重建**
在系统发育学中,深度学习方法常被提议作为经典似然基础程序的加速器。神经网络可以学习在特定模拟体制下预测树拓扑或模型特征,一旦训练完成,可能减少重复的似然评估。这里的理论启示更多是计算性的而非认识论性的:深度学习可以作为推断管道部分的替代函数。然而,不确定性解释仍然是领域特定的。神经网络产生的置信度分数并不自动等同于自举或贝叶斯后验支持,必须相应评估。因此,该领域的理论进展取决于澄清神经置信度与系统发育不确定性之间的关系。
**4.1.3. 语言和表示学习模型**
与直接推断任务相反,表示模型专注于从DNA或蛋白质数据中学习序列级嵌入。这些模型通常采用自监督或迁移学习策略,并基于下游预测任务进行评估。理论启示是向表示优先基因组学(representation-first genomics)的转变,其中生物学有意义的机构被隐含地捕捉在嵌入中。然而,此类表示并不固有地编码进化机制,除非明确整合进化建模假设。因此,理论解释需要仔细区分预测效用与机制推断。
**4.2. 实际启示**
深度学习在进化基因组学中的实际价值取决于模型如何训练、评估和报告。这些考虑因素跨领域差异显著。
**4.2.1. 区分训练成本与推断成本**
跨领域,深度学习模型一旦训练完成,可能提供快速推断。然而,训练可能计算密集——特别是在群体遗传学中,需要生成大型模拟语料库,以及在表示学习中,可能需要大规模预训练。实际报告因此应区分以下内容:(1) 数据生成或模拟时间,(2) 模型训练时间,(3) 推断时间,(4) 计算环境和硬件要求。未能分离这些组件可能产生对可扩展性或效率的误导性印象。
**4.2.2. 分布偏移与进化复杂性下的验证**
分布偏移下的鲁棒性是一个领域依赖的关切。在群体遗传学中,模拟到现实的差距构成主要挑战。评估应包括在种群错误设定、重组变异和选择异质性下的压力测试。在系统发育学中,基准测试应涵盖不同的比对体制、分类单元采样方案和替代异质性条件。在表示学习中,实际部署取决于跨生物体和任务的迁移性,以及学习特征的生物学可解释性。鲁棒的验证框架和透明的基准测试对于领域适当的可信度至关重要。
**4.2.3. 平衡解释与结构化比较**
当研究避免“总体优越性”的定性声明,而是明确报告领域特定目标、输入结构、评估指标和局限时,可信度会提高。由于评估指标在三个领域中根本不同——群体遗传学中的参数估计准确性、系统发育学中的拓扑准确性和表示学习中的任务特定预测指标——跨领域性能比较可能具有误导性。结构化的领域对齐综合,如表2、6和7所提供的,促进了更精确的解释。
**4.2.4. 在应用情境中的采用**
保护基因组学、农业和病原体监测等应用领域可能受益于深度学习,当流程可重复、计算需求透明且输出对生物学决策可解释时。在实践中,最可持续的采用场景似乎是深度学习补充现有进化建模工作流程的场景——加速重复分析、实现跨大数据集的筛选或提供丰富的序列表示——而最终结论仍锚定在领域适当的验证和不确定性评估中。
**5. 局限、空白与未来研究方向**
本节概述了当前深度学习在进化基因组学中的关键局限,并提出了有前景的未来研究方向。基于第3节的发现以及表6和表7的见解,还讨论了阻碍这些方法广泛应用的方法论空白。
**5.1. 局限**
尽管前述部分综述了实质性方法论进展,但文献中识别的局限并非跨领域一致。相反,它们反映了群体遗传推断、系统发育重建和表示学习框架在生物学目标、输入表示、训练范式和评估策略上的根本差异。因此,以下分析以领域特定方式重构了识别的局限,以澄清方法论边界、避免跨领域混淆,并提供对当前深度学习在进化基因组学中应用的更平衡和分析性评估。
**5.1.1. 群体遗传推断**
在群体遗传应用中,深度学习模型主要嵌入基于模拟的推断管道。一个主要局限是模拟到现实的差距,即在合并或正向模拟上训练的模型可能无法泛化到经验基因组数据,如果种群异质性、重组结构或选择体制未被充分代表。模型泛化性因此关键取决于模拟规程的真实性和覆盖范围。此外,参数错误设定和对种群偏移的有限鲁棒性可能导致偏倚推断。虽然推断时间通常高效,但生成大型模拟训练语料库和超参数优化带来了可观的计算成本。可解释性也仍然有限,因为许多架构提供事后特征归因而非机制性进化解释。
**5.1.2. 系统发育重建**
在系统发育重建中,深度学习方法常被设计用于近似或加速经典似然基础推断。然而,若干领域特定约束持续存在。某些神经网络架构依赖于固定输入结构(如基于四元组的模型),限制了可扩展性到更大的分类单元集合。可扩展性到大型系统发育和异质替代体制仍然是一个结构性挑战。此外,性能对比对属性和分类单元采样的敏感性使跨研究基准测试复杂化。虽然推断速度可能提高,但训练成本和跨研究可比性仍然是重要局限。该领域的可解释性通常局限于置信度估计,而非生物学基础的机制性洞察。
**5.1.3. 表示和语言模型**
表示学习和语言建模框架引入了一组不同的局限。这些模型专注于序列嵌入和特征学习,而非直接进化参数推断。因此,一个核心局限是缺乏显式进化基础,因为许多架构优化预测性能而不纳入群体遗传或系统发育约束。大规模预训练需要大量计算资源,限制了可访问性和可重复性。可解释性仍然具有挑战性,特别是对于大型基于变换器的模型,其中学习嵌入的生物学意义并非总是透明。此外,评估指标通常是任务特定的,并且与推断聚焦的领域不可直接比较。
**5.1.4. 跨领域结构性局限**
在所有领域,若干结构性局限持续存在。这些包括缺乏标准化基准测试框架、异质评估协议以及计算成本的不一致报告。此外,数据不平衡和有限的分类多样性降低了外部有效性。没有培训条件、验证分区和资源消耗的透明报告,有意义的跨研究比较仍然困难。
**5.2. 空白与未来研究方向**
基于第5.1节概述的领域特定局限,未来研究方向必须以一种反映群体遗传推断、系统发育重建和表示学习框架之间生物学和方法论差异的方式构建。不是将深度学习在进化基因组学中视为一个统一的方法论领域,未来进展取决于领域感知的创新、透明基准测试、可解释性驱动的验证以及与进化理论的原则性整合。以下综合识别了研究空白,并阐述了直接解决当前方法论约束的结构化、领域对齐的未来方向。
**5.2.1. 澄清新颖性与概念贡献**
审查过程中强调的一个核心挑战涉及新颖性的清晰阐述。未来研究应超越增量性能提升,而是专注于概念创新。这包括:(i) 将进化理论显式整合到神经网络架构中;(ii) 开发混合概率-神经框架,结合机制建模与表示学习;(iii) 设计领域自适应推断策略,明确解决模拟到现实的差距。此类贡献将未来研究与纯粹预测性深度学习应用区分开来,并将其扎根于进化生物学中。
**5.2.2. 群体遗传推断**
群体遗传学的未来研究应优先考虑在种群异质性和分布偏移下的鲁棒性。结合经验基因组数据集与模拟数据的混合训练范式可能会减少模拟到现实的差距。整合祖先重组图(ARG)表示和分层神经模型可能提高对复杂选择场景的敏感性。此外,结合经典机器学习特征工程与深度表示学习可能增强可解释性并减少过拟合,直接解决关于ML-DL整合的审稿人关切。
**5.2.3. 系统发育重建**
在系统发育学中,能够处理大型和可变分类单元集合的可扩展架构仍然是优先事项。置换不变模型、在树空间上操作的图神经网络以及分治推断策略代表了有前景的方向。未来工作还应建立标准化的拓扑基准数据集,具有冻结的训练/验证/测试分割,以确保跨方法的可比性和统计评估。计算复杂性和时间效率的明确报告必须伴随准确性指标。
**5.2.4. 表示和语言模型**
表示学习框架应将显式进化约束纳入预训练目标,以避免纯粹任务特定的优化。嵌入的机制验证——通过基序富集、保守性分析和跨物种迁移测试——对于生物学可信度至关重要。面向效率的变换器压缩和资源感知训练策略也可以提高可扩展性和可重复性。
**5.2.5. 跨领域整合机会**
一个主要的未来机会在于跨领域方法转移。预训练序列嵌入可能增强群体遗传推断管道,而表示学习中开发的生成模型