
-
生物通官微
陪你抓住生命科技
跳动的脉搏
DeepHyb:基于深度学习的杂交分析推断工具,内置全面的多元序列比对功能
《BMC Bioinformatics》:DeepHyb: deep learning-based inference of hybridization with embedded comprehensive multiple sequence alignment features
【字体: 大 中 小 】 时间:2026年08月11日 来源:BMC Bioinformatics 4.4
编辑推荐:
摘要背景杂交是影响生命树中物种形成与遗传多样性的关键进化过程。传统的杂交推断方法依赖于位点模式统计量,无法捕捉更高阶的序列依赖关系,因此在复杂场景下表现不佳。此外,现有工具往往无法明确区分非杂交的进化情景,也无法确定亲本与杂交后代的谱系关系,给基因组研究的结果解读带来了困难。因此
杂交是影响生命树中物种形成与遗传多样性的关键进化过程。传统的杂交推断方法依赖于位点模式统计量,无法捕捉更高阶的序列依赖关系,因此在复杂场景下表现不佳。此外,现有工具往往无法明确区分非杂交的进化情景,也无法确定亲本与杂交后代的谱系关系,给基因组研究的结果解读带来了困难。因此,亟需能够利用完整基因组序列信息、且具有可解释性的高效方法来克服这些局限。
DeepHyb是一种基于卷积神经网络(CNN)的深度学习框架,旨在直接从多序列比对得到的位点模式和k-mer计数特征中推断历史上的杂交事件。该框架整合了四种互补的特征表示形式——15种汇总位点模式、256种单碱基位点模式、75种汇总k-mer模式以及256种序列级k-mer模式,从而能够捕捉短距离及更高阶的序列依赖关系。在作为多物种合并模型下评估系统发育不一致性的标准框架——包含一个外群和三个内群的典型四类群场景中,DeepHyb能够同时预测杂交状态及亲本与杂交后代的谱系组合。在序列长度为100,000、突变率为0.01的模拟数据上,该方法的准确率为0.8773,精确率为0.5000,F1值为0.6667(相比之下,HyDe的对应数值分别为0.8501、0.4501和0.6202),同时保持1.0的召回率。在实证的Heliconius数据集上,DeepHyb与HyDe得出的杂交/非杂交标签的一致性超过93%;而这些数据并没有真实的杂交事件作为独立参考依据。通过Shapley加法解释方法,DeepHyb识别出了三种具有高度信息量的、与系统发育无关的位点模式特征,即ABBA、ABAA和ABAB,它们与基于HyDe的杂交推断所使用的核心对比特征相对应。与需要染色体级别连续比对的HyDe-CNN不同,DeepHyb基于多序列比对得到的位点模式和k-mer特征进行运算,因此可以应用于碎片化或非连续的基因组数据,同时仍能保留有关杂交/渗入现象的可解释信号。该框架用Python实现,支持多核并行处理和GPU加速,可作为开源资源免费使用。
DeepHyb提出了一种具有可解释性的概念验证方法,在模拟数据以及Heliconius数据集中均得到了验证。通过将数据驱动的深度学习与生物学知识相结合,该方法在杂交推断方面的跨类群通用性仍有待进一步验证。它解决了传统工具的诸多局限,在模拟数据集和实证数据集中都表现出优异的性能,同时还发现了杂交现象的新的基因组特征。这一工具对于进化基因组学研究具有重要意义,能够帮助精准检测杂交事件、确定亲本与杂交后代的关系,以及研究不同类群间的渗入动态。
杂交是影响生命树中物种形成与遗传多样性的关键进化过程。传统的杂交推断方法依赖于位点模式统计量,无法捕捉更高阶的序列依赖关系,因此在复杂场景下表现不佳。此外,现有工具往往无法明确区分非杂交的进化情景,也无法确定亲本与杂交后代的谱系关系,给基因组研究的结果解读带来了困难。因此,亟需能够利用完整基因组序列信息、且具有可解释性的高效方法来克服这些局限。
DeepHyb是一种基于卷积神经网络(CNN)的深度学习框架,旨在直接从多序列比对得到的位点模式和k-mer计数特征中推断历史上的杂交事件。该框架整合了四种互补的特征表示形式——15种汇总位点模式、256种单碱基位点模式、75种汇总k-mer模式以及256种序列级k-mer模式,从而能够捕捉短距离及更高阶的序列依赖关系。在作为多物种合并模型下评估系统发育不一致性的标准框架——包含一个外群和三个内群的典型四类群场景中,DeepHyb能够同时预测杂交状态及亲本与杂交后代的谱系组合。在序列长度为100,000、突变率为0.01的模拟数据上,该方法的准确率为0.8773,精确率为0.5000,F1值为0.6667(相比之下,HyDe的对应数值分别为0.8501、0.4501和0.6202),同时保持1.0的召回率。在实证的Heliconius数据集上,DeepHyb与HyDe得出的杂交/非杂交标签的一致性超过93%;而这些数据并没有真实的杂交事件作为独立参考依据。通过Shapley加法解释方法,DeepHyb识别出了三种具有高度信息量的、与系统发育无关的位点模式特征,即ABBA、ABAA和ABAB,它们与基于HyDe的杂交推断所使用的核心对比特征相对应。与需要染色体级别连续比对的HyDe-CNN不同,DeepHyb基于多序列比对得到的位点模式和k-mer特征进行运算,因此可以应用于碎片化或非连续的基因组数据,同时仍能保留有关杂交/渗入现象的可解释信号。该框架用Python实现,支持多核并行处理和GPU加速,可作为开源资源免费使用。
DeepHyb提出了一种具有可解释性的概念验证方法,在模拟数据以及Heliconius数据集中均得到了验证。通过将数据驱动的深度学习与生物学知识相结合,该方法在杂交推断方面的跨类群通用性仍有待进一步验证。它解决了传统工具的诸多局限,在模拟数据集和实证数据集中都表现出优异的性能,同时还发现了杂交现象的新的基因组特征。这一工具对于进化基因组学研究具有重要意义,能够帮助精准检测杂交事件、确定亲本与杂交后代的关系,以及研究不同类群间的渗入动态。