平衡DNA插值改善植物遗传距离信息嵌入的学习

《PLOS Computational Biology》:Balanced DNA interpolation improves learning of genetic distance-informed embeddings in plants

【字体: 时间:2026年09月04日 来源:PLOS Computational Biology 3.7

编辑推荐:

  在分类学研究中,基于传统系统发育树和结构的遗传数据分析正日益被基于机器学习的识别和表示学习所补充。尽管训练最先进的机器学习模型所需的DNA数据量往往超出生物学研究中实际可收集和测序的范围,但样本数量可以通过数据增强人为扩展。遗传数据增强通常指引入随机碱基变异、

  
在分类学研究中,基于传统系统发育树和结构的遗传数据分析正日益被基于机器学习的识别和表示学习所补充。尽管训练最先进的机器学习模型所需的DNA数据量往往超出生物学研究中实际可收集和测序的范围,但样本数量可以通过数据增强人为扩展。遗传数据增强通常指引入随机碱基变异、易位和反向互补序列。这些增强方法未考虑种群和物种的内在结构,可能模糊遗传数据集中实体之间的界限。研究人员提出DNAInterpolator,一种在给定数据集内对DNA序列进行插值的方法,该方法提供了一种邻居引导的随机突变替代方案。研究人员使用四个开花植物数据集和一个训练用于预测配对样本间遗传距离的人工神经网络,测试了插值作为增强技术的效果。为解决训练数据集中距离分布不均的问题,研究人员通过筛选插值序列来平衡距离分布,并检验了平衡的效果。研究人员发现,平衡有助于模型捕获整个距离范围内的遗传距离,通过强化分布中代表性不足区域的性能来实现。该新方法挖掘了分类学DNA数据集在现代机器学习应用中的潜力。

作者总结:近年来,使用基于机器学习的方法研究遗传数据的兴趣日益增加。然而,对于专注于细粒度物种分类或界定的研究而言,可用的遗传数据有限。现成的细粒度数据数量有限,且研究人员在材料采集方面面临挑战(例如狭域特有种或偏远地区),这构成了在微调最先进的基因组基础模型或从头训练大型模型时的重大问题。通过DNA增强方法对遗传数据进行上采样已被证明能改善模型性能。通常,这些增强方法引入随机突变,可能模糊给定数据集固有的物种边界和种群结构。研究人员检验了一种离线增强技术的潜力,该技术通过对同一物种的样本进行插值,向数据集中添加半人工DNA序列。该方法透明、可解释,且独立于编码方法或后续分析。
平衡DNA插值改善植物遗传距离信息嵌入的学习——论文解读

一、研究背景与问题

遗传数据已成为进化生物学和分类学研究的基础资源,为生命之树中的生物多样性提供了详细见解。随着测序技术的进步,遗传数据集在规模和多样性上持续增长,从单基因座到多基因座乃至全基因组(重)测序。与此同时,机器学习方法越来越多地应用于这些分子数据,为进化生物学、系统学和生态学中的模式识别、分类和推断创造了新机遇。DNABERT-2、AgroNT、GROVER、Caduceus、Nucleotide Transformer等基因组基础模型在大规模数据上训练,能够可靠预测表观遗传标记、剪接位点、RNA稳定性或基因表达。然而,这些模型的构建多聚焦于人类或细菌DNA,很少涉及植物遗传学,且模型往往仅使用非植物数据进行训练或评估。当这些模型被应用于物种分类时,植物物种鉴定和界定中普遍存在的挑战很少被讨论,包括高频率的古代和近代杂交或异源多倍化(部分与无性生殖结合)所导致的复杂网状进化模式。解决植物物种进化和亲缘关系需要至少对现有基因组基础模型进行微调,但数据库中通常仅有粗粒度的基因组数据,例如GenBank中少数基因组往往代表整个植物科。通过靶向富集获得的数百个单拷贝核基因等亚基因组数据在多数开花植物属中较为易得,但用于物种界定和分类目的的、每物种包含多个重复样本的细粒度亚基因组数据在许多植物类群中仍然非常有限。在分类学研究中,样本量不足对预训练网络的微调构成重大挑战,尤其是大型语言模型。数据增强虽然不能替代足够的原始数据,但可以通过人为增加训练数据的变异性来缓解样本量不足的问题。现有DNA数据增强方法包括随机突变、插入缺失引入、反向互补、易位和输入值噪声扰动等,但这些方法未充分考虑数据集固有的种群和物种结构,可能模糊实体间界限。此外,在线增强技术难以检查,限制可解释性,且当目标值依赖于增强输入时(如训练于DNA序列对之间的遗传距离),训练前进行离线增强更为合理。

二、研究目标与数据集

针对上述问题,研究人员提出了DNAInterpolator,一种物种感知且共识辅助的增强方法,利用数据集中经验观察到的单核苷酸多态性(single nucleotide polymorphism, SNP)变异。该方法通过在同一物种的DNA样本之间进行插值来增强数据,并利用共识序列限制新生成样本的遗传分歧。插值确保了序列模拟过程中只产生自然发生的突变、插入和缺失,是一种保守的、严格数据约束的插值策略,允许追踪生成样本中注入的信息。研究使用了四个开花植物数据集,涵盖兰花、草本谱系和热带树木:兰科(Orchidaceae)的Dactylorhiza属物种(涉及杂交种D. cantabrica及其亲本,共20个个体、266个基因座)、伞形科(Apiaceae)的Lomatium属L. foeniculaceum复合群(5个物种含2个变种、286个基因座)、山榄科(Sapotaceae)的Palaquium属(8个物种、260个基因座)以及豆科(Fabaceae)的Pterocarpus属(12个物种、319个基因座)。所有数据集均基于Angiosperms353探针组生成的系统发育组学数据。

三、主要技术方法

研究人员使用Python v3.13.2实现了物种感知共识辅助(species-aware consensus-based, SACB)插值技术。该流程首先为每个物种-基因座分组创建FASTA文件,并在增强前确定训练/验证划分,仅使用训练子集进行插值,以避免信息泄漏。基于FASTA文件,使用R包ape计算p-距离,使用sn p-sites版本2.5.1确定SNP位点,并生成共识序列。插值过程中,将SNP从供体序列转移到受体序列:随机选择一个p-距离非零的插值伙伴作为供体,将受体和供体序列缩减至二者间不同的SNP位点,进一步将相关SNP缩减至受体序列中已与共识序列产生分歧的位置(当额外偏离位点会超过数据集中观察到的与共识序列的最大分歧时),使用偏斜随机分布确定要改变的碱基数量,并从过滤后的SNP列表中进行随机抽样。为避免生成重复个体,存储跨所有基因座的SNP序列并进行比对检查。通过热图(使用ComplexHeatmap包)可视化插值样本与原始样本在GTR+GAMMA距离下的聚类关系。训练阶段采用留一数据集交叉验证(Leave-One-Out Cross-Validation, LOOCV),即使用四个数据集中的三个进行训练,在第四个数据集上测试。模型采用BERT架构,使用基因组基础模型DNABERT-2的预训练权重,DNA序列经DNABERT-2分词器处理,将两条DNA序列输入网络后计算所得嵌入的余弦距离,并与从原始遗传距离转换的目标余弦距离比较以计算训练损失。使用全局训练批次大小256,学习率1.6e-5,每次LOOCV训练在6块NVIDIA A40 GPU上约需3天。评估时使用Friedman检验、配对Wilcoxon检验、线性混合效应模型(lmerTest包)及Spearman秩相关系数进行统计分析。

四、研究结果

**插值与平衡后的距离分布** 使用插值但未平衡的数据集相比无插值数据集样本量增加,但余弦距离范围内的距离分布基本保持一致,所有四个LOOCV训练集均强烈偏向较小距离。使用平衡插值的数据集显示出明显更均匀的分布。总体而言,平衡插值数据集的中位遗传距离接近0.97-0.99,而未插值和未平衡插值数据集中位距离在0.02-0.11之间。详细的样本贡献检查显示,Palaquium仅产生遗传距离特别小的序列对,即使在平衡插值数据集中也维持了不均匀的距离分布。

**预测距离分歧** 对于所有四个数据集,考虑完整测试集时,插值方法间遗传距离预测分歧存在显著差异(Friedman p < 0.001)。在Dactylorhiza中,未平衡插值的效果差于无插值;在Lomatium中,未平衡插值相比无插值改善了距离预测;在Palaquium和Pterocarpus中,未平衡插值与无插值结果相当。当使用平衡插值时,对于Dactylorhiza和Palaquium,仅使用原始DNA序列产生的嵌入余弦距离最接近真实遗传距离;而对于Lomatium和Pterocarpus,基于平衡插值方法训练的模型提供了显著最小的目标距离分歧。线性混合效应模型分析表明,真实距离、插值方法及其组合显著影响模型预测与真实值之间的分歧(ANOVA p < 0.0001)。分段分析显示,对于小距离(扇区1-7),不进行插值训练产生最准确的预测(Dactylorhiza和Pterocarpus),而在中到大数据集距离(扇区8-30)中,平衡插值显著优于未平衡插值和无插值。Lomatium中,小距离时未平衡插值表现最佳,较大距离时平衡插值表现最佳。Palaquium仅覆盖扇区1-7,该范围内不进行插值产生最准确的预测。

**预测距离相关性** 在Dactylorhiza和Palaquium中,无插值训练的模型相比未平衡插值训练表现出更强的预测与目标距离相关性(R2=0.24 vs 0.18和0.36 vs 0.27,p < 0.001)。在Lomatium和Pterocarpus中,未平衡插值训练的相关性强于无插值(R2=0.29 vs 0.25和0.22 vs 0.19,p < 0.001)。平衡插值在Dactylorhiza、Lomatium和Pterocarpus上相比未平衡插值产生更高的相关系数(R2=0.21 vs 0.18、0.42 vs 0.29和0.27 vs 0.22,p < 0.001),仅Palaquium中未平衡插值优于平衡插值。

五、讨论与结论

研究结果表明,插值后平衡数据的训练在Lomatium和Pterocarpus中产生比无插值训练更准确的距离预测,而在Dactylorhiza和Palaquium中不插值训练效果最佳。这些差异反映了测试数据集中的总体样本量以及Angiosperms353基因间进化分歧所致的偏差距离分布。Palaquium序列对仅覆盖小距离范围——恰是所有方法表现最佳的区域,其距离偏差可能源于快速辐射和最低的SNP数量(2k),这导致训练与推断距离分布之间显著不匹配。Dactylorhiza中由近代多倍体杂交引起的距离偏差解释了无插值数据略好的相关系数。Lomatium和Pterocarpus表现出较大的进化分歧、高SNP数量和低水平的网状进化过程,因此覆盖广泛的遗传距离范围,平衡插值产生最准确的距离预测。研究人员指出,当推断数据的遗传距离与训练/验证数据显著偏离时,插值和平衡可能不会改善模型性能,因此了解测试集的距离范围并相应调整插值和训练是有利的。DNAInterpolator的潜在应用包括通过生成生物上合理的插值序列来缓解采样不足的局限,以及利用可靠的遗传嵌入空间将化石形态信息与DNA信息联系起来。该方法独立于下游分析和特定的编码方法,提供可追踪性和完全透明度。与隐马尔可夫模型(Hidden Markov Model, HMM)等生成方法不同,DNAInterpolator不会外推超出观察数据的序列空间,而是保留组内遗传变异并记录每个选定核苷酸的来源。平衡插值通过增加稀疏序列空间的密度,可在采样困难、稀有单倍型或生物限制导致代表性不足的分布区域实现模型微调,为下游任务提供关键信息并稳定嵌入空间内的表征构成。

结论:研究人员证明,在模型训练前对DNA序列进行选择性增强可以改善n维嵌入空间内嵌入之间的关系,使其更具生物学意义。通过在原始数据集内的序列之间插值并系统选择样本以平衡原始数据中观察到的遗传距离分布,可以强化预定义距离谱内所有关系的学习。当测试样本覆盖整个距离谱时,谱内连接的加强降低了距离预测与真实值的分歧。与训练中引入情境无关突变和插入缺失的增强方法相比,插值在可解释性方面提供了额外优势。在机器学习之外,插值方法可通过提供在原始样本之间构建连续统的生物数据驱动序列模拟,缓解系统发育组学研究中采样受限的问题。该研究发表在《PLOS Computational Biology》。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号