使用DNABERT和DNABERT-2可解释预测酿酒酵母DNA复制起点

《BMC Bioinformatics》:Interpretable prediction of DNA replication origins in S. cerevisiae using DNABERT and DNABERT-2

【字体: 时间:2026年07月24日 来源:BMC Bioinformatics 4.4

编辑推荐:

  背景:DNA复制是一个生物过程,其中单个DNA分子被复制,起始于多个基因组位点,称为复制起点(replication origins,ORIs)。识别复制起点并分析其底层碱基序列组成对于理解DNA复制机制至关重要。尽管已有多种机器学习和深度学习方法用于起点预测

  
背景:DNA复制是一个生物过程,其中单个DNA分子被复制,起始于多个基因组位点,称为复制起点(replication origins,ORIs)。识别复制起点并分析其底层碱基序列组成对于理解DNA复制机制至关重要。尽管已有多种机器学习和深度学习方法用于起点预测,但许多方法依赖于劳动密集型的特征工程或缺乏可解释性。研究人员微调了两种基于基因组的预训练语言模型DNABERT和DNABERT-2,以预测出芽酵母(budding yeast)中的复制起点,并揭示其背后的DNA碱基组成。本研究的关键贡献在于提供了一个系统性的框架,用于分析基因组语言模型在复制起点预测中的应用,该框架结合了受控数据集设计与模型特定的可解释性流程,以检验不同的分词策略如何影响学习到的序列特征,以及这些方法是否能够突出生物学上有意义的信号。结果:研究人员在设计的两个数据集上评估了两种模型,以确保鲁棒性并支持可解释性。DNABERT表现出稳定的性能,在更具挑战性的数据集上平均准确率为0.72,在较简单的数据集上为0.83。相比之下,DNABERT-2在相同数据集上取得了可比的分数,分别为0.72和0.81。研究人员基于注意力的基序发现流程增强了DNABERT的可解释性,通过从高注意力片段中识别出与已知复制起点序列模式高度匹配的基序。研究人员还应用了基于扰动的解释方法,包括Shapley加法解释(Shapley additive explanations,SHAP),来解释DNABERT-2的学习机制。该分析识别出具有高归因得分的标记,这些标记与生物学相关的序列组成一致。结论:本研究表明,两种模型都能识别复制起点序列,尽管采用不同的学习策略。分词似乎影响模型的学习和注意力行为。与DNABERT-2中使用的字节对编码(byte pair encoding,BPE)分词相比,DNABERT中使用的重叠k-mer分词产生了更可解释的注意力图。研究人员证明,尽管共享相同的BERT风格架构,DNABERT捕获了相关的短程模式以及一些超出局部上下文的序列依赖关系,如其注意力图所示。相比之下,DNABERT-2的替代分词策略通过优化标记权重,使其学习偏向相关的短程模式。
**论文解读:基于DNABERT和DNABERT-2的酿酒酵母DNA复制起点可解释预测研究**

**1. 研究背景、问题与意义**

DNA复制是所有生命体维持基因组稳定性的基础生物学过程,复制起始于基因组上多个特定位点,即复制起点(replication origins,ORIs)。准确识别ORIs并解析其底层序列特征,对于理解DNA复制调控机制至关重要。在酿酒酵母(*Saccharomyces cerevisiae*)中,自主复制序列(autonomous replication sequences,ARS)已被鉴定,其核心元件为ARS共有序列(ARS consensus sequence,ACS),通常为11-bp的富T序列(WTTTATRTTTW),但仅凭ACS不足以定义活性起点,因为基因组中存在超过12,000个ACS匹配位点,而正常条件下仅约500个发挥功能。这表明染色质结构、转录活性和次级序列基序等因素共同参与调控。现有机器学习方法(如支持向量机、随机森林)和深度学习方法(如Word2Vec结合卷积神经网络)在ORI预测中取得了一定进展,但大多依赖繁重的特征工程或缺乏可解释性,难以揭示模型所学到的生物学信号。因此,本研究旨在利用预训练的基因组语言模型DNABERT和DNABERT-2,通过微调预测酿酒酵母复制起点,并开发系统性的可解释性框架,分析不同分词策略如何影响模型对序列特征的学习,从而在保持预测性能的同时提供生物学上有意义的解释。该研究发表在《BMC Bioinformatics》。

**2. 主要关键技术方法**

研究人员采用了两种预训练基因组语言模型:DNABERT(基于重叠k-mer分词,参数约86M)和DNABERT-2(基于字节对编码BPE分词,参数约117M,预训练数据包含多物种基因组)。模型微调为二分类任务,输入序列固定为500 bp。数据来源为OriDB数据库,共325个实验证实ORI作为正样本,并以两种策略构建负样本:Random-Neg数据集(随机选取基因组非ORI区域)和ACS-Neg数据集(选取含非复制ACS基序的基因组区域,以控制ACS基序强度在两类别间无显著差异)。模型训练采用7次随机训练/验证/测试分割(70/10/20),早停法选择最佳检查点。可解释性方法包括:针对DNABERT的基于注意力分数的基序发现流程(结合MEME工具),针对DNABERT-2的扰动(如移除ACS基序、随机打乱BPE标记顺序)和Shapley加法解释(SHAP)分析(利用TransSHAP框架)。此外,还进行了交叉数据集评估(在打乱序列的测试集上验证模型)。

**3. 研究结果**

**3.1 性能分析(Performance analysis)**
DNABERT在Random-Neg数据集上平均准确率0.83,AUC 0.90;在ACS-Neg数据集上准确率0.72,AUC 0.82。DNABERT-2在Random-Neg数据集上准确率0.81,AUC 0.82;在ACS-Neg数据集上准确率0.72,AUC 0.72。两模型在ACS-Neg数据集上性能下降,表明ACS基序的区分作用被削弱,但模型仍能捕捉其他序列特征。

**3.2 可解释性结果(Explainability of the results)**
**DNABERT**:基于注意力的基序发现流程从Random-Neg数据集的高注意力片段中鉴定出与ACS模式高度一致的基序(如5’-TTTTTWTTTATRTTT-3’),E值显著;从ACS-Neg数据集训练集中鉴定出交替A/T碱基的基序(ATATATATATATDTA),与基因间起点相关。交叉验证显示,在打乱序列的测试集上,Random-Neg训练模型AUC降至0.68–0.69,而ACS-Neg训练模型仍保持较高AUC(~0.81),表明后者依赖于更复杂的序列特征。

**DNABERT-2**:注意力热图显示强对角线模式,表明模型主要关注局部标记依赖,而非全局上下文。扰动实验表明,移除ACS基序仅使10%的起点序列被重新分类,AUC从0.82降至0.77;随机打乱BPE标记后,正样本预测不变,但负样本中真阴性减少30%,假阳性几乎翻倍,AUC降至0.75。SHAP分析揭示,对起点预测贡献最高的标记均为A/T富集,包括TATA-like重复模式,与已知起点序列组成一致。AT-index分析显示,真阳性序列AT指数(均值0.61)显著高于真阴性(均值-0.45)和打乱后变为假阳性的序列(均值-0.17)。

**3.3 人类数据探索性分析(Human data)**
将DNABERT流程应用于人类K562细胞系复制起点数据(来自iOR-Epi研究)。在控制长度分布的数据集(K562-LenMatch)上,DNABERT准确率0.894,AUC 0.956。基于注意力的基序发现从高注意力片段中鉴定出G富集基序,且随注意力峰值筛选更严格,G富集程度增强,与人类起点常位于GC富集区域及G-四链体形成序列附近的报道一致。

**4. 讨论与结论**

讨论部分指出,由于缺乏标准化基准数据集,直接与先前ORI预测方法比较存在困难。但本研究框架与现有方法(如多视图集成学习MEL、XGBoost)在类似概念数据集上的性能处于可比范围。关键发现是分词策略对模型行为有显著影响:DNABERT的重叠k-mer分词产生更可解释的注意力图,能捕捉全局序列依赖;而DNABERT-2的BPE分词使模型偏向短程模式,依赖标记身份。SHAP分析进一步确认AT富集标记是起点预测的重要特征。

结论部分总结:研究表明两个Transformer模型均能有效识别酿酒酵母复制起点,但学习策略不同,分词影响模型注意力可解释性。DNABERT捕获了相关的短程模式和部分序列依赖,而DNABERT-2通过优化标记权重学习短程模式。建议未来基因组基础模型应结合生物学感知的分词策略,以提升可解释性和预测性能。尽管研究聚焦于酿酒酵母,但DNA复制起始的基本原理在真核生物中高度保守,该可解释性框架可推广至更复杂基因组,如人类复制起点分析。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号