Tangermeme:从深度学习模型中提炼可解释顺式调控模式的基因组分析工具包

《Nature Methods》:Tangermeme: a toolkit for understanding cis-regulatory logic using deep learning models

【字体: 大 中 小 】 时间:2026年10月09日 来源:Nature Methods 28.3

编辑推荐:

  深度学习模型(deep learning models)在预测多种基因组模态(genomic modalities)方面已达到最先进性能,但其在生物学发现中的潜力取决于在证明预测性能之后如何使用这些模型。在此,研究人员描述了tangermeme的功能;tang

  
深度学习模型(deep learning models)在预测多种基因组模态(genomic modalities)方面已达到最先进性能,但其在生物学发现中的潜力取决于在证明预测性能之后如何使用这些模型。在此,研究人员描述了tangermeme的功能;tangermeme是一个高度优化的工具包,用于基因组深度学习中的‘everything-but-the-model’(模型之外的一切),并展示了如何利用tangermeme将模型学习到的顺式调控(cis-regulatory)模式提炼为人类可解释的见解。
该论文发表于《Nature Methods》。研究背景方面,机器学习模型(machine learning models)如隐马尔可夫模型(hidden Markov models)和支持向量机(support vector machines)已在基因组学中使用数十年,但深度学习(deep learning)的快速采用改变了机器学习在基因组数据中的应用方式。深度学习在基因组学中的关键优势是其端到端性质,即直接训练于核苷酸序列,取代人工特征工程。当前模型可预测转录因子(transcription factor, TF)结合、组蛋白修饰(histone modification)、染色质可及性(chromatin accessibility)、染色质架构(chromatin architecture)、转录、可变剪接(alternative splicing)、miRNA结合(miRNA binding)和RNA降解率(RNA degradation rates),包括单细胞或空间分辨率。尽管多数关注最大化预测性能,但这只是生物学发现的第一步。模型在证明准确性后,可估计非编码变异(noncoding variants)效应以识别潜在驱动,可与特征归因(feature attribution)方法配对以识别驱动预测的核苷酸或基序(motif),可被探测以识别全局顺式调控规则,或用于设计具有期望特征的序列。关键的是,这些下游使用通常与模型架构或训练无关;估计变异效应基本不受模型使用卷积还是变换器(transformers)、优化器选择或学习率影响。尽管存在这种模块性,目前尚缺乏跨模型类型通用且优化的仓库。分析代码通常与模型发布捆绑。Captum实现一种或几种相关算法;Selene、kipoi、CREsted、EUGENe和gReLU侧重训练和微调,有的包含预训练模型库,但对训练后使用这些模型的支持更有限。因此,研究人员引入tangermeme填补这一空白。

研究人员开展的工作是推出tangermeme,一个实现基因组深度学习“everything-but-the-model”的软件包。这一设计选择是有意为之,因为模型内部计算操作及其训练策略比下游使用更多样且快速演变;tangermeme聚焦使训练后模型的使用尽可能简单。它具有易用的模块化序列操作实现,以创建相关输入,并包含涉及模型的操作,如高效预测或计算特征归因。此设计哲学将模型加载和定义细节留给用户,以避免锁定到任何特定仓库或他人对模型存储和分发的设计选择。序列操作和模型操作可堆叠以创建有用分析:in silico边际化(in silico marginalization)比较将短序列替换入模板前后的预测,可快速从数据库识别相关基序;消融(ablation)概念相反,比较改变模型可能响应的输入区域前后的预测;变异效应估计(variant effect estimation)比较一个或少数通常非连续替换前后的预测,可精细定位候选驱动。预测不必跟随序列操作;任何模型操作,包括DeepLIFT/SHAP、in silico饱和突变(saturation mutagenesis)或任何自定义操作,均可在序列操作后执行。这种模块性使研究人员能轻松创建针对特定研究问题的定制分析。Tangermeme支持多种DNA设计方法,其中许多由De Winter, Konstantakos and Aerts描述。最简单方法是筛选,随机生成序列,按用户定义目标函数评分并返回最佳。贪婪替换(greedy substitution)迭代更新随机生成序列,考虑所有可能的单核苷酸变体并在每阶段选择最佳。基序植入(motif implantation)与贪婪替换类似,但考虑用户提供数据库中的整个基序而非单个突变。最后,新的构建体边际化(construct marginalization)方法概念上合并in silico边际化和设计,创建短构建体,在众多背景序列上平均产生指定模型预测变化,可用于设计诱导期望活性如染色质可及性模式的构建体插入文库,而无需了解构建体。由于tangermeme不内置模型仓库,它也通过包装现有实现避免重复努力;例如Ledidi和TF-MoDISco与tangermeme的设计和归因代码重叠,但现有代码广泛使用和维护,研究人员寻求使tangermeme与其兼容,以降低其未来开发负担。每个操作设计为简化基因组深度学习的实际使用:在适当时内置批处理(batching),支持PyTorch允许的所有数据类型和设备,并在多输入/输出模型上开箱即用;每个操作低层且易扩展或集成到研究代码。例如多数DeepLIFT/SHAP实现要求所有背景序列同时位于图形处理单元内存,使大模型难以解释;tangermeme的内置批处理移除该要求且不损害精确性,低精度支持进一步减少负担。Tangermeme可支持任何内部计算单元类型,如卷积、长短期记忆模型(long short-term memory models, LSTM)、变换器和自定义操作,以及任何预测类型,如单一二元值或整个profile;这些模型可操作任意长度序列,仅受运行单条序列所需中央处理单元/图形处理单元内存限制。核心操作更快,one-hot编码整个hg38 chr1不到2秒,约比次快实现快三倍。通过抽象实现并验证这些算法,研究人员识别出其他常用代码库中未被充分认识的问题:DeepLIFT/SHAP广泛用于特征归因,涉及重写非线性操作的反向传播以纳入参考;识别哪些操作非线性需要将每个计算层与内部字典比对;遇到字典外非线性操作或操作通常为激活函数被重用时,实现会静默失败,且常缺乏文档或警告;用户可能仅在收敛delta(convergence deltas)理论应为零但实际变高时才发现归因错误。Tangermeme不会静默失败,它会在收敛delta过高时发出警告,可返回收敛delta供监测,并可包含自定义非线性函数以避免该问题。除实现常用算法外,tangermeme还包含新算法,用于从训练好的深度学习模型中自动提炼学习到的顺式调控逻辑,聚焦“seqlet(连续高归因片段)”的调用和使用。Seqlet来自DeepLIFT/SHAP、in silico饱和突变、PISA或saliency等算法产生的连续高归因字符片段。Seqlet调用器直接调用可变长度seqlet,并使用seqlet的原则性定义提供简单稳健算法;调用后,tangermeme包含用基序数据库注释seqlet并从中导出统计的步骤,如计数、成对存在和间距关系。

关键技术方法方面,tangermeme实现优化one-hot编码,避免不必要中间计算和内存分配,将字符字节表示直接解释为索引,并使用无符号8位整数。模型方面使用五个公开深度学习模型,并训练两个BPNet模型预测E2F3和MYC结合,使用ENCODE Compendium中染色质免疫沉淀测序(ChIP-seq)实验ENCSR036QIR和ENCSR000EGJ,两者均使用对照轨道ENCSR000BLJ;DeepSEA/Beluga模型来自Kipoi并修改字母表;ChromBPNet和ProCapNet来自ENCODE Compendium的ENCSR467RSV和ENCSR740IPL,仅使用fold 0。模拟中随机生成2,114-bp DNA序列,替换基序,使用ChromBPNet、DeepLIFT/SHAP、饱和突变和变异效应预测。Seqlet调用使用递归统计检验,对归因值X∈?n,l分箱并计算零分布,填充矩阵A1,0:b,转换为1 ? CDF后索引P值;注释使用Tomtom-lite映射到JASPAR2024中来自人类ChIP-seq实验的基序数据库;随后计数注释、成对出现和间距。

研究结果方面,原文按主题可概括如下。

工具包功能概览:原文比较功能,分为支持模型仓库和训练、已实现基因组分析核心操作、支持seqlet调用和使用、支持生物设计以及内置集成具有成熟代码库的外部方法,橙色X表示使用tangermeme的功能。该设计使训练后模型使用简单,并将模型加载和定义留给用户。

序列操作与模型操作的模块化:模拟显示序列操作可与任何模型操作分离;边际化模型响应基序、消融模型响应基序以及引入破坏基序的变异均产生预期结果。One-hot编码hg38 chr1的计时显示tangermeme约三倍快于次快实现。DeepLIFT/SHAP收敛delta评估显示,tangermeme提供自定义profile head操作并正确注册,而Captum不易允许此操作。

DNA设计:tangermeme支持筛选、贪婪替换、基序植入和构建体边际化。筛选随机生成序列并按用户目标函数评分返回最佳;贪婪替换迭代考虑所有单核苷酸变体并每步选最佳;基序植入考虑用户提供数据库中的整个基序;构建体边际化创建短构建体,在多个背景序列上平均产生指定模型预测变化,可用于设计诱导期望活性的插入文库。

外部方法:tangermeme不内置模型仓库,也避免重复努力,而是包装现有实现。Ledidi和TF-MoDISco与设计或归因代码重叠,但现有代码广泛使用和维护;研究人员寻求兼容以降低未来开发负担,类似numpy线性代数代码与scikit-learn线性模型重叠但numpy作为许多包基础。

实际使用优化与软件问题识别:各操作内置批处理,支持PyTorch数据类型和设备,多输入/输出模型开箱即用。DeepLIFT/SHAP批处理移除所有背景序列同时占用GPU的要求且不损精确性,低精度支持减少负担。支持卷积、LSTM、变换器和自定义操作,支持单二元值或整个profile等预测,序列长度仅受CPU/GPU内存限制。核心操作更快。通过抽象实现和验证,研究人员识别DeepLIFT/SHAP静默失败问题;tangermeme会在收敛delta过高时警告,可返回收敛delta,并可包含自定义非线性函数。

Seqlet调用与注释:新算法自动提炼学习到的顺式调控逻辑。Seqlet调用器直接调用可变长度seqlet,其定义是“与零分布相比具有统计显著归因和的跨度”,且该统计检验下所有子跨度也应被调用为seqlet。调用后,用Tomtom-lite将seqlet核苷酸序列映射到JASPAR2024人类ChIP-seq来源基序数据库,以最低P值注释;随后可计数注释、成对存在和间距。

与TF-MoDISco seqlet调用器比较:随机生成100条序列,将MYC基序插入中心,使用MYC BPNet模型并通过DeepLIFT/SHAP默认设置生成归因。递归算法调用的seqlet短于TF-MoDISco,后者默认固定较长;两者均调用多于中间一个seqlet,但TF-MoDISco覆盖更多整个示例,即使P值阈值非常宽松。二元分类任务中,插入序列6 bp为正标签,seqlet调用二元跨度为预测,精确率和召回率趋势显示TF-MoDISco接近该趋势,表明方法存在潜在相似性。计时显示,TF-MoDISco在极少序列时更快,而递归算法在中等至大量序列时更快,包括示例/秒和seqlet/秒。原文指出TF-MoDISco设计选择因其为更大算法一部分:调用宽seqlet以便后续分裂,过度调用以便质控丢弃;递归seqlet调用器则是独立面向用户的算法。

基于seqlet的模型逻辑比较:在PLD6启动子,不同模型预测由不同基序集驱动,BPNet和Beluga的MYC预测由不同基序驱动。自动调用和注释seqlet显示,BPNet预测仅由MYC基序驱动,而Beluga由许多也驱动可及性和转录起始的基序驱动。计数所有MYC峰中注释seqlet以及成对出现,可立即看到BPNet和Beluga的学习逻辑显著不同,尽管表面训练用于预测相同现象;BPNet几乎仅关注MYC基序,Beluga学习更广泛的基序词典和与染色质可及性相关的相互作用。

讨论与结论部分,tangermeme是用于基因组深度学习的软件包,提供核心算法的高效实现以及将学习到的顺式调控模式提炼为见解的新算法。其操作易用、文档完善,可在多种场景中适配或扩展至研究代码。研究人员在此聚焦tangermeme如何与TF结合和染色质可及性模型一起使用,但tangermeme可用于预测任何模态的模型,包括可变剪接、转录、增强子活性,甚至DNA以外分子的模态,如RNA稳定性和结合。研究人员预期,随着基于大语言模型(large language model)的编码代理变得更常见,像tangermeme这样文档完善、稳健的软件包将越来越有价值。当此类系统能从常见基因组分析示例中学习,并重用经过测试、可组合的构建块,而不是从头重建每个分析时,研究人员需要审计的代码更少。因此,tangermeme未来开发不仅聚焦扩展功能,还聚焦改进文档,为这些系统提供全面说明,以使用该软件包而无需用户指定低层应用程序编程接口(application programming interface, API)调用。这种整合将使研究人员能够快速迭代,同时仍信任生成的代码。

研究结论翻译:Tangermeme是一个用于基因组深度学习的软件包,提供核心算法的高效实现以及将学习到的顺式调控模式提炼为见解的新算法。其操作易于使用、文档完善,并可在多种场景中适配或扩展至研究代码。在此,研究人员聚焦于tangermeme如何与转录因子结合和染色质可及性模型一起使用,但tangermeme可与预测任何模态的模型一起使用,包括可变剪接、转录、增强子活性,甚至DNA以外分子的模态,如RNA稳定性和结合。研究人员预期,随着基于大语言模型的编码代理变得越来越普遍,像tangermeme这样文档完善、稳健的软件包将越来越有价值。当此类系统能够从常见基因组分析示例中学习,并重用经过测试、可组合的构建块,而不是从头重建每个分析时,研究人员需要审计的代码就更少。因此,tangermeme的未来开发不仅将聚焦于扩展其功能,还将聚焦于改进文档,为这些系统提供全面说明,以使用该软件包而无需用户指定低层应用程序编程接口调用。这种整合将使研究人员能够快速迭代,同时仍信任生成的代码。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号