Mamba-GRN:一个受Mamba框架启发的无重叠保留规则边缘预测工具
《Computational Biology and Chemistry》:Mamba-GRN: A Mamba-inspired framework for no-overlap held-out regulatory edge prediction
【字体:
大
中
小
】
时间:2026年09月04日
来源:Computational Biology and Chemistry 3.4
编辑推荐:
• 严格的非重叠协议防止了保留的负边泄漏。• Mamba-GRN在平均AUROC和AUPRC上优于GENIE3和GRNBoost2。• 在1:1、2:1和5:1的训练负样本比例下,性能稳定。• K562 Perturb-seq基准测试了源匹配的难阴性样本的恢复能力。• 固定候选评
• 严格的非重叠协议防止了保留的负边泄漏。• Mamba-GRN在平均AUROC和AUPRC上优于GENIE3和GRNBoost2。• 在1:1、2:1和5:1的训练负样本比例下,性能稳定。• K562 Perturb-seq基准测试了源匹配的难阴性样本的恢复能力。• 固定候选评分算法效率较高;而穷举所有成对解码的复杂度为二次方。
引言
基因调控网络(GRNs)描述了基因与转录因子之间的定向调控关系,并提供了细胞调控的系统级表示。从转录组测量中推断GRNs仍然具有挑战性,因为调控网络是稀疏的、依赖于上下文的,并且只部分观察到。现有的方法包括基于相关性和互信息的方法、回归模型、基于树的集成模型以及诸如ARACNE、GENIE3、GRNBoost2和SCENIC(Margolin等人,2006年;Faith等人,2007年;Huynh-Thu等人,2010年;Moerman等人,2019年;Aibar等人,2017年)等集成工作流程。基准研究进一步表明,GRN推断方法的表现在不同数据集、网络家族和评估协议之间可能有显著差异(Pratapa等人,2020年;Marbach等人,2012年)。深度表示学习提供了一种灵活的方式,将表达衍生基因特征与可学习的基因特异性表示相结合。然而,在监督式GRN预测中,评估设计尤为重要。如果模型是通过重建用于优化的网络来评估的,或者如果在训练期间也使用了分配给验证或测试集的负边,那么模型的性能可能会被高估。在稀疏的调控网络中,这个问题会更加严重,因为负边的定义、采样和重用会显著影响AUROC和AUPRC。因此,一个合理的保留评估必须明确正边的划分方式、训练集、验证集和测试集的负样本构建方法、模型选择过程以及最终的测试隔离措施。由于调控边预测的高度不平衡,应同时使用精确度-召回率指标和AUROC来进行解释(Davis和Goadrich,2006年;Saito和Rehmsmeier,2015年)。
近期,结构化状态空间和Mamba风格模型为序列类表示提供了比密集自注意力更高效的替代方案(Gu等人,2022年;Gu和Dao,2023年)。尽管如此,当前的实现不应被解释为一个完整的选择性状态空间Mamba模型。本研究中使用的编码器包括带有层归一化的残差块、线性扩展、深度一维卷积、GELU激活和线性投影。它没有实现输入依赖的状态空间离散化或原始Mamba架构的选择性扫描操作。因此,我们将该模型描述为受Mamba启发的,并评估了完整的基因表示和候选边解码框架,而不是将结果归因于选择性状态空间机制。
我们提出了Mamba-GRN,这是一个用于监督式保留调控边预测的紧凑框架。该模型结合了表达衍生的基因特征、数据集特定的基因身份嵌入、轻量级残差编码器以及双线性或混合边解码器。候选调控边直接分批评分,从而避免了训练过程中的密集所有成对张量。修订后的评估采用了一种非重叠协议,在训练之前对验证和测试负边进行采样,并从训练负样本池中移除这些边。
本研究的主要贡献如下:
1. 我们重新审视了原始的边采样流程,并引入了一种严格的非重叠保留协议,防止验证和测试负边被用作训练样本。
2. 我们将Mamba-GRN与官方的GENIE3和GRNBoost2实现、类似MI/ARACNE的方法、表达相关性和使用相同保留的测试边的随机排名进行了比较。
3. 我们报告了AUROC、AUPRC、Precision@P、自助法置信区间、数据集级别的胜率、带有Holm校正的配对Wilcoxon检验、负样本比率敏感性、表示维度敏感性以及实现级别的效率测量结果。
4. 我们在独立的K562 Perturb-seq基准测试上评估了该框架,使用了源分层的正样本划分、源匹配的难阴性样本、边级别和源级别的指标,以及随机初始化的固定骨架对照组。
5. 我们区分了高效的固定候选边评分和穷举所有成对解码,并明确展示了枚举所有定向基因对在基因数量上的复杂度为二次方(见图1)。
问题表述
设??∈???×??表示一个包含??个基因和??个细胞或样本的基因表达矩阵。一个定向的参考调控网络由邻接矩阵??∈{0,1}??×??表示,其中???????=1表示从源基因??到目标基因??的定向调控边。
目标是学习一个评分函数???????=???(??,??∣??),该函数为候选定向边(??,??)分配一个调控可能性分数。自循环被排除在外。正边来自参考网络,而负边则...
非重叠保留的主要基准测试
表1总结了在修正后的非重叠协议下七个GSD数据集和三个随机种子的平均性能。所有方法都使用了相同的保留正负测试边进行评估。
完整的Mamba-GRN配置在评估方法中实现了最高的平均AUROC(0.6225)和AUPRC(0.4754)。其Precision@P为0.4444,与GENIE3相当,并高于GRNBoost2。双线性Mamba-GRN变体的AUROC为0.6015,AUPRC为...
讨论
本研究在修正后的非重叠保留边协议下重新评估了Mamba-GRN。在从训练负样本池中移除验证和测试负边后,观察到的性能比通过训练网络重建获得的性能更为保守。尽管如此,完整模型在评估方法中保持了最高的平均AUROC和AUPRC。相对于GENIE3和GRNBoost2,所有四个平均配对差异都是正的,并且自助法...
局限性
本研究有几个局限性。首先,主要基准包含七个每个包含19个基因的小型GSD网络。每个保留的测试分割只包含15个正边,这导致了数据集级别和种子级别的显著变异性。因此,主要基准应被视为一个受控的试点评估,而不是对大规模生物网络中GRN推断算法的最终排名。
结论
我们提出了Mamba-GRN,这是一个用于监督式保留调控边预测的紧凑型Mamba启发式基因表示和候选边解码框架。修订后的评估引入了一种严格的非重叠协议,其中验证和测试负边被排除在训练负样本池之外。
在七个非微小的GSD数据集和三个随机种子中,完整模型在评估方法中实现了最高的平均AUROC和AUPRC。
CRediT作者贡献声明
HaiLong Wu:撰写 – 审稿与编辑、撰写 – 原稿、可视化、软件、方法论、调查、形式分析、数据整理、概念化。
ZhiMo Wu:撰写 – 审稿与编辑、验证、调查、数据整理。
XiaoQiong Liu:撰写 – 审稿与编辑、监督、资源管理、项目实施、资金获取。
在撰写过程中使用生成式AI和AI辅助技术的声明
在准备修订稿件期间,作者使用了ChatGPT(OpenAI)进行语言编辑、组织建议和初步的可编辑图形布局生成。作者手动审查和校正了所有科学内容、数值、标签和视觉关系,并在draw.io中完成了提交的矢量图。所有的实验设计、代码执行、数据分析、科学解释和最终手稿决策均...
资助
本研究得到了国家科技重大 project(项目编号2024ZD1000208和2024ZD1000204)、国家自然科学基金(项目编号42364006)以及江西省重点学科学术和技术领导者培训计划(项目编号20232BCJ23051)的支持。
利益冲突声明
作者声明他们没有已知的财务利益或个人关系可能会影响本文所述的工作。
致谢
作者感谢BEELINE、GENIE3、Arboreto及相关GRN推断资源的开发者,他们将其数据集、软件和评估工具公开可用。
HaiLong Wu | ZhiMo Wu | XiaoQiong Liu
生物通微信公众号
生物通新浪微博
今日动态 |
人才市场 |
新技术专栏 |
中国科学人 |
云展台 |
BioHot |
云讲堂直播 |
会展中心 |
特价专栏 |
技术快讯 |
免费试用
版权所有 生物通
Copyright© eBiotrade.com, All Rights Reserved
联系信箱:
粤ICP备09063491号