GiGCN:一种基于网络的框架,用于揭示合成致死与合成存活的遗传相互作用

《Briefings in Bioinformatics》:GiGCN: a network-based framework for uncovering synthetic lethal and viable genetic interactions

【字体: 时间:2026年09月08日 来源:Briefings in Bioinformatics 7.3

编辑推荐:

  遗传相互作用(GIs)支撑着基因和通路的功能连接,对于解析基因型-表型关系和识别疾病的治疗靶点至关重要。然而,人类基因组的规模限制了对GIs的系统性实验探究。现有的计算工具侧重于预测合成致死(SL)和合成存活(SV)这两种主要的GI形式,但其准确性和生物学可解

  
遗传相互作用(GIs)支撑着基因和通路的功能连接,对于解析基因型-表型关系和识别疾病的治疗靶点至关重要。然而,人类基因组的规模限制了对GIs的系统性实验探究。现有的计算工具侧重于预测合成致死(SL)和合成存活(SV)这两种主要的GI形式,但其准确性和生物学可解释性因对正、负相互作用背后的分子机制建模不足以及负样本的限制而受到损害。为了克服这些挑战,研究人员开发了遗传相互作用图卷积网络(GiGCN),一种用于联合鉴定具有SL和SV的基因对的符号网络建模框架。研究人员通过整合已验证的GIs、非相互作用基因对以及源自生物过程的基因语义相似性,构建了一个高置信度的符号遗传网络。通过利用解纠缠子空间分解,该框架分别建模基因网络内不同功能维度,从而能够稳健地表示情境依赖的调控关系,并准确区分SL和SV事件。基准实验表明,GiGCN优于最先进的方法(受试者工作特征曲线下面积(AUC):0.978,精确率-召回率曲线下面积(AUPR):0.944)。进一步分析揭示了具有生物学意义的见解,包括以癌基因MYC原癌基因(MYC)为中心的已知和新型SL相互作用,以及与自噬和线粒体自噬通路相关的SV相互作用。本研究为系统探索GIs提供了一种稳健且可解释的基于网络的策略。GiGCN框架不仅提高了SL和SV预测的精度,还为基因功能关系提供了机制性见解,从而支持发现针对癌症和其他人类疾病的可行治疗靶点。
**背景与目标**

遗传相互作用(Genetic Interactions, GIs)是基因和通路功能连接的基础,对于解析基因型-表型关系和识别疾病治疗靶点至关重要。然而,人类基因组包含约2万个蛋白编码基因,理论上的基因配对组合高达数百亿,使得系统性实验检测GIs极为困难。现有计算工具主要聚焦于合成致死(Synthetic Lethality, SL)和合成存活(Synthetic Viability, SV)的预测,但存在两个关键缺陷:一是对正负相互作用背后的分子机制建模不足;二是随机选取的负样本可能将尚未验证的真实相互作用标记为阴性,造成假阴性污染,严重制约模型准确性与可解释性。因此,需要一种能够同时建模SL与SV、并具备生物学可解释性的新型计算方法。

针对上述挑战,研究人员开发了遗传相互作用图卷积网络(Genetic Interaction Graph Convolutional Network, GiGCN),一种基于符号网络(Signed Network)的框架,用于联合鉴定具有SL和SV的基因对。该研究发表于《Briefings in Bioinformatics》。

**关键技术与方法**

研究整合了癌症遗传相互作用数据库(Cancer Genetic Interaction database, CGIdb)2.0和合成致死数据库(Synthetic Lethality Database, SynLethDB)中的实验验证数据,经严格清洗后构建了包含4918个SV对、39836个SL对、98320个非相互作用的SL对、覆盖8887个基因的高置信度基准集。利用基因本体语义相似性测量(GOSemSim)计算基因间基于生物学过程的语义相似性,并通过主成分分析降至128维作为节点初始特征。模型采用符号图神经网络架构,包括解纠缠编码器(将节点特征分解为K个独立潜在因子)、符号聚合器(通过SUM、MEAN、MAX和注意力等方式融合邻域信息)、多因子解码器(计算因子间的交互矩阵并分类)以及结合交叉熵与自监督判别损失的复合损失函数。整个设计不依赖结构平衡理论,通过正边增强特征传播、负边抑制特征融合来刻画SL和SV的差异。

**研究结果**

**性能评估:** 在五折交叉验证下,GiGCN与包括非负矩阵分解(NMF)、图卷积网络(GCN)、图注意力网络(GAT)、符号图卷积网络(SGCN)等在内的20余种基线方法对比,取得了最优的受试者工作特征曲线下面积(AUC=0.978)和精确率-召回率曲线下面积(AUPR=0.944),F1_macro和F1_micro分别达到0.8837和0.9277,证明符号图神经网络和因子解纠缠机制的有效性。

**超参数设置:** 通过消融实验发现,潜在因子数量K=8时性能最佳,而K=1(即无解纠缠)导致AUC降至0.890;双层卷积结构优于单层和三层;解纠缠损失权重λ=0.1时平衡了重构与正交性;SUM聚合方式加速收敛且更符合遗传网络中的冗余补偿特征。

**分析人类基因组中的基因相互作用对:** 将GiGCN预测的SL对与SynLethDB数据库比对,前100个预测中91个可被数据库确认,前1000个中732个被确认,表明预测可靠性。案例研究发现MYC–SAE1、MYC–UBE3B等新的SL对,其中MYC–SAE1已被独立实验验证;此外,高分的SV对富集自噬相关基因(如PINK1–ATG3、PINK1–ATG5),提示其通过补偿线粒体自噬缺陷发挥合成存活功能。

**讨论与结论**

研究人员讨论了SL与SV均植根于特定生物学功能模块,但机制相反;指出结构平衡理论在遗传网络中的局限性——超过20%的三元结构呈不平衡状态,且该理论忽视正负相互作用的分子机制差异。与因子感知知识图神经网络(SLGNN)相比,GiGCN通过符号边建模扩展了预测范围,同时具备更高的生物学可解释性。

**研究结论部分翻译为:** 本研究引入了GiGCN,一种用于预测不对称GIs——特别是SL和SV的符号图神经网络框架。GiGCN不依赖平衡理论公理,增强了在复杂生物医学环境中的适应性。其聚合机制不基于符号乘积关系的先验约束,这种与理论无关的架构显著提高了模型在复杂生物网络中的泛化能力和机制可解释性。基于包含39836个SL对、4918个SV对和98320个高置信度非相互作用基因对的基准数据集,整合生物学过程相似性与符号拓扑关系,GiGCN系统地捕获了复杂GI模式。关键创新包括:(1)引入符号GNN处理符号边的差异化传播机制;(2)设计多因子解纠缠编码模块,将基因功能分解为独立子空间;(3)采用经过生物学验证的负样本集消除随机采样造成的假阴性污染。结果表明,GiGCN在SL/SV预测上优于传统机器学习、经典GNN及现有符号图模型(AUC=0.978,AUPR=0.944)。案例研究验证了以MYC为中心的SL对(如MYC–TRIM3、MYC–SAE1)和自噬介导的SV对(如PINK1–ATG3、PINK1–CUL4A)的精确识别,揭示了在肿瘤学(如靶向MYC驱动的癌症)和神经退行性疾病(如补偿自噬缺陷)中的转化潜力。当前局限性包括实验验证的基因对过于稀疏(不足人类基因对的0.1%),且尚未整合单细胞转录组数据。未来工作将构建细胞类型特异性的符号图,优化对动态微环境相互作用的预测。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号