KGTC-DDA:基于并行图同构网络与Transformer网络及交叉注意力机制的药物-疾病关联预测

《Biochemistry and Biophysics Reports》:KGTC-DDA:Drug-disease association prediction based on parallel graph isomorphism and transformer networks with cross-attention

【字体: 时间:2026年09月04日 来源:Biochemistry and Biophysics Reports 3.3

编辑推荐:

  药物研发是一个复杂、耗时且昂贵的过程,使得药物重定位成为识别现有药物新治疗应用的重要策略。因此,计算药物-疾病关联(DDA)预测近年来受到越来越多的关注。尽管许多现有方法结合相似性信息与图神经网络进行DDA预测,但有效捕获局部结构模式与全局依赖关系,以及建模药

  
药物研发是一个复杂、耗时且昂贵的过程,使得药物重定位成为识别现有药物新治疗应用的重要策略。因此,计算药物-疾病关联(DDA)预测近年来受到越来越多的关注。尽管许多现有方法结合相似性信息与图神经网络进行DDA预测,但有效捕获局部结构模式与全局依赖关系,以及建模药物与疾病间复杂交互仍具挑战。为解决这些局限,研究人员提出KGTC-DDA(KNN、GIN、Graph Transformer与Cross-attention的DDA预测模型),一种结合图同构网络(GIN)、图Transformer(GT)与交叉注意力机制的新框架。具体而言,整合药物化学结构相似性、疾病表型相似性与高斯交互轮廓(GIP)核相似性等多源生物相似性,构建综合的药物与疾病相似性图。随后并行采用GIN与GT模块,从相似性网络中同时学习局部拓扑特征与全局上下文表示。此外,引入交叉注意力机制捕获药物与疾病嵌入间的高阶相互依赖,从而增强异质特征交互与表示学习。在三个基准数据集上10次10折交叉验证的广泛实验表明,KGTC-DDA在AUROC与AUPR指标上优于若干最先进方法。此外,在未见疾病预测上的实验进一步验证了所提框架的鲁棒性与泛化能力。这些结果表明,KGTC-DDA为计算药物重定位与DDA预测提供了一种有效且有前景的方法。
研究背景方面,从头药物发现通常历经发现、临床前研究、I–III期临床试验、监管提交及最终批准,耗时10–15年、耗资数千万至数亿美元且成功率低。在此背景下,药物重定位尤其是药物-疾病关联(DDA)预测成为识别现有药物新适应症的实际策略。现有DDA方法分为四类:基于矩阵的方法将DDA视为低秩关联矩阵补全问题,易受过拟合与稀疏噪声影响;网络传播方法依赖异质生物医学网络信号扩散,精度受图完整性与边质量制约;传统机器学习方法将DDA作为有监督分类,性能依赖特征质量与负样本构造;深度学习方法虽表示能力强,但多数或偏局部邻域聚合或偏全局依赖建模,且药物-疾病异质交互建模不足,部分异质图方法在已知关联稀疏时易引入噪声传播。为此,研究人员开展KGTC-DDA研究,旨在联合捕获局部拓扑与长程结构依赖、显式建模跨域相互依赖、缓解稀疏性,并在三个基准数据集上验证其优越性能与泛化能力,该文发表于《Biochemistry and Biophysics Reports》。
关键技术方法上,研究人员使用三个基准队列:Fdataset(592药、313病、1931关联,源自Gottlieb等构建、DrugBank与OMIM)、Cdataset(663药、409病、2532关联,Luo等构建)与LRSSL(763药、681病、3051关联)。特征构建融合药物化学结构相似性(SMILES经CDK生成2D指纹、Tanimoto指数)、疾病表型相似性(OMIM文本挖掘MinMiner计算)与高斯交互轮廓(GIP)核相似性;针对稀疏性采用K近邻(KNN)稠密化;表示学习并行部署图同构网络(GIN)与图Transformer(GT)分别提取局部结构与全局上下文;异质交互通过双向交叉注意力建模药物与疾病嵌入间高阶依赖;预测头接多层感知机以输出关联概率,训练采用10次10折交叉验证与未见疾病设定评估鲁棒性。
研究结果部分,按原文小节叙述。2.1 Datasets小节给出三数据集预处理后统计(Fdataset去重DB00510与DB00313同义后592×313、稀疏度0.0104;Cdataset 663×409、0.0093;LRSSL 763×681、0.0059),明确药物来自DrugBank、疾病来自OMIM。2.2 Similarity calculation小节分三目:2.2.1以SMILES→CDK 2D指纹→Tanimoto得药物化学结构相似性矩阵DRs∈?M×M;2.2.2以MinMiner从OMIM表型文本得疾病表型相似性DSp∈?N×N;2.2.3以GIP核(DRg(dri,drj)=exp(?γdr‖F(dri)?F(drj)‖2),γdr=γ′dr/(1/M∑i=1M‖F(dri)‖2)补结构/表型信息不足,同理得疾病GIP。2.3 KNN densification小节对每类相似性矩阵保留每节点Top-k近邻置边、其余置零以缓稀疏。2.4 Parallel GIN and GT小节中GIN通过∑与MLP聚合邻域捕获局部同构结构,GT借自注意力捕获全图长程依赖,两路输出拼接。2.5 Cross-attention interaction小节以药物侧Query对疾病侧Key/Value(反向亦然)算注意力权重,融合得跨域增强嵌入。2.6 Prediction and training小节将融合向量送MLP经Sigmoid得评分,损失用交叉熵,评估含AUROC与AUPR。3. Results小节报告在Fdataset、Cdataset、LRSSL上10×10折CV中KGTC-DDA的AUROC与AUPR均高于REDDA、AMDGT等对照;未见疾病设定下召回稳定,证明泛化性。4. Discussion小节指出并行GIN-GT补单结构偏颇、交叉注意力显式解耦药-疾互依赖、KNN-GIP缓稀疏是性能来源;局限在于未引入转录组/蛋白互作等更异质边、计算开销随节点数平方增长。结论部分译文:KGTC-DDA通过并行图同构网络与图Transformer及双向交叉注意力,有效联合局部拓扑与全局上下文、显式建模药物-疾病高阶异质交互,在多源相似性图上实现优于现有方法的DDA预测,其未见疾病泛化能力支持计算药物重定位应用。
讨论总结,研究人员强调该框架并非简单堆叠模块,而是以KNN稠密化承接多源相似性的稀疏痛点,以GIN-GT并行兼顾同构敏感性与长程依赖,以交叉注意力替代隐式传播来抑制已知关联不全带来的噪声;实验设计上以10次10折交叉验证控方差、以未见疾病预测分离记忆与泛化,从而得出KGTC-DDA在AUROC/AUPR与鲁棒性上均占优的结论。该工作意义在于为计算药物重定位提供可解释、可扩展的图表示学习范式,但未在原文中展开更异质生物网络融合与大规模算力优化,相关方向留待后续。
相关新闻
生物通微信公众号
微信
新浪微博

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号