利用神经网络模型进行药物重定位:以心脏肥厚为例的案例研究

《Scientific Reports》:Leveraging neural network models for drug repurposing: a case study on cardiac hypertrophy

【字体: 时间:2026年09月11日 来源:Scientific Reports 4.9

编辑推荐:

  药物重定位已成为当代制药研究中一项具有吸引力的策略,为加速药物发现、降低开发成本以及减轻与开发新药相关的风险提供了机会。在本研究中,研究人员探讨了一种基于人类转录组机制深度学习的新方法,用于系统性识别现有药物的额外治疗潜力。研究人员利用来自ARCHS4数据库(

  
药物重定位已成为当代制药研究中一项具有吸引力的策略,为加速药物发现、降低开发成本以及减轻与开发新药相关的风险提供了机会。在本研究中,研究人员探讨了一种基于人类转录组机制深度学习的新方法,用于系统性识别现有药物的额外治疗潜力。研究人员利用来自ARCHS4数据库(即GEO数据集汇编)的基因表达数据训练了一个复合前馈神经网络(feedforward neural network, FFNN)模型,该数据集涵盖了广泛的人类数据集。随后,研究人员从由内皮素-1(Endothelin-1, ET-1)刺激诱导的心脏肥厚(cardiac hypertrophy)干细胞来源体外模型中生成了疾病相关基因表达数据。这些数据被用于识别与因ET-1刺激而差异表达基因相关的潜在变量。通过检查模型潜在空间中的差异表达谱,研究人员成功地将疾病信号与DrugBank中收录的已知药物靶点相关联。该模型准确地编码了超出精选基因集范围的额外疾病相关基因,证明了其泛化疾病关联的能力。利用该模型,研究人员识别出了潜在的候选药物,例如拉帕替尼(lapatinib)和胺碘酮(amiodarone),它们在缓解与心脏肥厚相关的proBNP浓度方面显示出前景。本研究展示了深度学习人类转录组机制在快速识别现有药物新治疗潜力方面的强大能力,突显了人工智能技术在加速针对其他复杂医学状况的药物开发中的关键作用。

论文解读:利用神经网络模型进行药物重定位——以心脏肥厚为例的案例研究

一、研究背景与意义

近年来,药物研发成本持续攀升,而年度获批新药数量并未成比例增长,这主要归因于科学复杂性、监管要求以及个性化医疗的推进。在此背景下,药物重定位(drug repurposing)作为一种利用已批准药物或失败候选药物治疗新适应症的策略,因其能够显著缩短开发周期、降低成本和风险而备受关注。传统的高通量筛选虽有效,但耗时且昂贵。因此,整合先进的计算分析方法,特别是人工智能(artificial intelligence, AI)技术,成为加速药物重定位的关键方向。本研究旨在开发一种基于深度学习的可解释性神经网络模型,通过嵌入疾病相关基因集,系统性识别现有药物的新治疗潜力,并以心脏肥厚(cardiac hypertrophy)作为案例进行验证。该研究发表于《Scientific Reports》。

二、关键技术方法概述

研究人员首先从ARCHS4数据库中获取大规模人类RNA-seq实验的基因表达数据,经预处理后得到27,486个独特基因的表达谱。模型设计上,研究人员采用Keras实现了一个前馈神经网络(feedforward neural network, FFNN),其核心创新在于利用DisGeNET数据库中1,336种具有10个以上关联基因的疾病-基因关联信息,构建了1,336个独立的子网络,每个子网络对应一种疾病,并将这些子网络的输出拼接成一个具有生物学意义的潜在层。该潜在层随后连接至一个包含250个节点的全连接隐藏层,最终输出层对应所有27,486个基因。模型以最小化均方误差为目标,使用Adam算法进行优化,并在CPU资源下完成训练。此外,研究人员还利用主成分分析(principal component analysis, PCA)从潜在空间中提取特征,并通过蛋白质-蛋白质相互作用(protein-protein interaction, PPI)网络(如STRINGdb和FunCoup)评估基因集的生物学相关性。

三、研究结果

1. 一组1,336个疾病特异性变量能准确预测转录组
研究人员通过将DisGeNET中的疾病-基因关联嵌入模型潜在层,构建了具有可解释性的FFNN。该模型在独立测试数据上表现出高准确性,中位数Spearman相关系数达到0.95,表明仅凭1,336个疾病相关潜在变量即可精准重构完整的人类基因表达谱。
2. 额外的疾病相关基因被编码到相关潜在变量中
为了检验模型编码的生物学相关性,研究人员分析了未参与模型设计的低置信度疾病-基因关联集。通过对潜在节点进行五倍标准差扰动,观察输出层变化,发现53%的疾病中,这些低置信度基因的变化值显著高于其余基因(Mann-Whitney U检验,p < 0.05),表明模型成功捕获了额外的疾病相关基因信息。
3. 从模型潜在空间中提取学习到的生物学相关模式
通过对验证数据在压缩空间中进行PCA分析,并放大每个主成分(principal component, PC),研究人员提取了每个PC的前100个变化最大的基因。这些基因集在STRINGdb和FunCoup的PPI网络中表现出显著更近的距离,前10个PC的平均谐波距离仅为随机采样基因的27%(STRINGdb)和36%(FunCoup),证明潜在空间学习了已知的生物学模式。
4. 病例-对照数据中隐藏节点的差异激活可作为疾病注释分析的新方法
利用ET-1刺激的hiPSC衍生心肌细胞(cardiomyocytes, CMs)的RNA-seq数据,研究人员对潜在层节点的激活水平进行了Z-score转换。最高排名节点涉及舒张性心力衰竭和左心室肥厚等心脏相关疾病,而帕金森病(Parkinson disease, PD)节点的激活则被解释为共享的应激/线粒体程序,而非PD特异性生物学。
5. 将肥厚诱导的潜在空间差异激活与已知药物靶点匹配揭示现有药物的新用途
通过将最差异激活的节点进行五倍标准差扰动,记录解码器输出变化并与已知药物靶点匹配,研究人员获得了候选药物排序列表。经手动筛选和Ingenuity Pathway Analysis(IPA)分析,最终选择六种候选药物进行体外验证:胺碘酮(amiodarone)、比美替尼(binimetinib)、波生坦(bosentan)、双硫仑(disulfiram)、拉帕替尼(lapatinib)和瑞戈非尼(regorafenib)。
6. 候选药物治疗后proBNP蛋白浓度的变化
在ET-1诱导的肥厚体外模型中,拉帕替尼(1.0和10.0 μM)和胺碘酮(5.0和10.0 μM)显著降低了proBNP浓度,其中胺碘酮呈剂量依赖性,且效果优于阳性对照波生坦。而双硫仑反而增加了proBNP水平,提示其可能具有促肥厚效应。比美替尼和瑞戈非尼未显示显著效果。

四、讨论与结论

讨论总结:本研究通过将疾病-基因关联直接编码入神经网络的潜在层,实现了模型的可解释性,使研究人员能够直接从病例-对照数据中分析差异激活,并将其映射到药物靶点。与传统高通量筛选相比,该方法具有三个优势:可解释性、转录组范围上下文以及可扩展性。然而,研究也存在局限性,包括单节点扰动可能混淆相关疾病状态、公共RNA-seq数据的异质性以及急性暴露设计等。未来研究需结合正交肥厚终点、慢性给药方案及独立数据集来加强转化可靠性。
研究结论:研究人员证明,一个疾病对齐的、可解释的神经网络,在人类转录组数据上训练后,能够将病例-对照疾病信号连接到药物靶点,并筛选出机制上合理的重定位候选药物。在ET-1肥厚模型中,两种优先选择的药物(拉帕替尼和胺碘酮)在体外降低了proBNP,支持了所学潜在表征的生物学相关性。该框架通过结合可解释性、转录组范围上下文和可扩展性,补充了现有的发现方法,并为在聚焦实验验证之前进行机制引导的筛选提供了基础。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号