基于药物参照的机器学习框架用于高血压韩国草药配方优先排序:线性支持向量机与图卷积网络的应用

《International Journal of Molecular Sciences》:A Drug-Referenced Machine-Learning Framework for Prioritizing Korean Herbal Formulations in Hypertension Using Linear SVM and Graph Convolutional Networks

【字体: 大 中 小 】 时间:2026年09月25日 来源:International Journal of Molecular Sciences 5.6

编辑推荐:

  高血压受相互作用的分子系统调控,这为基于网络筛选多组分治疗候选物提供了理论依据。研究人员在网络药理学的概念框架下,开发了一个以高血压为核心的计算框架,利用由市售抗高血压药物和对照药物衍生的蛋白质-蛋白质相互作用(protein-protein interact

  
高血压受相互作用的分子系统调控,这为基于网络筛选多组分治疗候选物提供了理论依据。研究人员在网络药理学的概念框架下,开发了一个以高血压为核心的计算框架,利用由市售抗高血压药物和对照药物衍生的蛋白质-蛋白质相互作用(protein-protein interaction, PPI)网络,对韩国医保覆盖的草药配方进行优先排序。研究人员使用四种分子分类器对30个参考药物图(15个抗高血压药和15个对照药)进行了评估,并采用重复分组感知嵌套交叉验证。其中,整合蛋白质存在性、高血压特异性疾病权重和标准化度的线性支持向量机(support vector machine, SVM)达到了最高性能(AUROC,0.956 ± 0.007),并被用于对56种草药配方进行排序。在这56种配方中,去重后保留了229个独特的代表性化合物,并用于构建配方特异性分子网络。由此产生的蛋白质水平SVM解释确定了110个方向稳定的蛋白质,这些蛋白质与抗高血压参考组和对照药物的区分相关。尽管没有单个蛋白质达到严格的置换校准q < 0.05,但8个蛋白质达到了探索性的q < 0.10。网络分析揭示了一个由30个蛋白质组成的离子通道/兴奋性相关模块,其聚合模型效应最强(经验p = 0.0002)。排名最高的配方在独特的RAAS/血管受体相关模块内表现出最大的稳定特征重叠,而离子通道/兴奋性相关模块的蛋白质在配方网络中则很少出现。研究人员使用身份感知图卷积网络(graph convolutional network, GCN)进行的盲蛋白质身份归因提供了内部交叉模型一致性:在15个GCN高归因蛋白质中,有10个与稳定的SVM特征重叠,而随机期望为2.58(p = 4.78 × 10??),并形成了一个紧密连接的候选子网络(经验p = 0.0009)。重要的是,该框架对药理作用方向不可知;因此,高排名配方表示与抗高血压参考空间的分子相似性,而不是预测的降血压疗效。这些发现将一个强疾病判别性的离子通道网络与一个在精选配方网络中更常出现的受体相关分子界面区分开来。该框架为实验验证提供了机制组织的假设,而非临床抗高血压疗效的证据。
高血压是一种最常见的、可改变的心血管、脑血管和肾脏疾病危险因素,其调控涉及血管张力、肾脏钠处理、神经体液信号以及肾素-血管紧张素-醛固酮系统等多个相互作用的分子系统。大规模人类遗传学研究表明,血压调控具有高度多基因性和网络级特征。传统的单靶点药物虽有效,但多组分草药配方可能通过作用于多个分子组分而带来治疗潜力。然而,常规网络药理学研究多从预先指定的配方出发,再寻找疾病相关重叠,这种方法无法明确配方是否真正类似于有效的治疗干预。因此,研究人员开发了一种以高血压为核心的计算框架,利用市售抗高血压药物和对照药物的蛋白质-蛋白质相互作用网络作为参考空间,对韩国医保覆盖的56种草药配方进行优先排序,并探索其分子网络特征。

研究人员首先构建了包含15种抗高血压药和15种对照药的30个药物特异性PPI网络,并对四种分子分类器——蛋白质存在逻辑回归、高血压加权逻辑回归、线性支持向量机和身份感知图卷积网络——进行了重复分组感知嵌套交叉验证。线性SVM取得了最佳判别性能(AUROC 0.956 ± 0.007),被选为主要排序模型。该模型随后用于对56种草药配方进行评分,并对排序结果进行了一系列敏感性分析,包括协调置信度阈值、大小限制、贡献归一化和交叉疾病模型比较。研究人员还从蛋白质水平对线性SVM进行了解释,确定了稳定特征,并通过标签置换校准评估了单蛋白显著性。随后,利用模块化分析将稳定特征组织为网络模块,并计算了优先配方对模块的覆盖度。此外,研究人员使用身份感知GCN对三种代表性高排名配方进行了盲蛋白质身份归因,以进行交叉模型一致性分析。最后,将模型排序与一个独立发表的离体血管舒张实验数据进行了外部比较。

研究结果显示:

**HTN参考网络数据集构建与质量控制**:最终数据集包含30个药物特异性PPI图,共1254个独特蛋白质、2257个蛋白质节点和14430条PPI边。

**线性SVM最高HTN分类性能**:线性SVM平均AUROC为0.956 ± 0.007,准确率0.940 ± 0.014,F1分数0.944 ± 0.013,MCC 0.887 ± 0.026,均优于GCN和两种逻辑回归模型。消融分析显示,去除蛋白质身份嵌入后GCN性能显著下降,表明身份信息对模型判别至关重要。跨类药物转移分析显示模型存在类间泛化能力。去除高血压疾病权重通道后,稳定特征和配方排序保持高度一致。

**重复SVM筛选识别高稳定优先配方**:Daehwangmokdanpi-tang和Doinseunggi-tang位居前两位,七种配方在所有50个模型中均进入前10。敏感性分析表明排序对上游规则不敏感,而交叉疾病模型产生了不同排序。

**蛋白质水平SVM解释揭示可重复的HTN相关分子模式**:前20个药物判别性蛋白中,仅AGTR2和CCR3出现在优先配方网络中,其余钙/钠通道蛋白及REN、ACE、AGTR1均缺失。配方网络中的正贡献主要来自受体相关蛋白。

**置换校准支持稳定的多组分特征而非严格单蛋白显著性**:共110个蛋白满足方向稳定性标准,但无蛋白达到严格q < 0.05,仅8个蛋白(REN、SCN5A、SCN3A、CACNA2D1、CACNA1S、AGTR1、CACNA1C、CACNA1D)达到探索性q < 0.10。

**稳定SVM蛋白形成六个PPI模块**:M1为最大模块(57个蛋白),包含RAAS/血管受体相关蛋白,但聚合效应不显著;M2含30个蛋白,以钠/钙通道蛋白为主,模块级平均效应最强(经验p = 0.0002)。

**优先配方对M1模块覆盖更高**:排名靠前的配方对完整稳定特征约10.5–15.2%加权覆盖,对M1约34%覆盖,但M2覆盖极低,仅Daecheongryong-tang含一个M2蛋白TRPA1。

**GCN归因与SVM M1特征重叠**:GCN Top-15归因蛋白中10个与稳定SVM特征重叠,且全部属于M1,重叠显著超出随机期望(p = 4.78 × 10??),GCN归因蛋白形成紧密连接的子网络(经验p = 0.0009)。

**配方排序与独立测定的血管舒张活性相关**:22种配方中,模型决策得分与已发表的离体大鼠主动脉环血管舒张活性显著相关(Spearman ρ = 0.525,p = 0.0122),且该相关性在留一法和去除极端值后仍然显著。

讨论部分指出,最强的SVM聚合信号集中在离子通道/兴奋性相关模块M2,这与钙通道阻滞剂在阳性参考集中的大量代表一致,也符合血压调控的已知离子通道生物学。而优先配方主要覆盖受体富集的M1模块,表明多组分配方的分子空间更多触及受体相关界面而非强判别性的离子通道区域。M1覆盖反映了配方与RAAS模块受体相关外周部分的关联,并不证明直接调控RAAS或抗高血压疗效。该框架对药理作用方向不可知,高排名仅表示分子相似性而非降压效果。研究局限性包括参考数据集规模小、阳性参考集仅包含CCB和ARB两类、目标与PPI表示未包含浓度、生物利用度和作用方向等信息,以及代表性化合物的选择不全面。

研究结论:本研究建立了一个以高血压为中心的计算框架,利用从市售抗高血压药物网络中习得的分子模式对医保覆盖的韩国草药配方进行优先排序。高排名配方不应被解读为预测可降低血压,因为该框架无法区分激动与拮抗等方向相反的药理作用。线性SVM提供了最高的预测性能,蛋白质和网络层面分析揭示了抗高血压参考相关分子特征中离子通道和受体相关组分的互补性。优先配方在受体相关的M1网络中表现最大稳定特征重叠,而M2蛋白在配方网络中稀疏。这些发现为实验优先排序和机制假设生成提供了可重复的基础,但不应被视为临床抗高血压疗效的证据。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号