Mol2Image:一种利用药物分子描述符的增强型DDI预测框架

《BMC Bioinformatics》:Mol2Image: an enhanced DDI prediction framework leveraging drug molecular descriptors

【字体: 时间:2026年07月24日 来源:BMC Bioinformatics 4.4

编辑推荐:

  药物-药物相互作用(DDIs)是临床实践中的一个关键安全问题,因为其可能导致严重且往往不可预测的不良反应。在多药治疗中,这一风险显著升高,而多药治疗正越来越多地用于癌症、心血管疾病和糖尿病等复杂慢性疾病的治疗。然而,通过体内研究识别DDIs成本高昂且耗时。在本

  
药物-药物相互作用(DDIs)是临床实践中的一个关键安全问题,因为其可能导致严重且往往不可预测的不良反应。在多药治疗中,这一风险显著升高,而多药治疗正越来越多地用于癌症、心血管疾病和糖尿病等复杂慢性疾病的治疗。然而,通过体内研究识别DDIs成本高昂且耗时。在本研究中,研究人员提出了一种新型DDI预测模型Mol2Image,该模型利用源自简化分子线性输入规范(SMILES)表示的化学结构特征,包括分子性质描述符和结构指纹。所提出的模型将化学结构信息与自动特征学习相结合。从SMILES表示中提取的分子描述符和结构指纹被转换为视觉模式,以捕捉每种药物的关键化学特征。然后,这些图像由卷积神经网络(CNN)处理,以学习与药物-药物相互作用相关的高级结构特征。该模型使用两个基准DDI数据集进行训练和评估:Drugbank数据集(包含443,046对相互作用)和ChCh-Miner数据集(包含48,514对DDIs)。实验结果表明,所提出的模型(Mol2Image)与几种最先进方法相比取得了有竞争力的性能。实验结果表明,该模型持续优于现有方法,在使用Drugbank数据集和ChCh-Miner数据集时分别达到了0.9608和0.9683的准确率。最终,Mol2Image提供了一个高度可扩展、严格以结构为中心的框架,在最小计算开销下确保卓越的预测准确性,且完全独立于临床数据运行。
### 论文解读:Mol2Image——一种基于分子描述符与图像化CNN的药物相互作用预测框架

#### 研究背景与问题

多药联合治疗已成为癌症、糖尿病、心血管疾病等复杂慢性病的常见策略,但药物-药物相互作用(DDIs)引发的严重不良反应(ADRs)是临床安全的关键挑战。在美国,ADRs年花费超100亿美元,其中DDIs占30%以上。DDIs可导致疗效改变、毒性增加甚至药物撤市。然而,通过体内外实验识别DDIs成本高昂、耗时且不易检测罕见相互作用。因此,亟需高效的计算方法辅助临床决策。现有计算方法分为文本型、网络型、相似性型和结构型四类。结构型方法仅依赖药物分子结构(如SMILES字符串),无需外部临床数据,具有高效性和可推广性,但序列型特征难以捕捉二维或三维空间结构及拓扑特征。此外,许多基于深度学习的模型(如PTB-DDI、StructNet-DDI)虽取得较好效果,但存在计算成本高、特征冗余或依赖复杂架构(如ResNet18)等问题。为此,研究人员提出Mol2Image框架,旨在通过优化分子描述符集与轻量级CNN,实现高精度、低开销且完全独立于临床数据的DDI预测。

#### 研究内容与结论

研究人员开发了Mol2Image模型,该模型通过从SMILES字符串中提取优化的分子描述符和摩根指纹,将其确定性映射为64×64灰度图像,并利用双分支孪生CNN(Siamese-like CNN)进行相互作用预测。模型在Drugbank(443,046对相互作用)和ChCh-Miner(48,514对DDIs)两个基准数据集上训练与评估。实验结果表明,Mol2Image在准确率、AUC-ROC、精确率和F1分数上均优于PTB-DDI、CASTER、1D CNN等现有方法,具体在Drugbank上达到0.9608准确率、0.9907 AUC-ROC,在ChCh-Miner上达到0.9683准确率、0.9989 AUC-ROC。该研究证实,通过21个精选分子描述符与摩根指纹的视觉化表示,结合轻量级CNN,可在不依赖临床数据的前提下实现高效、准确的DDI预测,为化合物初步筛选提供了可扩展的解决方案。

#### 主要关键技术方法

1. **特征提取**:利用RDKit从SMILES字符串中提取21种分子描述符(涵盖基本分子性质、原子组成、拓扑指数、理化性质等)和2048位摩根指纹(Morgan fingerprints)。
2. **特征-图像映射**:将21种描述符和摩根指纹按固定顺序填充至64×64矩阵(4096像素),其中指纹位占据前2048像素,描述符按类别分组排列,剩余像素零填充;连续值描述符通过灰度值编码,确保空间邻近性代表化学关联。
3. **CNN架构**:采用双分支孪生CNN,每个分支包含三个卷积块(卷积层→批归一化→ReLU→最大池化),通道数从32递增至128,最后通过全连接层输出二分类结果。模型使用Adam优化器,学习率0.001,训练20个epoch。样本队列来源:Drugbank数据集(443,046对,平衡正负样本)和ChCh-Miner数据集(48,514对,含1514种药物)。

#### 研究结果

**Datasets and methods**:采用两个公开基准数据集Drugbank和ChCh-Miner,前者含443,046对(平衡正负),后者含48,514对及1514种药物。

**Proposed approach**:模型分为数据预处理和CNN训练两阶段。预处理中,从SMILES提取32种初始描述符,经消融实验(ablation study)和Grad-CAM可视化分析,最终确定21种最优描述符与摩根指纹组合,以消除冗余和噪声。特征映射为64×64灰度图像,确保无信息损失。

**Experiments and results**:
- 通过比较13、21、32种描述符子集,发现21种描述符在Drugbank和ChCh-Miner上均取得最佳性能(Drugbank:ACC 0.9608,AUC 0.9907;ChCh-Miner:ACC 0.9683,AUC 0.9989)。32种描述符因引入空间噪声导致性能略降,McNemar检验(p < 0.001)证实差异具有统计学显著性。
- Grad-CAM可视化显示,21描述符模型激活区域集中在关键理化性质和摩根指纹子结构,而32描述符模型激活扩散,验证了特征优化有效性。
- 与现有方法对比:在Drugbank上,Mol2Image的ACC、AUC、精确率、F1均高于PTB-DDI(0.86/0.896/0.8221/0.825)、CASTER(0.8676/0.9268/0.829/0.8767)和1D CNN(0.9353/0.9802/0.9353/0.9369)。在ChCh-Miner上,Mol2Image的ACC、F1、精确率(0.9683/0.9699/0.9747)优于StructNet-DDI(0.944/0.967/0.999)、CASTER(0.9073/0.932/0.9993)、PTB-DDI(0.935/0.932/0.945)和1D CNN(0.9492/0.9495/0.9529)。CASTER精确率最高(0.9993)但召回率较低,Mol2Image在平衡精确率和召回率上表现更优。

#### 讨论与结论

**讨论**:Mol2Image的优越性源于其完全依赖化学结构而非临床数据,因此具有高通用性。与仅用1D SMILES的PTB-DDI和CASTER相比,Mol2Image通过优化描述符提取更丰富的理化性质并转化为2D图像,使CNN能捕捉更判别性的空间模式。与StructNet-DDI(仅13个描述符)相比,Mol2Image的21个描述符提供了更精细的结构关系。与1D CNN相比,2D图像表示充分发挥了CNN在空间层次特征学习上的优势。当前研究局限在于未进行冷启动(cold-start)评估(即完全未见药物的预测),未来将采用留一药交叉验证模拟真实场景。此外,可扩展至多类/多标签预测以输出具体相互作用类型,并整合药物靶点、通路、临床记录等多模态数据,以及量子化学性质(如LiTENexus方法)以增强泛化能力。

**结论翻译**:本研究提出了一种新型药物-药物相互作用(DDI)预测模型Mol2Image。该模型不依赖药物临床数据,而是基于药物化学结构。Mol2Image在基准数据集上优于多种现有模型。它整合了更广泛的分子描述符,包括基本分子性质、原子组成与计数、拓扑描述符、结构描述符、理化与电子性质、杂化特征以及结构指纹描述符,从而研究了多种药物描述符类型。所提出的方法在两个基准数据集上进行了评估,显示出持续的高准确率。这些结果凸显了将CNN与基于图像的分子表示相结合的价值。Mol2Image使用了更多种类的分子描述符和卷积神经网络(CNN)架构。利用SMILES表示提取分子描述符,并将其转化为灰度图像。这些图像作为CNN的输入,使模型能够学习复杂的分子特征并预测潜在的药物相互作用。Mol2Image与现有模型比较,在准确率、AUC-ROC、精确率和F1分数上均更优,在Drugbank数据集上分别达到0.9608、0.9907、0.9612和0.9608,在ChCh-Miner数据集上分别达到0.9683、0.9989、0.9747和0.9699。总之,Mol2Image提供了一种完全独立于临床数据的高效、以结构为中心的DDI预测解决方案。通过整合优化的21种描述符集与轻量级孪生CNN,该框架在最小化计算开销和空间噪声的同时不牺牲预测能力。最终,这种可扩展的方法优于现有方法,并成为仅基于分子结构进行化合物初步筛选的理想工具。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号