《Molecular Diversity》:Machine learning-driven drug repurposing and computational validation for Nipah virus
编辑推荐:
尼帕病毒(Nipah virus, NiV)的反复暴发以及有效抗病毒疗法的缺乏,凸显了采取有效治疗干预措施的迫切需求。鉴于NiV暴发的散发性和不可预测性,药物重定位(drug repurposing)相较于开发新型抗病毒药物提供了一种省时的替代方案。本研究利用
尼帕病毒(Nipah virus, NiV)的反复暴发以及有效抗病毒疗法的缺乏,凸显了采取有效治疗干预措施的迫切需求。鉴于NiV暴发的散发性和不可预测性,药物重定位(drug repurposing)相较于开发新型抗病毒药物提供了一种省时的替代方案。本研究利用机器学习(machine learning, ML)技术加速潜在治疗候选药物的识别过程。研究人员使用公开可用的NiV抑制剂数据集(即Anti-Nipah、NVIK、PubChem)及文献检索(共211种化合物),实施了多种监督式ML模型,包括支持向量机(Support Vector Machines)、随机森林(Random Forest)、逻辑回归(Logistic Regression)、决策树(Decision Tree)、K近邻(k-Nearest Neighbors)、人工神经网络(Artificial Neural Networks)及岭分类器(Ridge Classifier)。其中,随机森林模型展现出最高的预测性能,在训练集(95%)和测试集(86%)上均取得了较高的准确率。优化后的模型随后被用于筛选FDA批准、临床前、临床及抗病毒药物库(包含9021种化合物),以识别潜在的抗NiV候选药物。初筛化合物通过分子对接(molecular docking)评估结合亲和力,并通过分子动力学模拟(molecular dynamics simulations)评估与关键病毒靶标(包括糖蛋白和RNA依赖性RNA聚合酶(RNA-dependent RNA polymerase, RdRp))的结构稳定性及相互作用,从而进行进一步验证。基于对接得分和分子动力学稳定性,研究人员分别针对糖蛋白和RdRp确定了三个和五个有前景的候选药物:2,3,4,5,6-五没食子酰葡萄糖、松果菊苷、巴利森苷A,以及新橙皮苷二氢查尔酮、柚皮苷二氢查尔酮、地奥司明、荭草苷、阿米卡星。这种结合ML、药物重定位和计算验证的整合方法,旨在加速发现针对尼帕病毒的有效治疗药物,并加强对未来疫情暴发的防范准备。
**基于机器学习和计算验证的尼帕病毒药物重定位研究解读**
**1. 研究背景与问题**
尼帕病毒(Nipah virus, NiV)是一种由蝙蝠传播的人畜共患病毒,属于副粘病毒科(Paramyxoviridae) Henipavirus 属,其感染可导致严重脑炎和呼吸系统疾病,致死率高达40%至75%。自1998年马来西亚首次暴发以来,NiV已在南亚和东南亚地区造成周期性散发疫情,对公共卫生构成持续威胁。然而,目前尚无获批的特异性抗病毒药物或疫苗,现有治疗选择(如利巴韦林、瑞德西韦、法匹拉韦及单克隆抗体m102.4)的临床疗效不确定且有限。鉴于NiV疫情的爆发具有散发性和不可预测性,传统药物研发周期长、成本高,难以满足疫情应对的紧迫需求。药物重定位(drug repurposing)策略通过探索已批准或研究中的药物新用途,可显著缩短研发时间并降低成本。近年来,机器学习(machine learning, ML)与计算结构生物学方法的结合已在抗病毒药物发现中展现出巨大潜力,但针对NiV的综合性计算药物重定位研究仍较为有限。因此,开发一种整合ML、分子对接和分子动力学模拟的集成计算流程,对加速NiV治疗药物发现具有重要意义。
**2. 研究主要方法**
研究人员构建了一个两层级联的计算药物筛选流程。第一层级采用ML分类模型:从公开数据库和文献中收集211种经实验验证的NiV抑制剂和非抑制剂化合物,计算二维/三维分子描述符及多种分子指纹,经特征选择后训练随机森林(Random Forest, RF)、支持向量机(SVC)等七种ML模型,以最优模型筛选FDA批准、临床前/临床及抗病毒化合物库(共9021种化合物)。第二层级采用结构生物学验证:对候选化合物进行分子对接(molecular docking),并选取对接得分最高的前五名复合物开展200纳秒分子动力学(molecular dynamics, MD)模拟,通过均方根偏差(RMSD)、均方根波动(RMSF)和回转半径(Rg)评估其结合稳定性;此外,还进行了ADMET(吸收、分布、代谢、排泄和毒性)性质预测。
**3. 研究结果**
**数据收集、预处理与过滤**:研究人员从文献和数据库中收集了218种经实验验证的化合物,经去重和相似性过滤后获得211种,其中114种被标记为活性分子,97种为非活性分子。数据集按80:20比例分为训练集和测试集。
**特征选择**:初始特征集包含8106个特征,通过相关性分析、低方差过滤和互信息(MI)三步特征选择策略,最终确定150个关键特征用于模型开发,包括PEOE_VSA6、BCUTdv-1L、2D_pharmaco_3180、ECFP_289和MACCSFP54等。
**机器学习模型构建**:七种ML模型经超参数优化后,随机森林模型表现最佳,在训练集上准确率达95%,测试集上达86%,马修斯相关系数(MCC)和受试者工作特征曲线下面积(AUROC)也优于其他模型,被选为最终筛选模型。
**SHAP分析**:可解释性分析(SHAP)确定了影响模型预测的20个关键特征,其中Xc-5dv、AMID_O、HybRatio、AATSC5s和Mor24v贡献最大,这些描述符反映了分子的分支程度、氢键供体/受体几何特征和杂化状态等结构电子性质。
**虚拟筛选**:优化后的随机森林模型对9021种化合物进行预测,以0.6概率阈值筛选出1426种化合物进入后续验证。
**分子对接**:对1426种候选化合物与糖蛋白(G)和RNA依赖性RNA聚合酶(L)进行分级分子对接。结果显示,2,3,4,5,6-五没食子酰葡萄糖(PGG)与G蛋白结合最强(XP对接得分?18.636 kcal/mol),新橙皮苷二氢查尔酮(NHDC)与L蛋白结合最强(?13.583 kcal/mol)。相互作用分析揭示关键氢键和疏水接触残基。
**分子动力学模拟**:对得分前五的配体-蛋白复合物进行200纳秒MD模拟。针对G蛋白,PGG、松果菊苷和巴利森苷A形成稳定复合物;针对L蛋白,NHDC、柚皮苷二氢查尔酮(NDC)、地奥司明、荭草苷和阿米卡星均保持低RMSD值,显示出良好的结构稳定性。
**ADMET分析**:候选化合物虽普遍不符合Lipinski五规则(分子量>500),但预测无显著肝毒性和致癌性,且不抑制细胞色素P450酶,提示药物相互作用风险较低,总体安全性良好。
**4. 讨论**
本研究的发现具有多方面的重要意义。从方法学角度看,集成ML、分子对接和MD模拟的多层级筛选策略成功地从大型化合物库中高效识别出候选药物,展现了计算驱动药物发现在应对新发病毒疫情中的应用价值。从生物学机制角度看,候选化合物与G蛋白的结合位点位于Ephrin-B2/B3受体结合界面,提示其可能通过竞争性阻断受体结合来抑制病毒入侵;而与L蛋白的结合发生在拇指亚结构域与PRNTase结构域交界处的变构口袋,可能通过干扰RNA延伸和mRNA加帽过程来抑制病毒复制。这些多靶点作用机制为NiV治疗策略提供了新的思路。此外,研究还进行了反向筛选实验以评估化合物特异性,排除了部分非特异性结合的可能性。但是,机器学习模型预测的“活性”化合物即使拥有较低对接分数,也不能简单地视为假阳性,未来仍需在更广泛的病毒和宿主靶标上评估这些预测结果,以获得更准确的假阳性率评估。
**5. 结论**
本研究通过整合机器学习、分子对接和分子动力学模拟等计算手段,系统性地筛选了FDA批准药物库、临床前/临床化合物库及抗病毒药物库,并针对NiV糖蛋白(G蛋白)和RNA依赖性RNA聚合酶(L蛋白)两个关键靶点鉴定出多个有前景的候选药物。针对G蛋白,研究人员确定了2,3,4,5,6-五没食子酰葡萄糖、松果菊苷和巴利森苷A;针对L蛋白,确定了新橙皮苷二氢查耳酮、柚皮苷二氢查耳酮、地奥司明、荭草苷和阿米卡星。上述候选药物在对接评分、MM-GBSA结合自由能以及MD模拟稳定性评估中均表现出良好的靶标结合潜力和构象稳定性,但其实际抗病毒效果仍需进一步通过体外和体内实验加以验证。该研究发表于《Molecular Diversity》。