《Journal of Genetic Engineering and Biotechnology》:Machine learning–driven identification of PIM2 kinase inhibitors through QSAR modeling and molecular dynamics simulations
编辑推荐:
原癌基因丝氨酸/苏氨酸激酶PIM2是细胞增殖、存活及肿瘤进展的关键调节因子,是多种癌症极具吸引力的治疗靶点。研究人员开发了一种集成机器学习引导的计算流程,通过结合定量构效关系(QSAR)建模、虚拟筛选、分子对接、分子动力学(MD)模拟及药代动力学预测来识别潜在
原癌基因丝氨酸/苏氨酸激酶PIM2是细胞增殖、存活及肿瘤进展的关键调节因子,是多种癌症极具吸引力的治疗靶点。研究人员开发了一种集成机器学习引导的计算流程,通过结合定量构效关系(QSAR)建模、虚拟筛选、分子对接、分子动力学(MD)模拟及药代动力学预测来识别潜在的PIM2抑制剂。研究人员从ChEMBL数据库获取PIM2抑制剂的生物活性数据,得到5953个化合物,经数据清洗、结构标准化及去除重复与无效条目后,获得1584个化合物的精选数据集用于QSAR建模。为解决数据集不平衡问题,在模型开发前应用合成少数类过采样技术(SMOTE)。生成12种分子指纹描述符,并使用随机森林(RF)、极端梯度提升(XGBoost)、支持向量回归(SVR)、k近邻(KNN)和多层感知机(MLP)五种机器学习算法构建180个QSAR模型。其中随机森林-指纹模型表现出最佳预测性能,在训练、测试和交叉验证数据集上平均R2达0.971,预测误差低(RMSE = 0.271;MAE = 0.125)。优化后的模型随后应用于多个化学库的虚拟筛选,包括FDA批准药物、天然产物数据库及商业化合物集合,识别出若干有前景的候选分子,包括TCMBANKIN000009(吐根碱,emetine)、Amb28533044(4,6′-脱水氧孢子二酮,4,6′-Anhydrooxysporidinone)、NPC170963(溶血磷脂酰胆碱(15:0),Lysophosphatidylcholine (15:0))、NPC262768(硫丹,Endosulfan)和NPC469603(8-羟基ircinialactam A)。分子对接显示这些化合物结合于PIM2激酶ATP结合口袋,与Lys62、Asp125、Asp128和Glu168等关键残基形成相互作用。随后的分子动力学(MD)模拟证实了所选复合物的稳定性,显示模拟期间残基波动减小、蛋白紧凑性稳定及持续的分子间相互作用。此外,ADMET(吸收、分布、代谢、排泄和毒性)预测表明若干化合物具有有利的药代动力学和毒性特征。综上,这些发现凸显了所识别分子作为潜在PIM2抑制剂候选物的价值,为未来实验验证与抗癌药物开发提供了宝贵线索。
研究背景与意义
原癌基因丝氨酸/苏氨酸激酶PIM2作为PIM原癌基因家族成员之一,是一种组成型活性酶,在血液系统及实体瘤的恶性细胞存活、增殖及代谢适应性中发挥关键作用。PIM2通过磷酸化BAD和4E-BP1等关键凋亡与翻译检查点,并与MYC稳定性及输出交互,抑制凋亡并在细胞应激下维持帽依赖性翻译,使其成为具有广泛抗肿瘤影响的紧凑且可成药信号节点。临床上,PIM2在多发性骨髓瘤、多种白血病及淋巴瘤中反复过表达,导致侵袭性表型、治疗抵抗及不良预后,其与JAK/STAT、PI3K/AKT及NF-κB的串扰加剧了骨溶解性疾病。尽管AZD1208、PIM447等泛PIM抑制剂已进入临床,但早期化合物如SGI-1776因hERG介导的QT间期延长而受限,且现有计算研究多基于小规模同源系列或单一骨架,缺乏基于配体的ChEMBL衍生多描述符QSAR框架与多样库筛选及MD动态验证的结合。因此,研究人员开展此项整合计算流程研究,旨在发现具有高选择性、优安全性特征的潜在PIM2抑制剂,为实验验证提供先导化合物,该研究发表于《Journal of Genetic Engineering and Biotechnology》。
主要关键技术方法
研究人员从ChEMBL数据库(ID: CHEMBL4523)获取5953条PIM2生物活性数据作为样本队列,经去重、去无效SMILES及RDKit清洗后得到1584个化合物数据集,按IC50阈值分为活性、中等及非活性类,应用SMOTE处理不平衡后采用80:20划分训练测试集。计算12种分子指纹描述符,采用随机森林(RF)、极端梯度提升(XGBoost)、支持向量回归(SVR)、k近邻(KNN)及多层感知机(MLP)构建180个QSAR模型,以R2、RMSE、MAE及复合评分评估,优选模型用于FDA药物、NPASS、ZINC、TCMBANK及Ambinter库的虚拟筛选(pIC50> 5.0为阈值)。以PDB ID: 4X7Q的PIM2晶体结构为受体,用AutoDock Vina进行分子对接,红ocking验证(RMSD 0.033 ?)。选取Top hits用AMBER 22进行200 ns全原子显式溶剂MD模拟,采用ff14SB及GAFF2力场,分析RMSD、RMSF、Rg、SASA、氢键、PCA及自由能景观(FEL),并用Deep-PK预测ADMET性质。
研究结果
3.1. Data preprocessing
研究人员从ChEMBL检索到5953条记录,经清洗后保留1918个化合物,最终标准化得1584个有效化合物。活动度分布极不平衡(活性88.6%、中等9.8%、非活性1.6%)。应用SMOTE多类过采样至每类1404个,总4212个训练实例并映射回最近真实化合物,二元建模时保留pIC50≥ 7.0为活性、≤ 5.5为非活性,排除边界模糊样本。
3.2. Machine learning models construction and optimization
研究人员构建60种模型-描述符组合(5算法×12指纹)共180次评估。随机森林结合FingerPrinter描述符获最高复合评分0.9393,平均R20.9716,RMSE 0.2715,MAE 0.1257,ΔR20.0142,训练、测试及交叉验证R2分别为0.9807、0.9615、0.9627,表现稳健。XGBoost虽训练R2略高但误差及ΔR2大,易过拟合。指纹类描述符占前十模型中的八席,证实其捕获PIM2抑制活性结构特征的优势。
3.3. Molecular docking and MD simulation
3.3.1. Molecular docking and interaction analysis
研究人员将Top hits对接至PIM2 ATP口袋(PDB 4X7Q),参考配体形成1个与ASP128氢键及多位点疏水接触。TCMBANKIN000009(emetine)与GLY40、LYS62、ASP125、ASP183形成氢键及VAL47等疏水接触;Amb28533044与ASP125、ASP128氢键;NPC170963与LYS62、ASP125、ASP128盐桥;NPC262768与ASP183氢键、ASP128与GLU168卤素键及PHE44 π-阳离子;NPC469603与GLY40、GLU168氢键及LYS41、ARG119盐桥,均反复作用于ASP125、ASP128、GLU168、LYS62及LEU39、VAL47、PHE127、ILE182等残基。
3.3.2. Residue-level flexibility analysis using RMSF
200 ns MD轨迹RMSF分析显示参考体系末端波动>20 ?,核心区10–15 ?。TCMBANKIN000009在40–120残基全局降低波动;Amb28533044与NPC262768在中央域(50–200残基)RMSF < 12 ?;NPC170963在60–160残基适中但在250残基附近局部峰;NPC469603 C端(270–310)波动高但ATP位点稳定。关键催化残基Lys62、Asp125、Asp128、Glu168结合预测抑制剂后RMSF降低,NPC262768与TCMBANKIN000009功能核心波动最低。
3.3.3. Compactness assessment via radius of gyration (Rg)
Rg分析显示参考复合物Rg从4 ?升至>11 ?,呈展开趋势。NPC262768稳定在6–7.5 ?;TCMBANKIN000009从3 ?升至~8 ?;NPC469603升至~9 ?;Amb28533044与NPC170963末段超10 ?。NPC262768与TCMBANKIN000009因多点相互作用维持最紧凑构象,Rg低且稳定。
3.3.4. Ligand-induced changes in solvent accessibility of PIM2
SASA分析显示参考复合物从~16,000 ?2增至>20,000 ?2。NPC262768与TCMBANKIN000009稳定在17,500–18,500 ?2;Amb28533044与NPC170963在18,000–19,500 ?2;NPC469603初期速升至~20,000 ?2后波动。前两者溶剂暴露少,构象紧凑,去溶剂化惩罚低。
3.3.5. Hydrogen bond dynamics and ligand–protein stability
氢键追踪显示参考体系罕超1个氢键。NPC170963持续1–3个氢键;NPC469603维持1–2个;Amb28533044间歇中等;TCMBANKIN000009多为短暂单氢键;NPC262768虽氢键短暂不规则但靠疏水及π-π堆叠稳定。NPC170963与NPC469603极性相互作用持久。
3.3.6. Principal component analysis (PCA) of essential dynamics
PCA投影显示参考体系在PC1/PC2广泛分散,两构象盆地间频繁转换。TCMBANKIN000009与NPC262768局限于单一优势盆地,构象受限;Amb28533044与NPC469603呈弧状中等扩散;NPC170963跨多盆地高灵活性。前者限制PIM2运动更有效。
3.3.7. Root mean square deviation (RMSD) analysis
RMSD显示参考体系从2 ?持续升至>10–11 ?。TCMBANKIN000009稳于6–8 ?;NPC170963于5–7 ?;Amb28533044初期3–4 ?后缓升;NPC262768于6–7 ?;NPC469603达9–10 ?。TCMBANKIN000009、NPC170963与NPC262768 RMSD更低更稳定。
3.3.8. Free energy landscape analysis
以PC1、PC2为反应坐标的FEL显示参考体系采样广;TCMBANKIN000009与NPC262768具明确低能盆地及受限采样;其余三者低能区存但盆地多或宽。FEL与RMSF、Rg、SASA、氢键、PCA及RMSD一致,支持NPC262768与TCMBANKIN000009优先。
讨论与结论总结
讨论部分指出,集成QSAR、对接、MD及ADMET的预测流程有效优先候选分子,复合评分避免单指标误判,随机森林指纹模型兼顾解释与泛化,优于XGBoost等易过拟合模型,指纹描述符擅长编码拓扑片段以捕捉激酶识别特征。对接证实候选物结合ATP口袋关键残基(Lys62、Asp125、Asp128、Glu168)及疏水袋(Leu39等),MD动态验证静态对接之不足,RMSF、Rg、SASA、氢键、PCA及FEL共同支持NPC262768与TCMBANKIN000009稳定复合物。Deep-PK预测部分化合物ADMET有利。局限在于SMOTE可能引入人工模式、2D指纹缺3D构象信息、对接与MD为理论近似需实验验证。结论部分研究人员总结:集成QSAR建模、虚拟筛选、分子对接、MD模拟及ADMET预测的計算流程成功识别潜在PIM2抑制剂,随机森林指纹QSAR模型预测性能强并指导发现候选物,结构与动态分析支持配体在催化口袋稳定,NPC262768与TCMBANKIN000009动态稳定性最优,应优先进行生化IC50验证、激酶选择性谱分析及细胞抗癌评价,为PIM2靶向治疗开发提供先导。