《Advanced Intelligent Discovery》:Accelerating Primary Screening of USP8 Inhibitors from Drug Repurposing Databases with Tree-Based Machine Learning
编辑推荐:
泛素-蛋白酶体系统(UPS)对维持蛋白质稳态至关重要,去泛素化酶(DUB)如泛素特异性蛋白酶8(USP8)通过移除泛素链调控蛋白质稳定性。USP8在信号传导、受体运输及细胞周期控制中发挥关键作用,其失调与肝内胆管癌、乳腺癌及肝细胞癌等多种癌症进展相关。尽管若干
泛素-蛋白酶体系统(UPS)对维持蛋白质稳态至关重要,去泛素化酶(DUB)如泛素特异性蛋白酶8(USP8)通过移除泛素链调控蛋白质稳定性。USP8在信号传导、受体运输及细胞周期控制中发挥关键作用,其失调与肝内胆管癌、乳腺癌及肝细胞癌等多种癌症进展相关。尽管若干小分子USP8抑制剂在临床前研究中展现疗效,但尚无任一进入临床批准,凸显传统药物开发挑战。药物重定位通过既有药理与安全数据提供低成本、高效率替代路径。为加速USP8抑制剂发现,研究人员将监督机器学习(ML)应用于高通量筛选(HTS)数据,训练并评估六种ML架构结合多种分子指纹,确定优化XGBoost模型在阳性命中率上较基线提升16.3倍。该模型虚拟筛选DrugBank与Broad Repurposing Hub化合物,获得100个高优先级USP8抑制剂候选,近半已进入临床试验或获其他适应症批准,并识别出9类未见报道的分子骨架。该整合策略为靶向USP8的重定位驱动药物发现提供可扩展高效流程。
研究背景与动机
泛素-蛋白酶体系统(Ubiquitin-Proteasome System, UPS)通过降解错误折叠蛋白维持蛋白质稳态,去泛素化酶(Deubiquitinases, DUBs)以移除泛素链拮抗该过程。USP8作为DUB家族成员,稳定TGF-β受体、OGT及β-catenin等促癌蛋白,在乳腺癌、肝内胆管癌(intrahepatic cholangiocarcinoma, iCCA)及肝细胞癌(hepatocellular carcinoma, HCC)中高表达促进上皮-间质转化与增殖。已有MB7295、DC-U4106、9-ethyloxyimino-9H-indeno[1,2-b]pyrazine-2,3-dicarbonitrile及DUB-IN-3等小分子抑制剂展现临床前抗肿瘤活性,但均无临床批准。传统开发成本高昂(约20–30亿美元),而药物重定位借助已获批药物的临床前与安全性数据可将成本降至约3亿美元。研究人员因此转向计算驱动的重定位策略,以监督机器学习从公开HTS数据中学习USP8抑制活性规律,缩小化学搜索空间。
主要技术方法
研究人员以PubChem AID 1645853(Buhrlage实验室、Dana-Farber癌症研究所与Novartis Institute for Biomedical Research于2021年联合报道的Ub-Rho荧光HTS,47480分子,30%最大抑制率界定Active)为标注数据集,剔除Unspecified后按4.2%阳性率极端不平衡处理;从Broad Repurposing Hub(6798药)与DrugBank(2750药)经pubchempy转SMILES、RDKit去盐去立体得到7330预测集;以RDKit 2048位拓扑指纹、ECFP4、MACCS及Chemprop消息传递神经网络(D-MPNN)输出MPNN/FFN向量、MoLFormer隐态向量为输入,训练Random Forest、XGBoost、LightGBM、CatBoost及Chemprop、MoLFormer共六架构,Optuna-TPE调参100 trial;采用MaxMin多样性抽样划分训练/验证(80/20),测试集混入163个库内分子与31个近期文献新抑制剂(Colombo/Tian/Waltrich-Augusto等)共194分子;以二值交叉熵(Binary Cross Entropy, BCE)、ROC-AUC、PR-AUC及阈值依赖的均衡准确率(Balanced Accuracy, BA)、马修斯相关系数(Matthews Correlation Coefficient, MCC)评估。
研究结果
3.1 基于分类阈值无关验证指标遴选最优模型
在完整训练集均匀权重下,RDKit指纹配树基模型验证BCE最低(XGBoost 0.075,LightGBM/CatBoost 0.074,RF 0.086),显著优于Chemprop(0.091)与MoLFormer(0.214);RDKit指纹因2048位路径哈希捕获长程子结构且唯一率99.6%优于ECFP4(99.4%)与MACCS(91.9%)。XGBoost在RDKit下验证ROC-AUC≈0.98、PR-AUC 0.705居首。MoLFormer因数据量<4万过拟合,训练/验证BCE早停后噪声上升。
3.2 欠采样数据集性能
XGBoost均匀权重在全量非欠采样时BCE最低0.075;1:1欠采样升至0.69。全量训练集Bemis-Murcko(BM)骨架多样率64.2%(活性91.6% vs 非活性64.7%),独有活性骨架819个;欠采样超1:12后骨架覆盖流失致BCE陡增,故保留全量不平衡集。
3.3 分类阈值细化
XGBoost在阈值0.01时BA 0.926(活性召回100%、非活性85.3%),阈值0.1时MCC 0.607(阳性77.3%、阴性96.7%),默认0.5阈值敏感性与MCC均崩坏,证明不平衡数据须调阈值权衡灵敏/特异。
3.4 最优XGBoost(RDKit)模型预测
3.4.1 留出测试集预测
训练+验证合集重训后,XGBoost在0.01阈值对测试集阳性精度68.3%(28/41),较HTS基线4.2%高16.3倍;31个文献新抑制剂识得23个(74.2%),其中15个BM骨架未在HTS出现,Colombo吡嗪二腈类9/10、Tian类5/10(含LLK203、ML364)、Waltrich-Augusto卤代水杨苯胺类9/11被正确判活,显示跨分布泛化力。
3.4.2 已知他适应症药物候选预测
对7330预测集以0.01阈值判活1272个,取概率Top100:近半处临床期或已上市;Top20含TCS-PIM-1-1、4-methylgenistein、indisulam等激酶抑瘤药及tacrine、7-methoxytacrine等中枢乙酰胆碱酯酶抑制药;Top100预测候选均价2.86 USD/mg、中位0.86,较HTS高活性分子均值487.11 USD/mg低两数量级;t-SNE显示预测阳性与HTS阳性分子空间大重叠,但挑出9个最大Tanimoto相似度≤0.2的BM骨架(如pyrrolidine、azobenzene)为未研究过的USP8结合骨架。
讨论与结论翻译
讨论指出,树基模型在小样本HTS上胜出神经网络源于数据规模不匹配与RDKit指纹高分辨;保留全量不平衡集优于欠采样,因活性骨架多样度高;阈值调优是不平衡分类必步。结论部分译文如下:
本研究提出一种可扩展且高效的机器学习驱动药物重定位方法以精炼USP8抑制剂发现化学空间。通过利用Broad Repurposing Hub与DrugBank既有化合物,降低对从头合成依赖并加速早期药物发现。研究发现保留完整不平衡HTS数据集(而非对阴性欠采样)带来更优模型性能,欠采样致二值交叉熵上升与预测精度下降。经系统评估四种树基ML配六类分子指纹,RDKit特征XGBoost最优,留出阳性命中率约为基线16.3倍;该模型以近期报道的、与训练验证集骨架相异的USP8结合剂压力测试,阳性预测准确率约70%。模型从原HTS外识别100个高置信候选,近半已在其他适应症临床或获批,凸显快速转化潜力;并遴出9个结构相异BM骨架作新类抑制剂起点。该工作以排序候选与新颖骨架并重,为后续实验验证与USP8靶向肿瘤治疗从计算到临床铺路。
(全文约1520汉字)