《Pharmaceuticals》:An Explainable Machine Learning-Based QSAR Framework for Predicting Thrombin Inhibitory Activity
编辑推荐:
背景/目的:公共凝血酶生物活性记录包含异质终点、重复测量、相关化学系列和潜在反应性化合物,可能使定量构效关系模型产生偏倚。研究人员开发了一种可解释、assay感知且防泄漏的机器学习框架,用于预测凝血酶抑制活性。方法:研究人员将人凝血酶(CHEMBL204)的精
背景/目的:公共凝血酶生物活性记录包含异质终点、重复测量、相关化学系列和潜在反应性化合物,可能使定量构效关系模型产生偏倚。研究人员开发了一种可解释、assay感知且防泄漏的机器学习框架,用于预测凝血酶抑制活性。方法:研究人员将人凝血酶(CHEMBL204)的精确Ki与IC50记录标准化,转换为pActivity,并按预定义标准聚合。最终数据集包含5189个唯一化合物,由开发集过滤后的Mordred描述符和Morgan指纹表示。模型使用仅开发集的袋外验证优化,并采用随机与支架不重叠保留测试评估。结果:随机划分中,ConsensusAll袋外R2为0.7588,保留测试R2为0.7480,RMSE为0.7360,MAE为0.5307,一致性相关系数(CCC)为0.8540。支架不重叠锁定测试中,ConsensusTop5的R2=0.5831,RMSE=0.9484,MAE=0.7290。适用性域覆盖92.68%锁定测试化合物,R2=0.6041。100次Y随机化平均R2为?0.1233,经验p=0.0099。结论:该框架在所代表化学空间内可提供有用预测,并对未知支架具有可衡量泛化能力,可支持化合物优先级排序,但仍需前瞻生化验证。
研究背景方面,止血是维持血管完整性的受调控生理过程,凝血酶(thrombin,凝血因子IIa)作为类胰蛋白酶丝氨酸蛋白酶,在凝血启动、放大和稳定中居核心地位。现有直接凝血酶抑制剂如dabigatran、argatroban、bivalirudin仍有出血风险、药代差异和剂量调整等局限。公共数据库ChEMBL虽提供大量生物活性记录,但存在重复结构、单位不一致、Ki(抑制常数)与IC50(半数抑制浓度)终点异质、重复测量冲突和潜在反应性结构等问题,传统定量构效关系(QSAR,Quantitative Structure–Activity Relationship)模型易受影响而产生偏倚。因此,研究人员开展一项assay感知、防泄漏且可解释的机器学习QSAR研究,论文发表于《Pharmaceuticals》。
关键技术方法方面,研究人员从ChEMBL获取人凝血酶(CHEMBL204)记录,仅保留精确关系、纳摩尔单位、无数据有效性警告且可RDKit标准化的结构;将Ki与IC50转为pActivity并按结构与终点分组,用中位数聚合一致重复、排除跨度大于1.0 log的冲突组与跨终点不一致对;用Mordred二维描述符和Morgan指纹表示化合物,特征过滤与缺失值填补仅在开发集进行;采用随机80:20与Bemis–Murcko支架不重叠划分,内部用五折支架分组验证;模型含随机森林、Extremely Randomized Trees(ExtraTrees)、XGBoost、LightGBM、支持向量回归等,并以非负最小二乘构建ConsensusTop3/Top5/All;用SHAP(SHapley Additive exPlanations)、置换重要性、Y随机化、基于Morgan Tanimoto相似度的适用性域(Applicability Domain)解释与稳健性评估。
研究结果方面,2.1 Assay感知整理与数据集特征显示,初始9327条记录经精确关系、单位、有效性警告、结构标准化和去重后得6414条;按结构–终点分组后排除96个冲突重复组和49个不一致跨终点对,最终5189个唯一化合物,pActivity范围3.37–11.00,520个含潜在反应结构警报。2.2 分子表示与防泄漏特征处理显示,Mordred从1613降至615个非冗余描述符,Morgan 2048位中保留2039个非常量特征,过滤与填补均冻结于开发集,避免测试集泄漏。2.3 随机保留模型开发与预测性能显示,ExtraTreesMorgan袋外R2=0.7448最强;ConsensusAll袋外R2=0.7588,随机保留1038化合物测试R2=0.7480、RMSE=0.7360、MAE=0.5307、CCC=0.8540。2.4 支架不重叠数据集划分显示,开发集4151化合物1180支架,锁定测试1038化合物295支架,无支架重叠,活性分布与警报比例均衡,测试化合物对开发集中位最大Morgan Tanimoto相似度0.7045。2.5 支架分组模型选择与锁定测试性能显示,ExtraTreesMorgan支架袋外R2=0.5714;ConsensusTop5被选并冻结,锁定测试R2=0.5831、RMSE=0.9484、MAE=0.7290、CCC=0.7257。2.6 随机与支架不重叠验证比较显示,两者R2差0.1649,性能下降来自结构划分难度而非拟合不稳定。2.7 终点特异与反应亚结构敏感性分析显示,Ki仅子集R2=0.6053优于IC50仅子集0.5097;无警报化合物R2=0.5717,警报化合物0.5674,说明反应基团未主导预测。2.8 Y随机化分析显示,100次置换响应后ExtraTreesMorgan平均R2=?0.1233,最高?0.0033,经验p=0.0099,排除偶然相关。2.9 基于相似性适用性域显示,阈值D*=0.5867,域内962化合物R2=0.6041、RMSE=0.9268,域外76化合物R2=?0.0043;相似度四分位R2从0.2560升至0.7486。2.10 模型解释与结构归因显示,ExtraTreesMorgan中Morgan位935、82、1416等经TreeSHAP影响最大,映射为代表原子环境如取代芳环、氮杂环、羰基区;SVRMordred中n7FARing、SlogP_VSA4等描述符经置换重要性突出,解释为模型关联而非因果机制。2.11 补充数据与可重复性记录显示,项目种子20260823,锁定前完成模型选择,补充材料含整理、划分、特征、超参与解释记录。
讨论部分总结方面,研究人员指出随机划分反映已知化学空间内插值,支架不重叠反映新核心框架外推;assay感知整理降低但未消除实验异质;Ki与IC50合并为pActivity具端点异质,Ki信号更强;反应警报敏感分析不支持共价机制主导;ExtraTreesMorgan与共识模型互补提升稳定;Y随机化仅为负对照;适用性域说明局部环境支持决定可靠性;SHAP与置换重要性产生假设而非机制证据;相较Masand等的GA-XGBoost,本文贡献在集成验证与透明可重复;模型适用于虚拟筛选排序,不替代生化与ADMET实验;局限含单库回顾、元数据不全、端点非同质、反应机制未定、支架相似连续、解释受哈希碰撞影响、无前瞻合成验证。
结论部分翻译方面,本研究建立了一个assay感知、可解释且防泄漏的机器学习QSAR框架用于预测凝血酶抑制活性。对ChEMBL记录的系统性整理在分子标准化、重复一致性评估、跨端点协调和冲突测量排除后产生了5189个唯一化合物数据集。随机保留评估显示所代表化学空间内有用预测能力,支架不重叠锁定测试提供对新支架的保守泛化估计。端点特异、反应警报、Y随机化和适用性域分析厘清了预测受支持的条件。该框架可支持凝血酶抑制剂发现中的假设生成与实验优先级排序,但前瞻性生化验证仍必要。