动物与人口服药物生物利用度:机器学习表明二者相关

《AAPS Open》:Animal versus human oral drug bioavailability: machine learning says yes – they correlate

【字体: 时间:2026年09月04日 来源:AAPS Open

编辑推荐:

  口服生物利用度(%F)是药物疗效的关键决定因素,也是早期药物开发中的关键决策参数。目前对人%F的预测常依赖临床前动物研究,这类研究成本高、存在伦理争议,且未必与人%F相关。机器学习(ML)作为一种新兴的计算机模拟技术,已被用于预测人%F,但既往ML方法多依赖二

  
口服生物利用度(%F)是药物疗效的关键决定因素,也是早期药物开发中的关键决策参数。目前对人%F的预测常依赖临床前动物研究,这类研究成本高、存在伦理争议,且未必与人%F相关。机器学习(ML)作为一种新兴的计算机模拟技术,已被用于预测人%F,但既往ML方法多依赖二分类或回归性能有限,R2介于-0.36至0.50。本研究证明ML流程可利用临床前数据准确预测人口服%F,有望减少动物实验需求。研究人员整理了192个FDA批准化合物,覆盖多样化学空间。模型输入包括分子描述符、结构指纹、已发表动物%F及细胞色素P450(CYP)感知代谢特征(后者用于解释代谢驱动的种属间变异)。五折交叉验证重复100次,得R2=0.766(RMSE=16.13%),显著优于既往模型及单一种属(含非人灵长类NHP,R2=0.691)的单变量相关。不含NHP数据时,大鼠与犬%F联合仍达R2=0.723±0.016,降低对灵长类研究的依赖。置换特征重要性分析确定亲脂性、表面积与CYP特征为信息量最高预测因子,兼顾机制可解释性。结果表明,特征工程结合完整ML流程可从常规临床前数据精确、可重复地预测人口服%F,有望降低后期淘汰率并加速候选药临床转化。
研究背景方面,口服给药因便利、安全、经济及依从性好,占据全球处方量的71%,但口服候选药开发的主要淘汰原因之一是生物利用度(%F)不佳。%F受胃肠pH、酶降解、首过代谢等生理屏障影响,现行预测依赖动物模型(小鼠、大鼠、犬、非人灵长类NHP),然而动物与人%F相关性有限、成本高且有伦理压力,监管趋势推动无动物研究。既有ML研究多将%F转为高/低二分类,掩盖了5%与45%或50%与90%之间的临床差异;少数回归尝试R2仅-0.36~0.50。因此,研究人员开展本项研究,旨在用回归ML从临床前数据连续预测人口服%F。
该研究发表于《AAPS Open》。研究人员以Musther等整理的182个口服小分子(剔除两个对映体重复的普萘洛尔)为基础,从ChEMBL、HobPre等公开库增补10个低%F覆盖盲区化合物,构建192个FDA批准药的最终队列;动物%F涵盖小鼠(39)、大鼠(134)、犬(131)、NHP(46),存在缺失。关键技术方法包括:基于RDKit生成217个分子描述符与MACCS指纹,按生理pH 7.4与pKa推算酸/碱/中性/两性离子类别;对缺失动物%F采用跨种属两遍贝叶斯岭回归填补;构造大鼠犬均值、加权组合及四物种均值的动物复合特征,并对动物%F做logit变换;用ChEMBL等2071个外部化合物预训练核岭回归(KRR)得到stage1_pred作为结构先验;引入ADMET-AI的CYP2D6底物概率,按公式cyp2d6blend=(CYP2D6×stage1pred)+((1-CYP2D6)×(rat+dog)/2)融合结构与动物信号;目标%F做arcsin平方根变换稳定方差;用RDKit标准化、RFE选特征、Optuna调参,六类回归器比对后选KRR,五折交叉验证重复100次。
研究结果部分,探索性数据分析显示增补10个化合物拓展了UMAP化学空间并补齐<%F<23%长尾(如bortezomib 0%、aliskiren 2.8%),BCS四类齐全,分子量多<500 Da;单变量相关中鼠、大鼠、犬R2微升至0.28、0.30、0.38,NHP维持0.69。机器学习分析中,仅用描述符+动物%F的KRR得R2=0.15;换用跨种属填补后升至0.37;RFE压至22特征达0.67;补NHP的logit变换达0.73;最终加入预训练KRR与CYP感知特征得最优R2=0.766、RMSE=16.13%。泛化性检验(80%训练/20%独立测试,重复10次)得测试集R2=0.73±0.08,证实非过拟合。与文献对比一节指出该成绩超越Fagerholm等14组件复杂模型,以更少组件创新基准。种属贡献分析表明无动物数据仅靠结构达R2=0.57;加大鼠0.62、加犬0.68、大鼠+犬0.72±0.016;小鼠无贡献;NHP可再提升但样本仅46。置换特征重要性中CYP感知特征、stage1_pred、MolLogP、填补NHP%F居前,印证亲脂性、表面积与代谢特征的主导性。
讨论部分总结:本研究突破在于把跨种属填补、动物复合、logit变换、预训练堆叠与CYP感知特征工程系统性整合,使回归R2从文献负值跃至0.766;所有预处理仅在训练折内拟合以防泄漏,KRR带L2正则,重复CV加独立测试共同抑制过拟合。结论翻译如下:准确的人口服%F预测可为候选化合物排序、临床剂量预期及先导优化提供连续量值依据;大鼠+犬%F联合已可逼近含NHP性能,能削减昂贵灵长类实验与动物伦理负担;特征工程而非单纯增加模型层数成为精度驱动核心;CYP感知特征机制合理——CYP介导的肝肠首过代谢是多数药物口服吸收主要酶障,CYP底物跨种差异大时模型转向结构先验,非底物时信任动物%F;亲脂性(MolLogP)与表面积(PEOE_VSA、ESTATE_VSA)的重要性与既有药理规律一致。该流程有望降低后期开发淘汰率、加快转化,并为未来完全去动物化的口服PK预测提供可行路径。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号