《Nature Biotechnology》:AI-enhanced adaptive virtual screening of large libraries for ligand discovery
编辑推荐:
超大规模虚拟筛选(ULVSs)可评估数十亿个分子用于药物发现,但面临成本、灵活性和可扩展性方面的限制。研究人员推出AdaptiveFlow,这是一个开源平台,使ULVSs更易访问、可扩展且高效,并支持人工智能(AI)和机器学习(ML)方法开发。Adaptive
超大规模虚拟筛选(ULVSs)可评估数十亿个分子用于药物发现,但面临成本、灵活性和可扩展性方面的限制。研究人员推出AdaptiveFlow,这是一个开源平台,使ULVSs更易访问、可扩展且高效,并支持人工智能(AI)和机器学习(ML)方法开发。AdaptiveFlow提供了经过筛选准备的Enamine REAL Space版本——据研究人员所知,这是最大的即用对接类药分子库,包含690亿个化合物,同时以SELFIES格式提供。一个18维的分子性质网格可优先定位有前景的化学子空间,并可选配主动学习功能,将计算成本降低数个数量级。AdaptiveFlow整合了超过1500种对接协议,包括GPU加速和基于ML的方法,并在亚马逊云服务(AWS)中实现了高达560万个CPU的近线性扩展。研究人员针对两个疾病相关靶点——铁死亡抑制蛋白1(FSP1)和聚(ADP-核糖)聚合酶1——鉴定了纳摩尔级抑制剂。共晶结构为FSP1抑制提供了机制见解。AdaptiveFlow以前所未有的规模支持药物发现,并促进AI驱动方法的发展。
研究背景与问题
早期药物发现的核心挑战是从海量化学空间中识别能够与靶标生物大分子特异性结合并具有足够效力的先导化合物。实验高通量筛选(HTS)虽已成功发现众多先导物,但受限于成本高昂、周期漫长、检测体系可扩展性差。理论估计合成可及、类药性良好的小分子数量超过10
60,而典型HTS仅覆盖数十万化合物,面临极具挑战性的靶点(如蛋白–蛋白相互作用界面、别构位点)时极易遗漏候选。虚拟筛选从十年前的百万级扩展到如今数十亿至万亿级的超大规模虚拟筛选(ULVSs),显著降低了成本与时间,但仍存在财务成本高、算法整合灵活性差、对CPU/GPU异构计算基础设施利用不足等瓶颈。为解决上述问题,研究人员开发了AdaptiveFlow,一种开源、可扩展、支持人工智能(AI)与机器学习(ML)方法开发的大规模虚拟筛选平台。该研究成果发表在《Nature Biotechnology》。
研究内容概述
研究人员构建了三模块架构的AdaptiveFlow:配体制备模块(AFLP)、虚拟筛选引擎(AFVS)以及一体化工作流模块(AFU)。利用该平台将Enamine REAL Space(2022q1-2版)由315亿个枚举分子制备为687亿个即用对接分子(其中99%符合Lipinski五规则,包含约10.99亿个独特Murcko骨架),并计算28种分子属性、按18维性质矩阵组织成约1200万个tranche。平台独创自适应靶标导向虚拟筛选(ATG-VSs)策略,以预筛加主筛级联方式降低计算量,可选ML主动学习层进一步提升富集效率;平台集成1500余种对接协议,在AWS云上实现560万vCPU近线性扩展。应用AdaptiveFlow针对铁死亡抑制蛋白1(FSP1)和聚(ADP-核糖)聚合酶1(PARP1)两个治疗相关靶点开展筛选,成功获得纳摩尔级抑制剂并经共晶结构等实验验证。
关键技术方法
关键技术包括:①AFLP大规模配体制备,完成立体异构体与互变异构枚举、3D构象生成、质子化预测及28项理化性质计算,并自动按性质分配tranche;②AFVS引擎整合约1500种对接协议,涵盖经典打分与采样算法组合以及DiffDock、TANKBind等深度学习对接方法,并支持GPU与ARM架构;③ATG-VS自适应管线,通过预筛—主筛级联及可选ML分类器(基于Morgan指纹和神经网络,以对接分数为标签)优先排序化合物,形成闭环主动学习;④云原生并行架构,基于Slurm与AWS Batch调度,利用spot实例与对象存储实现超大规模并行。样本队列来源为Enamine REAL Space(2022q1-2版,31,507,987,117个枚举分子);基准测试覆盖10个蛋白靶标;FSP1筛选共合成33个命中化合物及20个类似物;PARP1筛选合成160个候选化合物。
研究结果
AdaptiveFlow平台。AFLP完成了REAL Space的预处理,在AWS上调用560万Intel vCPU并行运行,扩展呈完美线性,中断CPU时间小于0.1%;AFVS支持约40种独立程序并组合出约1500种对接协议,适用于小分子、肽、蛋白、RNA/DNA及共价配体;AFU将制备与对接整合为单一环境,提供命令行与API两种模式,大幅降低使用门槛。
Enamine REAL Space文库。制备后文库含687亿分子,约74%(620亿)含有至少一个手性中心,230亿含卤素(其中174亿含氟,适于
19F核磁共振检测)。18维性质矩阵理论tranche数为244亿,实际约1200万被占用,平均每个tranche约5600分子。大量未占用tranche提示广阔未探索化学空间,为前瞻性合成提供了机遇。多种格式(PDB、PDBQT、MOL2、SDF、SMILES、SELFIES、Parquet)及交互式网络界面增强了可用性。
自适应超大规模虚拟筛选(ATG-VS)。预筛从每tranche选取1–10个代表分子(全库约1200万次对接),根据打分选择高潜tranche并进行完全主筛,可选ML模型以打分第75百分位为阈值筛选高置信结合分子。对照实验表明,1个代表分子/每tranche且exhaustiveness=1时即可获得与更高参数相近的排序表现。在10个蛋白靶标中,ATG-VS(100,000次总对接)优于随机筛选1,000,000分子;生产规模下其top50打分与标准ULVS相媲美或更优,而计算量大幅下降。ML主动学习进一步改善高亲和力命中富集,尤其在结合口袋特征复杂(兼具疏水表面与极性子口袋)的靶点中增益显著;采用Smina/Vinardo与GWOVina重复实验,表明基于理化性质的分箱策略在不同打分函数下均稳健。
ML与云端支持。平台原生支持SELFIES表示与EquiBind、DiffDock、TANKBind等深度学习对接工具,可在生成模型与强化学习流程中产生训练数据或目标函数。在AWS上利用超过560万vCPU完成十亿级筛选仅需数小时,相较本地集群数周至数月大幅提速。
FSP1结构研究。研究人员应用祖先序列重建获得四足动物祖先FSP1(与人类FSP1序列一致性72.5%,保留全部活性位点残基,Tm=62°C),解析FSP1结合FAD、FAD+NAD
+以及FAD+NAD
++辅酶Q1的高分辨率晶体结构。NAD
+引发黄素环2 ?位移,烟酰胺C4位于异咯嗪N5正前方,符合氢化物转移机制;辅酶Q1结合于Phe354与Tyr290两个芳香残基之间,醌氧与黄素N(3)H形成氢键,底物与NAD
+可同时结合,与三元复合动力学机制一致。
靶向FSP1的AdaptiveFlow筛选。以FSP1–FAD–NAD
+结构(PDB 9IFT)为受体、辅酶Q位点为靶点进行ATG预筛(1200万次对接)和主筛(1000万分子),经logP、logS、TPSA、立体中心数及毒性过滤后订购42个化合物,合成33个进行热位移与NADH消耗实验。
实验验证:抑制剂从辅酶Q位点延伸至NAD位点。afi-FSP1-1与afi-FSP1-2使蛋白熔解温度上移≥1.5°C,且在10 μM浓度下抑制FSP1氧化还原酶活性≥50%,Ki分别为0.283 μM和0.777 μM;细胞热位移实验显示二者在FSP1表达细胞中有效靶点结合(热位移2.8°C与3.1°C)。afi-FSP1-1与ferroptosis诱导剂erastin联用在Jurkat细胞中诱导铁死亡,且可被liproxstatin-1完全挽救。共晶结构证实两抑制剂占据辅酶Q位点,黄素N(3)H与配体羰基形成氢键,并通过水分子与L323主链胺基相互作用。基于结构的类似物筛选又获4个活性分子(afi-FSP1-3至afi-FSP1-6),Ki介于三位数纳摩尔至低微摩尔范围;共晶结构显示其共同药效团为芳香酰胺-饱和杂环核心。这些化合物对FSP1 NADH氧化酶活性抑制减弱10–12倍或完全无抑制,提示选择性抑制辅酶Q还原活性可能具有药理学益处。
将AdaptiveFlow应用于PARP1。ATG预筛及1亿分子主筛后合成160个候选,两浓度酶学筛选明确7个抑制剂,其中4个IC
50<250 nM;iParp1 IC
50=8.8 nM,与FDA批准的奥拉帕利相当。核磁共振证实其结合于PARP1活性位点,2.05 ?晶体结构解析了水解形式iParp1的结合模式;BRCA1缺陷三阴性乳腺癌细胞克隆形成实验显示iParp1与iParp2具有选择性细胞毒性。
讨论与结论
ATG-VS在69亿化合物规模下较穷举筛选节约计算成本达1000倍,结合GPU与深度学习对接可再提升10–100倍通量。既往研究人员发现KEAP1–NRF2纳米摩尔抑制剂需无偏筛选13亿分子,而ATG导引的FSP1筛选仅用2200万次对接即获类似成功。随着化学空间持续扩张,聚焦靶标特异子空间将从可选变为必需。AdaptiveFlow的开源模块化架构支持持续纳入新对接协议与ML工具,兼容生成模型和强化学习管线。研究结论指出,AdaptiveFlow为ULVS提供了统一、开源且大规模可扩展的解决方案,无缝整合传统与AI驱动的对接协议、提供最大的即用对接化学库,并以自适应策略高效导航万亿级化学空间。