多模态AI与生成化学闭环驱动药物发现的TechBio 3.0范式

《npj Drug Discovery》:TechBio 3.0 closes the drug discovery loop with multimodal AI and generative chemistry

【字体: 大 中 小 】 时间:2026年10月10日 来源:npj Drug Discovery

编辑推荐:

  人工智能(AI)已深刻改变了分子预测与设计领域,然而这些进展目前仍仅部分整合至实验驱动的药物发现流程之中。研究人员将TechBio 3.0定义为一种新兴的闭环药物发现范式,该范式将多模态分子表征、生成化学与自动化实验有机连接。研究人员审视了该范式在临床前及临床

人工智能(AI)已深刻改变了分子预测与设计领域,然而这些进展目前仍仅部分整合至实验驱动的药物发现流程之中。研究人员将TechBio 3.0定义为一种新兴的闭环药物发现范式,该范式将多模态分子表征、生成化学与自动化实验有机连接。研究人员审视了该范式在临床前及临床阶段的早期证据,识别了尚存的技术与转化障碍,并论证了这一技术融合正开始定义生物技术领域的下一个时代。

论文主体内容总结

引言

制药生产力危机

过去五十年间,制药研发投入大幅增长,但药物审批率基本停滞不前。新药上市平均成本已超过20亿美元,从靶点识别到监管批准的开发周期超过12年。值得注意的是,进入临床试验的候选药物中近90%未能获批,安全性问题在从临床前测试到上市后监测的各阶段失败中占据相当比例。晚期失败代价尤为高昂,因其涉及临床试验、生产和监管准备方面的大规模投资。药物发现生产力危机的主要原因在于预测药物分子在复杂生物系统中行为的挑战:单一化合物可能结合预期靶点,也可能与众多脱靶蛋白相互作用、在特定组织中蓄积、被代谢为活性中间体,并在易感细胞类型中触发应激反应。传统定量构效关系(SAR)模型将三维(3D)结构简化为固定长度描述符向量,虽可应对简单终点,但往往无法捕捉对安全性至关重要的空间排布与构象变化。

从生物技术到TechBio的演进

TechBio在过去二十年间不断演进,计算方法日益深入制药研究。TechBio 1.0(预测阶段)形成于2015至2019年间,以机器学习预测分子性质为驱动力。深度学习模型在结合亲和力、溶解度、代谢稳定性及早期毒性终点预测方面取得更优表现,但主要作为传统药物发现管线中的排序或过滤工具,其临床影响受限于数据可得性和与实验工作整合的成熟度不足。TechBio 2.0(加速阶段)出现于2020至2023年间,生成模型和端到端AI平台加速了发现过程。例如Insilico Medicine将特发性肺纤维化(IPF)项目从靶点识别推进至临床前候选提名仅用时约18个月,而传统流程需3至5年。尽管取得进展,该阶段工作流仍仅部分整合,预测、生成和实验组件协同运作但未在统一反馈系统中持续优化。研究人员将TechBio 3.0(闭环生成式多模态整合)定义为当前AI原生药物发现阶段的结构性转变,其特点为多模态分子表征、生成设计系统和实验室整合反馈框架的融合。与TechBio 2.0中各组件的松散耦合不同,TechBio 3.0以算法与实验的紧密整合为特征,模型输出直接指导合成与检测设计,实验数据持续用于更新模型参数和不确定性估计。

综述范围与结构

本综述聚焦定义TechBio 3.0的技术创新,重点考察两种汇聚的方法论。多模态AI系统整合视觉表征、图拓扑、机制模拟和预测的转录组响应,以捕捉单一方法无法完整呈现的分子行为互补方面。生成化学平台利用AI不仅预测现有化合物性质,还设计针对疗效和安全性优化的全新分子结构。综述按七个部分组织:首先探讨多模态分子表征的生物学与技术动因;随后介绍多模态神经网络的最新架构创新;接着考察从传统基于规则的生物电子等排变换到现代数据驱动的神经生成模型的生成化学策略;讨论预测与生成如何整合为统一的闭环优化工作流;通过案例研究突出TechBio 3.0的临床与商业验证;最后讨论数据获取、监管框架演进和实验验证缺口等持续挑战。

多模态分子表征的基础

药物毒性背后的生物学复杂性

理解多模态方法的必要性始于认识药物与生命系统相互作用的复杂性。肝毒性是这一复杂性的典型案例,也是药物失败或撤市的主要原因。肝损伤可通过至少四种不同机制发生:(i)反应性代谢物形成,取决于官能团排布及其对细胞色素P450酶的可及性;(ii)线粒体功能障碍,受化合物理化性质影响其在氧化磷酸化位点的蓄积;(iii)胆汁盐输出泵抑制,依赖分子形状和静电特征促进转运体结合;(iv)免疫介导损伤,源于药物与蛋白共价结合形成半抗原,使免疫系统将修饰蛋白视为异物。由于单一分子表征无法捕捉所有这些因素,多模态方法通常比依赖单一信息类型的模型更为有效。肝毒性或药物性肝损伤(DILI)是多模态模型必要性的有力例证,其可源于分子结构特征如驱动毒性代谢物形成的反应性基团,也可源于下游生物学响应如应激通路激活和免疫介导损伤。一项消融分析显示,结合结构指纹与学习型简化分子线性输入规范(SMILES)序列表征的模型在DILI预测中优于任一单一模态,两种输入提供互补信息。同样,基于高通量L1000转录组谱训练的深度学习模型比经典描述符方法更准确地预测了DILI。

不同分子表征编码的互补信息

每种分子表征类型捕捉独特信息,各视角相互补充而非简单重复。标准化2D分子图以药物化学家熟悉的方式描绘原子和官能团排布;卷积神经网络(CNN)分析图像时可检测与毒性相关的视觉模式,如醌类结构和可被代谢活化的芳香胺。分子图中原子为节点、键为边,编码分子的连接性和同一性,不受绘制方向影响;图神经网络(GNN)学习性质如何通过分子拓扑传播,捕捉分子某部分变化如何影响数键之外的其他部位反应性,包括通过共轭体系传播的电子效应。机制模拟使用常微分方程(ODE)建模生物系统随时间的动态响应,通过模拟三磷酸腺苷(ATP)产生与消耗、氧化应激中活性氧(ROS)生成、质子梯度破坏导致的膜电位变化及细胞死亡通路激活等过程,可捕捉源于动态变化而非静态分子特征的毒性。转录组特征无论实验测量还是从结构预测,均可捕捉细胞在基因调控层面的化合物响应;关键毒性相关基因的表达变化可揭示应激响应通路如未折叠蛋白反应、核因子E2相关因子2(NRF2)介导的抗氧化防御及p53介导的DNA损伤响应的激活。转录组表征聚焦下游生物学效应而非结构本身,可识别引发相似细胞响应的化合物,即使其化学结构差异显著。

药物发现的多模态神经架构

各分子表征的专用编码器架构

每种模态专用编码器将多样输入转换为固定大小嵌入,保留毒性相关信息同时兼容下游数据融合。对于分子图像,CNN编码器常采用ImageNet迁移学习,在自然图像预训练后微调至化学结构图;ResNet架构利用跳跃连接稳定深层训练,ResNet-18在典型制药数据集上达到模型容量与训练效率的良好平衡。空间注意力机制使网络聚焦与毒性相关的特定分子区域,生成突出预测毒效团的注意力图。GNN编码器使用消息传递架构,节点表征通过聚合邻近原子信息迭代更新;图注意力网络(GAT)引入学习到的注意力权重调节各邻居的相对贡献,使模型优先处理化学相关相互作用。节点特征通常包括元素类型、形式电荷、杂化状态、芳香性、度和环成员资格等原子描述符,边特征编码键级、共轭和立体化学。机制编码器结合基于物理的建模与深度学习,从分子结构提取50余种理化描述符如分子量、分配系数、极性表面积和氢键计数,参数映射网络将这些描述符转换为各化合物的特定值,用于一组关联方程模拟生物系统随时间的响应;状态变量可能包括ATP浓度、ROS水平、膜电位和凋亡信号,数值积分产生模拟暴露的时间过程轨迹,汇总统计形成机制嵌入。转录组编码器解决多数筛选化合物缺乏实验基因表达特征的问题,从分子结构预测转录组响应,学习从SMILES字符串到多种细胞类型(包括HepG2肝细胞、A549肺细胞和MCF7乳腺癌细胞)基因表达主成分的映射,训练数据来自连接图谱和TAHOE-100M数据集。此外,将量子力学信息直接编码入分子编码器成为新趋势,如量子化学感知图模型qcGEM以电子结构特征补充消息传递,QuADMET-Former作为等变图变换器在分子中原子量子性质上预训练,在治疗数据共享、Biogen ADME和OpenADMET基准上改善ADMET预测。

整合多模态的融合机制

信息融合方式同时影响预测的准确性和清晰度。早期融合将所有来源信息合并为一组,但不考虑来源间交互,虽速度快却可能忽略重要联系。晚期融合分别处理各数据源后合并结果,常通过平均或投票,允许各来源贡献其优势并产生更均衡的预测,但可能遗漏需要联合优化的协同效应,静态组合权重也无法反映化合物间相关性差异。层次注意力融合通过分配动态的、化合物特异性的权重提供更灵活的先进解决方案:第一层注意力确定各数据类型对特定化合物预测的影响程度,例如模型可在毒性源于代谢活化时强调机制特征,在毒性关联已知毒效团时优先结构特征;第二层注意力在各数据类型内识别对预测影响最强的具体特征。这种两步方法通过明确哪些数据类型最重要以及各数据源内哪些细节影响最大,增强了可解释性。

面向监管与科学决策的模型可解释性

在制药安全性评估中,模型仅准确是不够的,还必须为其预测提供机制解释。美国食品药品监督管理局(FDA)和欧洲药品管理局(EMA)等监管机构日益认可计算方法作为安全性评估的有效组成部分,但期望将预测与潜在机制关联的科学推理。层次注意力融合架构通过生成预测及可纳入监管提交材料的注意力可视化满足这一需求。模型在模态层面显示哪些分子信息类型对预测贡献最大,在各模态内进行特征级分析定位影响结果的具体分子子结构、轨迹特征或通路组分,在化合物层面通过注意力可视化突出与预测毒性相关的原子、键和官能团。对于CNN模型,梯度加权类激活映射(Grad-CAM)技术在分子图像上生成空间热图。GNN利用边和节点注意力机制突出与毒性关联最强的分子子结构。机制模型使用轨迹分析识别与毒性效应最相关的模拟生物学状态变量。监管层面的可解释AI应用已非纯理论:FDA 2025年1月草案指南引入基于风险的信用评估框架,模型解释有助于论证拟议使用情境;EMA 2023年AI反思文件强调透明度、可追溯性和人类监督。ICH M7(R1)框架是既有范例,允许申办方使用两个互补的(Q)SAR预测替代某些细菌致突变性(Ames)研究。然而更复杂的毒性仍难以解释,特应性免疫介导损伤仍是重大局限,因当前方法可突出有影响的输入特征但通常无法重建从半抗原形成到T细胞活化的完整因果链。

治疗优化的生成化学

基于规则的变换与药物化学知识

生成化学指为特定目标优化设计分子结构的计算方法。基于规则的变换技术建立在数十年药物化学经验之上,通过成熟化学取代进行系统修饰以产生多种类似物。生物电子等排替换是此方法的关键策略,通过交换官能团在保持生物活性的同时改变其他性质,经典实例包括以四唑替代羧酸维持酸性并改善代谢稳定性、以磺酰胺交换酰胺改变构象柔性、以氰基或三氟甲基取代硝基降低致突变风险同时保留吸电子效应。化学家还针对特定毒性问题修饰官能团:将伯芳香胺转化为仲胺或乙酰胺可降低氧化风险;通过添加饱和基团或大体积基团降低迈克尔受体的反应性;破坏易氧化基序可防止毒性醌形成。修饰分子骨架如改变环结构可在保持核心形状的同时调整代谢。基于规则的方法可解释且易于实验室应用,但受限于现有化学知识边界。

从头分子设计的生成模型

生成模型超越传统基于规则的方法,直接从数据学习分子设计。变分自编码器(VAE)将分子编码至连续空间,相似结构彼此邻近,关联性质预测器支持基于梯度的优化以实现特定安全性和疗效特征。生成对抗网络(GAN)训练生成器创建类似已知类药化合物的新分子,条件版本可将性质约束直接纳入生成过程。强化学习(RL)方法将分子构建视为逐步决策过程,奖励高效力并惩罚预测毒性。扩散模型借鉴图像和蛋白质生成思想,逐步细化分子图并支持基于性质的采样。图基生成模型和强化学习框架进一步扩展药物发现可访问的化学空间。不同模型类别在分子设计应用中的行为倾向各异:VAE可能忽略部分潜空间,GAN易坍缩至相似分子,二者均限制化学多样性实现;RL方法可能过度聚焦给定指标优化,导致分子虽在预测器上高分但未能捕捉预期药物化学意图;扩散和流基方法采样效率可能较低,但可实现更丰富的分子多样性和对结构或性质约束的更强控制,这些权衡对于片段连接子设计和PROTAC生成等约束设计问题尤为重要。基于规则的变换在TechBio 3.0技术栈中仍可发挥重要作用,作为化学信息先验鼓励生成分子具有现实性和可合成性。

毒性预测与生成优化的整合

TechBio 3.0的定义性特征是将预测和生成系统整合于闭环优化工作流中。当前方法在起始阶段即将毒性和药代动力学约束构建入设计目标,而非事后过滤候选。在强化学习中,毒性惩罚被纳入奖励函数以平衡安全性、效力和吸收、分布、代谢、排泄(ADME)性质。多目标优化策略如帕累托前沿分析帮助管理不同目标间的权衡。在VAE中,由毒性预测器引导的潜空间梯度将搜索引离化学空间的不安全区域。生成流网络(GFlowNets)使用复合奖励函数采样广泛候选分子,生成覆盖可行权衡谱的多样化选项集。生成模型常产生与性质预测器训练集结构不相似的分子,因此必须将不确定性和误差估计纳入设计循环上游,需要三项保障:预测器须在其适用域内部署,超出范围的分子在提交合成前被标记或惩罚;不确定性须贯穿从性质预测到分子生成和最终选择的整个工作流,应使用深度集成、贝叶斯推断或保形预测而非单点估计;主动学习实验应使用提供最大模型改进的采集函数,如期望改进、上置信界采样或不确定性-多样性采集函数。

闭环发现工作流

从顺序到整合的管线

传统药物发现采用逐步方法,计算预测、药物化学设计、合成和实验测试为独立阶段。TechBio 3.0将所有要素整合至统一工作流:计算预测帮助科学家决定下一步合成哪些化合物,实验结果实时反馈以改进底层模型。在闭环系统中,不同类型数据用于识别先导化合物潜在问题,AI工具提出靶向修改,新实验数据通过主动学习持续更新模型。科学家基于预测改进、合成可行性和可提供的新信息选择化合物进行合成,每次新测量帮助重新校准模型并减少化学空间重要区域的不确定性。

自动化与高通量整合

自动化合成平台支持快速生产计算模型优先排序的化合物,在预测与实验验证之间创建更紧密高效的反馈循环。机器人工作站以最少人工输入对提议分子执行标准化化学反应,自动化纯化和分析方法确保测试化合物与预期一致,实验室信息管理系统追踪各化合物从计算设计经合成、纯化到测试的全程。微流控和小型化检测平台减少所需材料量并提高实验毒性测试的通量。器官芯片系统和先进体外平台在生理相关情境中实现毒性评估,改善临床前安全性评价的转化相关性。高维表型和转录组谱分析捕捉详细细胞响应,为训练和验证多模态预测模型提供丰富数据。Recursion Pharmaceuticals构建了结合大规模细胞成像与AI驱动分析的平台,捕捉不同化合物在多种细胞类型和条件下的结构和功能影响,其与Exscientia的合并通过整合自动化合成化学进一步加强了该方法,实现从靶点识别到先导优化的完全连接流程。

药物设计中的人机协作

尽管自动化取得进展,成功的药物发现仍依赖AI系统与人类专家的紧密协作,后者提供关键生物学见解、战略判断和对影响患者安全决策的责任担当。交互式可视化和可解释性工具使药物化学家能够质询AI生成的化合物建议、理解底层模型推理并迭代优化设计。构效关系(SAR)框架和药物化学专业知识继续在验证AI输出和指导生成模型探索方向方面发挥关键作用,确保计算设计不仅具有数学最优性,还符合药物化学实践和可合成性的现实约束。

订阅生物通快讯

订阅快讯:

最新文章

限时促销

会展信息

关注订阅号/掌握最新资讯

今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

版权所有 生物通

Copyright© eBiotrade.com, All Rights Reserved

联系信箱:

粤ICP备09063491号