引言
诱导接近已成为一种通用的治疗设计原则,即通过小分子或工程化系统创建具有功能性的分子相互作用,以消除、稳定、重定位或功能性重编程与疾病相关的靶点。[1], [2], [3], [4] 在靶向蛋白降解中,蛋白水解靶向嵌合体(PROTACs)将目标蛋白招募至E3泛素连接酶,而分子胶降解剂则稳定E3连接酶与底物蛋白之间的新界面。[5], [6] 相关模式将同样的空间逻辑扩展至经典降解之外:溶酶体靶向嵌合体(LYTACs)、自噬靶向嵌合体(AUTACs)和自噬体锚定化合物(ATTECs)将货物重定向至替代降解途径[7], [8];去泛素化酶靶向嵌合体(DUBTACs)招募去泛素化酶以稳定特定蛋白[9];磷酸化靶向嵌合体(PhosTACs)重定向磷酸酶以改变翻译后修饰状态[10];调控型诱导接近靶向嵌合体(RIPTACs)和可编程系统重编程信号通路或细胞状态决策。[11] 这些模式共同反映了从占据驱动抑制向接近赋能的蛋白命运、信号状态和细胞功能控制更广泛的转变。
对于诱导接近领域之外的研究者而言,这些模式可以被视为围绕一个共同设计问题的变体:在相关的细胞背景下,哪些靶点、效应物和诱导分子或工程化模块将形成具有功能性的作用轴?PROTACs和分子胶仍是最成熟的范例,但同一原则现已涵盖稳定、去磷酸化、转运、合成致死和可编程回路控制。因此,本综述将诱导接近视为一系列相关但并非完全相同的发现问题的家族,而非某一单一降解剂类别的延伸。这些策略的代表性机制和转化里程碑总结于表1中。
从设计角度来看,诱导接近应被视为一组相关但并非完全相同的建模问题。PROTACs需要连接臂的可及性、兼容的退出向量以及具有功能性的目标蛋白–E3三元几何构型。分子胶需要识别潜在或可诱导的新界面并预测底物谱。DUBTACs和PhosTACs需要效应物可及性、催化取向和上下文相关的功能输出。可编程接近系统进一步引入了动态逻辑控制、表达调谐和回路级行为。[5], [6], [7] 这些模式特定的约束条件解释了一个单纯的结合亲和力模型为何不够充分。具有功能性的活性依赖于分子、结构和细胞因素之间的耦合,包括界面互补性、三元复合物稳定性、赖氨酸或修饰位点的可及性、泛素化或催化能力、细胞定位、效应物丰度和通路状态。[8], [9], [10], [11] 如图1所示,人工智能赋能的诱导接近发现最好被视为一个连接数据、模型和实验反馈的闭环过程。
人工智能日益相关,因为诱导接近设计需要整合异质的化学、结构、组学和表型信息。近期的资源和模型开始支持这一转变。PROTAC-DB 2.0和PROTAC-DB 3.0提供了经策划的降解剂、连接臂和活性注释,用于模型开发和基准测试。[18], [19] 结构预测的进步,包括AlphaFold 3,正在重塑生物分子复合物的建模,但降解剂专用的评估表明,通用结构预测器在配体定位、连接臂几何构型和诱导三元界面预测方面仍面临局限。[20], [21], [22] 与此同时,基于学习的方法如DeepPROTACs、PROTAC-STAN和DeepTernary已开始解决降解预测、结构感知的活性建模和三元复合物分析。[23], [24], [25] 本综述旨在讨论人工智能如何帮助诱导接近发现从经验筛选向更系统化、可预测和实验可操作的設計转变。
在本综述中,我们使用"人工智能"指代从化学、结构、组学、表型或文本数据中学习预测、生成或决策模式的基于数据的模型。这包括机器学习、深度学习、生成模型、基础模型风格的模型以及主动学习或智能体工作流。我们将这些方法与传统分子建模、对接和分子动力学模拟区分开来,后者是基于物理或搜索的计算方法。在实践中,最强大的诱导接近工作流往往结合两类方法:对接或分子动力学模拟可提供机制假说和结构先验,而人工智能模型可从积累的实例中学习、对假说排序、生成候选分子并指导实验优先级排序。
诱导接近系统可按功能输出首先进行组织。降解模式旨在通过将靶蛋白招募至细胞降解途径来消除靶蛋白。PROTACs和分子胶降解剂仍是最成熟的范例,而溶酶体和自噬相关策略将降解概念扩展至细胞外、膜相关、细胞器或聚集相关的货物。[7], [8] 非降解模式使用同样的空间逻辑,但旨在改变功能而非去除靶点。DUBTACs通过招募去泛素化酶活性来稳定特定蛋白[9];PhosTACs重定向磷酸酶以改变磷酸化状态[10],而可编程系统使用工程化模块控制合成或细胞反应。[11] 这些模式可映射至一个涵盖筛选、设计、预测、优化和验证的共享信息学工作流,但它们在效应物机器、检测读数和设计约束上存在差异。
一个正交分类基于分子或系统架构。双功能接近剂含有由连接臂连接的两个识别元件,并受连接臂长度、拓扑结构、连接向量和诱导复合物几何构型的强烈影响。分子胶样系统通常是单价小分子,在不具有两个预连接配体的情况下稳定复合或潜在蛋白界面;其核心设计问题在于新界面识别而非连接臂优化。工程化接近系统使用蛋白、受体、抗体或合成回路,使得组分正交性、表达水平和动态响应尤为重要。[1], [6], [7], [26] 这些类别是互补而非互斥的:一种模式在输出上可以是降解性或非降解性的,同时在架构上可以是双功能的、分子胶样或工程化的。
尽管在机制上存在多样性,诱导接近模式共享若干设计瓶颈。第一个是具有功能性的界面形成。分子或工程化模块不仅要使两个组分靠近,还必须将它们以兼容于降解、稳定、催化或信号传导的几何构型组装在一起。对于降解系统,这通常需要协同的三元复合物形成、合适的赖氨酸呈现以及能够促进有效泛素转移的排列。对于非降解系统,相关的约束可能涉及催化取向、相互作用持续时间、构象选择或信号传递几何构型。[4], [5], [9], [10] 第二个瓶颈是上下文依赖性。细胞定位、效应物丰度、受体转运、通路状态、靶点表达和本地浓度都可能决定同一设计的接近事件是否产生预期效果、脱靶效果或无可测量的反应。[7], [8], [11] 第三个瓶颈是数据稀缺和偏差。与传统的配体结合问题相比,诱导接近研究仍缺乏针对三元结构、具有功能性和无功能性的组装、上下文特异性疗效、阴性对照和检测元数据的标准化数据集。[2], [3], [26] 这些瓶颈解释了为何有用的人工智能模型必须连接分子设计、结构组装、细胞上下文和实验反馈,而非仅依赖标准对接或亲和力预测。