《Protein Science》:Engineering selective amyloid precursor protein inhibitors by machine learning and deep mutational scanning
编辑推荐:
深度突变扫描(DMS)已被证明在绘制蛋白质-蛋白质相互作用方面是有效的,但它无法对突变景观提供完整的覆盖,特别是对于多突变变体。为了解决这一局限性,研究人员针对结合两种与多种人类疾病相关的丝氨酸蛋白酶(mesotrypsin与激肽释放酶-6,KLK6)的稳定化
深度突变扫描(DMS)已被证明在绘制蛋白质-蛋白质相互作用方面是有效的,但它无法对突变景观提供完整的覆盖,特别是对于多突变变体。为了解决这一局限性,研究人员针对结合两种与多种人类疾病相关的丝氨酸蛋白酶(mesotrypsin与激肽释放酶-6,KLK6)的稳定化淀粉样前体蛋白抑制剂(APPI),在先前生成的DMS数据上训练了机器学习(ML)模型。研究人员结合这些模型,准确预测了APPI变体(包括双突变变体)对这两种丝氨酸蛋白酶的结合选择性。在预测的对数2选择性富集比率与DMS衍生的数值之间,研究人员达到了0.937的皮尔逊相关系数。研究人员进一步通过酵母表面展示测量与纯化APPI变体的抑制实验验证了组合模型的预测,并揭示了塑造蛋白酶选择性的上位相互作用。在结合选择性预测的指导下,研究人员鉴定出了高选择性的APPI变体,其中包括迄今为止报道的最具选择性的mesotrypsin抑制剂。总之,这些发现支持将DMS与ML作为一种预测PPI选择性并优先选择具有治疗潜力的蛋白质变体的框架。
蛋白质-蛋白质相互作用在调控众多细胞过程中扮演着核心角色,但在靶向拥有多个结构相似底物的蛋白质时,缺乏特异性的非特异性相互作用常导致严重的脱靶毒性。由于同源靶标蛋白间结构与化学性质高度相似,通过突变操作改变相互作用界面的残基以提升结合选择性面临着巨大挑战。特别是当涉及多个位置的突变时,突变间产生非加性效应的上位相互作用会极大干扰亲和力与选择性的预测。此外,尽管DMS技术已被广泛应用于探查突变对蛋白质功能的影响,但因搜索空间随突变残基位置数量呈指数级增长,DMS对多变体空间的覆盖极其有限;同时,传统的有监督机器学习方法在捕捉非加性效应及应对多靶标选择性的预测上仍存在瓶颈。
为克服上述挑战,研究团队以人Kunitz型丝氨酸蛋白酶抑制剂——淀粉样前体蛋白抑制剂与两种同源丝氨酸蛋白酶(mesotrypsin与KLK6)的结合为研究模型。由于野生型APPI(APPIWT)极易被mesotrypsin切割,研究人员选取了具有更高切割抗性的稳定变体APPI-3M(APPIM17G,I18F,F34V)作为支架。研究团队在前期产生的APPI-3M单突变体DMS数据集基础上训练了机器学习模型,旨在预测双突变变体对mesotrypsin和KLK6的结合选择性,并揭示了上位相互作用。最终研究人员鉴定出两种前所未有的高选择性抑制剂,其中APPI T11K,P13I对mesotrypsin的选择性相较于APPIWT提升了2254倍,是目前文献报道的最高选择性mesotrypsin抑制剂。该研究有效填补了大规模突变数据覆盖不全的缺陷,为设计高亲和力且具特异性的治疗性蛋白质变体提供了坚实的计算与实验整合框架,相关成果发表在《Protein Science》期刊上。
在关键技术方法上,研究团队首先基于高通量测序(HTS)处理了先前通过流式细胞荧光分选技术(FACS)获得的DMS原始数据,计算了各变体对两种蛋白酶的富集比率(ER)与选择性比对数2值。在模型构建上,研究人员以独热编码为输入,构建了由一维卷积层、池化层及全连接层组成的卷积神经网络(CNN)集成模型,并在训练中采用对数2转化读数作为样本权重。随后,通过酵母表面展示技术对模型预测的变体进行竞争性结合的快速初筛,最后利用纯化后的可溶性蛋白进行体外抑制实验测定抑制常数,以对模型在中度与极端选择性预测上的性能进行严谨验证。
**训练与评估机器学习模型以预测APPI-3M变体的选择性**
研究人员开发了基于CNN的机器学习模型来预测给定变体的对数2选择性富集比率。性能测试显示,针对mesotrypsin与KLK6的预测模型在留出测试集上分别达到了0.783和0.946的皮尔逊相关系数。通过将两个独立模型的预测值相减,构建的模型在预测双突变变体选择性上取得了高达0.937的皮尔逊相关系数,显著优于多任务学习框架的表现。留一位置评估也证明该模型对未观测突变具有一定的泛化能力。
**测序深度与样本加权对机器学习模型性能的影响**
通过计算机重采样模拟不同测序深度,研究发现预测性能随数据量增大而提升,KLK6的预测在低采样水平下依然保持高鲁棒性。在训练方案中,未加权与对数2加权模型表现相似,但使用原始读数作为权重会过度强调高覆盖度变体,导致性能显著下降。这表明在对样本进行加权时,对数转化是防止极端权重效应的重要手段。
**鉴定影响APPI对mesotrypsin与KLK6选择性的残基位置**
研究揭示了突变残基位点在选择性上的上位效应贡献。12和17位点的组合突变产生了高强度的正向上位性,而13与11位点(作为mesotrypsin的“冷点”残基)的组合则呈现显著的负向上位性。此外,13位点的突变持续增强对mesotrypsin的选择性,而17位点的突变则促进对KLK6的结合偏好,充当了定向转移靶标选择性的“开关”残基。
**候选变体的选择与实验验证**
基于模型预测的高选择性及显著的上位效应,研究团队挑选了42个单、双突变变体进行后续验证。在双突变体中,17个被赋予了高置信度预测,确保后续筛选的可靠性。
**通过YSD筛选进行实验验证**
通过YSD高通量初步筛选,预测的对数2选择性ER值与YSD实验测得的选择性指数呈现出0.755的良好皮尔逊相关性。模型不仅准确预测了DMS数据中已观测到的变体,对未在原库中出现的新双突变变体也展现了良好的泛化预测能力,虽在中等选择性区间的预测上略有偏差,但对上位效应变化的趋势实现了8/10的准确重现。
**通过抑制实验进行实验验证**
在对纯化可溶性蛋白进行抑制常数测定后,YSD测得的选择性指数与抑制实验结果高度一致,相关性达0.8728。验证发现了对mesotrypsin具有高度选择性且未被DMS覆盖的双突变变体APPI T11K,P13I,其对mesotrypsin的Ki值低至1.8 nM,较KLK6的亲和力高出3832倍;变体APPIG17Y,F18K则表现出对KLK6的显著抑制选择性,增幅达12.1倍。
**讨论**
本研究成功构建并验证了一套结合深度突变扫描与机器学习的整合方法论,有效应对了在结构高度相似的同源蛋白酶靶标间预测多突变变体选择性的难题。该研究不仅量化了非加性的上位相互作用在靶标选择性决定中所起的关键作用,还精准锁定了主导靶标特异性转换的关键残基位置。尽管模型在中等选择性变体的预测精度上仍有提升空间,且当前实验主要聚焦于双突变变体与双靶点系统,但该研究显著降低了治疗性蛋白质工程对繁琐实验筛选的依赖。未来,通过引入图神经网络与大型蛋白质语言模型以整合更高维度的突变数据,并结合细胞与体内验证,该框架将有望拓展至更广泛的蛋白酶及抗体药物家族,加速高特异性创新生物药的发现进程。