无序列信息依赖性景观推断用于定向进化

《PLOS Computational Biology》:Sequence-free landscape inference for directed evolution

【字体: 时间:2026年09月04日 来源:PLOS Computational Biology 3.7

编辑推荐:

  摘要 定向进化是一种工程化生物系统或组分(如蛋白质)的方法,其中期望性状通过迭代的诱变和适应变异体选择循环得以优化。蛋白质定向进化过程可视为在高维优化景观(具有众多局部最大值)上的导航。任何策略在此类景观中导航的性能取决于该景观的崎岖度。然而,这一信息在实验

  
摘要

定向进化是一种工程化生物系统或组分(如蛋白质)的方法,其中期望性状通过迭代的诱变和适应变异体选择循环得以优化。蛋白质定向进化过程可视为在高维优化景观(具有众多局部最大值)上的导航。任何策略在此类景观中导航的性能取决于该景观的崎岖度。然而,这一信息在实验开始时通常是不可获得的。在此,我们提出SLIDE(Sequence-free Landscape Inference for Directed Evolution,无序列信息依赖性景观推断用于定向进化),由两部分组成。首先,SLIDE仅利用群体水平表型数据和突变率估计值,即可从突变群体中估计景观崎岖度。此类崎岖度信息本身在蛋白质设计中具有重要价值,例如用于预测进化稳定性。其次,SLIDE提供了一个框架,用于利用估计的崎岖度指标识别高性能的定向进化选择策略。利用理论NK景观和四个经验蛋白质适应度景观,研究团队展示了在计算机模拟中相较于固定参数策略的一致性能改进,该流程还可与新兴的基于人工智能的定向进化驱动方法相结合。

作者总结

定向进化(Directed Evolution, DE)在高维蛋白质适应度景观中导航以寻找改进的变异体,但任何策略的成功取决于景观的崎岖度,而该信息通常是未知的,且往往需要基因测序来推导。研究人员提出了无序列信息依赖性景观推断用于定向进化(SLIDE),这是一个两步框架:(i)从群体水平表型衰减曲线结合突变率估计值估计景观崎岖度,以及(ii)利用该崎岖度估计值选择能更好平衡探索与利用的DE控制参数。与现有崎岖度指标相比,SLIDE依赖频谱分析,将随机无偏突变下平均适应度的指数衰减速率与景观的主导频率含量相关联。该衰减速率与底层基因型图的归一化狄利克雷能量相关,且该框架可自然扩展至有偏突变谱。在均匀景观(如NK景观)上,崎岖度可以从单一起始基因型准确估计。异质经验景观则需要采样多个起始点,自然区分局部与全局崎岖度估计。研究团队将SLIDE与先前工作中开发的DE策略相结合,但该方法与策略无关,可搭配任何DE工作流程,包括新兴的人工智能驱动工作流程。计算机模拟测试表明,SLIDE能可靠恢复景观崎岖度,并在不同崎岖度的景观上比固定参数方法更有效地选择定向进化策略。尽管异质景观需要从多个起始点测量适应度衰减,但这些测量可利用高通量诱变方法(如易错PCR或化学诱变)并行生成,从而避免了对大规模测序或组合完备的基因型-表型图谱的需求,同时保持对大规模筛选的可扩展性。除DE外,该方法还可快速表征遗传电路、酶文库和生态模型中出现的景观,为量化遗传稳定性和指导实验或计算搜索提供途径。
基于频谱景观理论的崎岖度推断与定向进化策略优化——SLIDE框架的计算机模拟验证

一、研究背景与问题

适应度景观将DNA或氨基酸序列映射至适应度度量,如酶活性、细胞生长、结合亲和力或稳定性。景观的崎岖度、上位性、中立性和可导航性等结构性质对进化和稳定性具有重要影响。在蛋白质工程中,定向进化是通过迭代的诱变和选择循环来优化蛋白质等生物组件的关键方法,可视为在高维适应度景观上进行导航的过程。然而,任何定向进化策略的性能高度依赖于景观的崎岖度,而这一信息在实验启动时通常不可获得。现有的崎岖度度量方法大多需要组合完备的基因型-表型图谱,这在实验上往往不可行。因此,开发一种无需大规模测序数据即可有效估计景观崎岖度的方法,并利用该信息优化定向进化策略,具有重要的理论和应用价值。

二、研究目标与意义

本研究旨在开发一种无需序列信息即可推断适应度景观崎岖度的方法,并将其与定向进化策略优化相结合。该研究的意义在于:(1)提供一种实验上可行且可扩展的崎岖度估计方法,仅需群体水平表型数据和突变率估计;(2)利用估计的崎岖度自适应地选择定向进化策略参数,从而在固定代数内更有效地搜索高适应度变异体;(3)该方法与策略无关,可集成至现有及新兴的定向进化工作流程中,包括人工智能驱动的方法。相关成果发表于《PLOS Computational Biology》。

三、主要技术方法概述

研究团队基于频谱景观理论,利用图傅里叶变换将适应度景观分解为不同频率的组分。核心方法包括:(1)理论推导:将平均适应度在随机突变下的指数衰减速率与景观的归一化狄利克雷能量相关联,定义新的崎岖度指标(λ?和λ?);(2)计算机模拟验证:在NK模型理论景观和四个组合完备的经验蛋白质适应度景观(GB1、ParD3、TrpB、TEV)上进行验证;(3)统计估计:采用非线性优化方法(scipy.optimize.curve_fit)从含噪适应度衰减曲线中估计衰减速率参数;(4)策略优化:利用预先计算的NK景观查找表,根据估计的崎岖度选择最优的base chance和群体分裂参数。样本队列来源包括文献中已发表的组合完备经验适应度景观数据。

四、研究结果

4.1 从适应度衰减速率推断景观崎岖度

研究团队从理论上证明了平均群体适应度在随机突变下衰减的指数速率可以作为景观崎岖度的度量。该衰减速率与基于图傅里叶变换的频谱质心密切相关,并等价于基因型图的归一化狄利克雷能量。在NK景观上,拟合的衰减速率与解析崎岖度值高度相关,且估计对突变率、群体大小和起始点数量在一定范围内具有鲁棒性。通过对NK景观参数网格的系统分析,研究团队确认了局部估计(从单一起始基因型获得)和全局估计(从多个起始基因型平均获得)在均匀景观上的一致性。

4.2 经验景观上的崎岖度推断

在四个经验蛋白质适应度景观上,频谱分析揭示了这些景观相较于NK景观具有更强的异质性。对于此类景观,全局崎岖度估计需要采样多个起始点。随着起始点数量增加,拟合的衰减速率从局部估计值收敛至全局估计值。群体大小和采样代数对估计的影响相对较小。与其他现有崎岖度指标(如粗糙度-斜率比、景观R2、谱熵、到局部最大值的距离、到全局最大值的路径数、局部上位性)的比较表明,新指标在经验景观上的排序与多数指标一致,且具有无需测序数据的独特优势。此外,在有偏突变谱下,该框架仍能提供稳健的崎岖度估计;在引入最小适应度区域、中立脊和模块化结构等景观扰动时,该指标能系统性地响应这些结构变化。

4.3 利用SLIDE优化定向进化结果

研究团队将SLIDE与先前开发的策略框架(包含base chance和群体分裂两个参数)相结合,生成了以崎岖度索引的NK查找表。在该查找表中,平滑景观对应的最优策略接近纯开发策略(基线策略),而崎岖景观则偏好更高的探索性参数。将SLIDE应用于NK景观模拟,在崎岖景观上实现了比基线策略高约58%的适应度提升,且能选择策略空间中的最优策略。在经验景观上,SLIDE在GB1、TrpB和TEV景观上分别实现了24.9%(p<0.001)、22.6%(p<0.01)和44.2%(p<0.001)的相对适应度增益,而基线策略往往陷入局部最优。在ParD3景观上,基线策略已接近最优,SLIDE选择了等效参数。

五、讨论与结论

讨论部分指出,SLIDE的衰减速率估计在无选择压力条件下,将平均适应度衰减近似为指数曲线,其拟合衰减速率λ??近似解析的基因型依赖性指标λ?,而平方适应度衰减速率λ??则近似基因型无关指标λ?,后者与图拉普拉斯的归一化狄利克雷能量相关。在有偏突变谱下,该指标对应于有效突变算子而非未加权Hamming图。在实际应用方面,SLIDE的主要实验要求是建立无选择压力、突变率跨代近似恒定的诱变方案,例如随机体外诱变配合荧光表型读数,可在微流控mother-machine系统中实现。局限性包括:当前框架主要考虑与宿主或变异体生长解耦的适应度测量、更一般突变算子(如不可约图)的处理、突变-选择-景观结构的联合效应尚未系统研究,以及所有验证均为计算机模拟,缺乏大尺度实验验证。研究结论部分的核心内容为:SLIDE提供了一种利用平均表型数据和突变率估计来估计蛋白质适应度景观崎岖度的新方法。这些崎岖度估计可为定向进化中的实验策略提供参考,帮助定制适应底层景观结构的实验方案。除定向进化外,SLIDE的崎岖度指标还可扩展至合成生物电路等更复杂景观的表征,为设计具有更高遗传稳定性和功能稳健性的电路提供定量基础。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号