《New Biotechnology》:Lycopene pathway rewiring by combinatorial co-expression of constituent enzymes in a cell-free protein synthesis system
编辑推荐:
研究人员建立了一个平台,利用粗提物大肠杆菌(Escherichia coli)无细胞蛋白质合成(cell-free protein synthesis, CFPS)系统,通过5种组成酶的组合共表达来重建番茄红素途径。DNA模板以模块化形式制备,其浓度被用作调控
研究人员建立了一个平台,利用粗提物大肠杆菌(Escherichia coli)无细胞蛋白质合成(cell-free protein synthesis, CFPS)系统,通过5种组成酶的组合共表达来重建番茄红素途径。DNA模板以模块化形式制备,其浓度被用作调控表达水平的定量输入。来自混合模板的共表达可直接在体外重建具有功能的番茄红素途径,并替代传统上对分别表达酶进行混合搭配(mix-and-match)的方法。借助基于孔板的比色分析(colorimetric assay),研究显示番茄红素产量对酶的身份以及模板剂量均高度敏感,这反映了资源竞争、裂解液中的内源性活性以及蛋白质可溶性等因素的影响。单因素逐次分析(one-factor-at-a-time)与同源酶替换(homolog-swap)实验揭示了基本设计规则,但同时也强调,与可能存在的共表达设计空间相比,这些结果覆盖范围有限且存在偏倚。为更高效地探索这一空间,研究人员将CFPS实验与一种混合主动学习(hybrid active learning, HAL)工作流程相结合;该流程依据模型引导标准对候选DNA组合进行排序。HAL引导的多轮实验提示了高性能、甚至更为简化的番茄红素途径构型,表明CFPS共表达结合HAL可作为一种实用平台,在将代谢通路重构入细胞之前,对其进行设计与优化。
该研究发表于《New Biotechnology》,围绕合成生物学中代谢通路“解构—重构”的核心命题,提出了一种以粗提物大肠杆菌无细胞蛋白质合成(cell-free protein synthesis, CFPS)为底盘、以模块化DNA模板为输入、以机器学习辅助设计为驱动的番茄红素通路原型构建框架。代谢工程实践通常依赖“设计—构建—测试—学习”(design-build-test-learn, DBTL)循环,但在多酶通路优化中,传统策略多采用分别表达酶后再进行混合搭配,这种方式虽然便于操作,却难以反映真实共表达状态下的资源竞争、表达串扰、蛋白可溶性差异及宿主裂解液内源代谢活性等复杂约束。因此,如何在较低实验负担下,更真实地表征多基因共表达对通路性能的影响,并从庞大的组合空间中筛选出优良设计,成为代谢通路快速原型开发的关键问题。
研究人员据此选择番茄红素生物合成途径作为概念验证对象。该途径从异戊烯基焦磷酸(IPP)出发,涉及5种关键酶:异戊烯基焦磷酸:二甲基烯丙基焦磷酸异构酶(Idi)、法呢基焦磷酸合酶(IspA)、牻牛儿基牻牛儿基焦磷酸合酶(geranylgeranyl pyrophosphate synthase, GGPPS;CrtE)、八氢番茄红素合酶(phytoene synthase, PSY;CrtB)以及八氢番茄红素脱氢酶(phytoene desaturase, PDS;CrtI)。研究的核心思想是,不再使用预先单独制备的酶,而是通过在同一CFPS体系中混合不同DNA模板,并以模板浓度作为表达量调控手柄,实现多酶通路的体外直接共表达与重建。结果表明,这一策略不仅能够成功构建功能性番茄红素通路,而且能够揭示通路输出对酶同源体选择和表达剂量的高度依赖性;在此基础上,引入混合主动学习(HAL)后,研究人员进一步提高了模型在偏倚小样本条件下对设计空间的探索效率,筛得高性能乃至可简化的通路构型,显示出该框架在细胞重构前进行方案预筛选的实用价值。
方法概括:研究人员构建了由启动子、核糖体结合位点(RBS)、目标基因和终止子组成的模块化线性DNA模板,并在粗提物大肠杆菌CFPS体系中实现5种通路酶的组合共表达;通过Western blot评估表达与可溶性,通过比色法建立番茄红素相对产量读出,并以萃取-分光光度法及高效液相色谱(HPLC)验证产物;在设计空间探索中,结合XGBoost集成模型、超参数随机搜索、SHAP解释分析和混合主动学习(HAL)进行迭代式实验推荐与模型更新。验证数据来源包括已发表的丁醇、柠檬烯无细胞通路数据集以及本研究自建番茄红素数据集。
在结果部分,论文首先在“3.1. Using DNA templates as inputs to DESIGN and BUILD cell-free lycopene pathways”中说明,研究人员将DNA模板浓度确立为可量化的输入变量。模板采用模块化设计,固定使用野生型T7启动子和BCD2,以减少构建负担,而通过改变模板剂量来调控表达强度。以超折叠绿色荧光蛋白(sfGFP)为测试对象,研究人员证明PCR扩增模板在CFPS中的输入浓度与蛋白表达量存在明确关系:0.5 nM模板已接近终点产量饱和,而1 nM则进一步提高初始表达速率。基于此,研究确定了0、0.1、0.25、0.5和1 nM五个离散DNA输入水平,分别代表无、低、中、高和很高表达。将同样策略应用于Pa_CrtE、Pa_CrtB和Pa_CrtI后,也观察到表达强度随模板剂量变化而定性响应,从而为后续通路共表达实验提供了标准化输入框架。
在“3.2. Relative quantification of lycopene using colorimetry to TEST pathway performance”中,研究人员验证了混合DNA模板共表达足以在体外装配功能性多酶通路。将Pa_crtE、Pa_crtB和Pa_crtI在单一CFPS反应中共表达,并补加IPP与FPP作为底物后,反应体系出现橙红色,而无DNA对照保持FAD导致的黄色。萃取后吸收光谱与HPLC保留时间均证实产物为番茄红素。考虑到传统萃取定量步骤繁琐且不适于较大规模筛选,研究人员引入基于L*a*b*颜色空间中“a”值的比色法,作为番茄红素相对产量代理指标。尽管绝对a值受脂质体、CFPS组分批次、环境光和操作差异影响较大,但通过将无DNA对照设为0、标准通路组合Sl_idi、Ec_ispA、Pa_crtE、Pa_crtB、Pa_crtI各0.25 nM设为1,建立了跨实验板和跨日期可比较的相对番茄红素尺度。这一尺度与实际滴度呈正相关,因此可作为中等通量兼容的测试输出。
在“3.3. DESIGN-BUILD-TEST of lycopene pathway can be realized using cell-free co-expression of pathway enzymes”中,研究人员系统考察了单个酶身份及其剂量对通路输出的影响。首先采用单因素逐次设计,在标准组合基础上分别扰动idi、ispA、crtE、crtB和crtI之一,并在同时补加IPP和FPP条件下测试5个剂量水平。结果显示,缺失crtE、crtB或crtI时无法检测到产物,证明下游3酶对通路功能绝对必需;而省略idi或ispA时通路仍有活性,这与外源底物已含IPP和FPP相符。进一步地,提高ispA模板剂量反而降低了通路性能,提示过表达可能导致转录—翻译资源浪费或IPP:FPP失衡。crtE和crtI则表现出剂量最适区间,说明不足和过量表达均可能不利。随后,在仅补加IPP时,idi、crtB和crtI变为必需,而ispA或crtE即使省略也不完全消除活性,这提示CFPS裂解液中可能保留内源IspA活性,且系统中可能存在微弱GGPP生成能力。论文结合既往文献指出,Ec_IspA的底物广谱性或可解释无外源CrtE时仍出现痕量红色类胡萝卜素现象。跨同源酶比较进一步显示,较优组合往往包含在CFPS中可溶性更高的酶,而表现差的At_Idi、Kp_CrtE、Sh_CrtE和Ss_CrtI则多为不溶或表达偏弱;La_CrtI虽在高剂量下可溶性较差,但在低输入时仍可支持较高产量,说明同源体选择与表达剂量调优必须结合考虑。该部分结果建立了若干定性规则,但也揭示单因素策略仅覆盖极小一部分组合空间,且数据偏向特定同源体和剂量模式。
在“3.4. To LEARN from structured experimental design: development of a hybrid active learning (HAL) strategy”中,研究人员针对上述设计空间爆炸和样本偏倚问题,开发了混合主动学习(HAL)策略。论文首先指出,已有METIS等基于不确定性的主动学习框架在该番茄红素R0数据集上的表现有限,即使经过5轮新增实验,保留测试集上的R
2仍仅约0.21,难以有效克服训练数据稀疏与偏倚。为此,研究人员将两类查询逻辑结合:一类是基于距离的多样性采样,优先选择远离既有标注点的实验条件,以扩展设计空间覆盖;另一类是基于预测方差的不确定性采样,优先测试模型最不确定的区域,以提升代理模型精度。HAL通过动态α/β加权,在早期更重视多样性,后期逐渐提高不确定性权重,从而在探索与利用之间取得平衡。通过在已发表的丁醇、柠檬烯无细胞数据集以及本研究R0番茄红素数据集上进行80/20多次随机划分基准测试,HAL均比随机采样、贪婪采样(GS)和METIS更快达到收敛的R
2和平均绝对误差(MAE)。当HAL应用于番茄红素系统后,经过R1-R5迭代,模型性能提升至R
2约0.64、MAE约0.28,且模型集成内部的单模型表现逐步趋稳。尽管研究人员明确指出,在巨大组合空间仍严重欠采样的情况下,这并不意味着模型可精确预测所有输入组合,但足以形成一个粗粒度代理模型,用于定位有前景的设计区域。SHAP(SHapley Additive exPlanations)分析显示,Si_crtB、At_idi和Sh_crtE对预测有负向贡献,Hp_crtE和crtB模板浓度调节则为正向特征,其中前者与实验中较高可溶性和较好产量表现一致。
在“3.5. Applying HAL-trained models to RE-DESIGN of cell-free lycopene pathways”中,研究人员展示了HAL训练模型在逆向设计中的应用价值。研究将观测到的最高番茄红素产量归一化为100%,再划分为六个目标输出区间,从每个区间随机选取5种由模型预测得到的输入组合并进行三重复实验。结果显示,中高产量区间(40–90%)的预测与实测总体较为吻合,而低产和极高产区间误差较大,预测值与实测值的Pearson相关系数为0.65。值得注意的是,逆向设计面板中的combination 25被预测将明显优于依据直觉拼装的“最佳同类”组合,且实验证实前者经萃取测得番茄红素滴度约为0.82 mg/L,较后者0.61 mg/L提高约30%。研究人员进一步围绕combination 25开展局部搜索,在保持酶身份不变的前提下调整模板剂量,模型与实验均显示,仅最低总体剂量0.1 nM时性能显著下降。基于前述IspA可能可省略的观察,研究人员又去除combination 25中的ispA模板,结果通路性能基本保持。随后通过改变底物供给条件,研究表明在300 μM IPP条件下体系整体偏底物限制,提高至600 μM IPP可普遍提升产量;同时,对比固定150 μM IPP和150 μM FPP的条件发现,部分组合在绕过FPP生成模块后产量反而上升,提示上游Idi/IspA模块效率在某些样本中相对受限。总体而言,这部分结果支持一个核心结论:番茄红素通路优化关键在于平衡FPP生成与消耗,而非简单地提升所有酶的表达量。
讨论部分集中强调了该框架的现实意义与局限。其意义在于,CFPS开放体系使得DNA模板加入与组合极为便捷,而通过将模板浓度视作输入变量、将比色番茄红素读出视作输出变量,研究人员实际上将多酶通路原型设计抽象为一个可计算的输入—输出映射问题。HAL的引入则在实验吞吐量受限时提高了数据利用效率,使偏倚小样本条件下的通路搜索和逆向设计成为可能,并有助于在投入更高成本进行细胞内重构之前,先完成风险降低和方案优先级排序。与此同时,论文也指出若要将HAL引导得到的通路稳定迁移至细胞底盘或人工细胞系统,尚需解决若干问题:其一,本研究未直接定量IPP或各中间代谢物池,因此对于最佳组合中模板剂量变化影响有限、去除IspA后仍保持较高产量等现象,仍需结合前体供应窗口与通路资源约束进一步解释;其二,CFPS中通过模板浓度实现的表达调控,并不能直接映射到细胞内环境,后续体内重构仍需通过启动子、RBS和质粒拷贝数等变量进行系统化衔接验证。尽管如此,本文提出的CFPS-HAL框架已为代谢通路组合共表达优化提供了具有普适性的前期设计平台。
研究结论部分可译为:本研究建立了一个基于粗提物大肠杆菌CFPS的平台,可利用模块化DNA模板作为定量输入,对构成番茄红素通路的5种酶进行组合共表达。通过标定模板浓度与表达量关系,并采用比色分析作为相对输出指标,研究表明通路性能对各模板的身份与剂量均高度敏感,这种敏感性反映了资源竞争、裂解液中的内源酶活性以及表达酶可溶性的约束,而这些因素是传统分别制备酶后再混合搭配的方法无法捕捉的。以此方式,DNA模板浓度成为简单的过程变量,比色番茄红素读出成为兼容中等通量的输出,使得CFPS平台上的通路原型设计可被视为输入—输出映射问题。结构化单因素设计揭示了若干关键定性规则,但也暴露出实验设计相对于庞大共表达空间的偏倚。为解决这一问题,研究人员开发了结合距离型与不确定性型查询策略的HAL工作流程,可从带偏倚的标注数据出发更高效地探索巨大的组合空间。HAL在丁醇、柠檬烯和番茄红素数据集上均显示出优于单一策略的代理模型收敛性能;应用于番茄红素系统时,HAL逐轮提升了代理模型精度,并提出了相对滴度提升超过2倍的新共表达条件,同时还支持针对目标输出区间的近似逆向查询。总体而言,CFPS组合共表达与HAL引导DBTL循环的耦合,为通路同源酶及表达水平组合景观的导航提供了一种数据高效且便于实施的策略;尽管在代谢中间体定量和向细胞体系转化方面仍有限制,该框架仍可在进入劳动密集型细胞工程和工艺放大前,作为优先筛选和降低风险的通用途径设计平台。