《New Biotechnology》:Global structure and determinants of transcriptomic adaptation in CHO cells
编辑推荐:
摘要翻译:中国仓鼠卵巢(CHO)细胞主导着生物制药领域,占哺乳动物系统生产的所有生物制剂的89%。其广泛应用源于良好的生长特性、强大的翻译后修饰机制、监管接受度以及适应多样化生物工艺条件的能力。后者归功于CHO细胞显著的可塑性,这种可塑性由固有的基因组不稳定性
摘要翻译:中国仓鼠卵巢(CHO)细胞主导着生物制药领域,占哺乳动物系统生产的所有生物制剂的89%。其广泛应用源于良好的生长特性、强大的翻译后修饰机制、监管接受度以及适应多样化生物工艺条件的能力。后者归功于CHO细胞显著的可塑性,这种可塑性由固有的基因组不稳定性和表观遗传流动性驱动,使这些细胞能够在选择性压力下发生快速表型转变。然而,这种能力也导致细胞性能的变异性,表现为生产力、产品质量属性、应激反应和长期稳定性的差异。因此,理解这种变异性的分子基础对于合理的细胞系开发、过程控制和稳健生产策略的设计至关重要。组学技术使人们对塑造这些表型的细胞内机制有了前所未有的认识,并已成为推进这一理解不可或缺的工具。
使用微阵列或RNA测序(RNA-seq)技术的转录组分析揭示了CHO细胞中支撑细胞表型和特定环境条件的基因表达状态。这些方法通常用于比较具有不同生长和生产特性、生产者与宿主细胞、对温度下调或乳酸代谢干预的响应等差异的细胞。尽管此类研究在特定对比中提供了对转录组适应的必要认识,但将这些发现推广到CHO转录组组织的更广阔视野仍然具有挑战性。此外,跨谱系的基因组和表观遗传不稳定性及其对基因表达的最终影响可能限制研究结果在不同研究和细胞系之间的可转移性。
先前的工作已证明,表达的CHO转录组包含超过9500个在所有细胞系中普遍表达的基因。这一观察表明,表型多样性主要源于基因表达水平的组合差异,而非基因的二元激活或沉默。这些发现强调了新兴基因工程工具的潜力,这些工具能够实现对转录活性的精确调控。即使有了这些工具,基因表达变异性的决定因素仍然知之甚少。特别是,近端和远端调控特征、染色质状态和表观遗传修饰如何塑造CHO细胞间的转录变异性在很大程度上尚不清楚。同样,使转录组适应不断变化培养条件的机制或驱动表型不同亚克隆间差异的机制仍未得到完全表征。
在此,我们通过定义大量多样化CHO转录组集合中基因表达动态的全局图景来弥补这一空白。通过整合多个数据集和实验的基于方差的指标,我们确定了跨越细胞系和培养条件的转录组适应的共同轴。我们通过功能富集分析、与持家基因和必需基因集的比较,以及与不同变异性类别相关的调控特征的表征来情境化这一轴。此外,数据集水平分析揭示了与共享实验设计相关的常见转录组特征。总之,这项工作为理解CHO细胞中的转录组稳健性和可塑性提供了一个系统级框架,并为细胞系工程和生物工艺优化提供了潜在见解。
论文解读:
**一、研究背景与科学问题**
中国仓鼠卵巢(CHO)细胞是生物制药行业最重要的表达系统,约占哺乳动物系统生产的生物制剂的89%。CHO细胞的广泛应用源于其良好的生长特性、强大的翻译后修饰机制、监管接受度以及适应多样化生物工艺条件的能力。这种适应能力源于CHO细胞固有的基因组不稳定性和表观遗传流动性,使其能够在选择性压力下发生快速表型转变。然而,这种可塑性也导致细胞性能的变异性,表现为生产力、产品质量属性、应激反应和长期稳定性的差异。理解这种变异性的分子基础对于合理的细胞系开发、过程控制和稳健生产策略的设计至关重要。
尽管已有大量转录组学研究比较了不同生长、生产力、温度响应或代谢干预条件下的CHO细胞基因表达状态,但将这些研究结果推广到CHO转录组组织的全局视图仍然面临挑战。基因组和表观遗传的不稳定性跨谱系存在,且其最终对基因表达的影响可能限制研究结果的可转移性。先前研究显示,CHO表达的转录组包含超过9500个在所有细胞系中普遍表达的基因,这表明表型多样性主要源于基因表达水平的组合差异,而非基因的二元激活或沉默。然而,基因表达变异性的决定因素,特别是近端和远端调控特征、染色质状态和表观遗传修饰如何塑造转录变异性,仍然知之甚少。因此,研究人员开展了这项系统性的元分析研究,旨在定义CHO细胞转录组适应的全局结构及其决定因素。
**二、研究内容概述**
研究人员整合了来自20项独立研究的22个RNA-seq数据集,共计645个RNA-seq样本,涵盖了CHO-K1和CHO-S两种主要谱系、重组蛋白生产细胞和宿主细胞,以及多种培养条件和实验设计。通过统一的生物信息学流程处理原始测序数据,计算每个数据集中每个基因的表达标准差(SD)作为转录变异性的度量,并基于Spearman相关系数和主成分分析(PCA)建立了跨数据集的全局基因变异性排名。该排名被划分为十个等大小的十分位数(decile),用于下游功能富集分析、已知基因集评估、启动子结构分析、转录因子基序富集分析以及染色质状态分析。论文发表在《New Biotechnology》。
主要关键技术方法包括:使用nf-core fetchngs v1.12.0获取FASTQ文件,基于Nextflow v25.04.4流程处理不同测序技术(单端/双端、链特异性/非链特异性)的数据,利用STAR v2.11.1b比对到PICRH中国仓鼠基因组(GCF_003668045.3,NCBI注释版本104),使用RSEM v1.3.1进行定量;使用DESeq2 v1.46.0的median-of-ratios方法归一化并执行方差稳定变换(VST),计算每个基因在每个数据集中的SD;对基因SD的相关矩阵进行主成分分析,以PC1投影生成全局变异性排名;采用leave-one-out策略评估排名的稳健性;使用clusterProfiler v4.14.6进行基因集富集分析(GSEA),富集GO slim、secRecon本体和KEGG通路;使用FIMO v5.5.9和HOMER v5.1进行基序富集分析;基于已发表的ChromHMM染色质状态数据(由六种组蛋白H3修饰的ChIP-seq定义)计算各变异十分位数的染色质状态覆盖度。样本队列来源包括已发表的RNA-seq原始数据,来自PRJNA739051、PRJNA489076、PRJEB39258、PRJNA311594、PRJNA604220、PRJNA66258、PRJNA93815、PRJEB33024、PRJNA393479、PRJEB55916、PRJNA1130622、PRJNA59305、PRJEB37009、PRJEB38542、PRJNA746067、PRJNA304606等数据库项目,以及部分未发表或手稿准备中的数据。
**三、主要研究结果**
**3.1 数据集描述与转录组适应性的定义**:研究人员纳入了22个RNA-seq数据集,经质量控制后保留638个高质量样本。每个数据集的基因表达SD分布因技术差异而不同,但基因间SD的Spearman相关均为正值(范围0.05–0.58,均值0.24)。PC1解释了总方差的27.8%,基于PC1的全局变异性排名与各数据集内的排名高度一致。Leave-one-out分析显示排名高度稳健(所有ρ>0.99),对实验因素的排除也高度稳健(所有ρ>0.95)。与基于LOESS残差的方法高度相关(Spearman ρ=0.99),而与基于Shannon熵的方法相关性较弱(ρ=0.69),且熵方法将低表达基因不合理地排在前面,因此后续使用SD方法。
**3.2 与转录组适应相关的功能特征**:GSEA显示,142个GO slim术语中62个显著富集,其中45个富集于高变异基因(如细胞黏附、受体配体活性、有丝分裂细胞周期),17个富集于低变异基因(如mRNA代谢过程、线粒体组织、内体)。secRecon本体中19/73个术语显著富集,高变异基因富集于PERK通路和蛋白折叠(表明未折叠蛋白反应(UPR)机制),以及凋亡相关基因;低变异基因富集于内吞、外泌体生物学和细胞内蛋白运输。KEGG分析显示86条通路富集于高变异基因、仅8条富集于低变异基因,结果与GO和secRecon一致。
**3.3 持家基因和必需基因的转录组适应**:Gini系数定义的持家基因(2084个)强烈偏向低变异性(偏度=?0.659),第十个十分位包含423个持家基因(占该十分位基因的42.6%,占所有持家基因的22.8%),而第一个十分位仅14个。这些最稳定持家基因富集于高尔基体相关的细胞内囊泡介导运输、剪接体功能和蛋白分解代谢。qPCR参考基因中,Prkar1a、Gnb1和Mmadhc表现出极低表达变异性,而Gapdh位列高变异基因。必需基因(2025个)也偏向低变异性(偏度=?0.15),但其中97个必需基因位于第一十分位,主要富集于细胞周期、染色体组织和核苷酸代谢。
**3.4 与表达变异性相关的启动子结构和基因特征**:高变异基因中有60个TSS区域检测到TATA盒基序,而低变异基因中仅7个;TATA盒在高变异基因中富集于TSS上游约30 bp处。高变异基因的基因体GC含量显著高于低变异基因(Cliff's δ=0.38),但基因长度和最近邻距离的效应量可忽略。转录因子基序分析显示,高变异基因富集bZIP和锌指(Zf)家族转录因子的结合基序,特别是AP-1(Fos、Jun和ATF异二聚体);低变异基因则富集ETS和NRF家族基序。
**3.5 表观遗传学与转录组适应**:利用ChromHMM定义的11种染色质状态,研究人员发现除三种抑制性状态外,其余染色质状态在变异十分位数间均存在显著差异。高变异基因中强转录状态(H3K36me3)显著减少(基因体±10 kbp内平均比例从35.1%降至22.2%),而所有增强子相关染色质状态(弱基因增强子、弱增强子、活性增强子1/2)和活性启动子状态在高变异基因中显著富集。TSS上游状态增加,TSS下游状态减少,表明高和低变异性基因在近端和远端调控元件上存在差异。
**3.6 CHO细胞研究中转录组适应的分解**:对PC2至PC5与实验因素(温度下调、时间进程、生产者与非生产者、生产力水平、谷氨酰胺缺乏适应、无乳糖代谢、生长特征和病毒感染)的相关性分析显示,多种实验因素与这些PC存在中等相关性,但经BH校正后均不显著。PCoA和层次聚类显示,涉及温度下调和从指数生长期进入稳定期的数据集(Hofer、?tor、Nguyen和Tzani)聚在一起,表明存在共享的转录程序。CHO-S数据集未形成与CHO-K1明显分离的簇,表明不同谱系对条件的转录组适应具有相似性。
**四、讨论与结论**
研究人员系统地表征了CHO细胞在广泛细胞系、生物工艺设置和培养条件下的转录组适应,推导出一个能够统一各数据集变异模式的全局表达变异性轴。该变异性反映的是CHO转录组对环境变化和细胞系/谱系差异的适应,而非基因的内在变异性。稳定表达的核心基因富集于细胞内运输、RNA代谢和基础转录等核心生物过程,这些持家过程即使在广泛细胞应激下也保持最高的表达稳定性。常用的参考基因Gapdh并不在这些稳定表达基因中,而Prkar1a、Gnb1和Mmadhc是强候选参考基因。必需基因偏向稳定表达,但其中包含条件依赖的高变异亚群(如DNA复制和细胞周期控制基因),表明必需性与持家性并不等同。高变异基因富集于应激反应、信号转导、细胞外基质组织、凋亡和生长相关通路,以及蛋白折叠机制和UPR,反映了适应性转录程序。TATA盒基序和bZIP/锌指转录因子结合位点的富集表明这些基因具备快速诱导转录响应的能力。高变异基因的基因体GC含量较高,但基因长度和基因组聚类无显著关联。染色质状态分析显示,转录变异性由近端和远端调控元件共同介导,高变异基因富集活性增强子和启动子相关染色质,而稳定表达基因富集强转录状态。全局和上下文特异性变异性的分离表明,某些应激和信号通路在多项CHO研究中反复参与,而另一些响应则高度依赖具体环境。研究结果为参考基因选择和CHO细胞工程提供了指导:稳定表达基因可用于归一化和识别支持稳定高表达的基因组热点,而一致响应环境扰动的基因集则突出了可能影响生物工艺性能和产品质量的通路和调控模块,其中UPR是重要的应激因素和工程靶点。
研究结论:该研究巩固了CHO细胞转录组变异性的全局景观,为细胞系工程、工艺优化和可重复生产提供了潜在指导。所提出的框架和资源为将转录组见解转化为提高工业CHO工艺一致性、质量和生产力的可行策略奠定了基础。