《Cell Reports》:Eukaryotic AUG initiation contexts consist of a broad range of nucleotide patterns associated with distinct biological functions
编辑推荐:
在真核生物中,翻译起始受到位于mRNA上的顺式调控序列(cis-regulatory sequences)以及反式作用因子(trans-acting factors)的广泛调控,这些因子影响扫描中的43S复合物(43S complex)P位点内密码子-反密码子
在真核生物中,翻译起始受到位于mRNA上的顺式调控序列(cis-regulatory sequences)以及反式作用因子(trans-acting factors)的广泛调控,这些因子影响扫描中的43S复合物(43S complex)P位点内密码子-反密码子相互作用的持续时间,并最终控制核糖体组装。研究人员分析了AUG起始密码子周围的序列,以考虑影响起始密码子识别的相互依赖或相互排斥的核苷酸组合。通过比较六个模式真核生物中注释编码序列的起始上下文,研究人员表明其核苷酸特征具有高度物种特异性。搜索AUG起始密码子周围的精确共有核苷酸模式,识别出每个真核生物中存在多种核苷酸模式而非单一共有序列。重要的是,这些模式突出了所有真核生物中保守的?3位嘌呤周围的独特核苷酸特征,该嘌呤已知强烈影响起始效率。最后,为任何AUG上下文计算物种特异性评分表明,这些多样化的核苷酸特征与特定的生物功能相关。
在真核生物中,翻译起始是决定蛋白质合成速率和最终蛋白产物的关键步骤,受到mRNA上顺式调控序列与反式作用因子的共同调控。然而,以往对AUG起始密码子周围序列的认识多依赖于平均化的共有序列(如Kozak共有序列),这种表示方法忽略了核苷酸之间的相互依赖或排斥关系,无法解释AUG识别过程中复杂的分子相互作用。为弥补这一不足,研究人员系统分析了六种模式真核生物——酿酒酵母(Saccharomyces cerevisiae)、秀丽隐杆线虫(Caenorhabditis elegans)、黑腹果蝇(Drosophila melanogaster)、斑马鱼(Danio rerio)、小鼠(Mus musculus)和人类(Homo sapiens)——注释编码序列中AUG起始上下文(-6至+6位)的核苷酸特征。该研究发表于《Cell Reports》。核心发现是:真核生物的AUG起始上下文高度多样且具有物种特异性,不存在单一共有序列,而是由多个核苷酸模式共同构成;这些模式围绕保守的-3位嘌呤形成不同组合,并与特定的生物功能相关联。研究还提出了一种物种特异性评分方法,可用于评估任意AUG上下文作为起始位点的可能性。
研究人员采用了一系列生物信息学与实验方法。首先,从公共基因组注释中提取六个物种的CDS起始上下文并统计频率;其次,利用Spearman等级相关分析构建核苷酸共现网络,以识别相互依赖的位点组合。随后,定义了k-motif(含有k个确定核苷酸的序列模式),从“比例”和“覆盖度”两个角度评估每种模式的普遍性和独立性,并结合“零模型”排除背景核苷酸组成偏差。通过逐步Δcoverage算法鉴定核心基序(core motifs),并构建几何平均评分用于量化任意AUG上下文的物种特异性强度。实验方面,研究人员制备了兔网织红细胞裂解液(RRL)、HEK293-FT细胞裂解液和果蝇S2细胞裂解液,进行体外翻译实验验证-3位侧翼核苷酸的功能;同时整合了Noderer et al.和Ambrosini et al.发表的两项FACS筛选数据,用于验证评分与AUG识别效率的相关性。所有功能富集分析基于KEGG BRITE层级完成。
AUG起始上下文高度多样,其使用具有物种特异性。研究人员发现各物种的AUG上下文多样性评分高达71%-92%,编码序列大多拥有独特的起始上下文;仅有29种上下文在所有物种中共同出现,且丰度较低。至少42%的上下文为物种特有,提示不同真核生物存在各自特异的顺式调控决定因素。
核苷酸相关性分析显示真核AUG起始上下文内特定核苷酸之间相互依赖。通过Spearman相关分析,研究人员发现物种间仅共享极少数强相关(如+4U与+5C正相关、+4U与+5A负相关),而多数相关网络具有物种特异性。此外,-6至-1位(5'UTR)与+4至+6位(第二密码子)的核苷酸构成相对独立的相关网络,表明其可能分别作用于起始识别和第一位氨基酸tRNA的选择。
基序比例分析揭示真核生物使用多种丰度相近的核苷酸模式起始翻译。k-motif比例分析显示最丰富的2-motif最多仅覆盖23%-32%的起始上下文,且不存在占绝对优势的单一模式。哺乳动物中-3位与+4位的嘌呤组合并非最丰富,提示Kozak共识并非绝对优选。
基序覆盖度分析识别出足以独立支持AUG识别的基序。通过Δcoverage核心基序鉴定,研究人员发现酵母和无脊椎动物的核心基序为A富集模式(如NNNAAAAUGNNN),而脊椎动物核心基序更为多样,在-3位附近出现CANC/GCC等特征,且+4位多为G,第二密码子多为GCN(丙氨酸密码子)。哺乳动物核心基序分为-3G相关(GCC)与-3A相关(CACC/CANC)两类。
框内uAUG在注释的真核起始上下文中缺失。针对0%覆盖度基序的镜像分析显示,某些框内上游AUG模式(如AUGUUNAUGNNN)在所有物种中完全缺失,可能是由于起始密码子分配歧义或N端延伸对蛋白功能不利。
只有少数基序可被视为共有序列(综合比例与覆盖度)。通过计算几何平均值筛选候选共有基序,低复杂度模式(如1-motif)在数学上最优但不含关键核苷酸,不适作为共识;3-和4-motif是合理折中,但大量高复杂度基序超出覆盖度预期值,表明不存在单一高复杂度共识序列。进化选择同时作用于比例和覆盖度的多个基序,进一步支持AUG识别依赖多种模式。
-3位嘌呤的侧翼核苷酸强烈影响翻译起始效率。体外翻译实验显示,当-5至-1位均为C时,-3位为嘌呤(A或G)能显著提高效率,且这一效应在RRL和HEK293-FT提取物中均存在;果蝇S2细胞提取物中,-4C和-3A的组合对额外A碱基的插入具有稳健性,而-3C被侧翼A优化后也能恢复翻译效率,表明物种间存在复杂的上下文互作。
AUG上下文的核苷酸特征与不同生物功能相关。通过物种特异性评分和KEGG BRITE富集分析,核糖体蛋白、外泌体、细胞骨架等组成型表达核心基因的AUG上下文评分较高,而转录因子、G蛋白偶联受体等调控型蛋白的上下文评分较低。评分与已发表的FACS测定的AUG识别效率呈正相关(Pearson r=0.28-0.45,Spearman ρ=0.32-0.59),证明该评分能有效反映AUG识别强度。
翻译起始位点下游的二级结构与特定类型AUG上下文无特异性关联。计算下游+15/+65窗口的最小自由能(MFE)后,发现MFE与AUG上下文评分在哺乳动物中仅存在极弱的负相关,在其他物种中基本独立,说明下游二级结构并非专门补偿弱起始上下文,而是独立调节因子。
人类转录本中注释的AUG起始密码子和上游AUG的核苷酸上下文具有不同特征。将人类转录本AUG分为主AUG(mAUG)和上游AUG(uAUG)后,共享上下文占mAUG的52%和uAUG的21%。uAUG特异上下文富含NUG(近同源AUG)三联体(45%)和start-stop基序(6%),可能作为“核糖体陷阱”调节下游主ORF的翻译;而mAUG特异上下文富集-3A相关模式(CACC/CANC),可能确保更稳健的起始。
人类转录本中注释的AUG和上游AUG的上下文与不同生物功能相关。高评分的uAUG特异上下文富集于DNA修复和转录调控(如锌指转录因子),而高评分的mAUG特异上下文富集于核糖体蛋白、膜运输、细胞骨架和CD分子等基因,表明mAUG特异上下文对维持核心细胞功能至关重要。
在讨论部分,研究人员总结了AUG上下文的多样性反映了mRNA与预起始复合物之间物种特异的复杂相互作用网络,核心基序的进化差异表明酵母/无脊椎动物与脊椎动物采用了不同的起始策略。研究人员指出,结构数据有限以及评分方法中对各参数等权重加权是主要局限。研究结论为:真核生物AUG起始上下文中的多样化核苷酸特征,连同其他mRNA特征(如uAUG、二级结构、反式因子结合等),共同确保了编码序列的最佳翻译起始速率,从而维持细胞内蛋白质稳态。