《Nature Aging》:A microprotein atlas of the human frontal cortex in Alzheimer’s disease
编辑推荐:
理解神经退行性变的分子基础需要全面绘制基因组蛋白质编码输出图谱。尽管人类大脑中翻译了数千个小开放阅读框(open reading frames, ORFs),但对其编码的微蛋白(microproteins, MPs)(≤150个氨基酸)的蛋白质组学证据仍然有限
理解神经退行性变的分子基础需要全面绘制基因组蛋白质编码输出图谱。尽管人类大脑中翻译了数千个小开放阅读框(open reading frames, ORFs),但对其编码的微蛋白(microproteins, MPs)(≤150个氨基酸)的蛋白质组学证据仍然有限。在此,研究人员提出一份脑微蛋白图谱,整合了转录组学、质谱分析和深度学习预测谱图,覆盖了600多份有无阿尔茨海默病(Alzheimer’s disease, AD)的死后额叶皮层样本。研究人员鉴定了1,067个在经审阅的UniProtKB条目中缺失且具有高置信度谱图支持的微蛋白。其中一个子集在AD中差异表达,独立于同一基因座注释的主开放阅读框。由MKKS表达的一个小开放阅读框编码一个63个氨基酸的微蛋白,是该基因座的主要翻译产物并在AD中下调;其缺失损害小胶质细胞线粒体呼吸,提示其参与小胶质细胞生物能量学。该图谱扩展了已注释的脑蛋白质组,并为研究微蛋白在衰老和神经退行性变中的作用提供了资源。
阿尔茨海默病中人类额叶皮层微蛋白图谱:整合多组学证据的功能资源
一、研究背景与意义
健康认知衰老的分子机制尚未完全阐明。死后人脑多组学研究提供关键见解,但依赖不能充分代表小开放阅读框(small open reading frames, smORFs)的参考基因组数据库。smORFs是被转录和翻译后可编码短多肽的基因组元件,其产物通常称为微蛋白(microproteins, MPs)(通常少于100–150个氨基酸)。由于历史性排除,MPs及其编码基因在组学神经生物学研究中基本未得到探索。UniProtKB审阅部分约10%条目短于150个氨基酸,但可能被低估。TransCODE联盟已记录超过7,000个人类细胞类型中活跃翻译的smORFs,近四分之一有质谱(mass spectrometry, MS)证据,称为“peptideins”(仅有表达证据但无确定生物学功能)。MPs检测困难在于短长度仅产生少量酶解肽段,且大部分smORFs嵌入或邻近已注释蛋白质编码ORFs,常规RNA测序无法推断其单独表达。近年来核糖体测序(ribosome sequencing, Ribo-seq)、蛋白质基因组学和基于MS的技术已开始解决这些挑战。然而,全面脑MP图谱仍缺失。研究人员因此构建了整合原生转录组学与深度蛋白质组学的图谱,覆盖600多例有无阿尔茨海默病(Alzheimer’s disease, AD)的死后额叶皮层组织,提供串联质谱(tandem MS, MS/MS)谱图证据,报告超过1,000个审阅Swiss-Prot目录中缺失的MPs。其中由MKKS基因座编码的MP在AD中显著下调,其敲除(knockout, KO)损害小胶质细胞线粒体氧化磷酸化,并与经典MKKS蛋白表达解偶联。该图谱扩展了已注释脑蛋白质组,为研究MPs在衰老和神经退行中的作用提供资源。论文发表在《Nature Aging》。
二、主要技术方法(约250字)
研究人员使用Sanders-Brown中心12例DLPFC样本(6例AD/6例非AD,男女各6)的牛津纳米孔长读长转录组组装并三框翻译,构建包含未注释smORFs的定制蛋白质搜索数据库;结合宗教秩序研究(Religious Orders Study, ROS)与记忆与衰老项目(Memory and Aging Project, MAP)队列共610例DLPFC样本的串联质量标签(tandem mass tag, TMT)-MS数据,以FragPipe/Philosopher流程鉴定蛋白质,错误发现率(false discovery rate, FDR)<0.01。使用PROSIT深度学习模型预测碎片谱图,根据谱图角度和片段覆盖度分级验证肽段。整合43例非AD DLPFC的Ribo-seq数据,并使用ShortStop机器学习分类器评估smORF翻译。另对4例UCSD样本进行数据非依赖采集(data-independent acquisition, DIA)-MS验证。差异丰度分析在ROSMAP 480例样本中进行,并在西奈山脑库(Mount Sinai Brain Bank, MSBB)队列中验证转录组结果。
三、研究结果
1. Unique MS evidence of MPs in aged human brains(老年人脑中MPs的独特质谱证据)
通过长读长转录组构建搜索数据库并在610例ROSMAP样本TMT-MS数据中分析,鉴定出4,321个通过蛋白鉴定的MPs(FDR<0.01),其中3,217个为未审阅(unreviewed),1,104个为审阅(reviewed)。未审阅MPs广泛分布在各常染色体,多由靠近或位于已知基因内的smORFs编码,中位长度58个氨基酸,远短于审阅MPs的117个氨基酸。smORF类型中下游开放阅读框(downstream ORF, dORF)占比最高(19.9%),其次为短亚型(14.3%)、TrEMBL/altORF(14.1%)等。未审阅MPs谱图计数较低,且与mRNA相关性较弱(ρ=0.06 vs 0.36)。整合Ribo-seq后,部分MS未检出的MPs被核糖体足迹覆盖,表明MS检测受丰度限制。
2. Integrating Ribo-seq, MS and PROSIT provides an evidence framework for confidently identifying brain-expressed MPs(整合Ribo-seq、MS和PROSIT为可信识别脑表达MPs提供证据框架)
利用PROSIT比较观察谱图与预测谱图,将3,001个未审阅MPs分为强(1,067个)、中等(1,433个)、弱(343个)、不足(158个)四级。超过90%的强级MPs具有高片段覆盖度(>50%)和高谱图角度(归一化SA>0.78)。由于MPs短,大多数只能产生一个可检测胰蛋白酶肽段,传统“两个独特肽段”标准会排除许多真正MPs;而整合Ribo-seq可提供额外证据,如NYAP1基因座上游重叠开放阅读框(upstream overlapping ORF, uoORF)编码的MP虽然PhyloCSF分数为负且仅一个肽段,但具有强PROSIT分级和核糖体占有率。
3. Differential MP abundance in AD using TMT-MS quantification(使用TMT-MS定量分析MPs在AD中的差异丰度)
对480例ROSMAP样本(非AD n=111,无症状AD n=187,有症状AD n=187)进行差异丰度分析。严格模型(≥50%检出)下,99个审阅MPs和22个未审阅MPs达到FDR<0.05;宽松模型识别更多未审阅MPs。已知蛋白SST降低、MDK升高验证了流程。未审阅MPs中,BCL3内部开放阅读框(internal ORF, iORF)在症状AD中降低,RAB3C N端亚型升高。单核RNA测序(snRNA-seq)显示其细胞类型富集,过表达实验确认BCL3-iORF定位于细胞核,RAB3C N端亚型则无核定位。
4. A subset of smORFs diverges in expression from the main ORF of the encoding gene(部分smORFs的表达与编码基因主开放阅读框解偶联)
通过分别定量smORF编码序列(coding sequence, CDS)与主开放阅读框(main ORF, mORF)CDS的转录本表达,发现约一半smORF-mORF对近乎完全共表达(平均|r|=0.97),另一半弱相关(平均|r|=0.52)。在AD差异表达中,39%可检测smORF-mORF对显示独立于mORF的变化,其中dORFs比例最高(48%)。EMC10、RNF41和GNAQ三个dORF基因座中,dORF在症状AD中显著变化而mORF不变。这种解偶联在MSBB队列(副海马回)中重现(跨队列r=0.81),例如NCOA1 dORF在两个队列中均上调且mORF稳定。
5. Posttranscriptional splicing motif enrichment for genes encoding MPs(编码MPs基因的转录后剪接基序富集)
启动子分析显示约75%的smORF与配对mORF共享启动子基序,提示替代转录起始不是主要解释。剪接连接处RNA结合蛋白(RNA-binding protein, RBP)基序富集分析发现不同smORF类别具有不同特征,例如dORFs富集3′剪接位点/多腺苷酸化