《BioMedInformatics》:Expert Curation of Human Microarray Probe Annotations in the Biological Interpretation of Integrated Transcriptome Analyses
编辑推荐:
摘要专业翻译
背景:微阵列探针与基因座(gene locus)的精确匹配对于基因表达数据的可靠解读至关重要,然而现有的探针注释往往不完整或已过时。本研究旨在开发并应用一种专家人工审校(expert-curated)的方法对人类微阵列探针进行重注释,并评估其对转
摘要专业翻译
背景:微阵列探针与基因座(gene locus)的精确匹配对于基因表达数据的可靠解读至关重要,然而现有的探针注释往往不完整或已过时。本研究旨在开发并应用一种专家人工审校(expert-curated)的方法对人类微阵列探针进行重注释,并评估其对转录组数据解读的影响。方法:研究人员通过整合平台数据库信息,并利用BLAST比对(Basic Local Alignment Search Tool,基础局部比对搜索工具)将人类微阵列探针序列与更新后的参考转录本进行比对,随后对探针-基因座分配结果进行人工专家审校,以此实现对探针的重注释。作为概念验证,研究人员重新分析了一张整合的正常人类心脏转录组图谱,重点关注17个高表达变异性和17个低表达变异性的基因。随后,研究人员将经过审校的注释应用于一张唐氏综合征(trisomy 21,T21)与整倍体(euploid)人类成纤维细胞整合转录组图谱中,涉及代表一碳代谢(one-carbon metabolism)相关基因的1032个探针。研究评估了重注释对基因表达估计的影响,并通过实时逆转录聚合酶链反应(Real-Time RT-PCR)在独立成纤维细胞样本中对8个选定基因进行了实验验证。结果:人工审校发现,在心脏转录组图谱中,高表达变异性基因组的357个探针中有132个(37.0%)存在注释差异,低表达变异性基因组的43个探针中有24个(55.8%)存在注释差异。在T21与整倍体成纤维细胞数据集中,1032个探针中有341个(33.0%)需要重新分配或移除。整合审校后的注释修改了多个基因的表达估计值,并提高了其一致性。对8个选定基因的实验验证显示,Real-Time RT-PCR与重注释后的转录组数据之间存在正相关(r = 0.67)。结论:专家人工审校的微阵列探针重注释发现了大量的注释差异,并纠正了相当比例的探针-基因座分配错误,对基因表达估计产生了可测量的影响。研究最终提供的1432个人工审校探针注释集为解读历史人类微阵列数据集提供了更新资源,同时也凸显了开发更全面、更易用的自动化流程以复现专家级探针分配水平的必要性。
论文解读
一、研究背景与问题
DNA微阵列(DNA microarray)技术是研究基因表达模式最常用的技术之一,能够在不同生物学条件下同时测量数千个基因的表达水平。然而,微阵列实验长期面临灵敏度、准确性、可重复性以及跨平台一致性等问题。制造商提供的微阵列平台注释表格往往不完整且过时,这些注释通常依赖于较早版本的基因组和转录组数据库,与最新的序列数据库存在显著差异。此前的研究表明,热门微阵列平台中高达一半的探针存在可变剪接差异敏感性以及交叉杂交(cross-hybridisation)问题,即检测到的目标并非其设计时所针对的基因。跨平台可重复性差也进一步佐证了现有探针注释常常并非最优。当使用不同版本的阵列平台时,可重复性可能非常差,而使用相同版本时通常较好。
探针注释错误会导致基因表达估计出现偏差,进而影响生物学结论的可靠性。尽管已有多种重注释流程被开发并应用于特定且最常用的微阵列平台,但这些工具大多存在适用范围窄、安装运行复杂、技术门槛高等局限。例如COMMAND>_虽然包含基于序列比对的通用重注释功能,但依赖多个其他软件组件,需要较高的专业技术能力。因此,开发一种能够系统纠正探针-基因座分配错误、提高历史转录组数据解读准确性的方法具有重要的科学意义。
二、研究内容与结论
针对上述问题,本研究开发并应用了一种专家人工审校的微阵列探针重注释方法。研究人员从GEMMA数据库、NCBI GEO数据库或通过联系研究者获取探针序列,利用NCBI Nucleotide BLAST与最新的人类参考mRNA序列进行比对,通过人工检查比对结果,按照预设标准(一致性≥80%,且无其他基因同时满足一致性≥80%和查询覆盖率≥20%)将探针分配至特定基因座。作为概念验证,研究人员将这一方法应用于两个整合转录组图谱:正常人类心脏与除心脏外的组织池对比图谱,以及T21与整倍体人类成纤维细胞对比图谱。
研究得出以下主要结论:在心脏转录组图谱中,高表达变异性基因组的357个探针中有132个(37.0%)存在注释错误,低表达变异性基因组的43个探针中有24个(55.8%)存在注释错误;在T21与整倍体成纤维细胞数据集中,1032个探针中有341个(33.0%)需要重新分配或移除。值得注意的是,低SD值基因组中探针注释错误的比例反而更高,表明基于SD值的统计标准并不能有效识别探针注释错误。重注释后,多个基因的表达估计值发生显著变化,SD值普遍降低,与Real-Time RT-PCR验证结果的相关性从r = 0.57提高到r = 0.67。研究最终发布了1432个人工审校的探针注释集,为历史微阵列数据集的解读提供了更新资源,并强调了开发可复现专家级探针分配水平的自动化流程的必要性。
三、关键技术方法
本研究主要采用了以下关键技术方法:第一,利用TRAM(Transcriptome Mapper,转录组图谱绘制软件)1.3版本对来自NCBI GEO和ArrayExpress公共数据库的微阵列实验数据进行整合、归一化和差异表达分析,生成转录组图谱。第二,从GEMMA数据库、NCBI GEO数据库或通过联系作者获取探针序列,对非商业或定制平台的探针使用克隆GenBank登录号进行BLAST比对。第三,使用NCBI Nucleotide BLAST在线比对软件,选择人类参考RNA序列数据库,对每个探针序列进行比对,人工检查比对结果并记录查询覆盖率(Query Cover)和一致性百分比(Per. Ident)参数,按照预设标准进行探针-基因座分配。第四,将人工审校后的注释导入TRAM软件重新分析,获得更新后的基因表达值。第五,使用Real-Time RT-PCR对8个选定基因在独立成纤维细胞样本中进行实验验证,样本来自Galliera遗传银行(Galliera Genetic Bank,GGB),包括5个T21细胞系和3个正常对照细胞系。第六,与Re-annotator流程(针对GPL570平台)和Brainarray项目(针对GPL10558平台)的自动化重注释结果进行比较。
四、研究结果
4.1 基因群选择与探针序列获取
研究人员从心脏转录组图谱中选取了17个SD值≥400%的基因(对应357个非冗余探针标识符)和17个SD值≤40%的基因(对应43个探针标识符)作为分析对象。通过KEGG数据库和PubMed文献检索,研究人员构建了包含260个一碳代谢相关基因的列表,经排除非SAM依赖性甲基转移酶和功能不确定的基因后,最终对248个在T21与整倍体成纤维细胞转录组图谱中有表达值的基因进行了探针注释分析,涉及来自GPL570和GPL10558平台的1032个非冗余探针标识符。
4.2 探针序列注释分析
在高SD值基因组中,357个探针中有131个(36.7%)未被制造商正确分配,其中14个探针制造商未分配但人工BLAST分析成功分配,117个探针被重新分配到不同基因座或判定为无可靠分配。在低SD值基因组中,43个探针中有24个(55.8%)未被正确分配。在一碳代谢基因组中,1032个探针中有341个(33.0%)未被正确分配,其中6个探针制造商未分配但人工分析成功分配,335个探针被重新分配或判定为无可靠分配。列联表分析和Fisher精确检验显示,低SD值组中探针注释错误的比例显著高于高SD值组(双尾p = 0.02),表明基于SD的统计标准并不能有效识别探针注释错误。
4.3 心脏表达谱重分析
重注释后,高SD值组的基因SD值普遍降低,其中ARMC9的SD值从617.44%降至84.32%,平均表达值从153.35变为11.25。部分探针被重新分配到其他基因座,如原分配给ARMC9的探针被重新分配给VIM,原分配给UBOX5的探针被重新分配给FASTKD5。低SD值组中,CZ1P-ASNS、IGKV2-29和TMEM147-AS1因所有相关探针均失去分配而在重分析后消失,12个基因的表达值和SD值未发生变化。在心脏转录组荟萃分析中,17个低SD值基因中有5个(29.4%)在人工重注释前数值是错误的。
4.4 脑和甲状腺表达谱重分析
将相同的重注释标准应用于人类全脑和全甲状腺转录组图谱后,单个基因的表达值有所变化,但高SD值和低SD值基因的整体情况没有显著改变,表明SD值并非识别探针分配错误的普适标准,这种模式提示探针分配存在系统性偏差,而非心脏组织特有的问题。
4.5 T21与整倍体成纤维细胞表达谱重分析
在248个一碳代谢基因中,9个基因因所有探针标识符被删除而在重分析后丢失,METTL11B因官方基因符号更新为NTMT2而不再单独列出。99个基因(40%)的表达水平发生变化,其中89个基因在A池和B池中的SD值均降低。重分析后,163个基因在DS与N之间无差异表达,26个基因在DS中显著下调,48个基因在DS中显著上调。BUD23、SLC22A7和DNMT3L三个基因从无差异表达变为在DS中过表达,其中DNMT3L是位于Hsa21的基因,其表达比值从1.07显著增至1.75。NSUN5的表达比值从1.30降至0.93,从过表达变为无差异表达。
4.6 T21与整倍体成纤维细胞转录组图谱的体外验证
研究人员选取8个重注释后表达水平发生变化的基因(MTHFD1L、MTRR、SETD2、SLC46A1、N6AMT1、BUD23、INMT、MAT2A),在独立成纤维细胞样本中进行Real-Time RT-PCR验证。TRAM数据与Real-Time RT-PCR的T21/N表达比值相关性从重注释前的r = 0.57提高到重注释后的r = 0.67。分别考虑T21组和正常组时,与Real-Time RT-PCR ΔCq值的相关性从r = ?0.77和r = ?0.78提高到r = ?0.81。例如BUD23的平均表达值在T21样本中从154.84增至224.48,MAT2A的平均表达值在T21样本中从460.14降至100.74,表明探针重注释可以显著改变基因水平表达估计。
4.7 与现有重注释软件的比较
将人工审校结果与Brainarray项目(针对GPL570平台)和Re-annotator流程(针对GPL10558平台)的自动化重注释结果进行比较。在GPL570平台的608个探针中,513个(84.4%)注释一致,95个(15.6%)存在差异。在GPL10558平台的424个探针中,363个(85.6%)注释一致,61个(14.4%)存在差异。差异的主要来源包括人工分配而自动化未分配、自动化分配而人工未找到可靠分配,以及自动化无法排除多个高相似度基因座的情况。例如探针ILMN_1803312被Re-annotator分配给DIMT1,但其序列同时与DIMT1和KIF2A转录本100%匹配,人工审校判定无法可靠分配至单一基因座。
五、讨论与结论
本研究表明,人工审校的探针重注释能够识别大量制造商注释错误,并纠正相当比例的探针-基因座分配,对基因表达估计产生可测量的影响。基于SD值的统计标准并不能有效识别探针注释错误,低SD值组中注释错误比例反而更高。与自动化重注释流程的比较显示,人工审校仍然是最准确的方法,这主要归因于自动化工具在排除多基因座高相似性分配、处理基因别名以及判断交叉杂交等方面的局限性。研究发布了一个包含1432个人工审校探针注释的更新资源,为解读历史微阵列数据集提供了重要参考。研究人员强调,随着微阵列平台逐渐被RNA测序(RNA-seq)取代,大量历史微阵列数据仍具有重要的整合分析价值,开发能够复现专家级探针分配水平、易于使用且可大规模应用的自动化重注释流程是未来研究的重要方向。