《Mobile DNA》:Hide and seek: de novo identification in sugar beet reveals impact of non-autonomous LTR retrotransposons
编辑推荐:
植物基因组中充满了反转座子及其衍生序列,这些序列不断经历序列多样化和结构重排。其中,短小的非自主反转座子缺乏完整编码能力,并经常形成亚家族。因此,在大多数乃至全部基因组组装中,非自主反转座子都未被完整鉴定。在此,研究人员利用对甜菜(Beta vulgaris)
植物基因组中充满了反转座子及其衍生序列,这些序列不断经历序列多样化和结构重排。其中,短小的非自主反转座子缺乏完整编码能力,并经常形成亚家族。因此,在大多数乃至全部基因组组装中,非自主反转座子都未被完整鉴定。在此,研究人员利用对甜菜(Beta vulgaris)转座子(transposable element, TE)景观的全面理解,评估非自主长末端重复(long terminal repeat, LTR)反转座子鉴定盲区的范围。该用例旨在回答以下问题:这些序列是否全部来自易于鉴定的全长元素的衍生序列,还是存在当前被忽视的更多变异性?为此,研究人员采用半自动结构发现流程,并进行深度人工验证,以表征甜菜中的非自主LTR反转座子。研究人员检索到超过100个缺乏完整自主编码能力的非自主LTR反转座子家族,包括典型的小型终端重复反转座子(terminal-repeat retrotransposons in miniature, TRIMs)、延长的非编码衍生序列以及保留片段化编码残迹的家族。所鉴定家族涵盖广泛范围,包括长度超过15,000 bp的元素,并显示出序列重排和模块化进化的证据。其中仅有一小部分家族能够可靠地关联到自主反转座子,表明非自主LTR反转座子部分内的序列多样化程度超出了自主基因组模板的范围。研究人员强调,即使当前TE鉴定流程的输出经过良好整理并浓缩为TE文库,仍有大量非自主LTR反转座子未被完整回收,并建议了弥补这一缺口的程序。该研究提供了单一植物基因组中非自主LTR反转座子景观的全基因组视图,并强调了基于结构的方法对其鉴定和分类的重要性。
**甜菜非自主LTR反转座子的从头鉴定:揭示其多样性、进化动态与基因组影响**
**研究背景与科学问题**
转座子(transposable element, TE)在植物基因组中占据较大比例,其积累影响基因组结构与完整性,并可能引发基因组重组。长末端重复(long terminal repeat, LTR)反转座子是一类通过RNA中间体以“复制-粘贴”机制增殖的庞大TE类群,其典型结构由两个相同的LTR及内部区域构成,内部区域包含引物结合位点(primer binding site, PBS)、多嘌呤束(polypurine tract, PPT)及编码反转录和整合所需蛋白的结构域。然而,基因组中还存在大量缺乏完整编码能力的非自主LTR反转座子,它们通常较短、结构多样,包括小型终端重复反转座子(terminal-repeat retrotransposons in miniature, TRIMs)、大型反转座子衍生序列(large retrotransposon derivatives, LARDs)以及各种重排形式。由于缺乏保守蛋白编码域,且序列复杂度低,非自主LTR反转座子在多数基因组组装中难以被完整鉴定。现有TE鉴定流程通常依赖相似性搜索或结构特征识别,对这类元素存在系统性的“盲区”。尽管TE研究界意识到这一注释缺口的存在,但其规模究竟是大还是小,一直缺乏定量评估。本研究以甜菜(Beta vulgaris)为对象,旨在通过深度人工注释,系统鉴定非自主LTR反转座子,评估当前流程的遗漏程度,并揭示其多样性、进化来源与基因组分布特征。甜菜基因组大小中等(758 Mb),基于长读段测序的组装质量高,且其TE景观已有详细研究,是理想的用例。该研究发表于《Mobile DNA》。
**主要技术方法**
研究人员采用半自动、结构引导的从头鉴定策略,结合相似性定量与人工验证,对甜菜基因组(基于Oxford Nanopore Technologies的KWS2320ONT组装)中的非自主LTR反转座子进行全面检索。流程包括三个步骤:(1)使用LTR_Finder进行结构从头鉴定,关闭蛋白结构域检测,采用三组放宽长度约束的参数集,并通过BLASTx排除自主反转座子候选;(2)运用基于计算机视觉的Flexidot自点阵分析过滤结构不完整的候选序列,经CD-Hit聚类和人工检查获得252条非冗余参考序列;(3)通过MEGABLAST进行全基因组同源搜索,结合中点拆分自比较、人工点阵检查及LTR边界验证,最终获得完整全长元素数据集;再基于LTR相似性采用all-against-all BLAST结合马尔可夫聚类算法(Markov Clustering Algorithm, MCL)进行家族分配,并经严格长度阈值筛选和人工校正。
**研究结果**
**1. 检测到全基因组规模的非自主元件**
通过上述流程,研究人员从甜菜基因组中鉴定出7,182个完整全长非自主LTR反转座子,经家族水平质控后,最终获得1,581个全长序列,归属于115个家族。与现有工具对比显示,LTR_Finder默认参数只能恢复其中86个家族,EDTA虽可检测到97个家族的相似序列,但将其笼统归类为“LTR/未知”,无法区分非自主家族。这表明当前主流流程确实严重低估了非自主LTR反转座子的多样性。
**2. 非自主LTR反转座子群体高度多样:长度差异42倍且基序多变**
115个家族的长度中位数范围为291 bp至12.3 kb,呈现超过40倍的尺寸差异。按长度可分为短(0–4 kb,60个家族)、中(>4–7 kb,22个)、长(>7–10 kb,32个)和超长(>10 kb,1个)四类。多数家族LTR相似性高(≥85%),但长度与LTR大小无固定关系,内部区域组成多样。PBS基序分析显示,甲硫氨酸tRNA来源的PBS最为普遍,赖氨酸、天冬氨酸等来源的PBS仅在少数家族中出现。末端反向重复(terminal inverted repeat, TIR)基序包括5’-TGTT-3’、5’-TGAT-3’和5’-TGTA-3’,与长度仅存在有限关联。
**3. 靶位点重复和LTR保守性表明近期整合**
在1,581个全长元件中,1,352个保留了可识别的靶位点重复(target site duplication, TSD)。108个家族含有至少部分TSD阳性元件。LTR保守性与TSD保留相关:LTR一致性低于85%的家族大多缺乏TSD,但11个高度保守的家族也无TSD,提示重组等机制可导致TSD丢失。
**4. 重组在非自主LTR反转座子生物学中普遍存在**
研究人员在38个家族中检测到97个串联排列(tandemly-arranged, TA)拷贝,其中65个为3-LTR结构,73个保留TSD。101个家族存在solo-LTR,solo-LTR与全长元件的比值从0.01到111不等,表明不等同源重组频繁发生。此外,55个家族共享区域序列相似性,被归为16个“模块化组”(M1–M16),并检测到嵌合元件及大量截短或重排衍生物。这些结果说明重组,包括非法重组和不等同源重组,是非自主LTR反转座子结构多样化的重要驱动力。
**5. 并非所有非自主LTR反转座子都有可追溯的起源**
在115个家族中,43个保留残余编码结构域,其中10个与Ty1-copia相关,33个与Ty3-gypsy相关;28个仅含GAG/PROT结构域,15个保留部分POL相关结构域。然而,仅有30个家族能通过序列相似性关联到甜菜已知的自主LTR反转座子。综合编码残迹和序列相似性,共54个家族可确定进化起源,其余61个家族无法关联到任何已知自主元件。可追溯家族中,Ty3-gypsy相关(42个)远多于Ty1-copia相关(12个),比例约为3.5:1。
**6. 非自主LTR反转座子散布于基因组且偏向基因富集区**
染色体分布分析显示,非自主LTR反转座子在着丝粒区密度较低,而富集于染色体臂上的基因和Ty1-copia富集区域。GC含量较高的家族更常见于基因密集区。与基因注释比较,216个全长元件与基因重叠,其中72%位于内含子;627个元件位于基因5 kb侧翼区。基因关联分析表明,非自主LTR反转座子与基因体重叠的比例(15.9%)显著高于自主Ty1-copia(11.8%)和Ty3-gypsy(11.7%),基因侧翼关联比例(39.8%)也高于自主元件(34.3%和34.5%),差异均具有统计学意义(Fisher精确检验,P < 0.001)。
**总结与讨论**
该研究通过甜菜用例证明,非自主LTR反转座子在长度和序列多样性上被严重低估,其并非只是自主元件的被动残迹,而是通过重组、模块交换和序列周转持续演化的动态基因组组分。研究建议,TE注释框架应将非自主LTR反转座子作为独立的第三注释类别,而非强行归入自主超家族或模糊的“LTR/未知”;术语上应统一将“非自主”定义为转座功能丧失,而不论其大小或是否含片段化开放阅读框。该工作为植物基因组中这类隐蔽TE的鉴定提供了具体的方法学建议,包括使用高质量长读段组装、放宽结构搜索参数、基于自比较的验证及结合人工校正的图聚类。结论强调,仅包含自主TE的参考数据库会遗漏绝大多数非自主LTR反转座子,结构导向的鉴定策略对全面理解植物基因组进化至关重要。