《Plant Science》:GC-linked lncRNA organization in
Arabidopsis resolves into composition-constrained entropy and species-dependent transcript architecture
编辑推荐:
•与GC含量相关的长链非编码RNA组织特征将熵与结构加以区分•GC—熵关系在很大程度上受核苷酸组成约束•转录本结构表现出与核苷酸组成相关的物种依赖性联系•结构关联信号在调整与重复交叉验证之后依然存在•富含GC的拟南芥转录本占据独特的编码基因邻域引言植物基因组产生大量长链非编码
- •
与GC含量相关的长链非编码RNA组织特征将熵与结构加以区分
- •
GC—熵关系在很大程度上受核苷酸组成约束
- •
转录本结构表现出与核苷酸组成相关的物种依赖性联系
- •
结构关联信号在调整与重复交叉验证之后依然存在
- •
富含GC的拟南芥转录本占据独特的编码基因邻域
引言
植物基因组产生大量长链非编码RNA(lncRNA) repertoire,参与发育、环境响应以及多层次基因调控(Domínguez-Rosas 等,2023;Li 等,2023;Wang 等,2023;Cao 等,2024;Zhao 等,2024;Imaduwage 和 Hewadikaram,2024;Kindgren 等,2018;Jha 等,2020)。然而,植物 lncRNA 目录的快速扩张已超过了对其比较与功能解释的进展。与蛋白质编码基因不同,lncRNA 通常表现出较弱的初级序列保守性和较强的上下文依赖性,这限制了仅凭序列同源性进行直接跨物种推断(Deng 等,2018;Zhou 等,2023)。因此,核苷酸组成与转录本结构等特征层面的属性,为识别超越单个位点的组织模式提供了另一条路径。
包括 CANTATAdb 3.0、PLncDB V2.0、GreeNC 2.0 和 NONCODEV6 在内的大规模资源,如今使此类比较日益可行(Szcze?niak 和 Wanowska,2024;Jin 等,2021;Di Marsico 等,2022;Zhao 等,2021)。然而,已注释 lncRNA repertoire 的表观组成与结构,仍可能取决于转录组采样、分析策略以及条件或群体覆盖范围(Liang 等,2024;Yadav 等,2023;Severing 等,2018;Corona-Gomez 等,2022;Kornienko 等,2024)。拟南芥属提供了一个有用的系统,可在成熟的基因组框架内考察亲缘关系较近的物种;同时,拟南芥(A. thaliana)所拥有的丰富基因组与转录组资源,也揭示了注释分辨率不均衡带来的影响(Cheng 等,2017;Alonso-Blanco 等,2016;Jiao 和 Schneeberger,2020;Lian 等,2024)。这种组合使拟南芥尤其适合区分种内反复出现的组织特征与由注释条件所导致的跨物种差异。
GC 组成是进入 lncRNA 组织研究的一个自然切入点,但其与序列熵及转录本结构之间的关系本质上并不相同。香农熵衡量核苷酸的组成平衡性(Vinga,2014),并由与 GC 含量相同的碱基频率计算得出;因此,GC—熵之间的强相关性必然包含一个由公式本身定义的成分。相比之下,转录本长度、跨度和外显子组织描述的是一个结构层级,并非由 GC 含量在数学上决定。GC 组成已被关联到外显子—内含子组织及剪接位点识别(Amit 等,2012;Cheng 等,2023),从而为检验组成—结构关联是否超出其与熵之间的数学关系,提供了生物学依据。仍未解决的问题是:植物 lncRNA 中表观的 GC—熵—结构关系究竟是一个单一整合现象,还是可以在控制组成冗余和相关结构特征之后,将数学依赖与一个持续存在的结构关联信号区分开来。
在本研究中,我们使用来自 A. halleri、A. lyrata 和 A. thaliana 的 13,948 条源自 CANTATAdb 的 lncRNA 回答了该问题(Szcze?niak 和 Wanowska,2024)。我们首先通过精确的熵分解,将 GC—熵关系中由公式定义的成分加以分离,随后检验组成—结构关联在非冗余调整后分析以及重复样本外预测中是否仍然成立。我们采用考虑重复序列的分析、物种特异性匹配 mRNA 对照以及考虑注释的敏感性分析,来评估主要替代解释,并在 A. thaliana 中进一步考察功能背景分析。这些分析将 GC 相关的 lncRNA 组织解析为两个不同的层级:一个主要受组成约束的熵关系,以及一个在更严格的分析控制下仍可检测、但在物种与结构特征之间差异显著的组成—结构信号。我们将后者称为"物种依赖性组成结构",从而为区分数学依赖与具有结构信息的关联提供了框架。
章节摘录
数据来源、注释来源与 lncRNA 数据集
本研究以 CANTATAdb 3.0 中的植物长链非编码RNA(lncRNA)注释作为主要数据来源(Szcze?niak 和 Wanowska,2024)。分别于 2026 年 5 月 5 日下载了 Arabidopsis halleri、Arabidopsis lyrata 和 Arabidopsis thaliana 的 lncRNA FASTA 文件及相应的 GTF 注释文件。所分析的注释集合分别对应 Ahal2.2、v.1.0 与 TAIR10 组装版本。
对每个物种,均对 FASTA 记录与 GTF 转录本注释进行了
数据集概览及拟南芥 lncRNA 数据集中由注释条件导致的差异
在完成 FASTA—GTF 标识符统一后,所分析的数据集分别包含 A. halleri 的 3,617 条、A. lyrata 的 3,556 条以及 A. thaliana 的 6,775 条 lncRNA,分别对应 Ahal2.2、v.1.0 与 TAIR10 组装版本。所保留的转录本数量在 FASTA 记录、GTF 注释与整合特征表之间相互一致(图 1a;表 1;图 S1;表 S1A—S1B)。
三个数据集在若干基线序列与结构特征上存在差异。转录本长度的中位数为
拟南芥中由注释条件塑造的 lncRNA 特征景观
大规模的 lncRNA 资源与功能研究极大地拓展了植物比较转录组学的机会(Szcze?niak 和 Wanowska,2024;Jin 等,2021;Di Marsico 等,2022;Zhao 等,2021;Liang 等,2024;Yadav 等,2023;Severing 等,2018;Palos 等,2023;Paytuví Gallart 等,2016;Chekanova,2015),但由此产生的目录仍受基因组组装、转录组覆盖度与注释策略的影响(Liang 等,2024;Yadav 等,2023,
结论
拟南芥中与 GC 含量相关的 lncRNA 组织特征包含两个在分析上可区分的层级。GC 含量与核苷酸熵之间的强关系,在很大程度上由四态核苷酸分布的组成数学所决定。相比之下,一个组成—结构信号在纳入相关预测变量后仍然可被检测,并且在重复交叉验证中保留了样本外预测信息。该结构成分在不同……之间并不均一
资助
本工作得到了甘肃省科技计划项目(23ZDFA018)、中国博士后科学基金(资助编号:2025M82565)、中国科学院西部之光资助计划(XBZGLZB2022018)、国家重点研发计划(编号:2022YFC2601100)以及国家自然科学基金(32271659)的资助。
CRediT 作者贡献声明
Chenxu Wang:撰写—初稿,验证,软件,资源,方法论,数据整理,概念化。Yang Li:撰写—审阅与编辑,撰写—初稿,可视化,验证,软件,资源,方法论,调查,资助获取,正式分析,数据整理,概念化。Yunjiang Liang:验证,监督,软件,资源,方法论,数据整理,概念化。Yuhan Wu:监督,数据整理。Jiaxin Cai:
利益冲突声明
作者声明,他们没有已知的竞争性经济利益或个人关系可能会影响本文所报告的工作。
Chenxu Wang | Jiaxin Cai | Yuhan Wu | Yunjiang Liang | Yang Li