《The Plant Genome》:Dissecting genetic architecture and improving machine learning?based genomic prediction of flowering time in Osmanthus fragrans by integrating structural variants
编辑推荐:
桂花(Osmanthus fragrans)是中国传统观赏植物,其秋季开花时间存在显著变异,这显著影响景观应用和栽培效率。在此,研究人员对127份重测序材料进行了全基因组关联分析(genome-wide association study, GWAS),这些材
桂花(Osmanthus fragrans)是中国传统观赏植物,其秋季开花时间存在显著变异,这显著影响景观应用和栽培效率。在此,研究人员对127份重测序材料进行了全基因组关联分析(genome-wide association study, GWAS),这些材料被分为早花、中花和晚花类型,使用了2,325,410个单核苷酸多态性(single-nucleotide polymorphism, SNP)和246,824个结构变异(structural variant, SV)。通过将SNP/插入缺失(insertion and deletion, Indel)和SV数据与加权基因共表达网络分析、机器学习和基因组预测相整合,研究人员解析了开花时间的遗传结构。研究人员鉴定了24个关联的SNP/Indel和6个SV,定位到30个候选基因,包括已知的开花调控因子FLK、LOS1、Y14、MIF2和GID1B。这些基因表现出组织特异性表达,其中一些对低温有响应。两个枢纽基因GUX1和LYG027904位于与低温处理相关的共表达网络模块中。单倍型分析揭示了一个与晚花相关且与LOS1连锁的特异性三SNP单倍型,并且组合基因型之间的上位性互作导致了表型变异。值得注意的是,将SV与SNP/Indel整合提高了基因组预测准确性;梯度提升决策树模型优于其他机器学习算法,对所有开花类型实现了0.859的平均准确度和大于0.8的AUC(其中AUC为受试者工作特征曲线下面积)。这些发现为桂花开花时间变异的遗传机制提供了见解,为分子育种提供了候选基因和单倍型,并强调了将SV与机器学习整合用于木本观赏植物基因组预测的价值。
**桂花花期遗传结构解析与基于结构变异整合的机器学习基因组预测改进**
桂花(*Osmanthus fragrans*)属于木犀科,是中国十大传统名花之一,具有重要的观赏、经济和文化价值。栽培桂花按花期和花型可划分为四季开花的“四季桂”品种群和主要秋季开花的“金桂”“银桂”和“丹桂”品种群。秋季开花的桂花虽然一般8月至10月开花,但不同品种的初花日期差异显著,从8月上旬到10月上旬不等,导致开花不统一,影响景观应用和栽培管理效率。合理配置早、中、晚花品种可延长观赏期,但花期分散增加了采收和管理成本。已有研究鉴定了部分参与成花转变、花芽发育和秋季开花的调控基因,如*OfFT*、*OfBFT*、*OfSPL8*等,但桂花品种间秋季初花时间自然变异的遗传基础仍不清楚,限制了分子育种的开展。为此,研究人员对127份重测序桂花材料进行了全基因组关联分析(genome-wide association study, GWAS),结合结构变异(structural variant, SV)整合、加权基因共表达网络分析(weighted gene co-expression network analysis, WGCNA)和机器学习基因组预测(genomic prediction, GP),系统解析了花期变异的遗传结构,并评估了不同标记组合和模型的预测性能。该研究发表在《The Plant Genome》。
研究人员收集了来自中国不同地区的127份桂花种质,统一栽培于华中农业大学桂花园(114°21′W, 30°29′N)。重测序数据来自已发表的BioProject PRJNA679852。使用GATK进行单核苷酸多态性(single-nucleotide polymorphism, SNP)和插入缺失(insertion and deletion, Indel)检测,Manta进行SV检测,最终获得2,325,410个SNP/Indel和246,824个SV。采用GEMMA混合线性模型进行GWAS,将花期分为三个二元变量(早花、中花、晚花)分别分析,并以群体结构和亲缘关系作为协变量。基于WGCNA构建低温转录组共表达网络。通过LDblockshow进行连锁不平衡(linkage disequilibrium, LD)和单倍型分析。在GP中,采用基因组最佳线性无偏预测(genomic best linear unbiased prediction, GBLUP)作为基线模型,并与随机森林(random forest, RF)、梯度提升决策树(gradient boosting decision tree, GBDT)、极端梯度提升(extreme gradient boosting, XGBoost)和轻量梯度提升机(light gradient boosting machine, LightGBM)四种机器学习方法进行比较,使用五折交叉验证重复10次评估预测准确性。
**3.1 花期遗传变异分析**。通过表型统计发现,三个秋季花期类型分布于所有四个主要品种群中,晚花材料占总数的64.4%,早花占20.7%;在银桂品种群中晚花比例最高达69.6%。基于SNP/Indel基因型估算的狭义遗传力在早、中、晚三个二元变量中分别为0.45、0.19和0.37,平均0.34,表明该性状为中等遗传力,受环境和多基因共同影响。
**3.2 花期类型的全基因组关联分析**。在SNP/Indel-GWAS中,共鉴定到20个SNP和4个Indel显著关联;SV-GWAS中鉴定到6个显著SV。这些变异分布于14条染色体,其中13号和15号染色体上变异最多。每个显著变异的表型变异解释率(phenotypic variance explained, PVE)范围为0.263至0.418,平均0.290。共定位到30个候选基因,其中LYG007632(LOS1同源基因)、LYG038021(FLK同源基因)、LYG024080(GID1B同源基因)等是已知开花调控因子。
**3.3 候选基因的表达模式与共表达网络**。组织特异性表达分析显示,LYG007632、LYG025462和LYG003457在所有组织中高表达,LYG026935等根中高表达,LYG001450茎中特异表达。低温(19°C)处理下,LYG023372、LYG007632、LYG024866和LYG025462显著上调;WGCNA将八个候选基因分配到与低温响应相关的模块,其中LYG000533(GUX1)和LYG027904为所在模块的枢纽基因,其表达随低温处理逐渐升高并在第6天达到峰值,与花芽从S1期向S2期转变的时间吻合。对五个关键候选基因(MIF2、Y14、LOS1、ATGID1B、FLK)的共表达基因进行GO富集,发现乙烯、赤霉素、水杨酸和茉莉酸响应通路显著富集。
**3.4 单倍型块分析与花期相关单倍型鉴定**。对与LOS1关联的SNP(Chr04_2068119)进行LD分析,发现其与5′非翻译区的两个SNP构成单倍型块。单倍型分析显示,0-0-0单倍型与晚花显著相关(73%个体为晚花),1-1-2单倍型也显著富集晚花(69%)。此外,FLK关联的Indel和三个SV的特定基因型与花期类型存在显著相关,如GUX1关联SV的基因型2主要对应晚花。组合基因型分析表明,0-0-0-0组合主要对应晚花,而0-0-0-2组合主要对应早花,揭示了位点间的上位性互作。
**3.5 利用机器学习方法进行花期基因组预测**。基于仅SNP/Indel标记时,GBDT模型表现最佳,平均准确度为0.822,高于RF和GBLUP;整合SV后,所有模型的平均准确度提升,GBDT仍为最佳,平均准确度达0.859,Kappa系数0.703,对早、中、晚花类型的AUC值分别为0.882、0.801和0.862。混淆矩阵显示对中花类型的预测准确率最高达98%。
讨论部分总结了以下内容:候选基因的鉴定为花期调控提供了遗传资源,其中MIF2、Y14、LOS1、GID1B和FLK等均为已知参与开花或花器官发育的基因;低温响应的枢纽基因可能通过细胞壁重构和活性氧清除等途径影响生殖发育。单倍型和上位性互作分析表明,基于多个位点的组合基因型比单一标记更有利于早期筛选,在长育种周期的木本植物中具有应用价值。将SV整合入GP后,模型预测精度提升,这归因于SV与SNP的互补性,以及提升树方法在捕捉非线性关系上的优势。研究也指出群体规模较小和表型数据来自历史记录等局限性,未来需扩大群体并进行功能验证。研究结论认为,将SV与SNP/Indel标记整合显著提高了桂花花期类型的基因组预测准确性,尤其对早花和晚花类别获益明显。这些发现为桂花花期性状的高效分子育种提供了方法学参考,也为其他木本观赏植物复杂性状的基因组预测提供了借鉴。