《Theoretical and Applied Genetics》:Genomic selection in timothy (Phleum pratense L.): a comprehensive evaluation of prediction models, multi-trait strategies, and forward validation across Norwegian environments
编辑推荐:
摘要译文:梯牧草(Phleum pratense L.)是北欧最重要的饲草,然而基因组选择在该六倍体物种中尚未得到系统评估。研究人员评估了来源于49个品种/群体双亲杂交的889个FS2家系。这些FS2家系通过测序分型
摘要译文:梯牧草(Phleum pratense L.)是北欧最重要的饲草,然而基因组选择在该六倍体物种中尚未得到系统评估。研究人员评估了来源于49个品种/群体双亲杂交的889个FS2家系。这些FS2家系通过测序分型(GBS)获得30,698个SNP标记进行基因分型,并在挪威南部一个高原和一个低地大陆性地点进行了三个收获年的田间试验。研究人员比较了九种基因组预测模型,涉及六个产量性状(每次刈割及总干物质产量)和六个品质性状(蛋白质、消化率及纤维组分),每年三次刈割。训练集内交叉验证精度为中等至较高(平均r = 0.62),随机森林(Random Forest)和支持向量回归(SVR)持续优于GBLUP。然而,使用213个独立FS2家系的前向验证显示精度大幅下降(平均r = 0.16),30个性状–数据集组合中仅16个达到统计学显著(p < 0.05)。跨环境估计的基因组遗传力(GREML)范围为品质性状接近零至产量性状0.55。多性状模型较单性状方法提高了3–5%的精度,而随机森林与FS2家系–环境互作模型实现了最高的训练集内精度(平均r = 0.71)。标记密度分析显示精度在约15,000个SNP处趋于平台期。通过多性状REML估计了产量组分性状间的遗传相关;品质性状间的遗传相关因基因组遗传力较低而无法可靠估计。多性状选择指数确定了表现最佳的FS2家系用于进一步杂交推荐。这些结果为六倍体梯牧草的GS实施提供了基准,并强调交叉验证显著高估了对真正独立材料的预测精度。
**梯牧草基因组选择研究解读**
**一、研究背景与问题**
梯牧草(*Phleum pratense* L.)是北欧地区最主要的栽培饲草物种,也是全球最重要的冷季型禾草之一。在挪威,梯牧草占播种草地的约70–80%,对高纬度地区的畜牧生产系统至关重要。作为一种异源六倍体物种(2n = 6x = 42),其基因组庞大且复杂,估计大小约为4.25 Gb,这为已在二倍体禾草物种中成功应用的分子育种方法带来了独特挑战。近年来基因分型技术的进步,特别是测序分型(genotyping-by-sequencing, GBS)技术,使得在多倍体物种中生成全基因组标记数据成为可能,为基因组预测方法的应用打开了大门。
基因组选择(genomic selection, GS)由Meuwissen等人于2001年首次提出,利用全基因组标记信息预测选择候选个体的育种值,而无需直接表型鉴定。该方法已彻底改变了奶牛育种项目,并在小麦、玉米、水稻和大麦等主要作物中得到日益广泛的应用。然而,饲草育种项目面临对GS实施尤为严峻的挑战,包括多年生性、广泛的基因型与环境互作(G×E),以及产量和营养品质等多性状的重要性。
尽管梯牧草在北欧农业中具有重要的经济价值,但与其他主要作物相比,该物种的基因组选择研究仍然有限。梯牧草的六倍体特性带来了若干方法学挑战:(1)等位基因剂量的复杂模式使SNP调用和解释复杂化;(2)亚基因组间的部分同源重组影响连锁不平衡模式;(3)异交禾草物种较大的有效群体大小可能降低连锁不平衡程度;(4)与二倍体模式物种相比参考基因组资源有限。这些因素可能影响基因组预测模型的准确性和可转移性,使得经验性评估至关重要。此外,基因组选择研究中的一个关键但常被忽视的问题是交叉验证(CV)精度与前向验证精度之间的区别。大多数作物GS研究仅报告CV估计值,这可能因相关家系同时出现在训练集和测试集中而高估预测精度。使用完全独立的FS
2家系进行前向验证,可为实际育种项目中可达到的精度提供更现实的估计。
**二、研究目标与主要方法**
本研究的主要目标是:(1)利用30,698个GBS来源的SNP标记,评估九种基因组预测模型在梯牧草全同胞家系产量和品质性状预测中的精度;(2)比较训练集内交叉验证与使用独立全同胞家系的前向验证;(3)评估多性状、多地点及G×E互作模型;(4)估计基因组遗传力和遗传相关;(5)检验训练群体大小和标记密度对预测精度的影响;(6)为梯牧草育种项目中基于GS的FS
2家系选择和杂交策略制定实用建议。
研究材料包括889个来源于49个品种/群体双亲杂交的FS
2家系,在挪威南部两个对比地点(Arneberg和L?ken)进行了2002–2012年为期10年的田间试验。另外建立了213个独立验证FS
2家系用于前向验证。产量性状包括每次刈割及总干物质产量,品质性状通过近红外反射光谱(NIRS)预测,包括粗蛋白含量(R?prot)、酸性洗涤纤维(ADF)、中性洗涤纤维(NDF)、体外消化率(Ford?y)、肠道可吸收氨基酸含量(AAT)和瘤胃蛋白平衡(PBV)。基因分型采用GBS技术产生SNP标记,经质量控制后最终获得30,698个多态性SNP。由于梯牧草为六倍体,标记采用二倍化双等位基因编码(?1/0/1)。主要预测方法包括GBLUP/岭回归、LASSO、弹性网络、贝叶斯岭回归、支持向量回归(SVR)、随机森林(RF)、XGBoost梯度提升、LightGBM和多层感知器(MLP)神经网络。基因组遗传力通过限制性最大似然(GREML)估计,遗传相关通过多性状REML估计。
**三、研究主要结果**
**群体结构与标记特征:** 经质量控制后,最终标记面板包含覆盖889个FS
2家系的30,698个多态性SNP。主成分分析(PCA)显示群体结构较弱,前三个主成分仅分别解释总标记方差的0.6%、0.4%和0.4%,与FS
2家系间极低的亲缘关系一致。层次聚类在每个地点鉴定了六个主要遗传亚组,大体与全同胞家系的系谱背景对应。
**基因组遗传力:** 产量性状的基因组遗传力为中等水平,总干物质产量(SUMDM)为0.37 ± 0.03,各刈割产量性状范围为0.14 ± 0.04至0.55 ± 0.03。品质性状的基因组遗传力较低:PBV为0.14 ± 0.02,ADF为0.11 ± 0.02,R?prot为0.08 ± 0.02,NDF为0.05 ± 0.02,Ford?y为0.04 ± 0.02,AAT接近零(0.00 ± 0.02)。
**训练集内交叉验证精度:** 训练群体内的五折交叉验证显示各性状和模型间精度为中等至较高。在Arneberg,产量性状最佳模型达到r = 0.77–0.82,随机森林和SVR持续表现最佳。SUMDM是最可预测的性状(RF:r = 0.82)。品质性状的训练集内CV精度范围为r = 0.42至0.68。所有30个性状–数据集组合的总体平均训练集内CV精度为r = 0.62。
**前向验证精度:** 使用213个独立FS
2家系的前向验证显示预测精度显著低于训练集内CV。所有组合的平均前向验证精度为r = 0.16,与CV估计相比平均泛化差距为0.46。30个组合中仅16个(53%)在p < 0.05水平达到统计学显著。Arneberg的最佳前向验证结果出现在KGDM201(SVR,r = 0.52)和SUMDM(GBLUP,r = 0.25)。品质性状中,PBV在前向验证中表现最佳。值得注意的是,最佳前向验证模型通常与最佳交叉验证模型不同,表明训练集内拟合最佳的模型不一定对独立材料具有最佳泛化能力。
**模型比较:** 在九种评估模型中,机器学习方法通常获得较高的训练集内CV精度,但前向验证中并不一致优于简单方法。随机森林的平均CV精度最高(r = 0.67),其次为SVR(r = 0.65)和XGBoost(r = 0.63)。GBLUP的平均CV精度为r = 0.58。然而前向验证中,SVR和GBLUP经常取得与集成方法相当或更好的结果。
**多性状和多地点模型:** 多性状(MT)模型较单性状模型提供适度但一致的改进,MT-RF在Arneberg的平均训练集内CV精度为r = 0.70,较最佳单性状模型(r = 0.67)提高3–5%。包含地点作为协变量和标记–地点互作项的基因型–环境互作(G×E)模型实现了最高的总体训练集内精度(G×E-RF:平均r = 0.71),优于合并模型和单地点模型。
**标记密度和训练群体大小效应:** 预测精度随标记密度增加而提高,但约15,000个标记(全面板的50%)处趋于平台期。对于SUMDM,GBLUP精度从1,534个标记(5%)时的r = 0.54提高至完整30,698个标记时的r = 0.73。预测精度随训练群体大小增加呈典型的收益递减曲线,约250–300个FS
2家系后改进速率显著降低。
**遗传相关和选择建议:** 产量性状间的遗传相关通过多性状REML可靠估计。总干物质产量与其组分刈割产量呈强遗传相关。品质性状因基因组遗传力较低,多数遗传相关无法可靠估计。多性状选择指数识别出表现最佳的FS
2家系,排名第一的为Geno_277(KGB × KGB杂交后代),具有高总干物质产量(3,316 kg/ha)、良好消化率(75.6%)和适宜粗蛋白含量(12.7%)。杂交推荐通过平衡遗传优势和遗传距离进行优化。
**四、讨论与结论**
本研究的核心发现是训练集内交叉验证(平均r = 0.62)与前向验证精度(平均r = 0.16)之间存在较大的泛化差距。这一精度在预测真正独立FS
2家系时降低约74%,对梯牧草育种中的GS实施具有深远意义。造成这一较大差距的因素可能包括:全同胞家系结构使相关家系在CV中共享遗传背景和长程单倍型配置从而高估精度;六倍体基因组的复杂性意味着二倍化标记可能捕获群体特异性连锁模式而无法转移至独立材料;训练和验证田间试验周期之间的环境差异增加了噪声。GBLUP和SVR比复杂机器学习模型表现出更好的泛化能力,与偏差–方差权衡一致。
尽管存在较大泛化差距,这些结果支持基因组选择在梯牧草育种中的潜在效用,特别是对于具有稳健前向验证的性状(PBV、R?prot、KGDM201、KGDM101)。即使前向验证精度为r = 0.20–0.50,GS通过实现未表型幼苗的早期选择并减少品种释放前所需的田间评估周期数,仍可加速遗传增益。研究建议梯牧草育种项目应建立至少300个FS
2家系的遗传多样性训练群体,使用真正独立的FS
2家系验证预测模型,采用15,000–20,000个SNP标记作为成本效益基因分型策略,并在可用多地点数据时应用G×E模型,同时使用GBLUP或SVR作为对独立材料泛化良好的稳健基线模型,并将GS与表型选择结合于两阶段方法中。
结论:本研究利用889个FS
2家系的30,698个GBS来源SNP标记,在挪威育种种质中对六倍体梯牧草基因组选择进行了全面评估,揭示了GS在该重要饲草物种中的潜力和局限性。训练集内预测精度令人鼓舞(平均r = 0.62),但使用213个独立FS
2家系的前向验证显示精度大幅降低(平均r = 0.16),仅53%的性状–数据集组合达到统计学显著。这一泛化差距大于二倍体作物中的典型报道,强调了前向验证在多倍体GS研究中的重要性。机器学习模型在训练集内优于经典方法但泛化稳健性较差。多性状模型将精度提高3–5%,G×E互作模型实现了最高的训练集内精度(r = 0.71)。约15,000个SNP的标记密度和250–300个FS
2家系的训练群体捕获了大部分可用预测信息。这些发现为梯牧草GS实施确立了基准,并为将基因组信息整合到北欧饲草育种项目提供了实用指导。