《Theoretical and Applied Genetics》:Improving hybrid breeding efficiency in winter oilseed rape under sparse multi-environment testing
编辑推荐:
关键信息:平衡的、基于关系的数据省略、多环境预测和谱系-基因组矩阵改善了基因组预测,强调了育种者通过策略性训练集设计和模型选择影响性能的能力。
摘要:基因组预测(genomic prediction)在植物育种中越来越广泛应用,但其在冬油菜(Brassic
关键信息:平衡的、基于关系的数据省略、多环境预测和谱系-基因组矩阵改善了基因组预测,强调了育种者通过策略性训练集设计和模型选择影响性能的能力。
摘要:基因组预测(genomic prediction)在植物育种中越来越广泛应用,但其在冬油菜(Brassica napus L.)杂交育种项目稀疏测试下的稳健性缺乏证据。研究人员评估了数据省略策略、预测方案和模型对基因组预测准确性和选择一致性的影响。针对三种具有对比遗传结构的性状,评估了七种省略场景,使用观察和预测表型之间的相关性以及Cohen's κ作为基因组预测准确性和选择一致性的互补指标。两者随数据省略增加而系统性下降,尽管两个指标仅中度相关。跨环境平衡省略通过稳定方差估计和保持遗传力优于不平衡策略。研究人员的基于关系的数据省略策略进一步提高了预测性能,产生了更高且更稳定的预测准确性。基于组合谱系-基因组关系矩阵的模型能够包含未基因分型的亲本系,并进一步提高了预测性能。使用一般配合力(general combining ability, GCA)+特殊配合力(specific combining ability, SCA)模型的多环境预测始终优于每个环境预测和仅GCA模型;然而,响应是性状特异性的。总体而言,研究结果表明,在数据缩减下,知情省略策略和模型选择显著影响基因组预测的性能。基于关系的平衡省略代表了一种有前景的选择方法,平衡了预测性能和资源效率。
论文解读文章
研究背景:全球对高产作物品种的需求日益增长,推动了杂交育种的发展。冬油菜(Brassica napus L.)作为主要油料作物,占全球食用油产量的约13%和欧洲的35%(FAOSTAT 2025)。然而,大规模田间试验的高昂成本严重限制了育种项目的规模。与此同时,基因分型成本的下降使得广泛表征育种材料成为可能,为表型数据补充了深层信息,提高了选择效率。基因组预测(genomic prediction)利用全基因组标记数据预测未表型基因型的表现,已在植物育种中广泛应用。通过稀疏测试(sparse testing)减少训练群体中的田间小区数量,可进一步降低表型需求。然而,在稀疏测试下,影响预测准确性的关键参数(如遗传力、训练群体大小、训练与测试群体的亲缘关系)发生变化,而群体结构和标记密度保持不变。目前,在冬油菜杂交育种项目中,稀疏测试下基因组预测的稳健性缺乏证据,尤其是省略策略与预测模型之间的交互作用,以及基于亲缘关系指导数据省略的方法尚未得到充分研究。因此,本研究旨在优化稀疏测试下的基因组预测策略,平衡预测性能与资源效率。
研究人员开展了什么研究:研究人员利用来自Norddeutsche Pflanzenzucht Hans-Georg Lembke KG(NPZ)育种公司的4000个冬油菜杂交种,评估了七种数据省略场景(S1-S7)、两种预测方案(每个环境预测P1 vs. 完整多环境试验MET预测P2)和两种预测模型(仅GCA vs. GCA+SCA)对基因组预测准确性和选择一致性的影响。数据来自2022-2025年间的61个多环境试验(MET),每个MET包含72个杂交种,在5-7个地点(共31个环境)种植。三种性状(籽粒产量YSD、籽粒含油量OIL、粕蛋白含量PRM)被评估。基因型数据通过60K单核苷酸多态性(SNP)芯片获得,共27,214个多态SNP。研究使用了两种关系矩阵:基于SNP的基因组关系矩阵(G
(G))和结合谱系信息的谱系-基因组关系矩阵(G
(H)),后者可包含440个未基因分型的亲本系。评价指标包括Pearson相关系数(预测准确性)和Cohen's κ(选择一致性)。省略率从0%到50%逐步增加。
主要关键的技术方法:样本来源为NPZ育种公司的61个MET,每个MET包含72个杂交种,在31个环境中种植。基因分型采用60K SNP阵列,获得27,214个多态SNP。关系矩阵构建使用SNP数据(G
(G))或结合谱系信息(G
(H),Martini et al. 2018方法)。省略场景包括随机均匀省略(S1)、独立随机省略(S2)、保留内部环境均匀省略外部(S3)、保留内部环境独立省略外部(S4)、基于关系均匀省略(S5)、基于关系仅省略外部(S6)、遗传算法优化省略(S7)。预测方案分为每个环境独立预测后合并(P1)和先合并表型再预测(P2)。预测模型采用一般配合力(GCA)模型和GCA+特殊配合力(SCA)模型,使用混合线性模型(sommer包)。评估指标为Pearson相关系数和Cohen's κ,遗传力(H
2)按Piepho和M?hring(2007)方法估计。
研究结果:
1. 总体趋势:预测准确性和Cohen's κ随省略率增加而系统性下降,两者中度相关(r=0.62),表明预测准确性降低伴随着选择一致性下降。
2. 谱系-基因组关系矩阵的影响:使用G
(H)得到的结果与G
(G)高度相似,在0%省略率下,最佳配置(P2+GCA+SCA)的平均预测准确性YSD、OIL、PRM分别为0.88、0.95、0.93。G
(H)允许包含未基因分型亲本,扩展了预测范围且未降低准确性。
3. 省略场景的影响:平衡省略(S1、S5、S7)优于不平衡省略(S2、S3、S4、S6)。保留内部环境完整而省略外部环境(S3、S6)导致预测性能下降最明显,尤其对YSD。基于关系的省略(S5)在50%省略率下平均预测准确性YSD、OIL、PRM分别为0.72、0.84、0.80,高于随机省略(S1)。
4. 预测方案的影响:完整MET预测(P2)在每个性状和省略场景下均优于每个环境预测(P1),平均预测准确性提高0.03-0.05,Cohen's κ提高0.05-0.07。P2的优势在省略率增加时更明显,但YSD在S3和S6下P2的优势下降。
5. 预测模型的影响:包含SCA效应的模型(GCA+SCA)始终优于仅GCA模型,平均预测准确性提高0.03-0.05,Cohen's κ提高0.05-0.07。SCA方差对总遗传方差的贡献(τ)较小(YSD约0.09,OIL约0.05,PRM约0.04),但SCA的加入仍改善了模型拟合。
6. 性状特异性:OIL和PRM的预测准确性和选择一致性始终高于YSD,与其较高的遗传力(H
2:OIL约0.83,PRM约0.73,YSD约0.47)和较低的残余方差比例一致。
7. 方差组分分析:平衡省略(S1、S5、S7)保持了遗传力估计的稳定性,而不平衡省略导致遗传力下降,尤其对YSD。残余方差比例在平衡省略下保持稳定,在不平衡省略下增加。
8. 平衡省略策略比较:在50%省略率下,S5(基于关系)在低预测性能的MET中优势更明显,且预测准确性变异性低于S1(随机)和S7(遗传算法)。S5的测试集预测准确性与其他策略相似,表明无过拟合。
9. 测试集预测准确性:测试集(未测试杂交种)的预测准确性低于总体,随省略率增加从10%省略率时的0.55(YSD)、0.79(OIL)、0.71(PRM)降至50%省略率时的0.46、0.73、0.63。S5和S7的测试集杂交种类型分布中,双亲均在训练集(T2)比例较高(S7达68%),但测试集准确性并未因此提高。
总结讨论部分:讨论指出,预测准确性和选择一致性的中度相关性表明两者不可替代,需互补评估。G
(H)矩阵在保持预测性能的同时扩展了杂交种范围,增加了基因分型投资回报。省略场景中,平衡省略通过稳定方差估计优于不平衡,基于关系的省略(S5)进一步改善,尤其适用于低性能MET。完整MET预测(P2)优于每个环境预测(P1),因为聚合多环境数据更有效地捕捉稳定遗传效应。GCA+SCA模型的优势虽小但一致,可能源于捕获加性×加性上位变异,而非大的SCA方差。高遗传力性状(OIL、PRM)对数据省略更稳健,证实表型数据质量比群体大小更重要。S5在低预测性能MET中的优势及测试集相似准确性表明,基于关系的子采样减少了随机变异性,同时未人为提高准确性。研究结论部分翻译:本研究证明,数据缩减下的基因组预测性能受省略策略、预测方案、关系建模和性状架构的强烈影响。研究人员的结果表明,育种者可以通过知情的策略设计主动影响预测性能,并提供适应和改进的空间。使用G
(H)可以同时利用基因分型和未基因分型亲本信息,增加基因分型投资的回报。然而,强烈的环境效应和性状特异性遗传架构需要谨慎解释。总体上,量身定制的基因组预测策略在资源约束下优化遗传增益方面具有巨大潜力,但需跨群体和作物持续验证。在所有性状中,最稳健且一致的结果是通过跨环境平衡省略、完整MET预测(P2)、同时包含GCA和SCA效应的模型以及G
(H)组合实现的。特别是,基于关系的平衡省略策略(S5)因其更高的预测准确性始终优于随机和基于遗传算法的均匀不平衡省略。因此,研究人员提出这种基于关系的平衡子采样方法作为减少表型工作量的方法,并值得在未来的育种研究中进一步评估。