《Heredity》:Genetic covariance between plant biparental populations: concept and estimation
编辑推荐:
亲属间协方差、同一环境下不同性状间的协方差以及同一性状在不同环境下的值之间的协方差,长期以来在植物和动物育种中得到了广泛应用。这些协方差隐含的一个假设是,个体属于单一群体,或者各群体具有同质的协方差。这一假设在实践中经常被违反,然而目前缺乏一个用于定义和估计群
亲属间协方差、同一环境下不同性状间的协方差以及同一性状在不同环境下的值之间的协方差,长期以来在植物和动物育种中得到了广泛应用。这些协方差隐含的一个假设是,个体属于单一群体,或者各群体具有同质的协方差。这一假设在实践中经常被违反,然而目前缺乏一个用于定义和估计群体间协方差的框架。本研究的目标是开发并验证一个框架,通过分子标记效应估计植物双亲群体间的遗传协方差。研究人员推导了一种解析方法,用于估计此类群体间的方差和协方差,并在模拟数据集以及来自商业育种计划的玉米(Zea mays L.)数据集中对其进行了验证。模拟群体证实了该方法符合预期行为,而玉米数据集则显示了性状特异性和群体特异性的(协)方差模式。该方法需要以下输入,这些输入均可估计或近似获得:每个群体的标记效应;一张连锁图谱;连锁相信息;以及群体的近交系数。群体间协方差不仅在基因组预测中具有潜在应用价值,在生态学和驯化等非育种领域同样具有应用前景。
论文解读文章
一、研究背景与问题
协方差是衡量两个随机变量联合变异性的度量,长期以来一直是数量遗传学的奠基性概念。早在1918年,Fisher的开创性论文就确立了亲属间协方差在数量遗传学中的核心地位。同一环境下不同性状之间、以及同一性状在不同环境之间的协方差也早已被广泛研究。然而,这些协方差分析均隐含一个基本假设:个体属于单一群体,或不同群体间具有同质的协方差。这一假设在实践中经常被违反——植物和动物育种者经常面对来自不同群体、品种、亚种甚至物种的个体。例如,美国玉米育种系分属Iowa Stiff Stalk Synthetic(BSSS)杂种优势群和非BSSS杂种优势群;水稻品系分属籼稻和粳稻亚种;肉牛包含安格斯、利穆赞等多个品种。群体内或品种内的遗传参数已有明确定义,例如两个籼稻品系杂交后代群体的遗传方差可以通过标准方法估计,但迄今为止,缺乏一个框架来定义和估计来自不同杂交组合(如籼稻杂交群体与粳稻杂交群体)个体之间的遗传协方差。本研究正是针对这一空白,旨在开发并验证一个基于分子标记效应估计双亲群体间遗传协方差的框架。
二、研究内容与主要结论
研究人员的目标是开发并验证一个用于估计双亲群体间遗传协方差的框架,这些群体由近交系间杂交产生,估计基于分子标记效应。研究人员推导了一种解析方法,可估计任意近交水平下此类群体间的方差和协方差,并在已知方差和协方差的模拟数据集以及来自商业育种计划的玉米数据集上进行了验证。模拟群体证实了该方法符合预期行为:估计的方差和协方差与真实值高度吻合,遗传方差在连续群体间按预期递减50%,群体i与群体(i+1)之间的协方差与群体(i+1)的方差相匹配。玉米数据集则显示了性状特异性和群体特异性的(协)方差模式。该方法所需输入包括:每个群体的标记效应、连锁图谱、连锁相信息以及群体的近交系数,这些均可直接估计或近似获得。该框架具有重要的应用价值,不仅可用于基因组预测,还可扩展到生态学、驯化研究等非育种领域,以及杂交育种、杂种预测、遗传多样性管理和QTL定位等实践场景。
三、关键技术与方法
研究人员采用的主要技术方法包括:其一,推导了一种解析方法,通过扩展Osthushenrich等(2017)的公式,从标记效应估计双亲群体的遗传方差和群体间遗传协方差,适用于任意近交水平(0≤F≤1);其二,通过定义随机变量Z的基因型值及其事件空间,利用连锁不平衡系数Djk(由有效重组率Rjk计算)推导出位点间协方差的解析表达式;其三,当连锁图谱不可用时,可直接从观察到的标记和单倍型频率计算Djk(F=1和F=0情形);其四,模拟验证采用R软件(R Core Team 2021)中的AlphaSimR包(Gaynor等2021),模拟了4个连续递减的群体结构,每个群体1000个随机个体,10条染色体、每条2摩根、每染色体20个QTL,设置了F2(F=0)、F3(F=0.5)和DH(F=1)三种近交水平,重复1000次;其五,玉米数据集来自AgReliant Genetics商业育种计划的4个双亲群体(A/B、C/B、C/D、E/F),每个群体130至242个DH系分别与两个测验种杂交,共8个测交群体,在多环境田间试验中评估了籽粒产量、籽粒含水量、株高、穗位高和容重5个性状,标记数据为Illumina iScan平台的3072个SNP位点,经质控后每个群体保留447至863个多态SNP;其六,标记效应通过岭回归最佳线性无偏预测(RR-BLUP)估计,并测试了三种不同的收缩因子定义,最终采用基于有效独立检验数(Neff)的收缩因子,以获得最小偏差的方差估计。
四、研究结果
模拟数据集结果。 在DH群体中,1000次重复中群体1的分离位点数为200(标准差0),群体2为100.3(18.3),群体3为49.9(15.1),群体4为24.9(10.7),符合每代递减50%的预期。使用已知连锁图谱时,遗传方差(VG)的解析估计从群体1的200.85降至群体4的25.17;使用从观察标记频率估计的Djk时,估计值从199.77降至24.93。观察VG与解析估计之间的相关性在使用已知连锁图谱时均值为0.99,使用估计Djk时均值为0.99,两种方法之间的相关性均值为1.00。两种方法的协方差估计之间的相关性均值为1.00。当模拟群体为F2时,方差和协方差为DH群体的50%;F3群体则为DH群体的75%,与理论预期(1+F)因子一致。
玉米数据集结果。 在三种收缩因子定义下,解析估计与REML估计的VG均高度相关。采用λNeff的标记效应产生近乎无偏的VG估计,λ50cM导致向上偏差,λNm导致向下偏差,各性状内平均相对偏差的所有两两差异在0.05水平上均显著。在预测能力(rMP)方面,各方法间无显著差异。采用λNeff时,各群体解析估计的VG范围:籽粒产量为6.01至59.38 t2ha–2(均值19.41),籽粒含水量为31.82至299.09 g2kg–2(均值93.88),株高为5.08至60.55 cm2(均值27.77),穗位高为2.88至31.09 cm2(均值15.99),容重为4.19至196.09 g2L–2(均值70.4)。群体间遗传协方差估计随性状而异:籽粒产量为–2.57至9.52 t2ha–2(均值1.67),籽粒含水量为–4.49至82.89 g2kg–2(均值17.05),株高为0.29至22.12 cm2(均值4.14),穗位高为0.42至4.70 cm2(均值2.17),容重为–2.19至60.72 g2L–2(均值8.55)。群体间标记效应相关性普遍低至中等:籽粒产量为–0.12至0.36(均值0.10),籽粒含水量为–0.07至0.46(均值0.12),株高为0.09至0.49(均值0.19),穗位高为–0.01至0.29(均值0.17),容重为–0.01至0.40(均值0.13)。遗传协方差估计与标记效应相关性之间的相关系数:籽粒产量为0.52(p<0.01),籽粒含水量为0.65(p<0.01),株高为0.70(p<0.01),穗位高为0.32(p=0.24),容重为0.77(p<0.01)。最高协方差和标记效应相关性出现在同一群体不同测验种之间,最低值大多出现在无共享亲本的群体之间。
五、讨论与结论
讨论部分指出,群体间遗传协方差的产生机制可通过一个简单示例理解:当两个DH群体各有一个SNP与一个QTL连锁时,群体间标记效应的遗传协方差是重组频率、连锁相和QTL效应大小的联合函数。该框架的一个关键优势在于其通用性:将早期用于遗传方差估计的解析框架(如Lynch和Walsh 1998;Osthushenrich等2017;Lehermeier等2017)扩展到了群体间遗传协方差的估计,覆盖了近交系间双亲杂交产生的全部近交水平范围。与多性状RRBLUP联合估计方法相比,该框架将分析分解为独立的单群体分析,避免了跨群体标记效应和协方差参数的联合估计,特别适合大量双亲群体的应用场景。例如,5000个标记和50个双亲群体时,多性状方法需要联合估计250,000个标记效应和1275个协方差参数,而该方法仅需50次独立的RRBLUP分析。研究人员还评估了基于标记效应相关性和基于标记相似性回归的两种替代方法,但两者在模拟数据中表现不佳,未进一步采用。方差估计的准确性在很大程度上取决于标记效应估计中使用的收缩参数,基于有效独立检验数的校正产生了近乎无偏的估计,且与REML估计的VG相关性超过0.97。该方法的假设是群体内所有个体具有相同的近交水平F,主要局限性在于需要标记效应,而标记效应因群体而异,且依赖表型和标记数据的可用性,因此不适用于尚未表型化或尚未创建的群体。该框架可扩展到非近交亲本产生的群体,在育种中可将异质遗传协方差纳入预测模型以提高准确性,在QTL定位中可通过整合遗传相关的群体提高基因检测的功效和分辨率,在生态和进化遗传学中可用于表征亚群体间的遗传异质性,在杂交带系统、遗传多样性管理、保护生物学以及群体结构和适应性研究中具有直接应用价值。