《The Plant Genome》:Sparse phenotyping for wheat grain yield enabled by multiomics prediction
编辑推荐:
摘要翻译:
籽粒产量是小麦育种的核心目标,然而准确预测籽粒产量仍具挑战性,因为该性状受众多基因控制且对环境变化响应强烈。基因组选择(GS)通过实现基于基因组的遗传价值预测提高了育种效率,但在逆境环境下籽粒产量的可预测性(PA)常常受限。与此同时,利用无人机
摘要翻译:
籽粒产量是小麦育种的核心目标,然而准确预测籽粒产量仍具挑战性,因为该性状受众多基因控制且对环境变化响应强烈。基因组选择(GS)通过实现基于基因组的遗传价值预测提高了育种效率,但在逆境环境下籽粒产量的可预测性(PA)常常受限。与此同时,利用无人机(UAV)的高通量表型分析(HTP)技术的进步提供了能够捕获环境响应型植株表现的表型组数据,并可能补充基因组信息。在本研究中,研究人员评估了在灌溉、干旱和热胁迫环境下预测优质面包小麦品系籽粒产量的基因组模型与表型组模型。利用稀疏表型分析框架,研究人员比较了参数模型与非参数模型。在环境内及跨环境稀疏表型分析情景下评估了PA。基因组模型提供了稳定的基线,并在表型数据不完整时实现了跨环境的信息有效共享。仅基于表型组的模型捕获了环境特异性的植株响应,但对环境背景更为敏感。整合基因组与表型组信息的多组学模型一致地实现了最高的PA,在胁迫条件下增益最大。总体而言,研究结果表明,在稀疏表型分析设计中整合基因组学和基于UAV的表型组学,为提高小麦籽粒产量预测提供了一种实用且可扩展的方法。
多组学预测提升小麦籽粒产量:稀疏表型分析框架下的基因组与无人机表型组整合研究解读
**研究背景与问题**
小麦(*Triticum aestivum* L.)籽粒产量(GY)是育种项目的核心目标,但其由众多微效基因控制,且受环境变异和管理措施强烈影响,导致基因型×环境互作(G×E)显著,尤其在灌溉、干旱和热胁迫等对比鲜明的环境下,选择决策复杂化,遗传增益的稳定性受限。基因组选择(GS)利用全基因组分子标记预测遗传价值,已广泛用于小麦育种并显著提升效率,但籽粒产量的可预测性(PA)在逆境环境下往往中等偏低,尤其在跨环境、跨年份预测或表型数据不完整时。为缓解表型数据采集成本和物流限制,稀疏表型分析(或稀疏测试)策略被提出,即在每个环境中仅对部分基因型进行表型鉴定,其余缺失观测通过基因组信息和跨环境相关性进行预测。与此同时,基于无人机(UAV)的高通量表型分析(HTP)技术可快速、无损地获取冠层反射光谱等表型组数据,捕获与生物量积累、冠层结构、色素组成和胁迫响应相关的信息。然而,将表型组数据整合到育种预测流程仍面临高维性、时间结构、环境依赖性以及稀疏设计下光谱数据缺失等挑战。因此,在真实育种场景中系统评估基因组、表型组及其整合在稀疏表型分析设计下的预测性能,对于优化预测流程、指导育种实践具有重要意义。
**研究内容与结论**
该研究利用国际玉米小麦改良中心(CIMMYT)在墨西哥索诺拉州奥布雷贡城试验田于2022–2023生长季测试的1029份优质面包小麦品系(F6代,处于第二阶段产量试验),在四种模拟环境(B2IR:边际灌溉;B5IR:最佳灌溉;BDRT:严重干旱;BEHT:早期热胁迫)下评估了基因组、表型组及多组学模型对籽粒产量的预测能力。研究采用稀疏表型分析设计(CV2验证),比较了参数与非参数模型。结果表明,基因组模型提供了稳定的基线,并在表型数据不完整时有效实现跨环境信息共享;仅基于表型组的模型捕获了环境特异性植株响应,但对环境背景敏感;整合基因组与表型组信息的多组学模型一致获得最高PA,尤其在胁迫条件下增益最大。研究证实,将基因组学和基于UAV的表型组学纳入稀疏表型分析设计,可显著提升小麦籽粒产量预测的准确性和效率。该论文发表于《The Plant Genome》。
**主要关键技术方法**
研究人员使用了以下关键方法:(1)基因分型:采用小麦基因分型测序(GBS)流程获得18,239个单核苷酸多态性(SNP)标记,经质量过滤和BEAGLE v5.0填充后构建基因组关系矩阵(GRM);(2)UAV多光谱成像:利用搭载MicaSense RedEdge-M多光谱相机的DJI Matrice 100无人机,在生育期至成熟期共五个飞行日期采集蓝、绿、红、红边和近红外(NIR)五个波段的冠层反射率数据,经Pix4Dmapper拼接和Hiphen公司质量控制后提取各小区波长值;(3)表型组关系矩阵(PRM)构建:采用两种方法(M1:跨环境计算波长BLUE并构建单一PRM;M2:先利用标记预测各环境缺失波长,再分环境构建PRM后合并);(4)预测模型:包括基因组最佳线性无偏预测(GBLUP)、基于基因组信息的再生核希尔伯特空间(RKHS)回归、表型组BLUP(PBLUP)、表型组RKHS(P-RKHS)以及整合两类信息的P-GBLUP、G-P-RKHS和混合核方法等,在环境内五折交叉验证和跨环境稀疏表型CV2验证下评估PA。
**研究结果**
**3.1 统计分析**
对各模拟环境的籽粒产量进行了描述性统计、方差组分和遗传力估计。BLUE范围从BDRT的3.16 t/ha到B5IR的9.75 t/ha;遗传力在B5IR(0.45)和BEHT(0.67)之间变化。各波长在各环境和飞行日期下均表现出较高遗传力,其中B5IR环境下首次飞行日期(2023年2月15日)的蓝色波段遗传力高达0.92。环境间籽粒产量相关性分析显示,B2IR与BEHT相关性最高(0.38),BDRT与BEHT相关性最低(0.09)。反射率模式随波长和飞行日期变化,干旱胁迫环境下后期飞行日期的较高反射率可能反映了作物发育提前、衰老和胁迫进程。变量间相关性分析表明,在B2IR和BEHT环境中,多数波长与GY呈负相关,而NIR与GY呈正相关(分别为0.37和0.56);在B5IR和BDRT环境中,波长与GY相关性较弱。SREG分析显示所有变量均存在G×E互作,GY双标图清晰分离B5IR和BEHT,而波长双标图普遍分离B5IR与其他环境。
**3.2 预测结果**
在环境内验证中,GBLUP和RKHS的PA无显著差异,但环境间差异明显,PA范围从BDRT的0.21(GBLUP)到BEHT的0.39(GBLUP和RKHS)。在稀疏表型(CV2)验证中,仅基因组模型较环境内结果有提升,例如B2IR中GBLUP的PA从0.36增至0.48。表型基线(PB)模型在所有环境下均不如基因组模型,但仅在B2IR中优于纯表型组模型,且始终劣于多组学模型。仅表型组模型中,RKHS在M1和M2下均优于GBLUP,例如BDRT中PBLUP-M2的PA为0.18,而P-RKHS-M2为0.29;M2方法整体优于M1,例如P-RKHS在B5IR中从M1的0.26提升至M2的0.35。整合基因组和表型组信息的模型普遍达到与仅基因组模型相当或更高的PA,但优势依赖于环境。例如,G-P-RKHS-M1在BEHT中PA达0.59,而仅基因组G-RKHS为0.50。混合核方法在B2IR、B5IR和BDRT中较其他多组学模型有边际改善,而M2方法在整合情景下表现不稳定(如G-P-RKHS-M2)。
**讨论与结论**
研究讨论指出,基因组的PA具有强环境依赖性,极端干旱下较低,这与以往研究一致。稀疏表型设计与多环境基因组预测结合可显著提升PA,尤其在低环境内PA环境下,表明稀疏表型不仅能降低成本,还能通过跨环境信息借用稳定预测。表型组模型性能低于基因组模型,但RKHS优于GBLUP,说明光谱反射率与GY之间存在非线性关系;M2方法优于M1,表明保留环境特异性光谱模式对有效预测至关重要。多组学模型表现最优,证实基因组和表型组信息互补:基因组捕获稳定的加性遗传关系,表型组反映实际植株表现和环境响应。混合核方法通过显式建模基因组与表型组核间的互作,可提取额外预测信号,但增益有限。研究还从理论角度解释了各模型行为差异:基因组模型利用跨环境稳定的加性关系,RKHS能捕捉G×E引起的非线性响应,表型组模型对环境特异信号敏感,多组学模型则联合稳定遗传效应和环境响应表达。局限性包括仅单一生长季和地点、UAV飞行日期未按热时间或生理阶段对齐、仅使用多光谱数据等。未来研究应扩展至多年多点、采用热时间或物候期对齐的光谱测量、探索热红外或高光谱数据,以及利用深度学习方法整合多组学数据。结论部分强调,在明确定义的稀疏测试设计中整合基因组学和基于UAV的表型组学,可在对比环境下改善小麦品系的GY预测,尽管表型组整合的效益依赖环境。基因组预测提供稳健基础,表型组可添加环境响应信息,二者整合能在光谱特征捕获相关生理变异时产生更准确的预测。这些发现支持在现代小麦育种项目中持续推进和定向采用基因组-表型组稀疏测试策略,以应对资源限制和不断增长的环境变异性。