《BMC Research Notes》:Diversity parameter calculation from SSR data with varying and higher ploidy levels: an example on pear (Pyrus ssp.) data
编辑推荐:
摘要翻译:
目的:SSR标记因其高多态性、共显性和基因组广泛分布,被用于多种遗传分析,如基因分型、亲缘分析和遗传结构分析。大多数下游分析工具通常需要二倍体数据集,但某些植物物种可能具有更高的倍性水平,或物种内可能存在倍性水平不同的基因型。此外,SSR标记可
摘要翻译:
目的:SSR标记因其高多态性、共显性和基因组广泛分布,被用于多种遗传分析,如基因分型、亲缘分析和遗传结构分析。大多数下游分析工具通常需要二倍体数据集,但某些植物物种可能具有更高的倍性水平,或物种内可能存在倍性水平不同的基因型。此外,SSR标记可能表现出多位点行为,且容易产生基因分型错误。因此,现有分析工具往往无法满足植物数据集的需求。尽管如此,即使对于多倍体数据集,准确估计遗传多样性参数仍然至关重要。这强调了适当调整此类数据集以保留其生物学有效性的重要性。
结果:本研究以梨品种数据集为例,评估数据调整对遗传多样性参数的影响。将包含多个具有两个以上等位基因的标记的原始数据集与三个修改后的子集(排除了额外等位基因(超过两个)和选定标记)进行比较。结果表明,遗传多样性统计在各数据集间基本保持一致。因此,本研究使用的脚本为后续分析前的数据集调整提供了可靠基础。
**论文解读:基于SSR数据计算不同及更高倍性水平的遗传多样性参数——以梨(Pyrus ssp.)数据为例**
**研究背景与问题**
简单序列重复(Simple Sequence Repeat, SSR)标记因其高多态性、共显性及基因组广泛分布,被广泛用于基因分型、亲缘分析和群体遗传学研究。然而,大多数下游分析工具(如CERVUS、GenAlex、STRUCTURE)通常要求输入二倍体数据集,而植物中普遍存在多倍化现象,且同一物种内可能存在倍性水平不同的个体。此外,SSR标记可能因基因组中的多结合位点(如节段重复、同线性或旁系同源区域)表现出多位点行为,产生超过预期数量的等位基因;同时,基因分型错误(如等位基因判读误差)也可能导致额外等位基因的出现。这些因素使得现有工具难以直接适用于植物数据集,常导致数据因不符合输入格式而被部分或完全排除,造成信息丢失和统计功效下降。因此,在保留生物学有效性的前提下,合理调整数据集以适应后续分析,并准确估计遗传多样性参数,成为亟待解决的问题。
**研究内容与结论**
研究人员使用来自德国果树基因库(German Fruit Genebank, GFG)的421个梨品种(Pyrus ssp.)数据集,该数据集基于17个由欧洲植物遗传资源合作计划(European Cooperative Programme for Plant Genetic Resources, ECPGR)推荐的SSR标记生成,并通过OpenAgrar平台公开。原始数据中,许多二倍体品种表现出超过两个等位基因变异,且部分标记(如CH01d09和CH05a02)在多个基因型中显示多达六个等位基因,提示存在多位点行为或倍性差异。为评估数据调整对遗传多样性参数的影响,研究人员开发了R脚本“SSR_DivParCal”,该脚本能够处理不同及更高倍性水平的数据,并计算包括等位基因数(Na)、有效等位基因数(Ne)、观测杂合度(Hobs)、期望杂合度(Hexp)、多态信息含量(PIC)、无关个体身份概率(PID)和同胞个体身份概率(PIDsib)在内的常用多样性参数。研究比较了原始数据集与三个调整子集:(I)移除标记CH01d09和CH05a02(‘rem2markers’);(II)强制二倍体化,仅保留每个标记的前两个等位基因(‘force2x’);(III)同时进行上述两种调整(‘rem2markers_force2x’)。结果显示,各数据集的平均期望杂合度(?Hexp)范围在0.81至0.83之间,差异极小;观测杂合度(?Hobs)在原始数据集与‘force2x’数据集间完全一致;而Na和Ne的变异最大,但整体多样性参数变化幅度有限。Wilcoxon符号秩检验表明,‘force2x’和‘rem2markers_force2x’与原始数据集在Hexp、PIC、PID和PIDsib上存在显著差异(p<0.001),但实际数值差异很小。此外,将‘force2x’和‘rem2markers_force2x’数据集用CERVUS和GenAlex软件分析,结果与“SSR_DivParCal”脚本的输出完全一致,验证了脚本的有效性。通过R包polysat计算的PIC值也与脚本结果无显著差异。研究人员认为,基于遗传多样性参数,‘rem2markers_force2x’数据集(即移除两位点标记并强制二倍体化)可作为后续遗传结构分析的合理选择。
**主要关键技术方法**
本研究采用了以下关键技术方法:
1. 基于公开的梨品种数据集(来自GFG,包含421个品种,分子数据由17个ECPGR推荐SSR标记产生),原始数据中部分个体经流式细胞术确认倍性(92个二倍体,17个三倍体,312个未检测)。
2. 开发R脚本“SSR_DivParCal”,利用readxl、adegenet和openxlsx包读取和处理数据,计算遗传多样性参数(包括Na、Ne、Hobs、Hexp、PIC、PID和PIDsib),缺失数据在等位基因频率计算中被排除。
3. 对原始数据集进行三种调整:移除标记(CH01d09和CH05a02)、强制二倍体化(仅保留前两个等位基因)、组合调整。
4. 使用CERVUS、GenAlex和polysat软件对调整后数据进行验证,并通过Wilcoxon符号秩检验比较数据集间差异。
**研究结果**
- **原始数据特征**:部分品种表现出与预期倍性不符的等位基因数,如二倍体品种出现多个等位基因,CH05a02和CH01d09标记在多个基因型中显示多达六个等位基因,与ECPGR参考数据比较确认了多位点行为(如CH05a02在HiDRAS网站被标记为多位点标记)。
- **多样性参数比较**:平均期望杂合度(?Hexp)在原始数据中最高(0.83),在‘rem2markers_force2x’中最低(0.81),变异范围仅0.02;?Na和?Ne的变异最大,但?Hobs、?PIC、?PID和?PIDsib的变异均≤0.3。统计检验显示‘force2x’和‘rem2markers_force2x’与原始数据显著不同,但实际差异微弱。
- **工具验证**:CERVUS和GenAlex计算的结果与“SSR_DivParCal”脚本完全一致,polysat计算的PIC值也无显著差异,表明脚本功能可靠。
**讨论与结论**
讨论部分指出,多数生信工具基于二倍体哺乳动物设计,难以处理植物中常见的倍性差异和多位点SSR标记。虽然R包polysat可处理不同倍性,但未计算标准多样性参数。“SSR_DivParCal”脚本填补了这一空白,可保留所有等位基因而不依赖倍性先验知识。研究还讨论了多位点行为的可能原因(如染色体同线性、合成区块)和技术误差(如stutter带),并建议使用三核苷酸或更高重复模式的SSR以减少误判。研究强调,在最终分析前使用该脚本评估数据集调整的影响,可提高数据处理的透明度和可靠性。
结论部分(原文结论未单独列出,但根据摘要和讨论可概括):本研究通过梨数据集示例,证明了“SSR_DivParCal”脚本能够有效计算不同倍性水平下的遗传多样性参数,且调整后的数据集(如‘rem2markers_force2x’)在遗传多样性统计上与原始数据基本一致,可作为后续分析的基础。该脚本为处理具有额外等位基因或多倍性的SSR数据集提供了一种稳健的预处理方法,有助于提高数据分析的准确性和可重复性。论文发表在《BMC Research Notes》。