
-
生物通官微
陪你抓住生命科技
跳动的脉搏
多少名运动员才算足够?两次试验运动场测试中可靠性指标的小样本不稳定性以及实现可靠最小可检测变化所需的最小样本量:一项蒙特卡洛研究
《BMC Sports Science, Medicine and Rehabilitation》:How many athletes are enough? Small-sample instability of reliability indices and the minimum sample size for a trustworthy minimal detectable change in two-trial sport field tests: a Monte Carlo study
【字体: 大 中 小 】 时间:2026年08月14日 来源:BMC Sports Science, Medicine and Rehabilitation 2.1
编辑推荐:
摘要背景体育与康复领域测试的重复测试可靠性通常是基于极小的样本量来评估的,但所得指标的不稳定性以及所需参与者数量却很少被量化。我们采用蒙特卡洛模拟方法,在符合体育实际的小样本条件下,评估了相对可靠性指标(类内相关系数ICC)和绝对可靠性指标(最小可检测变化MDC??)。方法我们为
体育与康复领域测试的重复测试可靠性通常是基于极小的样本量来评估的,但所得指标的不稳定性以及所需参与者数量却很少被量化。我们采用蒙特卡洛模拟方法,在符合体育实际的小样本条件下,评估了相对可靠性指标(类内相关系数ICC)和绝对可靠性指标(最小可检测变化MDC??)。
我们为一种类似反向跳跃的测试项目(平均值为35厘米,标准差为6厘米)模拟了双次测试数据,采用完全交叉设计:真实ICC值在0.60至0.90之间,样本量N为8到100,每次测试之间存在0到1厘米的系统性差异,每个组合重复2000次。针对每组数据,我们计算了ICC(2,1)和ICC(3,1)及其95%置信区间,同时还计算了绝对误差指标(测量标准误差、典型误差、变异系数、MDC?5),并通过蒙特卡洛标准误差来评估偏差、相对均方根误差、区间覆盖率以及定性分类的不稳定性。我们认为,当相对均方根误差不超过15%时,MDC值才是可靠的;同时也考虑了20%、10%、5%的阈值。此外还测试了模型对异方差误差的稳健性,分析工作使用R语言完成。
ICC(2,1)的置信区间覆盖率基本在合理水平(约0.95),说明设计有效。不过ICC(2,1)在小样本情况下存在轻微的负向偏差,当样本量N为8时偏差可达-0.05,而当N为100时则可忽略不计。MDC?5的波动性则更大,其相对均方根误差从N为8时的约26%下降到N为30时的约13%,再到N为100时的约7%。对于20%、15%、10%、5%的不同容忍度,所需的最低样本量分别约为15、30、75和100以上。在大约一半的小样本中,定性ICC分类结果不稳定,即便在N为100时,处于良好/优秀水平的ICC值仍有约50%的概率不稳定。测试间差异对MDC的不稳定性影响很小,但会降低绝对一致性指标ICC(2,1)的值。模拟得到的MDC?5曲线与理论公式计算的结果一致,且在异方差误差条件下结论依然成立。
对于类似这样的双次测试可靠性研究,若要获得稳定的MDC?5值(15%的容忍度),至少需要30名参与者,若要求更高的容忍度,则需要更多参与者——这一数值因具体模型而异,并非普遍适用。高ICC值并不能保证MDC值的稳定性,我们的研究建议应同时报告绝对误差指标及其置信区间,并根据决定个体决策所需的MDC精度来设计可靠性研究。
体育与康复领域测试的重复测试可靠性通常是基于极小的样本量来评估的,但所得指标的不稳定性以及所需参与者数量却很少被量化。我们采用蒙特卡洛模拟方法,在符合体育实际的小样本条件下,评估了相对可靠性指标(类内相关系数ICC)和绝对可靠性指标(最小可检测变化MDC??)。
我们为一种类似反向跳跃的测试项目(平均值为35厘米,标准差为6厘米)模拟了双次测试数据,采用完全交叉设计:真实ICC值在0.60至0.90之间,样本量N为8到100,每次测试之间存在0到1厘米的系统性差异,每个组合重复2000次。针对每组数据,我们计算了ICC(2,1)和ICC(3,1)及其95%置信区间,同时还计算了绝对误差指标(测量标准误差、典型误差、变异系数、MDC?5),并通过蒙特卡洛标准误差来评估偏差、相对均方根误差、区间覆盖率以及定性分类的不稳定性。我们认为,当相对均方根误差不超过15%时,MDC值才是可靠的;同时也考虑了20%、10%、5%的阈值。此外还测试了模型对异方差误差的稳健性,分析工作使用R语言完成。
ICC(2,1)的置信区间覆盖率基本在合理水平(约0.95),说明设计有效。不过ICC(2,1)在小样本情况下存在轻微的负向偏差,当样本量N为8时偏差可达-0.05,而当N为100时则可忽略不计。MDC?5的波动性则更大,其相对均方根误差从N为8时的约26%下降到N为30时的约13%,再到N为100时的约7%。对于20%、15%、10%、5%的不同容忍度,所需的最低样本量分别约为15、30、75和100以上。在大约一半的小样本中,定性ICC分类结果不稳定,即便在N为100时,处于良好/优秀水平的ICC值仍有约50%的概率不稳定。测试间差异对MDC的不稳定性影响很小,但会降低绝对一致性指标ICC(2,1)的值。模拟得到的MDC?5曲线与理论公式计算的结果一致,且在异方差误差条件下结论依然成立。
对于类似这样的双次测试可靠性研究,若要获得稳定的MDC??值(15%的容忍度),至少需要30名参与者,若要求更高的容忍度,则需要更多参与者——这一数值因具体模型而异,并非普遍适用。高ICC值并不能保证MDC值的稳定性,我们的研究建议应同时报告绝对误差指标及其置信区间,并根据决定个体决策所需的MDC精度来设计可靠性研究。
生物通微信公众号