重新审视跆拳道自由品势中的裁判可靠性:对AI辅助评估的启示

《Frontiers in Psychology》:Revisiting judging reliability in taekwondo freestyle Poomsae: implications for AI-supported evaluation

【字体: 时间:2026年09月08日 来源:Frontiers in Psychology 3.8

编辑推荐:

  背景:在基于人工智能(AI)的评判系统可应用于跆拳道品势之前,有必要了解人类裁判能够一致识别哪些表现成分,哪些成分仍然难以可靠评估。本研究检验了自由品势评判中的可靠性,以识别具有稳定和不稳定的人类评分特征的评估成分。方法:十名持有国际裁判认证的跆拳道品势裁判对

  
背景:在基于人工智能(AI)的评判系统可应用于跆拳道品势之前,有必要了解人类裁判能够一致识别哪些表现成分,哪些成分仍然难以可靠评估。本研究检验了自由品势评判中的可靠性,以识别具有稳定和不稳定的人类评分特征的评估成分。方法:十名持有国际裁判认证的跆拳道品势裁判对十个官方比赛视频进行了两次评估,两次评估之间间隔一周的洗脱期。使用SPSS MIXED过程以限制最大似然估计的独立线性混合效应模型评估系统会话效应。将会话指定为固定效应,裁判和视频作为交叉随机截距,每个裁判-视频对内的两个观测值作为具有非结构化残差协方差矩阵的重复测量。固定效应推断采用Satterthwaite分母自由度。对相同的裁判-视频对评估重测稳定性,由于检测到系统会话效应,主要关注绝对一致性ICC。按照会话分别评估评分者间一致性,使用双因素随机效应、单次评分的绝对一致性和一致性ICC(附95%置信区间)以及Kendall's W。项目特异性分析为探索性分析,未进行多重性校正。结果:总分增加了0.304分,95% CI [0.187, 0.421],t(99)=5.177,p <0.001。在名义0.05水平下,探索性项目特异性分析显示跳跃侧踢(β=0.057,p<0.001)、杂技踢击技术(β=0.021,p=0.003)和能量表现(β=0.047,p=0.003)有增加;基本动作与实际应用性的增加未达到0.05阈值(p=0.053)。绝对一致性的重测ICC范围为0.039至0.848,其中和谐与总分达到优秀。所有单次评分的评分者间ICC(A,1)点估计值均低于0.40。对于总分,第一次会话ICC(A,1)为?0.007,95% CI [?0.018, 0.036],第二次会话为0.060,95% CI [0.010, 0.224]。结论:系统会话效应、绝对重测一致性、跨时间的相对一致性以及评分者间一致性是评判可靠性的不同方面。在考虑计算或AI辅助评分之前,单裁判一致性较差的评估成分需要更清晰的操作定义和进一步验证。
在体操、花样滑冰等审美好项目中,运动员的动作与艺术表现依赖裁判主观评分,评判中的偏差一直是研究热点。以往研究发现,运动员声誉、记忆偏差、裁判的视觉搜索模式、观看角度等因素均会影响评分可靠性。部分项目通过分离难度与执行、制定详细技术标准来提升客观性,例如竞技体操和花样滑冰的国际评分体系。然而,对于缺乏清晰运动学标准的项目(如舞蹈运动、霹雳舞),技术评分可靠性可能反而低于艺术评分,这与传统认知相悖。跆拳道自由品势作为可能纳入2028年洛杉矶奥运会的项目,其评分标准尚缺乏系统性验证。因此,本研究旨在评估自由品势评判中哪些成分能被裁判稳定识别,哪些成分难以可靠评估,从而为未来引入AI辅助评估提供实证基础。

研究人员选取10名持有国际裁判认证的跆拳道品势裁判,对10个官方比赛视频分别进行两次评分,两次间隔一周的洗脱期,以评估裁判内部的稳定性及裁判间的一致性。通过线性混合效应模型检验系统会话效应,并通过ICC和Kendall's W评估重测信度和评分者间一致性。结果显示,总分第二次评分显著升高,表明存在系统性的评分漂移;同一裁判对和谐与总分的绝对一致性达到优秀,但裁判之间在所有评估成分上的单次评分一致性点估计均低于0.40,整体一致性较差。该研究将评判可靠性细分为不同维度,为跆拳道自由品势评分标准的改进和AI辅助评估的开发提供了分阶段依据。论文发表在《Frontiers in Psychology》。

在技术方法上,本研究采用重复测量设计,10名国际裁判在间隔一周的两个时间点对10个官方比赛视频进行评分,视频素材来自韩国跆拳道协会组织的正式比赛,均为各场次第一名运动员的表现。评分依据2024年世界跆拳道(WT)自由品势竞赛规则,分为技术技能(6.0分)与表现(4.0分)两个领域。数据分析使用SPSS MIXED过程,以会话为固定效应、裁判与视频为交叉随机截距、重复测量采用非结构化残差协方差矩阵的线性混合效应模型评估系统会话效应;使用双向混合效应模型计算ICC(A,1)与ICC(C,1)评估重测信度;使用双向随机效应模型计算ICC(A,1)、ICC(C,1)及Kendall's W评估评分者间一致性。项目特异性分析均为探索性,未进行多重性校正。

研究结果分为三部分。第一,系统会话效应:通过线性混合效应模型发现,总分第二次评分平均增加0.304分(p<0.001);在名义0.05水平下,跳跃侧踢、杂技踢击技术和能量表现出现显著增加,基本动作与实际应用性接近显著(p=0.053),其余成分未达显著水平。这表明裁判在重复接触同一视频后产生了评分宽松化或记忆相关效应。第二,相同裁判-视频评分的重测信度:对完全相同裁判-视频对计算ICC,和谐(ICC(A,1)=0.848)和总分(0.773)达到优秀;跳跃侧踢、旋转踢梯度、杂技踢击技术和能量表现为可接受;多重跳跃踢、连续踢、基本动作与实际应用性、创造力、音乐与编排则较低。说明依赖整体印象的判断(如和谐)可以稳定复现,而需要精确计数或细化定义的成分则不稳定。第三,评分者间一致性:按第一次和第二次会话分别计算,所有单次评分的ICC(A,1)点估计均低于0.40,总分第一次ICC(A,1)=?0.007,第二次=0.060;Kendall's W总分从0.152升至0.350。表明不同裁判之间对同一视频的绝对评分一致性极差,且即使排名一致性有所改善,程度仍然有限。

讨论部分指出,评分不稳定性并非单纯源于裁判经验不足,而是与评估标准的操作性定义密切相关。技术技能领域中,诸如多旋转踢等需要快速计数的成分,可能超出人眼实时观察的时间分辨率;缺乏关节角度、腾空时间等运动学锚点,导致裁判各自依赖内部标准。表现领域中,和谐可依靠整体印象稳定判断,而音乐与编排需要同时综合多个艺术元素,定义模糊造成低信度。系统性的第二次分数上升可能来自记忆、熟悉度或曝光效应。对于AI辅助评估,研究者提出分阶段应用路径:优先测量有明确运动学定义的成分(如跳跃高度、踢击次数、旋转角度),其次发展视频回顾和自动计数功能,而对创造力等难以操作性定义的成分,则需先建立基于专家共识的参考标准,再考虑算法扩展。同时,像和谐这类人类裁判最稳定的整体判断,应继续由裁判负责。

研究结论:为使跆拳道自由品势在国际舞台(包括奥运会)上获得公认的公平性,应谨慎精炼每个评估成分的操作定义。技术领域可基于关节角度、腾空时间、落地稳定性等可观察表现条件制定扣分标准,但不应视为唯一方案,过度细化可能损害自由品势的艺术与表现特质。因此,未来规则修订应平衡可测量的技术指标与项目艺术本质。AI辅助评判系统的开发,须在人类裁判可靠性、操作定义及机器可检测动作特征被综合研究之后方可推进。
相关新闻
生物通微信公众号
微信
新浪微博

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号