《Frontiers in Public Health》:Interpretable skeleton-based movement profiles for formative feedback in school physical activity education
编辑推荐:
背景:学校是发展运动能力和支持体育活动(physical activity, PA)的重要场所。教师对学习者如何移动提供反馈,但在大班教学中,个性化的观察难以持续和记录。现有人工智能(artificial intelligence, AI)系统通常对动作进行分
背景:学校是发展运动能力和支持体育活动(physical activity, PA)的重要场所。教师对学习者如何移动提供反馈,但在大班教学中,个性化的观察难以持续和记录。现有人工智能(artificial intelligence, AI)系统通常对动作进行分类或预测一个竞技体育分数,这些输出无法识别学习者在练习中可能调整的具体运动特征。方法:研究人员使用三个公开人体动作数据集(NTU RGB+D、Penn Action和一个FineGym子集),在统一设置下对五个代表性骨架序列模型——循环模型(LSTM, GRU)、图模型(ST-GCN, CTR-GCN)和Transformer——进行了基准测试,并从关节坐标和轨迹构建了四个可解释的运动画像指标:运动幅度、姿势稳定性、左右协调性和时间一致性。每个指标均针对同类参考分布进行归一化,提供相对、可解释的描述而非专家认证的分数。结果:在每个数据集上五个随机种子的独立测试中,宏F1(macro-F1)范围从0.76到0.97;CTR-GCN在每个数据集上获得最高均值(NTU RGB+D 0.970 ± 0.003)。配对检验支持其在NTU RGB+D和FineGym上优于所有四个比较模型,而在Penn Action上,校正后仅与LSTM的比较仍然显著。在特征消融中,完整运动学输入在3D骨架上将宏F1从0.925提高到0.936(Holm校正p = 0.022);相应的2D变化从0.893到0.905在校正后不显著(p = 0.079)。逐动作画像和同动作案例分析表明,这些指标捕获了可解释的运动学结构。由此产生的百分位数描述了这些数据集内的相对倾向;低百分位数本身并不识别错误动作,也不构成儿童适龄标准。结论:仅基于骨架的运动画像提供了一种减少隐私、教师参与的形成性反馈方法,可支持学校的数字PA教育和健康促进。作为在公开数据集上评估的计算概念验证,该研究不包括健康或学习结果、特定年龄的K-12参考分布或真实课堂验证。在画像可被解释为运动质量反馈或用于支持公共卫生主张之前,需要对儿童课程相关数据进行校准,并与教师或运动专家评分进行验证。
超过80%的学龄青少年未达到推荐的体育活动(physical activity, PA)水平,且这一比例在过去二十年几乎没有变化。世界卫生组织呼吁采取可扩展、公平的方法来减少不活动。学校能够接触不同社会背景的儿童,是发展运动能力和身体素养的重要场所。教师的反馈对于动作学习至关重要,但在大班教学中,持续的个性化观察难以实施。现有人工智能(artificial intelligence, AI)系统通常只对动作分类或预测单一竞技体育分数,无法指出学习者下一次练习中应调整的具体运动特征。因此,需要一种介于动作识别与教学反馈之间的可解释运动画像层。针对这一空白,研究人员在《Frontiers in Public Health》上发表的这项研究评估了基于骨架序列的可解释运动画像,作为学校体育活动形成性反馈的计算概念验证。
该研究使用三个公开人体动作数据集:NTU RGB+D、Penn Action和FineGym子集,在统一设置下对五个代表性骨架序列模型(LSTM、GRU、ST-GCN、CTR-GCN和Transformer)进行了基准测试,并构建了四个可解释指标:运动幅度、姿势稳定性、左右协调性和时间一致性。每个指标以同类百分位表示。结果表明,CTR-GCN在所有数据集上取得最高宏F
1,在NTU RGB+D上达到0.970±0.003。特征消融显示,在3D骨架上完整运动学输入比单独坐标带来显著增益,而2D上不显著。逐动作画像和案例分析显示这些指标能捕获不同动作结构。但该研究仅证明计算可行性,不构成运动质量或公共健康效果证据。
研究人员的关键方法包括:使用三个公开人体动作数据集,其中NTU RGB+D提供3D骨架(25个关节),Penn Action提供2D骨架(13个关节),FineGym提供2D骨架(17个关节,由HRNet提取)。在数据预处理中,选择单主骨架、以脊柱基底或髋中心为中心、按躯干长度缩放并统一重采样至64帧。识别模型包括LSTM、GRU、ST-GCN、CTR-GCN和Transformer,所有模型使用相同分区和训练预算。运动画像指标通过关节角度范围、躯干抖动、左右关节角度轨迹相关性及速度峰值规律计算,并以同类百分位归一化。使用五个随机种子进行独立测试,结合成对t检验和Holm校正。特征消融使用固定GRU比较坐标、角度、速度和质心特征组合。t-SNE用于可视化特征空间。
4.1 识别性能:五种模型在三个数据集上的独立测试宏F
1均值范围为0.76至0.97。CTR-GCN在每个数据集上均获最高均值;在NTU RGB+D(0.970±0.003)和FineGym上显著优于全部四个比较模型,但在Penn Action上仅与LSTM的差异在Holm校正后显著,因此Penn Action上三个最强模型性能相近。
4.2 所选动作类别间的混淆模式:通过分析CTR-GCN在NTU RGB+D子集上的混淆矩阵,各类别召回率在0.95至1.00之间,最大离对角比例为0.03。跳跃、踢和踉跄等单腿支撑动作共享相似运动学结构,产生少量混淆,说明这些动作的平衡和时序特征需要更细粒度描述。
4.3 特征增量消融:使用固定GRU比较坐标、坐标+角度、坐标+速度、完整集(坐标+角度+速度+质心)和仅可解释特征。在3D NTU RGB+D上,完整集比单独坐标提高宏F
1(0.925±0.003 到 0.936±0.003,Holm校正p=0.022);在2D Penn Action上,对应提高(0.893±0.007 到 0.905±0.007)不显著(p=0