《Pattern Recognition》:Pose2Point: Bridging human poses and point clouds for unified action recognition
编辑推荐:
•Pose2Point 在单一框架中统一了姿态语义和点云几何。•Transfer2PointCloud 以显式的时空动态编码姿态序列。•均匀混合采样在下采样过程中保持拓扑结构和运动连续性。•在 NTU-RGB+D、NTU-RGB+D 120 和 NW-UCLA 基准上达到最先
- •
Pose2Point 在单一框架中统一了姿态语义和点云几何。
- •
Transfer2PointCloud 以显式的时空动态编码姿态序列。
- •
均匀混合采样在下采样过程中保持拓扑结构和运动连续性。
- •
在 NTU-RGBD、NTU-RGBD 120 和 NW-UCLA 基准上达到最先进性能。
引言
人体动作识别(HAR)是视频理解和人类运动理解中的关键任务,旨在通过分析动态动作和运动模式来准确解释和分类人类活动 [1], [2], [3], [4]。为实现精确识别,人们探索了各种视频模态,如姿态序列 [5], [6], [7]、RGB 图像 [8], [9] 和点云 [10], [11]。
基于姿态的 HAR 方法因其效率、轻量级表示以及对背景变化的鲁棒性而备受关注。由于人体姿态可自然地表示为图,大多数现有方法基于预定义的拓扑结构对姿态数据进行建模,如图 1(a) 所示,其中关节被视为节点,骨骼被视为边,并通过图上的信息传播进行特征学习。通过显式建模人类结构先验,这些方法在多个基准数据集上取得了强大的性能。然而,对固定拓扑的依赖也给建模灵活性带来了根本限制。人体动作本质上是关节在空间中的连续运动,许多运动模式涉及跨拓扑的关节交互,例如手手协调(如鼓掌)、手与头的互动(如戴眼镜)和手与脚的互动(如穿鞋)。在