基于语义引导的拓扑融合图卷积网络,用于高效实现基于骨架的动作识别
《Knowledge-Based Systems》:Semantics-guided topology fusion graph convolutional network for efficient skeleton-based action recognition
【字体:
大
中
小
】
时间:2026年08月11日
来源:Knowledge-Based Systems 8.0
编辑推荐:
摘要:图拓扑结构对于基于骨架的动作识别至关重要,它决定了运动信息在人体关节之间的传递方式。现有的基于GCN的方法通常依赖于物理骨架连接或从关节坐标中学习得到的自适应拓扑结构。然而,这类拓扑结构主要受解剖结构或运动统计特征的约束,难以捕捉那些在物理上相距较远但与动作相关的关节之间的
摘要:图拓扑结构对于基于骨架的动作识别至关重要,它决定了运动信息在人体关节之间的传递方式。现有的基于GCN的方法通常依赖于物理骨架连接或从关节坐标中学习得到的自适应拓扑结构。然而,这类拓扑结构主要受解剖结构或运动统计特征的约束,难以捕捉那些在物理上相距较远但与动作相关的关节之间的高层语义依赖关系。在需要区分细微动作的场景中,这一问题尤为突出,因为这些动作的识别往往依赖于身体各部位的职能、动作上下文以及特定类别下的关节交互作用。为了解决这一问题,我们提出了一种基于语义引导的拓扑融合图卷积网络(SGTF-GCN),该框架利用大型语言模型生成离线的语义图拓扑先验,从而提升基于骨架的动作识别性能。SGTF-GCN引入了两种互补的结构化先验:一种用于编码整体动作语义的全局动作上下文先验,另一种用于捕捉细微功能关联的局部关节关系先验。这两种先验均采用标准的GCN邻接矩阵格式,因此可以与原有的物理骨架拓扑结构无缝融合。随后,一个专门的设计用于将这两类语义先验与物理拓扑动态整合,从而形成具有强大语义引导能力的多模态教师网络。为确保在测试时无需依赖大型语言模型仍能保持高效推理,我们提出了拓扑知识蒸馏技术,通过使教师网络与学生网络的拓扑分布保持一致,将教师网络的多层次语义结构知识传递给更轻量级的单模态学生网络。大量实验结果表明,所提出的方法在NTU RGB+D、NTU RGB+D 120和NW-UCLA数据集上取得了优异的性能,并且具有出色的推理效率。
引言:人体动作识别是视频理解领域的一项基础任务,在人机交互、机器人技术、医疗监测等诸多领域都有广泛应用。与RGB视频相比,人体骨架序列能够以更为简洁且保护隐私的方式呈现身体运动状态,同时还能较好地抵御光照变化、背景干扰以及外观差异带来的影响[1]、[2]。正是由于这些优势,基于骨架的动作识别近年来成为了研究热点[3]、[4]、[5]。
图卷积网络因能够将人体自然表示为时空图结构,而成为基于骨架的动作识别的主流技术之一。早期的ST-GCN模型将人体关节视为图节点,将骨骼视为图边,从而实现了对不规则骨架结构的卷积学习[3]。后续的发展则进一步丰富了这一框架,包括引入多流表示[4]、多尺度时空建模[6]、逐通道拓扑优化[5]、信息论驱动的表示学习[7]、分层图分解[8]以及考虑拓扑结构的图编码技术[9]。尽管这些方法在设计上存在差异,但它们都揭示了一个共同点:图拓扑并非仅仅是实现细节,而是决定如何聚合不同关节间的运动特征的关键因素。
然而,现有的拓扑建模方法仍然存在一个固有缺陷。物理骨架图虽然能够反映解剖学上的连接关系,但许多对动作识别至关重要的关节关系在物理上并不相邻[3]、[8]、[9]。例如,识别“喝水”动作时需要考虑手与嘴之间的协调配合,而识别“踢腿”动作则更依赖于腿部相关关节的反应。当图卷积仅依赖物理连接时,这些在语义上相互关联但距离较远的关节就必须通过多跳传播来传递信息。这就引发了两个问题:一是信息延迟,因为相关信号需要经过多个中间关节;二是信息稀释,因为在每次信息聚合过程中,信号都会与那些关联性较低的邻近关节混合在一起。一些基于自适应GCN的方法试图通过从骨架坐标中学习潜在连接来打破固定拓扑的局限性[4]、[5]、[8]、[10]、[11]、[12],但这些学习得到的关联关系仍然主要受一级运动统计特征的驱动,因此难以揭示高层次的动作语义,比如哪些身体部位在动作中起关键作用,以及哪些关节交互在概念层面具有区分性。
近期,大规模语言模型和视觉语言模型的发展为结合语义知识与骨架坐标提供了新的可能[13]、[14]。语言描述能够揭示出那些无法通过一热标签直接表达的动作级信息,比如涉及的身体部位、动作意图、物体交互关系以及关节的功能角色。以往的研究已经尝试通过生成动作描述、引入部分级别的文本监督,或是通过对比学习将骨架特征与文本嵌入对齐等方式,来实现基于语言的骨架表示学习[15]、[16]、[17]、[18]、[19]。这些方法表明,文本语义可以作为辅助信号,有效帮助理解动作,尤其是在那些动作模式相似的细粒度分类任务中。不过,目前大多数基于语言的辅助方法都是在特征层面、表示层面或损失函数层面注入语义信息,而控制GCN中空间信息流动的图拓扑结构仍然主要依靠骨架数据本身来学习。这就引出了一个亟待探索的重要问题:是否可以将语义知识转化为特定动作对应的图拓扑结构,从而使语言不仅能用于监督表示结果,还能直接改变骨架信息传递的路径结构?
基于这一思考,我们提出了基于语义引导的拓扑融合图卷积网络(SGTF-GCN),该网络将语言模型作为离线语义知识源,将其知识转化为用于骨架图卷积的拓扑先验。具体而言,我们设计了一个语义引导拓扑融合模块(SGTF),该模块整合了三种互补的结构信息来源。首先,物理骨架拓扑保留了人体的解剖学特征;其次,全局动作上下文先验能够捕捉整体动作层面的语义信息,包括身体部位的关注重点、运动轨迹以及交互背景;最后,局部关节关系先验则提供了针对不同动作类别的成对关节关系模板,描述了各个关节在动作执行过程中的功能关联。通过整合这三类信息,SGTF能够生成一种既具备整体动作语义认知能力,又了解局部关节功能关系的动作感知型图拓扑结构。
尽管语义先验对于构建图拓扑结构具有很高的参考价值,但在实际应用中直接依赖它们会破坏基于骨架的识别方法所具备的轻量化特性以及仅依赖骨架数据的优点,而这些特性正是使得这类方法在现实场景中具有应用价值的原因。更重要的是,教师网络生成的语义拓扑结构实际上是一种将类别级语义信息与动作识别所需的关节连接模式相关联的结构化知识,这类知识与图卷积的运作机制十分契合,因此更适合在拓扑结构层面进行传递,而非仅在输出逻辑值层面进行处理。基于这一思路,SGTF-GCN采用了知识蒸馏训练框架[20]、[21]、[22]。在训练过程中,基于语义引导的教师网络会利用融合后的语义拓扑结构来学习与动作相关的关节依赖关系。与之相比,学生网络仅接收骨架数据作为输入,无需任何文本信息,就能学习到与语义拓扑结构相匹配的自适应拓扑结构。为此,我们提出了拓扑知识蒸馏技术(TKD),通过使教师网络与学生网络的拓扑分布保持一致,将教师网络的语义结构知识传递给学生网络。也就是说,传统的逻辑值蒸馏只是传递教师网络的输出结果,而TKD则传递决定关节间信息传递方式的语义注意力模式。训练完成后,所有的语言编码器、语义缓存以及教师网络都会被丢弃,最终得到一个仅依赖骨架数据的高效学生模型,用于实际推理任务。
本文的主要贡献如下:
• 我们提出了SGTF-GCN,这是一种将语言衍生出的动作知识转化为图拓扑结构、用于基于骨架的动作识别的框架。
• 我们设计了SGTF模块,该模块通过整合物理拓扑结构、全局动作上下文先验以及局部关节关系先验,构建出具有多粒度特征的动作感知型拓扑图。
• 我们提出了拓扑知识蒸馏技术,使得仅依赖骨架数据的轻量级学生网络能够在推理过程中无需文本输入即可学习到教师网络的语义拓扑知识。
• 在NTU RGB+D、NTU RGB+D 120和NW-UCLA数据集上的大量实验表明,SGTF-GCN不仅具有出色的性能,还具备高效的推理速度。我们的代码已公开发布在https://github.com/ITVR-lab/SGTF-GCN地址上。
本文的其余部分结构如下:第2节回顾了基于GCN的动作识别、语义引导学习以及知识蒸馏领域的现有研究;第3节详细介绍了我们的方法;第4节展示了实验结果及各种消融实验的分析;第5节对全文进行总结。
片段一:基于骨架的动作识别的图卷积网络
图卷积网络因能够处理非欧几里得数据,已成为基于骨架的动作识别的主流技术[3]。早期的方法,如ST-GCN[3],通过模拟自然的物理连接来构建时空图结构,以此表征关节间的依赖关系。然而,仅依赖固定的拓扑结构会限制模型的感知范围,也无法捕捉那些在物理上并不相连但在语义上存在关联的关节之间的关系[4]。
片段二:方法论
在本节中,我们将从五个方面详细介绍所提出的语义引导拓扑融合图卷积网络(SGTF-GCN)。3.1节首先定义骨架图表示形式以及基础的图卷积运算方式。3.2节则介绍了整体的教师-学生框架,包括基于语义引导的教师网络、轻量级的学生网络以及相应的训练目标。3.3节详细阐述了语义引导拓扑融合模块的功能,该模块负责构建……
片段三:实验
在本节中,我们从有效性、效率、各组件的贡献程度以及模型在面对错误时的表现等多个方面对SGTF-GCN进行了评估。4.1节和4.2节分别介绍了实验使用的数据集以及实现细节。4.3节将部署后的SGTF-GCN学生网络与在NTU RGB+D、NTU RGB+D 120和NW-UCLA数据集上表现最优的现有方法进行了对比,这些对比方法包括基于GCN的网络、Transformer/混合架构模型以及基于语义引导的模型。4.4节则分析了模型在训练和推理过程中的成本情况。
片段四:结论
在本文中,我们提出了SGTF-GCN,旨在将高层语义理解与局部拓扑建模相结合,用于基于骨架的动作识别任务。与那些主要依赖文本语义进行全局对齐或监督的现有方法不同,我们所提出的SGTF模块能够将特定动作对应的语义先验直接融入图结构构建过程中。在大型语言模型生成的丰富描述信息的引导下,该模型能够动态确定那些对特定动作而言具有语义关键意义的关节连接关系。
生物通微信公众号
生物通新浪微博
今日动态 |
人才市场 |
新技术专栏 |
中国科学人 |
云展台 |
BioHot |
云讲堂直播 |
会展中心 |
特价专栏 |
技术快讯 |
免费试用
版权所有 生物通
Copyright© eBiotrade.com, All Rights Reserved
联系信箱:
粤ICP备09063491号