《Electronics》:A Survey on Action Recognition: Multimodal Approaches, Ethical Considerations, and Feedback Mechanisms
动作识别已成为计算机视觉领域内的一个关键研究方向,其发展动力源自对能够理解和解释现实世界中人类行为的智能人机系统日益增长的需求。破译人类动作复杂细节的能力,在改善各个领域的系统设计、预测建模、数据驱动的决策制定以及实时操作改进方面具有巨大潜力。应用示例涵盖公共场所和基础设施系统的监控与实时管理,用于个性化医疗干预的预测建模和机器人系统的开发,以及在专业和娱乐环境中实现有效的人机交互。本文对动作识别的现状进行了全面综述,重点关注三个开放世界挑战:多模态的整合、这些技术的伦理和社会影响,以及利用反馈机制来增强模型性能。研究人员深入探讨了动作识别的演变,从早期基于特征的方法到深度学习的革命,强调了多种感官模态(如视觉、音频和深度数据及其他线索)的融入如何推动了该领域的发展。此外,研究人员还审查了在公共领域部署这些技术所带来的伦理挑战,特别是关于隐私、偏见和社会影响方面,并探讨了负责任的开发和监管的必要性。本文的第三个重点是自上而下和自下而上的反馈机制在深度学习架构中的使用,探讨了这些策略如何模拟人类认知过程以提高动作识别系统的准确性和可靠性。通过识别当前的研究空白并提出未来的研究方向,本文旨在激发智能系统这一充满活力和影响力的领域持续创新。
本文对人类动作识别领域的演变进行了全面综述,重点探讨了从孤立的单主体分类到真实世界多人群体动态识别的范式转变。文章围绕多模态融合、伦理与社会考量以及反馈机制三个核心支柱展开,详细梳理了该领域的历史发展、技术挑战及未来研究方向。
1. 引言
动作识别是计算机视觉领域的关键领域,旨在检测和分类个体或群体执行的动作序列,以实现智能人机系统对现实世界复杂行为的理解。其实际应用广泛涉及公共安全管理、交通系统监控和健康监测等领域。然而,随着传感器在公共空间的大量部署,研究焦点正从孤立的单主体分类向混乱的多人群组动态转移。在复杂、拥挤且动态的环境中部署系统引发了关于数据捕获、处理和伦理管理的紧迫挑战。
1.1. 问题陈述
传统动作识别系统采用包含预处理、特征提取和分类的三阶段方法。虽然现代深度学习模型能够自主提取空间-时间动态并在个体动作分类上表现优异,但在现实世界的拥挤场景中往往会失效。诸如分析行人行为或通过闭路电视(CCTV)监控公共安全等应用带来了严重的瓶颈,包括严重的人与人之间的遮挡、复杂的多智能体交互以及群组动态的模糊性。此外, ubiquitous的监控引发了关于隐私和持续监视的深刻伦理困境。为解决上述挑战,本文重点关注三个相互关联的支柱:多模态的利用、部署中固有的伦理和社会考量,以及在模型架构中纳入反馈机制。在术语标准化方面,动作识别指对个体或群体执行的短时原子运动序列的检测和分类;而活动识别涵盖更长、更复杂的动作序列。姿态估计是在空间坐标系统中对人体关节的计算定位,而体态估计是对整体身体配置的定性或静态解释。最终,这些基础计算任务指向人类行为理解的总体目标,即推断复杂现实环境中驱动观察到的动作的潜在意图、社会动态或心理状态。
1.2. 综述结构
以往的综述通常孤立地处理模态并侧重于单人动作,往往将社会影响作为事后考虑。本综述采取更具批判性的视角,强调多模态整合、认知反馈机制及其与多人部署挑战的直接相关性。文献系统来源于主要的计算机视觉和机器学习核心数据库,筛选标准优先考虑直接解决多人群体动态、多模态整合和认知反馈机制等开放世界挑战的最新研究。
2. 动作识别简史
2.1. 从早期方法到深度学习
早期动作识别依赖手工特征和基于规则的系统,如光流和运动历史图像(MHI),这些方法在受控环境中有效,但难以应对现实世界的变异性。2000年代引入了时空兴趣点(STIPs)和基于轨迹的方法,改进了运动模式识别。受文本检索启发的词袋模型和方向梯度直方图(HOG)在受控环境中提升了姿态和运动模式检测的分类精度。2010年代,大型数据集如UCF101、HMDB51和Kinetics扩大了训练可能性。深度学习革命由卷积神经网络(CNN)和循环神经网络(RNN)主导,双流CNN和3D CNN通过整合空间-时间特征实现了卓越性能。
2.2. 深度学习方法
高效方法通常依赖三维人体姿态数据和图卷积网络(GCN),将身体部位表示为图节点,连接表示为边,有效捕获空间和时间依赖性,适用于资源受限的场景。为扩展至多人群体动态,GCN被适应于宏观层面操作,整个个体作为图节点,其交互和物理接近度形成边,使模型能够映射社会动态和智能体间行为。高性能方法结合红绿蓝(RGB)视频、深度和姿态数据以优化精度。改编自自然语言处理(NLP)的Transformers通过注意力机制和位置编码在基于序列的任务中表现出色。为了平衡效率与性能,研究人员探索了蒸馏和压缩技术,结合CNN提取空间特征与Transformers进行时间分析的混合模型正在涌现。
2.3. 向自监督和无监督学习转变
近期突破之一是向自监督学习(SSL)和无监督范式的转变。现代方法利用跨模态对比学习,将未整理数据集中视频和音频的自然同步作为自身的监督信号,无需人类标签即可学习丰富的语义动作表示。利用预训练的视觉-语言模型(VLM)显著增强了零样本和少样本视频识别的跨模态知识探索。大型语言模型(LLM)展现出卓越的推理能力,通过专门的提示工程,弥合了高维视觉特征与自然语言语境之间的语义鸿沟,促成了视觉-语言-动作(VLA)模型的发展。掩码自编码器在视频和时空图上的适应也证明非常有效,网络通过重建缺失的时空管来学习人类运动的物理和动力学。
3. 探索不同模态
3.1. 引言
在动作识别中,模态指用于解释人类动作的数据或传感器输入类型。多模态系统利用不同数据类型的优势,如RGB提供外观信息,深度数据捕获空间关系,从而产生对环境变化具有鲁棒性的精确识别系统。
3.1.1. 从单模态到多模态方法的演变
早期受限于数据可用性集中于视觉数据,深度传感器实现了独立的空间捕获,是迈向多模态系统的重要一步。
3.1.2. 多模态的优势
多模态系统对照明和遮挡等环境变化具有弹性,例如音频数据可通过为具有独特声音的动作提供上下文来补充视觉输入。
3.1.3. 数据集
多个数据集支持多模态动作识别,提供包括RGB、深度、音频和红外(IR)在内的多样化数据类型,促进了不同场景下鲁棒识别的进步。
3.1.4. 量化性能与计算效率
尽管传统的3D CNN和标准Transformers在数据集上实现了高精度,但在扩展到更长的时间序列时,往往产生巨大的计算成本并遭受二次复杂度O(N
2)的困扰。状态空间模型(SSM)如VideoMamba在保持或超越Transformer级精度的同时,以线性时间复杂度O(N)运行,这是在内存和计算预算严格受限的连续现实环境中部署多模态动作识别的关键突破。
3.2. 视觉(RGB)数据
3.2.1. RGB数据的基础作用
早期系统依赖HOG和尺度不变特征变换(SIFT)等技术。深度学习特别是CNN通过自动从原始像素数据中提取层次特征改变了识别方式。
3.2.2. 基于图像和视频的识别
模型通过热图回归和部件亲和场映射人体关键点和肢体关系。时间卷积网络(TCN)和Transformer等高级架构擅长捕获长期依赖关系。然而,RGB数据在面临光照变化和最显著的拥挤环境中人与人之间的遮挡时存在困难。多模态方法将其与深度和音频等其他数据源整合以增强鲁棒性。
3.3. 基于姿态的识别
3.3.1. 传感器设备
可穿戴传感器检测身体姿态和运动,提供连续识别而不受光照或障碍物限制的相机影响。
3.3.2. 整合姿态数据
机器学习通过分析运动模式增强基于姿态的识别。使用图神经网络(GNN)的轻量级模型针对实时应用进行优化。
3.3.3. 未来方向
未来的研究方向包括增强传感器融合、高级算法、个性化模型、与增强现实(AR)/虚拟现实(VR)的集成以及医疗保健应用。
3.4. 音频数据
3.4.1. 用于动作识别的视听融合
视听融合通过利用两种模态的互补优势增强识别。传统后期融合未能捕获中水平时间同步。早期和中级融合架构如时间绑定网络(TBN)在紧密耦合的动作中表现出色。跨模态注意力机制和对比学习框架提供了混合优势,允许视觉模型仅在视觉特征被遮挡时选择性地查询音频流。
3.4.2. 挑战与未来方向
关键挑战包括同步、自适应加权和噪声干扰。未来方向涉及注意力机制和自监督学习。
3.5. 深度数据
深度传感技术通过提供3D空间表示,允许在困难条件下准确估计人体姿态,并作为RGB跟踪固有的遮挡问题的主要解药。
3.5.1. 深度传感技术
深度捕获技术包括飞行时间相机和结构光传感器。
3.5.2. 将深度与其他模态融合
深度数据存在随距离衰减、户外性能差等挑战。研究人员将深度与其他模态融合,利用融合策略增强鲁棒性。
3.5.3. 解耦与重新耦合框架示例
提出的一种统一的多模态解耦和重新耦合框架通过识别跨模态共享特征来增强RGB-D运动识别。
3.5.4. 未来方向
深度学习使端到端可训练模型能够从深度数据中提取特征。传感器技术的改进将扩大识别系统的适用性。
3.6. 文本和上下文信息
3.6.1. 整合方法
整合视觉和文本输入的模型使用多模态神经网络和跨模态嵌入。上下文线索通过场景理解被纳入,以基于环境上下文预测动作。
3.6.2. 语言知识辅助表示学习
基于骨架的动作识别利用语言知识捕获关系。最新方法利用LLM作为零样本推理引擎,将骨架序列投影为语言句子,改善对未见动作类别的泛化。
3.6.3. 未来方向
结合文本和上下文数据提供了类似人类对动作理解的途径。未来研究可能关注用于分析文本和上下文数据的无监督方法。
3.7. 组合模态
3.7.1. 特定任务融合策略
早期融合在输入级别组合模态;后期融合在决策级别组合输出;中间融合在中间点整合模态。最佳策略取决于被识别动作的性质。
3.7.2. 挑战与未来方向
多模态融合的挑战包括时空同步、计算瓶颈和延迟、模型复杂性与模态不平衡。未来研究需探索复杂模型以有效整合多样化数据源。
4. 社会/伦理考量与框架
4.1. 伦理考量
4.1.1. 隐私担忧
在公共和私人空间部署动作识别技术引发了关于监控和未经同意监视的重大隐私担忧。多模态系统的整合创造了关于监视的“风险乘数”效应,剥夺了自然的隐私缓冲。
4.1.2. 偏见与透明度
在非代表性数据集上训练的系统可能会产生偏见结果。透明度对于确保利益相关者了解数据收集做法至关重要。
4.1.3. 问责制与责任
随着技术日益普及,建立问责机制对于增强信任和伦理使用至关重要。
4.2. 隐私保护动作识别的技术解决方案
4.2.1. 视觉匿名化和混淆
直接解决方案是在特征提取前剥离敏感生物识别标识,如使用生成对抗网络(GAN)解耦动作特定运动学。
4.2.2. 用于去中心化视频分析的联邦学习
联邦学习(FL)将模型训练推至边缘设备,原始视频数据不离开本地设备,极大降低了大规模监控风险。
4.2.3. 动作识别中的差分隐私
差分隐私(DP)通过在训练过程中注入统计噪声,确保单个剪辑的包含或排除不会显著改变模型行为,抵御成员推理攻击。
4.3. 伦理框架
稳健的监管框架对于确保系统保护个人权利至关重要。开发者必须在工程管道中积极执行伦理规范,如使用开源偏见审计工具包和隐私保护机器学习(PPML)技术。
5. 自上而下和自下而上的注意力机制
注意力机制模仿人类专注特定环境方面的能力。为了清晰区分,文章明确定义了计算机视觉中的注意力机制、神经认知中的反馈机制以及深度神经网络中的后向/生成反馈。
5.1. 自下而上的注意力
自下而上的注意力是由刺激驱动的方法,模型焦点由输入数据中的显著特征引导。它在杂乱或动态背景中通过优先处理显著特征来增强模型的处理能力。
5.1.1. 有效性和应用
引入信息瓶颈和自注意力图卷积的方法增强了对相关输入部分的关注。
5.1.2. 挑战和考虑
其依赖于视觉显著性,可能受到无关刺激的影响,需要与上下文理解平衡。
5.2. 自上而下的注意力
自上而下的注意力是目标导向的,利用先验知识专注于与实现特定目标相关的元素。
5.2.1. 效率和有效性
反馈图卷积网络(FGCN)允许低层访问高层语义信息。在拥挤环境中,焦点转向“社会注意力”或“智能体间注意力”。语言知识的整合增强了上下文感知能力。高级视觉-语言模型(VLM)利用LLM作为主动认知控制器解析复杂语言指令以动态引导视觉注意力。
5.2.2. 最新进展:2024-2025年Transformer和状态空间架构
先进的VLM利用LLM生成语义自上而下先验。同时,由于标准Transformer注意力在密集多场景中的二次计算复杂度O(N
2),采用Mamba的状态空间模型(SSM)作为高效替代方案涌现,提供线性时间复杂度O(N)的长上下文理解。
5.3. 结合注意力机制
结合自上而下和自下而上的注意力机制提供了整体方法,实现动态优先级排序、增强鲁棒性和高效处理。整合方法包括分层注意力模型、自适应融合技术和端到端集成训练。
5.4. 未来方向
未来旨在开发具有深度上下文感知能力的模型、动态分配注意力的系统、融合多感官注意力的架构以及高效的注意力网络。
6. 动作识别的未来方向
6.1. 从关键发现到未来研究
重大进展必将从受控环境转向不受控的动态现实环境。
6.1.1. 关键发现总结
深度学习主导但存在时间瓶颈;准确识别多智能体现实环境是最大障碍;隐私和伦理要求迫切;多模态融合不再是可选项而是必需。
6.1.2. 对未来研究的启示
未来需探索如VideoMamba等具有线性复杂度O(N)的状态空间模型(SSM)以及增强记忆架构;整合高级VLMs作为认知推理引擎;开发动态路由焦点至特定人与人交互的智能体间注意力机制。
6.2. 解决现有模型的局限性
未来研究必须优先处理遮挡问题,向整体场景图表示转移;利用多模态上下文增强泛化能力;通过自监督多模态学习克服对标注数据的依赖;采用轻量级SSM与重型VLM或LLM骨干相结合的异步方法平衡语义能力与计算现实。
6.3. 跨领域应用:迈向城市动态
应用需转向系统性的宏观见解。城市行人动态需关注 sidewalk friction 定量度;隐私保护公共安全需结合多模态融合匿名化特征;医疗保健需向多患者互动监控发展。
7. 结论
人类动作识别经历了范式转变。克服现实世界部署瓶颈必须综合多模态、认知反馈机制和隐私保护伦理框架三大支柱。多模态融合提供解决遮挡所需的感官广度;最先进的反馈和注意力机制(如VLM和SSM)提供所需认知效率;伦理考量必须规定模态如何融合及注意力的优先级。最终,下一代系统将不仅以基准准确度定义,而是以其负责任地融入现实世界的能力来衡量。