综述:视觉手势识别与深度学习:方法、数据集、挑战和未来研究方向综述

《Neurocomputing》:Visual hand gesture recognition with deep learning: A comprehensive review of methods, datasets, challenges and future research directions

【字体: 时间:2026年08月14日 来源:Neurocomputing 6.7

编辑推荐:

  深度学习(DL)模型的快速演进和可用数据集规模的不断增长,提升了研究界对始终重要的视觉手势识别(VHGR)领域的兴趣,并催生了广泛的应用,例如使用相机的手语理解和人机交互。尽管该领域有大量研究工作,但仍缺乏关于VHGR的结构化且完整的综述,使得研究人员不得不浏

  
深度学习(DL)模型的快速演进和可用数据集规模的不断增长,提升了研究界对始终重要的视觉手势识别(VHGR)领域的兴趣,并催生了广泛的应用,例如使用相机的手语理解和人机交互。尽管该领域有大量研究工作,但仍缺乏关于VHGR的结构化且完整的综述,使得研究人员不得不浏览数百篇论文以寻找当前最优(SOTA)方法。本综述旨在通过提供该计算机视觉领域的全面概述来填补这一空白。通过识别SOTA工作的系统研究方法和结构化呈现各种方法、数据集和评估指标,本综述旨在为研究人员提供有用的指南,帮助他们提出改进。具体而言,本综述聚焦于四个基本问题:VHGR的主要方面是什么,当前的SOTA方法是什么,跨方法和任务可以得出哪些比较性见解,以及哪些挑战塑造了未来研究。从用于定位相关文献的方法开始,该综述以基于分类法的格式识别并组织了关键的VHGR方法,并介绍了影响最终方法选择的各种维度,例如输入模态、任务类型和应用领域。SOTA技术被分为三个主要的VHGR任务:静态、孤立动态和连续手势识别。对于每个任务,列出了架构趋势和学习策略。为了支持该领域未来方法的实验评估,该研究回顾了常用数据集并介绍了标准性能指标。该综述最后指出了VHGR中的主要挑战,包括一般计算机视觉问题和特定领域障碍,并概述了有前景的未来研究方向。
1. 引言

该部分介绍了视觉手势识别(VHGR)在推进人机交互(HCI)和辅助通信系统中的作用,强调深度学习(DL)模型的发展推动了该领域的进步。VHGR广泛应用于人机交互(HCI)、人机交互(HRI,包括工业机器人控制、医疗机器人辅助手术、无人机和无人车导航等)以及手语识别(SLR)系统。VHGR主要分为基于视觉的方法和基于传感器的方法,本综述聚焦于基于视觉的方法,因为基于传感器的方法成本高且设置复杂,实用性较低。本综述涵盖了2021年以来的238篇论文,与现有综述相比,更侧重于近期深度学习方法的当前最优(SOTA)技术。综述围绕静态手势识别(SHGR)、孤立动态手势识别(IDHGR)和连续动态手势识别(CDHGR)三个主要任务展开,并详细分析了各任务的方法、架构、学习策略以及挑战。

2. 文献综述方法论

该部分详细描述了系统性的文献综述方法。研究范围定义围绕五个基本支柱:先进的深度学习方法、基准数据集、评估指标、关键挑战以及创新解决方案。选择标准包括相关性(仅关注基于视觉的VHGR方法)、时效性(优先2021年后的出版物,数据集不限)和影响力(主要来自高h5指数来源)。文献检索在Scopus、Web of Science、Google Scholar和arXiv进行,通过关键词和布尔运算符检索,最终获得278篇出版物(包括方法、数据集和综述)。这些出版物被分类为方法、数据集和综述三类,并分别记录关键信息,如方法名称、所用数据集、评估指标、架构描述、输入模态和学习策略等。

3. 手势识别方法分类法

该部分提出了一个结构化的分类法,涵盖多个维度:应用领域(手语理解SLU、人机交互HCI、人机交互HRI、人机交互HMI)、任务(静态、孤立动态、连续)、输入(RGB、深度、红外、骨架等,分为单模态和多模态,融合策略包括早期、晚期、中间和多级融合)、信息传达类型(语义、语言、指示、操作)、相机视角(第一人称、第二人称、第三人称)、架构(空间、时间、时空、空间+时间、短期时空+长期时间)、学习策略(迁移学习、弱监督学习、知识蒸馏、对比学习、多任务学习、强化学习、少/零样本学习、对抗学习、掩码重建预训练)以及处理方式(在线实时、离线)。

4. 静态VHGR方法

静态手势识别(SHGR)仅依赖空间数据。在手语理解(SLU)中,使用了Gesture-CNN、STN-ND-Net、SIGNFORMER以及YOLO变体等。在人机交互(HCI)中,提出了LHGR-Net、2DPSTPP-Net和FGDSNet等轻量级模型,并结合手部分割和注意力机制。在人机交互(HRI)中,如URGR采用超分辨率和图卷积视觉变换器(GViT)实现远距离识别,DRCAM基于深度数据进行分类。通用方法包括EDenseNet、SpAtNet和MMFANet。比较表明,RGB模态占主导,手部分割未显著提升性能,近期工作趋向资源高效和多流架构。

5. 孤立动态VHGR方法

孤立动态手势识别(IDHGR)从时空输入中识别单个手势实例。单模态外观方法分为时空(如3DCNN、TS3C-Net)、空间+时间(如2DCNN+LSTM)和短期时空+长期时间(如EgoFormer)。单模态姿态方法包括时空(如GCN变体、SKIM、TD-GCN)、空间+时间(如GCN-BERT)、短期时空+长期时间(如MG-GCT)、时间(如LSTM、TCN)以及其他(如Fourier CNN、FS-Net)。多模态方法融合RGB、深度、骨架等,在通用领域(如RAAR3DNet、CTFB)、手语理解(如SignBERT、SAM-SLR、Uni-Sign)和人机交互(如HandSense)中均有应用。比较表明,关键帧选择可减少计算,姿态估计的误差可能影响性能,多模态大容量框架(如Uni-Sign)精度高但计算成本大。

6. 连续动态VHGR方法

连续动态手势识别(CDHGR)处理未分割的序列,通常采用连接主义时间分类(CTC)损失。RGB方法遵循2DCNN+1DCNN+BiLSTM三阶段架构,并引入辅助损失(如VAC-CSLR、SMKD)、注意力模块(如CorrNet、SEN-CSLR)和变换器主干(如CLIP-SLA、Swin-MSTP)。姿态方法依赖骨架或热图,如MSKA-SLR、CoSign和FA-STGCN。多模态方法如TwoStream-SLR结合RGB和姿态热图,利用双向横向连接和多级融合。比较显示,三阶段范式仍占主导,扩散模型(DM)和视觉基础模型(如CLIP)可提升性能,但计算成本高。

7. SOTA方法总结

该部分总结了各任务中的SOTA方法,比较了架构、部署、优势和局限性。手语理解(SLU)主导了其他领域,因其复杂性和对手势细微差异的区分需求。姿态方法在IDHGR中常见,但在连续识别中因快速运动导致姿态估计失败而受限。RGB模型在静态任务中已足够,而连续任务需要更复杂的架构。学习策略方面,SSL和NAS在IDHGR中常用,CSLR则通过辅助损失和额外训练数据缓解优化困难。

8. 基于手势的交互范式

该部分概述了实际应用中的手势交互范式。在人机交互(HCI)的VR/AR中,包括选择和操作(如“Go-Go”技术)、空中手势词汇(如捏合、指向)、移动和双手交互以及人体工学问题(如“猩猩手臂”效应)。人机交互(HRI)涵盖工业协作、自我中心视角和社交可接受性。人机交互(HMI)包括汽车座舱交互、智能家居/物联网、可穿戴计算以及可发现性反馈。

9. 数据集

该部分分类介绍了用于不同任务的数据集。孤立和连续手语识别(SLR)数据集包括RWTH-PHOENIX-Weather、BOBSL、OpenASL、CSL-Daily等,提供RGB、深度、姿态等多种模态,适用于不同语言和场景。语义手势HGR数据集分为静态(如HaGRID、OUHANDS)、孤立动态(如Jester、EgoGesture)和连续(如IPN Hand、ChaLearn ConGD),涵盖HCI、HMI和HRI领域。其他数据集包括FPHA(操作手势)、DP(指点手势)和SocialGesture(多人手势)。比较表明,HaGRID适合静态HCI,URGR适合远距离HRI,OpenASL和BSL-1K是大型SLR数据集。

10. 评估指标

该部分介绍了分类指标(如准确率、精确率、召回率、F1分数,包括微平均和宏平均)和序列指标(如字错误率WER、编辑距离准确率),以及计算资源指标(如推理时间、帧率、模型大小、参数数量、浮点运算数FLOPs)。

11. 当前挑战与未来研究方向

该部分识别了主要挑战。手势无关因素(如环境、主体特征、视角、图像质量)可通过手部裁剪、空间归一化、超分辨率、注意力机制缓解,但依赖外部模型,未来可借助可解释AI(XAI)和专门数据增强。计算成本高,尤其是CSLR方法(FLOPs可达2950.5G),可通过非参数层、小型架构和模型压缩(如剪枝、量化)降低。数据稀缺表现为多样性有限、实验室样本和类别不平衡,缓解策略包括多语言数据聚合、自监督学习、高级数据增强、少/零样本学习以及生成式AI(如扩散模型)。优化困难包括梯度衰减和CTC尖峰现象,可通过辅助监督、时间模块重新设计和语言约束缓解。架构局限性包括固定块设计、图卷积网络(GCN)拓扑不足和无效多模态融合,可通过神经架构搜索(NAS)、自适应手部拓扑和多级融合解决。未来研究路线包括消除手势无关因素、改善数据覆盖、降低计算成本、解决优化困难、推进多流融合以及高效利用基础模型。

12. 结论

该综述通过分类法回答了VHGR的主要方面,按任务呈现了当前SOTA方法,进行了比较分析,并指出了挑战和未来方向。研究表明,即使简单模型在静态HGR上也能取得高精度,而孤立动态和连续任务需要更复杂架构,但优化困难和数据稀缺仍是主要瓶颈。未来可探索开放词汇识别、基础模型和模型压缩技术。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号