ADASign:用于连续手语识别的自适应可变形视觉注意力机制
《Neurocomputing》:ADASign: Adaptive deformable visual attention for continuous sign language recognition
【字体:
大
中
小
】
时间:2026年07月24日
来源:Neurocomputing 6.7
编辑推荐:
摘要连续手语识别任务在很大程度上依赖于对视觉特征的有效建模,尤其是在处理手语中的非刚性运动和时间动态特性时。然而,现有采用传统注意力机制的连续手语识别方法存在局限性,如固定的采样网格以及不足的时间建模能力,这导致难以捕捉手语中细微的变化和长期依赖关系。为应对这些挑战,我们提出了一
摘要连续手语识别任务在很大程度上依赖于对视觉特征的有效建模,尤其是在处理手语中的非刚性运动和时间动态特性时。然而,现有采用传统注意力机制的连续手语识别方法存在局限性,如固定的采样网格以及不足的时间建模能力,这导致难以捕捉手语中细微的变化和长期依赖关系。为应对这些挑战,我们提出了一种名为ADASign的自适应且灵活的视觉注意力机制,该机制包括自适应融合可变形注意力模块和全局动态时间模块。自适应融合可变形注意力模块能够生成偏移预测,使注意力机制能够自适应地聚焦于手语中的关键区域,如手部关节和面部表情。通过整合多尺度卷积融合策略,AFDA实现了大范围感受野与精细细节之间的平衡,提升了空间采样的灵活性和准确性。此外,还采用了稀疏采样方式,在保留重要局部信息的同时减少冗余计算。轻量级的全球动态时间模块则通过门控机制将全局注意力与帧间时间变化相结合,从而平衡长距离依赖关系与短期动作表现之间的学习。在三个连续手语识别数据集上的大量实验表明,我们的方法相较于现有方案具有竞争力,证明了其有效性。
引言连续手语识别作为人工智能技术助力听力障碍群体实现有效沟通的重要任务,旨在从按句子级别标注的视频中依次识别多个手语手势,并输出对应的词形序列[1]。与大多数计算机视觉任务类似,连续手语识别的核心挑战在于对视觉特征的有效建模。目前主流方法通常依赖2D/3D卷积神经网络来自适应地建模手语中关键视觉元素的高维特征,如手势和面部表情,为后续识别过程提供支持[2]、[3]、[4]、[5]。尽管基于注意力的连续手语识别方法近期取得了性能提升,但仍然存在两大挑战:空间刚性和时间刚性。第一个挑战即空间刚性,源于传统空间注意力机制所依赖的固定形状采样网格(例如卷积操作)[8]。然而,这类固定模式无法有效建模手语中常见的非刚性空间变形,而这些变形往往是由不同手语者的个体差异造成的。例如,不同的手语者执行相同手势时幅度或速度可能有所不同,从而导致同类样本间的差异;而相似手势之间的细微差别则可能引发不同类别样本间的混淆[9]。第二个挑战是时间刚性。现有的时间模型通常使用固定窗口来计算局部或全局时间关系[10],这类方法无法适应手语的动态特性,比如快速与慢速动作的交替出现。因此,时间建模需要具备自适应捕捉手语速度变化的能力。近期的一些研究[7]、[11]、[12]、[13]探索了用于连续手语识别的动态和可变形建模方法。SignGraph[7]提升了空间依赖性建模能力,但它仍依赖相对固定的特征聚合策略,在精确定位精细手语区域方面可能存在局限,常常会将注意力错误地分配到无关的视觉内容上,如图1所示。DESign[11]引入了动态卷积权重以增强时间上下文表征能力。DCA[12]则通过采用多尺度可变形相关性来调整帧间相关性采样范围,以此解决空间-时间刚性问题。MixSignGraph[13]则通过构建局部、时间和层次化的手语图谱来建模手语序列,从而捕捉跨区域和多粒度依赖关系。这些研究都证实了降低连续手语识别的空间和时间刚性具有重要意义。不过,如何有效地学习用于精细非刚性手语区域的可变形空间采样方法,以及如何在轻量级时间建模中平衡长距离时间上下文与短期动作变化,依然是一项挑战。因此,设计一种专为连续手语识别优化的视觉注意力机制至关重要。考虑到手语的特性[14],这样的机制理想情况下应满足以下要求:(1)空间建模需聚焦于手部动作和面部表情等关键区域,从而克服固定采样网格在处理非刚性运动时的刚性问题;(2)时间建模需能够通过平衡长距离依赖关系与短期动作表现来自适应适应手语速度的变化;(3)由于手语表达通常集中在肩部和胸部区域,该注意力机制还应具备对背景噪声的强鲁棒性。为应对这些挑战,我们并未推出全新的连续手语识别框架,而是在基于图的连续手语识别流程基础上进行改进,提出了ADASign这一模块级增强方案,用以提升自适应的空间和时间表征学习能力。ADASign由两个互补的组件构成:自适应融合可变形注意力模块和全局动态时间模块。借鉴近期在可变形注意力领域取得的进展[15],AFDA首先在输入空间中均匀分布一组参考点,随后一个轻量级的多尺度偏移网络会预测每个点的位移,并将调整后的位置传递到每一个查询位置。通过自适应地将采样位置调整到包含有用信息的区域,如指尖、嘴角或其他细微的面部特征处,AFDA取代了传统的网格式刚性采样方式(图1(d)),采用了一种以数据为驱动的分布方式,能够精准覆盖语义上重要的区域(图1(e))。此外,我们还为AFDA配备了多尺度选择性核融合模块,该模块能够将大范围上下文特征与高分辨率细节相结合,从而使该模块既具备捕捉全局上下文的能力,又拥有保留精细特征的精度。稀疏采样策略则通过仅关注经过偏移调整后的关键点来控制计算量,避免冗余计算。在AFDA提升了空间聚焦能力之后,我们进一步提出了全局动态时间模块,该模块凭借简洁而富有表现力的设计,能够提供稳定且具有区分度的时间表征。具体而言,GDT首先将空间特征聚合为帧级描述符,然后应用多头自注意力机制来建模时间依赖关系,计算帧间时间变化以识别短期动作表现,同时还引入了门控机制来平衡这些不同时间层面的信息。虽然当前框架主要侧重于基于RGB的视觉建模,但所提出的AFDA和GDT模块采用即插即用式的设计,未来有望与姿态估计、光流或深度信息等多模态输入相结合。本文的主要贡献如下:•我们提出了一种专为连续手语识别设计的可变形视觉注意力模块,作为对基于图结构的连续手语识别流程的模块级改进。通过学习与手语者特征相关的偏移位移,所提出的AFDA能够自适应地将空间采样位置调整到指尖和面部特征等包含有用信息的区域,从而缓解在非刚性手语动作下固定网格特征提取方法的刚性问题。•我们将可变形注意力与多尺度卷积选择性核融合策略以及稀疏采样机制相结合,使得模型能够在保持适度计算成本的同时,捕捉大范围的上下文语义信息,并保留精细的空间细节。与此同时,轻量级的全球动态时间模块则能够动态平衡长距离时间依赖关系与短期动作变化,从而提升模型在不同手语速度下的稳定性。•所提出的AFDA和GDT模块均采用轻量级且即插即用的设计,因此易于扩展到其他连续手语识别架构中,未来在多模态连续手语识别系统中也有可能与其他模态信息相兼容。•我们在三个公开的连续手语识别数据集(PHOENIX-14 [16]、PHOENIX-14T [17]和CSL-Daily [18])上对所提方法进行了验证,结果表明其与现有方法相比具有稳定的竞争力。
章节摘录连续手语识别连续手语识别任务旨在将手语视频序列转换为词形级别的标注内容[1]、[19]。与单独的手语符号识别任务[20]相比,连续手语识别面临着更多挑战,包括手语符号之间的协同表达、非刚性空间变形以及模糊的时间边界等问题。早期的连续手语识别方法通常依赖基于CNN的架构来进行空间特征提取,随后再结合循环型时间模型[21]、[22]、[23]。尽管这些方法整体框架概述ADASign的整体框架如图2所示。给定一个包含N帧的视频序列,连续手语识别的目标就是预测出对应的词形序列G,其中N表示视频帧数,G则表示词形序列的长度。我们沿用了SignGraph[7]的思想,即将每一帧图像视为通过Patchify Stem模块生成的若干局部块,这些局部块被视作图节点。随后,通过连接语义上相关的局部块来构建空间图,之后再进行进一步的处理……
数据集与评估指标为全面评估所提方法的有效性与泛化能力,我们在三个广泛使用的公开连续手语识别数据集上进行了实验:(1)PHOENIX-14 [16]包含6841个句子级别的样本,词汇量为1295个词形,其中5672个样本用于训练,540个用于开发,629个用于测试。(2)PHOENIX-14T [17]同时支持连续手语识别和手语翻译任务,它包含8247个句子,词汇量为1085个词形,相关样本分为7096组用于训练……
结论我们提出了ADASign,该方法能够同时处理非刚性空间变形与非刚性时间变化问题。自适应融合可变形注意力模块通过稀疏采样和多尺度选择性核融合机制学习非刚性变形的偏移量,从而提升了空间适应性,能够有效聚焦于手和脸等语义上重要的区域。全局动态时间模块则通过建立长距离依赖关系与短期时间特征之间的平衡,进一步增强了模型的性能……
CRediT作者贡献说明张旭燕:撰写——初稿撰写、可视化、软件工具、资源准备、方法设计、数据整理。马华宇:撰写——初稿撰写、方法验证、软件工具、资源准备、方法设计、数据整理。薛万利:撰写——审稿与编辑、初稿撰写、项目监督、项目管理、方法设计、研究调查、资金获取、形式分析、概念构思。郭磊明:撰写——审稿与编辑、形式分析、概念构思。魏超:方法验证、数据整理。利益冲突声明作者声明不存在任何可能影响本文研究成果的已知财务利益或个人关系。致谢本研究部分得到了国家自然科学基金的支持,相关项目编号为62376197、62506260、62020106004和92048301;同时得到了天津市科技计划项目的资助,项目编号为23JCYBJC00360;还获得了陕西省重点研发计划的支持,项目编号为2025CY-YBXM-513;此外还得到了天津市健康研究项目的经费支持,项目编号为TJWJ2025MS045。张旭燕目前就读于天津工业大学计算机科学与工程学院,攻读计算机技术专业硕士学位。她于2019年获得江苏第二师范学院计算机科学技术专业学士学位,她的研究兴趣包括连续手语识别与翻译领域。张旭燕|马华宇|薛万利|郭磊明|魏超|李云鹏|袁甜甜|陈胜勇
生物通微信公众号
生物通新浪微博
今日动态 |
人才市场 |
新技术专栏 |
中国科学人 |
云展台 |
BioHot |
云讲堂直播 |
会展中心 |
特价专栏 |
技术快讯 |
免费试用
版权所有 生物通
Copyright© eBiotrade.com, All Rights Reserved
联系信箱:
粤ICP备09063491号