基于指令条件的视觉标记稀疏化,以实现高效的视觉语言模型推理

《Knowledge-Based Systems》:Instruction-conditioned visual token sparsification for efficient vision-language model inference

【字体: 时间:2026年07月19日 来源:Knowledge-Based Systems 8.0

编辑推荐:

  •视觉令牌剪枝被重新定义为一种基于指令的处理过程。•与任务相关的注意力头负责指导视觉令牌的选择。•回收的剪除令牌能够保留互补的视觉信息。•在推理阶段实现了更好的精度-效率平衡。引言近年来,大型语言模型[1]、[2]、[3]、[4]的进步极大地推动了视觉语言模型(VLMs)[5]、

  •视觉令牌剪枝被重新定义为一种基于指令的处理过程。•与任务相关的注意力头负责指导视觉令牌的选择。•回收的剪除令牌能够保留互补的视觉信息。•在推理阶段实现了更好的精度-效率平衡。引言近年来,大型语言模型[1]、[2]、[3]、[4]的进步极大地推动了视觉语言模型(VLMs)[5]、[6]、[7]、[8]、[9]、[10]、[11]的发展。这些模型在多种多模态任务中表现出色,包括视觉问答、图像描述以及复杂推理。大多数现代VLMs采用基于令牌的架构,将图像编码为一系列视觉令牌,并与文本令牌一起处理。跨模态交互通常通过注意力机制来实现,从而实现文本和视觉表示之间的精细对齐。尽管具备强大的功能,但VLMs仍面临一个关键的效率瓶颈。视觉编码器往往每张图像会产生数百甚至数千个视觉令牌。由于注意力计算随序列长度呈二次方增长,这导致了在计算和内存方面的巨大开销。在高分辨率场景下,密集的视觉令牌会显著增加延迟和资源消耗,这一问题更为严重。因此,高效的视觉令牌建模已成为可扩展多模态系统的核心挑战。为了解决这个问题,近期的一些研究探讨了视觉令牌稀疏化[12]、[13]、[14]、[15]、[16]、[17]。这些方法旨在通过利用跨模态注意力信号或特征相似性来去除冗余的视觉令牌。特别是基于注意力的方法,利用Transformer[18]层中的文本-视觉注意力权重来评估令牌的重要性,并识别出需要剪除的冗余令牌。然而,大多数现有方法依赖于头部平均的注意力得分,这可能会简化异构的跨模态交互,从而导致对令牌级语义相关性的估计不够准确。此外,视觉令牌稀疏化不可避免地会导致信息丢失。现有方法通常仅根据估计的重要性来丢弃令牌,假设低注意力值的令牌对多模态推理的贡献最小。但实际上,这些令牌可能仍然包含被保留的子集所无法捕捉的互补上下文信息。忽略这些信号会削弱视觉表示,降低整体推理性能。这一局限性凸显出需要一种更为平衡的稀疏化策略,能够在高注意力区域之外保留互补的视觉线索。我们的实证分析进一步表明,跨模态注意力头表现出高度的异质性和任务依赖性。如图1所示,在相同的图像-指令输入下,不同的注意力头关注不同的语义模式。这些响应往往是互补而非冗余的,这表明头部平均聚合可能会掩盖与任务相关的语义结构。此外,如图2所示,不同任务下选择不同的注意力头会导致性能出现显著差异,这说明视觉令牌的重要性在很大程度上取决于特定任务的头部选择,而非在所有任务中都保持一致。基于这些观察,我们提出了指令条件下的视觉令牌稀疏化(ICVS)框架,该框架在解码阶段进行令牌选择,并通过轻量级的离线准备来实现基于任务的头部路由。ICVS保持预训练的VLM主干不变,仅引入轻量级的语义路由器以及离线头部查找表,以实现基于指令的令牌选择。在推理过程中,ICVS结合基于密度的令牌回收机制,对视觉令牌进行任务感知的优先级排序,从而在强力压缩的同时提高选择质量并保留互补的上下文信息。在多个基准测试上的广泛实验表明,ICVS在各种令牌预算下都能实现具有竞争力的精度-效率平衡。通过利用任务感知的注意力模式并通过令牌回收来减少信息丢失,该方法实现了更有效的视觉令牌稀疏化,同时保持了出色的多模态推理能力。本工作的主要贡献如下:•我们从任务感知的角度重新审视了视觉令牌稀疏化问题,并将其定义为基于指令的选择问题。我们表明,视觉令牌的重要性并非固有的,而是由跨模态交互动态决定的,这一观点挑战了常见的不考虑头部的聚合方式。•我们提出了一种统一的框架,将视觉令牌选择与任务语义相衔接。该框架包括基于指令的令牌剪枝和基于密度的令牌回收,能够在有限的预算下实现稳健的令牌选择。特别是,我们引入了基于指令的注意力头路由机制以及与任务相关的相关性评估策略,用于识别关键的视觉令牌。•我们还提出了一种基于密度的令牌回收机制,以减轻强力剪枝带来的信息丢失。通过将被丢弃的令牌压缩为紧凑的代表性嵌入,该方法能够保留互补的视觉线索,提高在低令牌数量条件下的稳定性。本文的其余部分安排如下:第2节回顾了视觉语言模型及视觉令牌压缩方法的最新进展。第3节介绍了本工作中使用的预备知识及VLM推理框架。第4节阐述了所提出的框架。第5节展示了在多个基准测试上的广泛实验结果及消融研究。最后,第6节对本文进行总结,并讨论未来的研究方向。片段概述大型语言模型大型语言模型(LLMs)在自然语言理解、推理以及指令遵循方面取得了显著进展,为许多现代智能系统奠定了基础[19]。它们得益于大规模预训练以及在各种下游任务中表现出的涌现式上下文学习能力[20]。最近的研究已经系统地总结了它们的架构、训练策略和评估方法[21]。此外,LLMs还被广泛用于……预备知识在本节中,我们考虑一个预训练的视觉语言模型(VLM),它负责处理图像-指令对(I,T)。图像由视觉编码器编码为一系列视觉令牌{vi}i=1Nv,而指令T则被分词为文本令牌{tj}j=1Nt。在多模态解码过程中,视觉令牌和文本令牌会被拼接成一个统一的序列。该序列由带有多头自注意力的Transformer解码器层堆叠处理。设h∈{1,…,H}表示某个层的索引……方法论在第三节介绍的VLM推理框架基础上,我们将视觉令牌稀疏化重新定义为一种基于任务的选择问题。其目标是找出在有限的计算预算下仍能保持跨模态语义相关性的视觉令牌子集。为此,我们提出了指令条件下的视觉令牌稀疏化(ICVS),该框架包括三个组成部分:(i)基于指令的注意力头选择;(ii)基于……的语义相关性评估实验设置我们在统一的评估环境中测试所提出的方法,重点考察其在受限视觉令牌预算下保持跨模态语义相关性的能力。主要目标是探究这种稀疏化策略是否能够在大幅减少冗余视觉计算的同时,维持强大的多模态推理能力。我们在三种代表性的视觉语言模型(VLMs)上进行了实验,包括LLaVA-1.5 [9]、LLaVA-NeXT [26]……结论在本项工作中,我们从指令条件的角度重新审视了视觉令牌稀疏化问题,并提出了指令条件下的视觉令牌稀疏化(ICVS),这是一种用于高效多模态推理的任务感知框架。ICVS的核心思想是将视觉令牌选择与指令感知的语义相关性相衔接,从而在有限的令牌预算下选择更多与任务相关的视觉信息。为了解决强力稀疏化带来的信息丢失问题,我们引入了……CRediT作者贡献声明曹卫东:撰写——初稿、验证、软件、方法论、概念设计。张曦:撰写——审稿与编辑、形式分析。李成阳:撰写——审稿与编辑、监督、项目管理。刘丹军:撰写——审稿与编辑、验证、监督。谢永强:撰写——审稿与编辑、验证、监督。李忠波:撰写——审稿与编辑、验证、监督、资源提供。利益冲突声明作者声明没有已知的财务利益或个人关系可能影响本文所述的工作。致谢本项目得到了中国石油大学(北京)科学基金的支持(编号:2462025YJRC006)。曹卫东|张曦|李成阳|刘丹军|谢永强|李忠波
相关新闻
生物通微信公众号
微信
新浪微博

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号