通过多尺度与选择性特征学习提升推理分割中的模态对齐性

《Knowledge-Based Systems》:Improving modality alignment via multi-scale and selective feature learning in reasoning segmentation

【字体: 时间:2026年07月19日 来源:Knowledge-Based Systems 8.0

编辑推荐:

  •RSAT被提出用于处理推理分割任务。•引入AFE和MIM来提升跨模态对齐性能。•AFE和MIM可轻松集成到其他推理分割模型中。•RSAT在多种分割任务中都能提升性能。引言随着多模态大型语言模型[1]、[2]、[3]的快速发展,用户与智能系统之间的交互体验得到了显著提升[4]、[

  
  • RSAT被提出用于处理推理分割任务。
  • 引入AFE和MIM来提升跨模态对齐性能。
  • AFE和MIM可轻松集成到其他推理分割模型中。
  • RSAT在多种分割任务中都能提升性能。

引言

随着多模态大型语言模型[1]、[2]、[3]的快速发展,用户与智能系统之间的交互体验得到了显著提升[4]、[5]。在实际应用中,智能系统常常需要根据用户的自然语言指令来识别目标物体或感知周围环境。为满足这些需求,推理分割作为一种新的视觉-语言任务应运而生。该任务要求模型在复杂的自然语言指令条件下生成二值分割掩码,从而实现视觉感知与语言理解的整合。作为一种新提出的视觉-语言任务,推理分割强调模型的自我推理能力,而这对于提升智能感知系统的认知能力至关重要。这种自我推理能力能够推动智能感知系统的发展,使智能系统能够像人类一样理解简洁直接的指令,从而提供更加自然高效的交互体验[6]、[7]、[8]、[9]。鉴于其独特特性,推理分割在各个领域都具有巨大潜力,尤其是在具身智能领域,如视觉-语言导航、人机交互等。
与传统明确指定分割对象的分割方法不同,推理分割要求模型从模糊的文本指令中正确推断出目标对象。现有的推理分割模型[10]、[11]、[12]、[13]、[14]通常依靠视觉指令微调来实现跨模态对齐,让大型语言模型能够在一定程度上成功解读隐含指令。例如,LISA[10]通过线性投影将视觉特征映射到文本特征空间,并通过视觉指令微调实现跨模态对齐。然而,当指令-图像对包含多个实体或语义复杂的指令时,这种直接对齐策略往往会引入错误的语义关联。结果,模型无法在文本特征与视觉特征之间建立精确的对应关系,进而影响分割精度。如图1所示,当给定指令“用于在走廊中约束狗的物体”时,仅依赖视觉指令微调,模型会误解指令,错误地将“框架”纳入分割掩码中。这一例子充分表明,当指令包含多个相关实体时,现有模型往往无法准确识别任务的核心目标,也无法将指令中的隐含实体与图像中对应的视觉目标准确关联起来。为解决这一局限,我们提出了推理分割助手(RSAT),这是一种新型且高效的推理分割模型,旨在处理基于隐含且复杂文本指令的推理分割任务。通过建立文本与图像之间的语义关联,RSAT能够将指令中的隐含目标信息与图像中的实体精准匹配,降低模型理解输入信息的难度,提升推理精度。具体而言,RSAT的核心由两个关键模块组成:属性特征提取器(AFE)和模态交互模块(MIM)。接收到文本指令后,AFE会动态提取文本中隐含的目标物体的关键属性信息。这些属性线索为模型提供了指导,使其能够关注最相关的视觉和文本特征。提取出的属性随后会被转换为高级特征表示,有效弥合不同模态之间的语义差距,提升跨模态理解的语义一致性。MIM则作为跨模态交互模块,实现视觉与文本模态之间的细粒度语义对齐及多尺度特征融合。具体而言,MIM首先将视觉特征投影到一个新构建的语义空间中,在该空间内利用交叉注意力机制计算注意力图,捕捉视觉区域与文本语义之间的对应关系。这些注意力图随后会被上采样到与原始图像特征相同的尺寸,从而获得细粒度的交互特征。同时,该模块还会通过上采样和下采样增强原始视觉特征,生成自适应增强特征。最后,一个残差网络会将这两类特征与原始视觉特征融合,构建多尺度语义融合特征,使模型能够更准确地捕捉输入信息中的语义关联。
AFE能够从文本指令中提取目标物体的关键属性信息,从而显著提升模型的泛化能力和适应性。与此同时,MIM通过将融合重点从传统的空间尺度融合转变为语义尺度融合,引入了一种新的思路。借助交叉注意力机制,MIM能够精准建立不同模态之间的语义对应关系。此外,它还包含一个并行自适应增强机制,能够在交叉注意力计算过程中根据文本语义动态强化关键图像区域的特征。这一机制进一步提升了视觉特征与任务特定目标之间的匹配度。而且,MIM还能根据任务所需的语义粒度进行分层融合,实现更为精细且高效的跨模态融合。RSAT的有效性已在多个基准测试中得到充分验证。它在单目标、多目标以及参照分割任务中均展现出稳定的性能提升,且表现明显优于基线模型。值得注意的是,将AFE和MIM接入LLM-Seg[11]后,在零样本学习条件下,其在LLM-Seg40K[11]上的绝对gIoU提升了6.7%。
综上所述,我们的贡献包括:
  • 我们提出了RSAT,这是一种新型推理分割模型,专为处理基于隐含且复杂文本指令的推理分割任务而设计。
  • 我们引入了两个关键模块:属性特征提取器和模态交互模块。这两个模块能够提升模型捕捉输入信息中语义关联的能力,显著改善模型性能。同时,这两个模块都具备灵活部署的特性,可轻松集成到其他推理分割架构中。
  • RSAT在各类推理分割任务中都能实现显著的性能提升,在参照分割任务中更是表现出较强的竞争力。

章节节选

多模态大型语言模型

借助大型语言模型(LLM)的强大推理能力,研究人员推出了一系列技术创新,提升了LLM对多模态信息的理解和感知能力,从而推动了多模态大型语言模型(MLLM)的发展。Flamingo[15]创新性地结合了感知器和重采样器,从视觉编码器中提取时空特征,再通过交叉注意力将其压缩为固定长度的视觉标记

RSAT架构

RSAT的结构如图2所示,由五个主要部分构成:(i)MLLM视觉编码器(即预训练的CLIP-ViT[7]);(ii)属性特征提取器(AFE),用于从输入文本指令中提取目标的属性信息;(iii)模态交互模块(MIM),用于实现模态对齐,从而实现文本特征与视觉特征之间的细粒度语义关联;(iv)大型语言模型(LLM),作为对齐后的处理单元

实验部分

本节通过大量实验来验证RSAT的有效性。首先,我们分别展示了其在单目标推理分割、多目标推理分割以及参照分割任务中的对比结果。随后,我们对RSAT中的几个关键组件进行了消融实验。

结论

本文提出了一种名为推理分割助手(RSAT)的新型多模态大型语言模型。通过融入属性特征提取器(AFE)和模态交互模块(MIM),RSAT实现了出色的语义关联能力,使模型能够准确理解隐含且复杂的文本指令,尤其在推理分割任务中表现优异。大量实验表明,RSAT在各种基准测试中都取得了更好的性能

CRediT作者贡献说明

刘忠业:撰写——初稿、可视化、方法论、研究分析、概念构思。左伟良:撰写——审阅与编辑、资金获取。刘立国:验证工作。江静静:撰写——审阅与编辑、方法论、研究分析。

利益冲突声明

作者声明存在以下可能被视为潜在利益冲突的财务利益/个人关系:左伟良指出其获得了中国国家自然科学基金会的资助,项目编号为62088102;同时他还获得了陕西省自然科学基础研究计划的资助,项目编号为2024SF-YBXM-184。其他作者则表示不存在已知的利益冲突

致谢

本研究得到了中国国家自然科学基金会(项目编号:62088102)以及陕西省自然科学基础研究计划(项目编号:2024SF-YBXM-184)的资助。
Zhongye Liu|Weiliang Zuo|Liguo Liu|Jingjing Jiang
相关新闻
生物通微信公众号
微信
新浪微博

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号