基于文本蒸馏的弱监督目标定位方法TeD-Loc

《Pattern Recognition》:TeD-Loc: Text Distillation for weakly supervised object localization

【字体: 大 中 小 】 时间:2026年09月25日 来源:Pattern Recognition 9.1

编辑推荐:

  弱监督目标定位(Weakly Supervised Object Localization, WSOL)是一项关键且具有挑战性的计算机视觉任务,旨在仅使用图像级标签而非实例级标注来训练模型以定位图像中的目标。流行的类激活映射(Class Activation

  
弱监督目标定位(Weakly Supervised Object Localization, WSOL)是一项关键且具有挑战性的计算机视觉任务,旨在仅使用图像级标签而非实例级标注来训练模型以定位图像中的目标。流行的类激活映射(Class Activation Mapping, CAM)方法利用分类模型生成定位图,但其本质上聚焦于目标最具判别性的区域,往往无法捕获完整的空间范围。这一局限性源于判别模型被优化以最小化同类不同实例之间的互信息。已有多种策略试图缓解该问题,包括空间正则化、对抗擦除以及利用伪标签等。然而,这些方法受限于卷积神经网络(Convolutional Neural Network, CNN)的局部感受野,难以捕获对完整目标定位至关重要的全局依赖关系。 视觉变换器(Vision Transformer, ViT)近来展现出通过自注意力建模长距离依赖的潜力,弥补了CNN在WSOL中的关键缺陷——受限的局部感受野以及仅突出最具判别性目标区域的局部激活问题。然而,ViT缺乏CNN固有的局部归纳偏置,往往导致局部特征表示较弱。视觉-语言模型,尤其是对比语言-图像预训练(Contrastive Language-Image Pre-training, CLIP)模型,通过对齐文本与视觉特征为利用类级标签的定位任务提供了有前景的方向。然而,基于变换器模型的一个架构局限在于文本嵌入与局部块嵌入之间的脱节。由于类标记聚合的是全局图像语义而非空间定位表示,其与定位所需的局部特征对齐不佳,使得提取精确的定位图颇具挑战。此外,从CLIP提取定位图的主流方法,如基于梯度和注意力操作的方法,严重依赖真实标签(Ground Truth, GT)类别信息。这种依赖性在采用外部模型预测类别时会导致性能下降,原因在于特征错位和类别混淆,例如CLIP经常混淆“airplane”与“aircraft”等相似类别。因此,在不进行微调的情况下使用CLIP模型会在下游任务中引入显著误差,亟需能够在最小化对显式类别标签依赖的同时学习精确定位线索的策略。 近期,GenPrompt尝试通过将WSOL构建为条件去噪过程来应对这些挑战,利用CLIP嵌入捕获判别区域。尽管GenPrompt通过使用CLIP嵌入改善了定位性能,其在推理时仍依赖外部分类器或GT类别标签,增加了复杂性并限制了实际应用。此外,基于CLIP的方法存在一个根本局限:在缺乏先验类别信息的情况下无法定位图像中的目标。鉴于上述挑战,研究人员寻求有效利用视觉-语言模型学习精确的WSOL定位线索,同时缓解误分类并减少推理时对GT标签的依赖。 为解决这些问题,研究人员提出了TeD-Loc(Text Distillation for Localization)方法。CLIP的文本嵌入编码了与视觉概念高度对齐的语义信息,但CLIP无法将文本嵌入与局部块级表示对齐,限制了其目标定位能力。TeD-Loc通过将CLIP文本嵌入的知识蒸馏到定位模块来解决这一差距。在教师-学生框架内采用对比学习,将模型的块级视觉表示与文本嵌入对齐,该对齐由基于CAM的现成方法提取的伪标签引导。通过学习文本嵌入,TeD-Loc能够以单一模型实现最先进的性能,且无需在验证集上单独训练和选择分类器。TeD-Loc引入了通过定位实现分类的新范式,消除了基于分类器分数进行模型选择的需求。通过训练定位模块基于块嵌入与文本嵌入的相似性区分前景(Foreground, FG)与背景(Background, BG)区域,模型能够同时进行分类和定位。此外,为解决CLIP混淆语义相似类别的局限性,研究人员提出在蒸馏前对文本嵌入进行正交化处理。默认情况下,CLIP中的文本嵌入因在嵌入空间中距离过近而可能无法充分区分相似类别。为缓解该问题,研究人员使用QR分解对嵌入进行分解,并利用所得正交基向量进行对齐。 TeD-Loc采用基于变换器的架构,将图像分解为若干块,通过模型主干生成上采样的块嵌入以产生细粒度定位图。每个块嵌入被单独分类以估计其代表FG或BG区域的概率,这些分类分数被汇聚以生成突出图像感兴趣区域的定位图。图像的全局分类分数是块嵌入的加权平均值。该方法受多示例学习(Multiple Instance Learning, MIL)框架启发,其中每张图像构成一个包含多个“实例”(图像块)的“包”,训练时仅提供包级标签。借助MIL,目标定位与分类得以同时执行,通过为判别性块分配更高权重,无需依赖外部分类器或先验类别信息。这符合WSOL的要求,使模型能够独立生成准确的定位图与分类分数。 主要贡献如下:(1)提出了TeD-Loc方法,通过对比学习将CLIP文本嵌入的知识蒸馏到块嵌入中,实现在推理时无需类别标签或外部分类器的块级前景/背景定位。(2)引入分类模块,利用定位分数计算FG区域的期望嵌入,通过以FG定位图导出的权重对块嵌入进行加权平均,确保FG嵌入与正确类别嵌入对齐,消除了对外部分类器的需求。(3)为缓解CLIP混淆语义相似类别的倾向,提出在蒸馏前对类别文本嵌入进行基于QR分解的正交化,提升定位与分类的判别性。(4)在自然图像数据集(CUB和ILSVRC)及组织学图像数据集(GlaS和CAMELYON17)上的大量实验表明,TeD-Loc在多个具有挑战性的基准上优于最先进的WSOL方法。
一、研究背景与问题
弱监督目标定位(Weakly Supervised Object Localization, WSOL)是计算机视觉中一项关键且具有挑战性的任务,其目标是在仅使用图像级类别标签而非实例级标注的条件下训练模型以定位图像中的目标。经典的类激活映射(Class Activation Mapping, CAM)方法利用分类模型生成定位图,但这类方法本质上聚焦于目标最具判别性的区域,往往无法捕获对象的完整空间范围。这一局限源于判别模型被优化以最小化同类不同实例之间的互信息。已有多种策略被提出以缓解该问题,包括空间正则化、对抗擦除以及伪标签利用等。然而,这些方法受限于卷积神经网络(Convolutional Neural Network, CNN)的局部感受野,难以捕获对完整目标定位至关重要的全局依赖关系。
视觉变换器(Vision Transformer, ViT)通过自注意力机制展现出建模长距离依赖的潜力,弥补了CNN在WSOL中的关键缺陷——受限的局部感受野以及仅突出最具判别性区域的局部激活问题。然而,ViT缺乏CNN固有的局部归纳偏置,往往导致局部特征表示较弱。视觉-语言模型,尤其是对比语言-图像预训练(Contrastive Language-Image Pre-training, CLIP)模型,通过对齐文本与视觉特征为利用类级标签的定位任务提供了有前景的方向。然而,基于变换器模型存在一个架构局限:文本嵌入与局部块嵌入之间的脱节。由于类标记聚合的是全局图像语义而非空间定位表示,其与定位所需的局部特征对齐不佳,使得提取精确的定位图颇具挑战。此外,从CLIP提取定位图的主流方法,如基于梯度和注意力操作的方法,严重依赖真实标签(Ground Truth, GT)类别信息,这种依赖在采用外部模型预测类别时会导致性能下降,原因在于特征错位和类别混淆,例如CLIP经常混淆“airplane”与“aircraft”等相似类别。因此,在不进行微调的情况下使用CLIP模型会在下游任务中引入显著误差,亟需能够在最小化对显式类别标签依赖的同时学习精确定位线索的策略。
近期,GenPrompt尝试通过将WSOL构建为条件去噪过程来应对这些挑战,利用CLIP嵌入捕获判别区域。尽管其改善了定位性能,但在推理时仍依赖外部分类器或GT类别标签,增加了复杂性并限制了实际应用。此外,基于CLIP的方法存在一个根本局限:在缺乏先验类别信息的情况下无法定位图像中的目标。鉴于上述挑战,研究人员寻求有效利用视觉-语言模型学习精确的WSOL定位线索,同时缓解误分类并减少推理时对GT标签的依赖。
二、研究内容与主要技术方法
针对上述问题,研究人员提出了TeD-Loc(Text Distillation for Localization)方法,将CLIP文本嵌入的知识蒸馏到视觉编码器的块嵌入中。该方法采用基于ViT的编码器-解码器架构:编码器使用预训练且冻结的ViT-EVA-L将图像分解为块并产生块级嵌入,解码器将这些嵌入上采样到高空间分辨率。训练过程中,研究人员在教师-学生框架内采用对比学习,将模型的块级视觉表示与CLIP文本嵌入对齐,该对齐由基于CAM的现成方法提取的伪标签引导。为缓解CLIP混淆语义相似类别的问题,研究人员在蒸馏前对类别文本嵌入进行QR分解正交化,利用所得正交基向量进行对齐。此外,模型引入轻量级前景/背景(Foreground/Background, FG/BG)二值块分类器,其响应构成定位图,并通过多示例学习(Multiple Instance Learning, MIL)框架实现定位与分类的联合优化。推理时仅需视觉主干和轻量级FG/BG头,无需类别标签或外部分类器。
三、研究结果
(1)TeD-Loc的提出与核心机制:研究人员提出了TeD-Loc方法,通过对比学习将CLIP文本嵌入的知识蒸馏到块嵌入中,实现了无需类别标签或外部分类器的块级前景/背景定位。该方法将分类任务融入定位过程,使模型能够同时进行分类与定位,消除了对外部分类器的依赖。
(2)分类模块的设计:研究人员引入分类模块,利用定位分数计算前景区域的期望嵌入。通过对块嵌入进行加权平均(权重由前景定位图导出),确保前景嵌入与正确的类别嵌入对齐,从而无需外部分类器即可实现分类。
(3)文本嵌入正交化策略:为缓解CLIP混淆语义相似类别的倾向,研究人员提出在蒸馏前对类别文本嵌入进行基于QR分解的正交化处理,减少了语义重叠并提升了定位与分类的判别性。
(4)实验验证:研究人员在自然图像数据集(CUB和ILSVRC)及组织学图像数据集(GlaS和CAMELYON17)上进行了大量实验。结果表明,TeD-Loc在多个具有挑战性的基准上优于最先进的WSOL方法,在定位与分类性能上均达到最先进水平。
四、讨论与结论
讨论部分指出,TeD-Loc通过将CLIP文本嵌入蒸馏到视觉块嵌入中,有效解决了CLIP文本嵌入与局部块嵌入脱节的问题,使模型能够学习空间定位表示。通过正交化文本嵌入,缓解了相似类别混淆问题,提升了判别性。多示例学习框架使模型能够同时完成定位与分类任务,无需外部分类器或先验类别信息,显著简化了推理流程并提高了实际应用性。研究结论表明,TeD-Loc在多个基准数据集上实现了最先进的WSOL定位与分类性能,为弱监督目标定位提供了一种新的范式,即通过定位实现分类,消除了对分类器分数进行模型选择的需求。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号