STAR: 通过以对象为中心的提示缓解视觉-语言模型中的幻觉

《Pattern Recognition Letters》:STAR: Mitigating Hallucinations in Vision-Language Models through Object-Centric Prompting

【字体: 时间:2026年08月14日 来源:Pattern Recognition Letters 3.5

编辑推荐:

  一种免训练框架将对象级先验注入到大型视觉-语言模型(Large Vision-Language Models, LVLMs)的提示中;自适应局部验证以高分辨率(high resolution)裁剪低置信度区域;STAR通过抑制统计语言先验(statistica

  
一种免训练框架将对象级先验注入到大型视觉-语言模型(Large Vision-Language Models, LVLMs)的提示中;自适应局部验证以高分辨率(high resolution)裁剪低置信度区域;STAR通过抑制统计语言先验(statistical language priors)来缓解幻觉;在各种骨干网络(backbones)上验证了一致且高效的改进。
**论文解读:STAR——通过对象级提示缓解视觉-语言模型中的幻觉**

**研究背景与问题**

大型视觉-语言模型(Large Vision-Language Models, LVLMs)在图像描述、视觉问答和复杂场景理解中取得了显著进展。然而,对象幻觉(object hallucination)——即生成内容偏离图像中实际存在的物体——成为可靠视觉推理的主要障碍,严重限制了其在自动驾驶、医学图像分析和司法推理等安全关键领域的应用。现有研究指出,对象幻觉主要由两个原因引起:一是视觉编码器的分辨率瓶颈(resolution bottleneck)导致细粒度视觉证据丢失;二是解码时模型过度依赖统计语言先验(statistical language priors),忽视实际视觉线索。为缓解这一问题,先前研究探索了基于对齐的训练方法(如Supervised Fine-Tuning, SFT)和免训练的推理干预(如VCD、VAF),以及检测器引导的校正框架(如Woodpecker、Piculet)。但这些方法要么计算成本高、依赖专家数据,要么存在推理延迟增大或检测噪声干扰等问题。因此,如何高效注入准确的空间证据同时保持模型的固有推理能力,仍是一个开放挑战。

**研究内容与结论**

研究人员提出了一种免训练的STAR(Spatial Truth-Anchored Recognition)框架,旨在通过利用CNN(Convolutional Neural Network)对象检测器(YOLOv13)的先验信息来缓解对象幻觉。该方法系统地将结构化对象级证据——包括类别标签、精确坐标和置信度分数——直接注入推理提示中,从而提供显式的空间锚点以增强视觉接地(visual grounding)。同时,针对视觉编码器分辨率不足导致的细节丢失,提出自适应高分辨率裁剪策略,对低置信度区域进行动态高分辨率重编码。实验在多种主流LVLM架构(Qwen-3.5-VL, InternVL-3.5, Gemma-3, Ovis-2.5)上进行,在POPE、CHAIR和MME三个基准上均取得一致改进,且推理效率保持或提升。该论文发表在《Pattern Recognition Letters》。

**主要关键技术方法**

STAR的核心由两个阶段组成:全局上下文对齐(Global Context Alignment)和自适应局部验证(Adaptive Local Verification)。首先,使用YOLOv13检测器对输入图像进行密集对象检测,输出类别、边界框坐标及置信度,并通过3×3网格区域划分将对象映射到对应区域,将检测结果转化为结构化自然语言提示注入到LVLM的推理前缀中。其次,对于置信度低于阈值τ(0.3)或空间范围极小的对象,自动裁剪对应区域进行高分辨率重采样,生成局部增强视觉特征,与全局特征和结构化提示共同输入LVLM进行最终决策。整个过程无需额外训练,采用单次前向传播。

**研究结果**

**5.1. Results on POPE**
在POPE的Random、Popular、Adversarial三个子集上,STAR在GEMMA和OVIS模型上均获得最高F1分数。与VCD和VAF相比,STAR展现出更优的稳定性:在GEMMA上F1比基线提升3.6%,在OVIS上提升4.89%。相较于同样使用检测器引导的Woodpecker和Piculet,STAR也表现更优,在GEMMA上F1达89.95%(Woodpecker为89.51%),在OVIS上达90.10%(Woodpecker为87.13%)。分析精确率-召回率特征,STAR在GEMMA上大幅提高精确率(+11.34%),同时接受可控的召回率下降(-4.21%),体现了保守策略优先确保事实准确性;而在OVIS上则同时提升精确率(+0.95%)和召回率(+7.62%),显示出平衡抑制能力。

**5.2. Results on CHAIR**
CHAIR指标显示,STAR有效抑制了类别级幻觉,且在不同架构上具有鲁棒一致性。与基线相比,CHAIRi平均降低22.84%,CHAIRs平均降低15.12%,在InternVL上最为显著(CHAIRi降低30.76%,CHAIRs降低26.39%)。与VCD和VAF相比,STAR的稳定性更优(VCD在QWEN上甚至使幻觉增加14.26%)。与Woodpecker相比,STAR因其单次前向设计,在生成早期即融入空间证据,而非事后校正,因此更有效:平均CHAIRi为15.24(Woodpecker为14.71,但后者在部分设置中得分更高)。Piculet则因轻量级设计导致幻觉抑制效果较弱(平均CHAIRi为17.87)。

**5.3. Results on MME**
MME评估存在、计数、位置和颜色四个子集的总得分,STAR在所有骨干上均取得最高总分,平均提升10.32%。在计数任务上,STAR获得平均32.51%的增益,在OVIS上提升51.46%,在GEMMA上提升44.44%,显著优于Woodpecker,证明了自适应局部裁剪机制在拥挤场景中的区分能力。完整管线相比仅使用全局先验(Module 1)额外提升3.82%,表明全局对象中心锚点与自适应局部验证的结合对最大化细粒度感知任务至关重要。

**5.4. Further Analysis**
消融实验证实,仅使用全局检测器先验(Module 1)即可显著改善幻觉,但全局与局部验证结合(Full)达到最优。推理效率方面,STAR在OVIS上比基线减少7.85%时间,在GEMMA上减少20.66%,且比Woodpecker快3.19倍(OVIS上每图4.46秒 vs 14.22秒)。超参数分析显示,置信度阈值τ=0.3、最大裁剪区域比例α=0.5时达到最佳精度-效率平衡。定性失败案例说明,STAR的性能受限于检测器的召回率:当检测器遗漏物体时,注入的不完整证据会导致诱导性遗漏幻觉,模型错误地信任不完整先验而忽略自身视觉识别。

**总结与讨论**

论文结论部分指出,STAR的有效性源于两个关键见解:(1) 检测器输出的显式空间证据有效对抗了驱动幻觉的统计语言先验;(2) 结合全局检测器先验与局部细节恢复的多粒度验证同时解决了分辨率瓶颈和推理偏差。该方法在不同LVLM家族中展现出鲁棒性。然而,STAR的性能受限于底层检测器的精度和召回率,在检测小、遮挡或拥挤物体时存在挑战。未来工作应探索更强的检测器(如视觉Transformer和开放词汇模型)、不确定性感知检测,以及与其他互补幻觉缓解技术的集成。

**研究结论翻译**
研究人员开发了STAR,一个轻量级免训练框架,通过全局上下文对齐将显式对象级锚点注入到提示中,然后通过自适应局部验证细化不确定区域,从而缓解了LVLMs中的对象幻觉。在实践中,该方法首先利用检测器输出提供类别、位置和置信度线索,然后在需要时通过高分辨率裁剪恢复更精细的视觉细节。在POPE、MME和CHAIR上的实验显示了一致的改进,同时保持或提高了推理效率。STAR的有效性源于两个关键见解:(1) 检测器输出的显式空间证据有效对抗了驱动幻觉的统计语言先验;(2) 结合全局检测器先验与局部细节恢复的多粒度验证同时解决了分辨率瓶颈和推理偏差。该方法在不同LVLM家族中展现了鲁棒性。然而,STAR的性能受限于底层检测器的精度和召回率,在检测小、遮挡或拥挤物体时存在挑战。未来工作应探索更强的检测器,如视觉Transformer和开放词汇模型,不确定性感知检测,以及与其他互补幻觉缓解技术的集成。
相关新闻
生物通微信公众号
微信
新浪微博

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号