《Electronics》:Hijacking the “Safety Bifurcation Point”: Coupled Path Hijacking Attacks on Multimodal Vision–Language Models
编辑推荐:
从仅文本大语言模型(LLMs)到大型视觉-语言模型(LVLMs)的安全机制泛化性仍未被充分理解,尤其是针对排印对抗性提示的脆弱性。在本研究中,研究人员探究了模型内部安全与不安全决策的因果性作出位置。聚焦于仅解码器型LVLMs,研究人员证明安全性被编码为一种非线
从仅文本大语言模型(LLMs)到大型视觉-语言模型(LVLMs)的安全机制泛化性仍未被充分理解,尤其是针对排印对抗性提示的脆弱性。在本研究中,研究人员探究了模型内部安全与不安全决策的因果性作出位置。聚焦于仅解码器型LVLMs,研究人员证明安全性被编码为一种非线性、分布式的表示,该表示在早期一个特定的安全分岔点(SBP)处发生分岔——例如LLaVA-1.5的第9层和Qwen-VL的第5层——并揭示了一个相关性-因果性差距:后期层虽然高度线性可分离,但在因果上却是惰性的。基于这一发现,研究人员引入了一个多阶段、因果(可解释性引导)框架来定位和验证安全表示,并提出了耦合路径劫持(CPH),一种白盒攻击方法,在SBP处同时修补多层感知器(MLP)和自注意力激活,从而确定性劫持安全计算路径。在报告完整表格结果的两个模型上,CPH获得了基于神谕的高攻击成功率:LLaVA-1.5为99.43%,Qwen-VL为98.57%;研究人员还观察到在InstructBLIP-Vicuna上达到99.71%,其Vicuna后端同样为仅解码器。研究人员将这种仅解码器脆弱性与编码器-解码器设计(例如T5后端或Q-Former前端)进行对比,后者中跨模态接地发生在解码之前;研究人员提出这类架构的更强健性作为一个有待未来验证的架构假设,而非本研究的表格结果。这些发现表明视觉-语言模型(VLM)安全是架构依赖的,并激励了面向架构的防御策略,以实现可信的多模态人工智能。
**论文解读:多模态视觉-语言模型安全分岔点的因果定位与耦合路径劫持攻击**
**研究背景与问题**
大型视觉-语言模型(LVLMs)在图文对齐与多模态推理中展现出卓越能力,但引入视觉表征后显著增加了安全脆弱性。现有研究多聚焦于输入侧的对抗性攻击(如排印提示、图像扰动),而对模型内部安全机制的因果性理解仍处于初级阶段。尽管表征工程(Representation Engineering)已能在文本模型中通过激活干预控制输出,但多模态融合如何改变安全决策的因果切换点尚不明确。本研究旨在回答:在LVLM内部,安全与不安全决策的因果性分岔点位于何处?如何通过干预实现确定性劫持?论文发表在《Electronics》。
**关键技术与方法**
研究人员构建了一个包含350个排印对抗样本的基准数据集(源自FigStep和SafeBench),经人工标注为安全/不安全两类。采用**线性探针(Linear Probing)**逐层量化安全相关性的线性可分离性,再通过**因果干预(Causal Intervention)**——即对多层感知器(MLP)与自注意力(Attention)子模块进行耦合激活修补(Coupled Activation Patching)——定位因果性分岔点。核心方法包括:基于Fisher线性判别分析挖掘通用不安全令牌(Universal Tokens),计算其平均隐状态作为**通用不安全质心(Universal Unsafe Centroid)**,并在分岔点层同时替换MLP和Attention激活,实现无参数更新的白盒攻击。
**研究结果**
**1. 相关性-因果性差距的发现**
通过线性探针发现,后期层(如LLaVA第31层)对安全概念具有高线性可分离性(MLP探针准确率75.71%),但相同层的因果干预攻击成功率为0%(表2、表5)。这表明后期层编码了安全相关信息,但无法因果控制输出,暴露了相关性-因果性差距。
**2. 安全分岔点(SBP)的定位**
因果干预标准确定:仅解码器模型中,早期层(LLaVA-1.5第9层,Qwen-VL第5层)是唯一能通过耦合激活修补因果翻转输出的层,攻击成功率(ASR)≥90%(τ=0.9),而后期层相同干预无效。该层被定义为安全分岔点(SBP)。
**3. 耦合路径劫持(CPH)的成功验证**
在SBP处同时修补MLP和Attention激活(来自不安全样本),实现了近乎完美的神谕评分ASR:LLaVA-1.5为99.43%,Qwen-VL为98.57%,InstructBLIP-Vicuna为99.71%(表3)。消融实验表明,仅替换单一子模块时ASR大幅下降(如LLaVA上MLP仅26.3%,Attention仅34.2%),证实安全决策的跨模块分布式编码(表4)。
**4. 通用无供体攻击的可行性**
通过预计算的通用不安全质心,攻击可在推理时无需供体样本,仍保持高于96%的ASR(表5)。留一供体交叉验证(LODO)和跨图像测试显示ASR>93%,表明质心具有模型内泛化性。
**讨论与结论**
讨论部分强调:白盒因果实验揭示了安全对齐的架构依赖性——仅解码器模型在早期融合阶段即完成安全路由,而编码器-解码器模型(如T5后端)可能因跨模态接地前置而更具鲁棒性(需未来验证)。残差连接使早期状态在后续计算中占主导地位,归因于加性广播、深度放大与自回归自强化机制。防御启示包括:在分岔点层部署异常检测、强化融合模块、实施激活偏移约束等。
研究结论部分翻译如下:
本论文提出了一个系统性的因果、可解释性引导框架,通过受控白盒干预解码并操纵多模态视觉-语言模型(VLM)的安全对齐。实验结果超越了观察性相关性,表征了模型安全机制中的因果性。研究人员并未声称推翻表征工程,而是划定了后期层引导的边界条件:五种朴素激活干预(H0–H5)未能诱导因果安全翻转,暴露了一个关键的相关性-因果性差距,即后期层激活(如LLaVA第31层)对安全概念具有高线性可分离性,但在因果上却是惰性的。相反,研究人员定位了一个早期、架构特定的安全分岔点(SBP),例如LLaVA-1.5的第9层和Qwen-VL的第5层。通过引入耦合路径劫持(CPH)框架,研究人员证明在SBP处同时注入合成的通用不安全质心(z
unsafe)到MLP和自注意力子模块,可确定性翻转模型的安全决策。定量上,这种耦合激活修补在LLaVA上实现了近乎完美的神谕评分攻击成功率99.43%,在Qwen-VL上为98.57%,成功绕过了内部自我修正机制,无需任何参数更新。