《Displays》:Parameter-efficient image–text classification via bidirectional fusion and directional disagreement refinement
编辑推荐:
•仅需 7.40% 可训练参数即可实现参数高效的图文分类。•基于 LoRA 的预训练视觉和文本编码器适配。•双向令牌级协同注意力实现跨模态交互。•方向性分歧提供轻量级、任务相关的优化。•在三个图文基准数据集上取得具有竞争力的性能。引言Twitter/X、Instagram 和
- •
仅需 7.40% 可训练参数即可实现参数高效的图文分类。
- •
基于 LoRA 的预训练视觉和文本编码器适配。
- •
双向令牌级协同注意力实现跨模态交互。
- •
方向性分歧提供轻量级、任务相关的优化。
- •
在三个图文基准数据集上取得具有竞争力的性能。
引言
Twitter/X、Instagram 和 TikTok 等平台的流行催生了一种不同于纯文本的内容形式:配图配短句、口语化表达、表情符号和隐喻。在这种场景下,情感和意图不仅可以通过文本输入来传达,还可以通过面部表情、构图、光线、配色方案、场景背景等视觉特征来表达。因此,对图文中的情感信号和语用信号进行分析已成为一个日益重要的研究主题 [1]。图文分类必须同时考虑模态内结构和模态间交互。中性的图注配上悲伤的图片可能传达负面情绪,而负面的词语配上积极的图片则可能导致更模糊的解读。因此,当两种模态弱对齐或相互冲突时,简单的单模态分析或浅层融合可能会失效 [2]。
CLIP [3] 等预训练视觉-语言模型已在大规模数据上展示了强大的跨模态对齐能力;然而,它们在图文分类中的部署仍受限于三个问题。首先,全量微调需要消耗大量的计算和内存开销,且当专门应用于狭窄领域时可能会降低预训练表征的通用性 [4]。其次,许多融合策略依赖后期融合或特征拼接,这些方法并未显式建模视觉区域和文本片段之间的令牌级交互 [5]。第三,图像和文本并不总是相互支持的;显式建模它们在类别层面的分歧可以为最终预测阶段提供一个轻量级的诊断信号。
RAVEL 遵循三个设计方向:参数高效适配、令牌级双向交互以及基于类别的方向性分歧条件化。第一个方向通过更新低秩适配参数而非完整编码器权重来保持训练的高效性。第二个方向允许每种模态通过双向协同注意力从另一种模态中检索任务相关信息。第三个方向将最终预测头暴露于视觉和文本类别概率分布之间的有符号差值。具体而言,RAVEL 在图像和文本编码器中均使用低秩适配(LoRA),同时保持大多数预训练参数冻结。随后,它对令牌级的视觉和文本序列应用两层双向协同注意力。最后,基于方向性分歧条件化的优化(DDCR)计算单模态概率向量之间的类别级有符号差值,并将此信号与共注意力表示拼接后输入最终分类器。我们将方向性分歧作为预测条件化信号使用,而不将其解释为不确定性或可靠性估计器。
实验在三个广泛使用的图文基准上开展:MVSA-Single [6]、MVSA-Multiple [6] 和 HFM(MMSD)[7]。RAVEL 包含 291.17M 参数,其中仅有 21.54M(7.40%)在特定任务训练期间被更新。跨模态分歧被定义为视觉分支和文本分支预测的概率分布之间的类别级有符号差值。除分类性能外,我们还评估了置信度校准、跨随机种子的鲁棒性以及模态消融下的表现,从而对所提出方法提供更全面的刻画。
本研究的贡献总结如下:
- •
我们提出了一种参数高效的图文分类框架,集成了基于 LoRA 的编码器适配、双向令牌级协同注意力和基于方向性分歧条件化的优化,同时仅更新 7.40% 的模型参数。
- •
我们提出了一种基于类别的方向性分歧表示,用于轻量级预测优化,并刻画了其形式化性质。
- •
在三个基准数据集上的实验展示了具有竞争力的性能,同时受控消融实验验证了所提组件的有效性和任务相关性贡献。
本文其余部分组织如下。第 2 节回顾相关工作。第 3 节介绍 RAVEL 框架。第 4 节详细描述实验设置。第 5 节报告结果和可视化分析。第 6 节讨论我们的发现,第 7 节总结全文。
章节摘要
图文分类与参数高效适配
在社交媒体中,用户情绪往往通过简短的图注和充满风格化元素的图像来传达。这种组合产生了一种分布式的情感信号:文本可能是口语化的、缩写的或基于表情符号的,而图像在场景构图、颜色和上下文方面差异巨大。近期的综述将融合策略归纳为三类:通过特征拼接进行早期融合、通过合并独立输出进行后期融合,以及模态之间交换信息的交互式融合
架构与参数高效编码器
RAVEL 包含六个组件,如图 1 所示:
- •
带有基于 LoRA 微调的 CLIP 视觉 Transformer;
- •
带有混合 LoRA 和选择性解冻的 DeBERTa-v3-base 文本编码器;
- •
将两种模态映射到共享 512 维空间的线性投影;
- •
用于令牌级跨模态融合的两层双向多头协同注意力;
- •
为每种模态生成类别分布的单模态概率头;
- •
基于方向性分歧条件化的最终优化头。
我们初始化
数据集与实现
我们在三个图文基准上评估 RAVEL:MVSA-Single、MVSA-Multiple 和 HFM。MVSA-Single [6] 是一个包含 4511 个实例的三分类社交媒体情感数据集,划分为 3611 个训练样本、450 个验证样本和 450 个测试样本。相应的类别分布见表格 2。MVSA-Multiple [6] 包含 17,024 个实例,遵循 13,624/1,700/1,700 的训练/验证/测试划分。
HFM 是原始的多模态 24,635 个实例的图文基准
主要结果与类别级性能
表格 3 总结了主要的基准比较。在已报告的 MVSA-Multiple 和 HFM 评估中,RAVEL 的平均 F1 值分别比表格中列出的最佳值高出 0.88 和 2.08 分,同时仅更新 7.40% 的模型参数。由于部分已发表基线值是在非相同协议下获得的,这些差异属于文献层面的比较,而非宣称全局最先进性能或单种子优越性。贡献的
主要发现的解释
受控分析将双向协同注意力识别为 RAVEL 性能的核心贡献因素。在 MVSA-Single、MVSA-Multiple 和 HFM 上,移除协同注意力在所有评估的架构消融中产生最大的性能下降,远超移除方向性分歧输入的效果。具体而言,移除协同注意力使 MVSA-Single 上的加权 F1 下降 7.12 分,MVSA-Multiple 上下降 11.22 分,宏 F1 在
结论
本研究提出了 RAVEL,一种用于图文分类的参数高效视觉-语言框架,集成了基于 LoRA 的编码器适配、双向令牌级协同注意力和基于方向性分歧条件化的优化。在三个基准数据集上的实验结果表明,在所评估的多模态情感和网络讽刺场景中,RAVEL 仅更新 7.40% 的模型参数便取得了具有竞争力的性能。三个基准上的受控消融
利益冲突声明
作者声明他们不存在任何已知的竞争性经济利益或个人关系,这些关系可能影响本论文所报告的工作。
Phuong Lam|Y. Nguyen Minh|Thien Khai Tran