一种基于因果关系的多任务框架,用于增强图像与文本之间的交互

《Knowledge-Based Systems》:A causality based multi-task framework for enhancing image and text interactions

【字体: 时间:2026年08月11日 来源:Knowledge-Based Systems 8.0

编辑推荐:

  •它解决了在常见任务中那些被忽视的、不一致的图像与文本交互问题,比如讽刺语检测和幽默识别。•我们提出了一种基于多任务因果关系的框架,即便模型已是当前最优水平,也能进一步提升其性能。该因果关系方法旨在挖掘更重要的特征,而非像传统方法那样寻找噪声。此外,这种多任务建模是端到端的,从而

  •它解决了在常见任务中那些被忽视的、不一致的图像与文本交互问题,比如讽刺语检测和幽默识别。•我们提出了一种基于多任务因果关系的框架,即便模型已是当前最优水平,也能进一步提升其性能。该因果关系方法旨在挖掘更重要的特征,而非像传统方法那样寻找噪声。此外,这种多任务建模是端到端的,从而避免了类似研究中的计算开销。

引言
与单模态图像[1]、[2]或文本[3]、[4]的建模不同,将两种模态结合起来的建模方式[5]、[6]、[7]、[8]、[9]已成为研究热点,其主要任务就是处理图像与文本之间的交互关系。近年来,关于图像与文本对齐关系的研究十分广泛,这类研究具有诸多实际应用价值,比如图像与文本匹配[10]、[11],图像描述[12]、[13],文本生成图像[14],跨模态检索[15]、[16]、[17]等。基于这种图像与文本的对齐交互关系,现有的图像文本建模方法包括流行的ALBEF[18](先对齐再融合)、CLIP[19]、[20](对比式语言-图像预训练)、BLIP[21]、[22](自举式语言-图像预训练),以及LLava[23]、Qwen-VL[24]、[25]、DeepSeek[26]、[27]等视觉-语言多模态大型模型。在这些当前主流模型中,一个常见但关键的技术思路是,在预训练阶段首先对视觉和语言的语义向量进行对齐。这意味着它们的效果依赖于一个前提:图像和文本必须包含相同的信息,这样才能实现对齐,如图1(a)所示。

上述的对应交互关系主要强调图像与文本之间的一致性对齐,而那些不一致的关系[31]、[32]、[33]同样重要,但目前相关研究还相对较少。以图1(b)所示的讽刺语检测任务为例,某条推文同时包含文本和图像元素,这些元素会提供相互矛盾但又彼此有参考价值的线索。与多模态匹配或对齐不同,两者结合才能让我们准确判断是否为讽刺语,而单独依靠图像或文本都无法得出正确的结论。值得注意的是,在这种情况下,那些采用对齐式跨模态设置的现有模型将会失去作用。实际上,[28]中的某些实验表明,当比例高达60%时,ALBEF[18]的效果就会显著下降,这一点值得特别关注。

幸运的是,[28]中的先前研究已经通过三任务方案解决了这个问题。他们将讽刺语或幽默检测视为一种图像与文本的交互问题,这三个任务的输入分别仅为图像、仅为文本,或是图像与文本的结合体。这三个任务用于提取语义特征,之后再将这些特征融合起来,从而得到更准确的预测结果。简而言之,完成一次推理需要经过两个阶段:第一阶段通过三个任务提取三种特征;第二阶段融合这三种特征以实现预测。虽然这种方法有所改进,但建模过程却变得复杂得多。更重要的是,该方法无法区分因果特征与相关特征,而是将它们视为同质成分在单一框架中进行融合。

在此,我们重新审视这一问题,从基于因果关系增强图像与文本交互的角度,提出了一种更简单、新颖的端到端多任务框架。在许多先前的研究[34]、[35]、[36]中,传统的因果分析已成功应用于视觉领域,其目的是区分有效特征与噪声,引导模型避开噪声。与那些方法不同,我们的方法采用了更细致的因果视角,通过因果关系来判断输入(仅图像、仅文本或二者结合)是否不足以实现准确预测,进而确定它们的因果属性。

我们工作的主要贡献可总结如下:
•如图1(b)所示,那种常见但被忽视的不一致图像与文本交互问题,给模型在某些任务中的持续优化带来了巨大挑战,比如检测和幽默识别任务。为了解决这个问题,我们明确引入了因果分析的概念。与以往从特征中挖掘潜在噪声的做法[34]、[35]、[36]不同,我们采用更细致的因果分析方法,通过回答一个更基础的问题——这个特征是否足以实现准确预测——来评估特征的必要性。这种思维方式的转变能够提升模型的可解释性及其区分能力。
•与传统的知识共享[29]、[30]或多种特征融合[28]、[37]、[38]方法不同,我们采用了一种新的建模方式,即通过增强因果关系特征来设计多任务框架。如图2(c)所示,通过基于增强的建模方式,该框架是端到端的,相比现有的两阶段建模方法[28]更易于推理。由于需要同时处理所有这些任务,模型不得不关注不同特征的属性,从而具备更强的能力。
•为了使模型能够处理单模态和多模态输入,我们设计了针对主流跨注意力或串联式输入模式的掩码策略。实验也验证了这些策略的有效性。与单模态标注需求类似,我们利用先进的LLM提示工程技术[39]、[40]来生成高质量标注。需要注意的是,我们在提示工程中实际上运用的是多模态大型模型,不过在下文中这些模型仍被归类为LLM。通过全面的对比实验,我们证明了所提出的增强方法的有效性,模型的性能得到了显著提升。此外,我们还分析了部分关键因素,这些因素有助于进一步理解该方法。

本文结构如下:第2节概述相关研究,第3节详细介绍所提出的框架。接着,我们在第4节进行了较为充分的实验,其中展示了实验的关键设置和结果。最后,第5节给出结论。

相关研究
基于本文提出的框架,我们从视觉-语言分类、因果建模、多任务以及提示工程这几个方面介绍相关研究。

方法论
在本文中,我们专注于图像和文本这两种模态的预测任务。要实现准确预测,就需要利用可能仅存在于图像或文本特征中的一方、在两者中都存在但存在冗余的情况,或者需要将两种模态的特征信息协同结合的相关信息。

定义1 图像-文本任务
给定分别从图像和文本中提取的两种类型特征ximage和xtex,该任务的目的是利用这两种模态来预测标签y。数据集可表示为符号D= 。

实验
在本节中,我们使用不同的数据集和模型开展实验,以评估所提出的增强方法的性能。为了全面了解增强任务的影响,我们还分析了一些可能影响性能的关键参数,并进行了相关比较。

结论
在本文中,我们从基于因果关系的多任务角度出发,探讨了如何增强图像与文本之间的交互。与以往研究侧重于分析噪声不同,我们试图通过细致的因果分析,找出单模态或多模态特征所提供的有效信息,从而从多模态特征中筛选出关键信息。所提出的多任务框架是端到端的,而非分多个阶段,因此不仅建模更简单,推理应用也更便捷。

作者贡献说明
程兆蒙:撰写——初稿、软件实现、方法论、形式化分析。季忠:撰写——审阅与编辑、资金获取、形式化分析、概念设计。张岩:撰写——审阅与编辑、形式化分析、概念设计。

利益冲突声明
作者声明不存在任何可能影响本文所述工作的已知财务利益或个人关系。

致谢
本研究得到了国家自然科学基金(项目编号:62441235)的支持。

程兆蒙|季忠|张岩
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号