作为一类强大的生成模型,扩散模型推动了文本到图像生成领域的快速发展。其中的里程碑之一就是去噪扩散概率模型,它将统计物理中的原理应用到了现代生成模型中。近年来,又出现了许多先进的扩散模型,如Stable Diffusion及其衍生版本,以及流匹配模型及相关算法。虽然扩散模型能够生成比早期文本到图像方法更美观的图像,但它们仍存在一个根本性问题:生成结果可能与人类偏好不一致。例如,模型生成的图像可能在语义上与输入文本不符,或者无法满足美观度和风格等主观标准。
在自然语言处理领域也普遍存在类似的对齐问题,研究人员开发出了多种方法将人类反馈纳入模型优化过程。代表性的方法包括基于人类反馈的强化学习以及直接偏好优化,这些方法提升了大型语言模型在指令遵循和编程等任务上的能力。
这些方法可被归为生成模型的人类偏好对齐方法。从实际应用来看,经过对齐的大型语言模型的成功进一步证明了对大规模生成模型进行对齐的可行性和有效性(见图1)。
受到语言模型对齐方法成功的激励,研究人员越来越多地探索如何将这类对齐方法应用到文本到图像扩散模型中,因此关于扩散模型对齐方法的文献也在不断增加。与语言模型不同,扩散模型是通过迭代去噪来生成样本的,即神经网络会预测噪声或速度场,从而在多个时间步中逐步过渡到中间状态。由于扩散模型的标准训练目标并未明确包含人类偏好信号,因此有必要在训练阶段或推理过程中引入奖励反馈,同时还要控制额外的计算成本。
近年来,针对大型语言模型的对齐研究占据了生成模型领域的大量文献。相比之下,尽管扩散模型在现实应用中也具有同等重要性,但扩散模型对齐方面的研究仍然相对较少。这一现象表明,虽然人们对扩散模型对齐的研究兴趣正在不断上升,但该领域远未饱和,未来仍有很大的发展空间。
虽然本综述主要聚焦于文本到图像的对齐问题,但也需要认识到文本到图像生成与其逆向过程,即图像到文本方法之间的关联性,比如图像描述功能。在对齐领域,图像到文本方法为生成模型理解视觉内容提供了基础,使得模型能够提取语义特征,进而用于指导文本到图像的去噪过程。有效的对齐通常需要形成一个闭环机制,即模型生成的视觉输出能够被文本提示准确描述,从而确保转换过程的连贯性。
在本研究中,我们对文本到图像扩散模型的对齐方法进行了系统而全面的综述。为避免歧义,我们需要明确的是,虽然文本到图像对齐可以涵盖多个方面,如文本语义对齐、个性化偏好对齐等其他相关方向,但本文的重点是通过显式或隐式的人类反馈,让模型符合人类的主观偏好(如美观度、文本忠实度以及整体实用性)。我们的目标是帮助研究人员快速了解现有方法的概况,识别关键挑战,并把握未来的研究方向。
值得注意的是,近期已有部分综述探讨了生成模型的对齐问题。具体而言,刘等人[1]对扩散模型对齐进行了总体概述,涵盖了相关的基础概念;吴等人[2]则对图像生成和编辑任务中的偏好对齐方法进行了全面总结。我们的综述在三个重要方面与这些现有工作有所不同且相互补充。首先,我们将研究范围限定在文本到图像的人类偏好对齐上,这样的聚焦使我们能够更深入地探究文本到图像生成的机制。其次,我们没有采用简单的分类方式,而是建立了一个由多个二元分类轴构成的结构化分类体系,为实践者提供了更为清晰的算法指引。最后,现有综述多为定性分析,而我们的研究则包含了严格的独立实证评估。我们在SD1.5和SDXL架构下,使用常见的人类偏好评估指标,对代表性对齐方法进行了标准化测试和定性比较,从而揭示了实际应用中的问题。
本文的结构如下:第2节介绍扩散模型的基本原理,包括核心生成机制及最新进展;第3节总结现有的文本到图像扩散模型对齐方法,并对其进行系统分类;第4节通过结合多种人类偏好评估指标的定量测试和详细的视觉分析,对典型的扩散模型对齐方法进行综合评估;第5节介绍主流的偏好构建方法,包括用于扩散模型对齐的偏好数据集和评估指标;第6节讨论扩散模型对齐领域当前面临的挑战及未来发展方向;第7节对全文进行简要总结。
我们的主要贡献包括:
?(i) 我们提出了一个更为细致且基于原理的扩散模型对齐方法分类体系,并对典型方法进行了全面评估。
?(ii) 我们总结了偏好构建的相关流程,包括人类偏好数据集、奖励模型以及评估指标。
?(iii) 我们分析了当前存在的挑战,并探讨了未来有前景的研究方向。