基于因果驱动的高效DPO生成式少样本奖励推断
《Knowledge-Based Systems》:Causally-motivated generative few-shot reward inference through efficient DPO
【字体:
大
中
小
】
时间:2026年07月19日
来源:Knowledge-Based Systems 8.0
编辑推荐:
•GFRIEND通过CoT偏好优化实现少样本奖励推理。•多级DPO利用基于困惑度的偏好差异为不同对进行加权。•HelpSteer2将困惑度差距与人类偏好强度关联起来。•GFRIEND借助3000组人工标注数据实现了高精度。•我们分析了合成标签噪声、风格偏差以及计算开销。引言大型语
•GFRIEND通过CoT偏好优化实现少样本奖励推理。•多级DPO利用基于困惑度的偏好差异为不同对进行加权。•HelpSteer2将困惑度差距与人类偏好强度关联起来。•GFRIEND借助3000组人工标注数据实现了高精度。•我们分析了合成标签噪声、风格偏差以及计算开销。引言大型语言模型在各种自然语言处理任务(如问答、对话)中取得了显著成果[1]、[2]。然而,如何让这些模型符合人类偏好仍是一个核心挑战[3]、[4]。通过人类反馈强化学习(RLHF)可以利用基于人类偏好数据训练的奖励模型来优化LLM策略,以此解决这一问题。该奖励模型能够预测在给定提示下人类更倾向于哪种回答,其准确性至关重要:它为后续的策略优化提供了目标(通过强化学习或偏好引导的微调实现)[5]、[6]。现有的奖励建模框架通常依赖基于成对偏好数据的监督学习[7]。对于每个用户查询,系统会比较两个或多个回答,然后学习如何给更受青睐的回答更高分。虽然这种方法在大型数据集上效果良好,但在数据量较少的情况下(少样本偏好学习)存在严重局限。两个主要问题在于:(1)选择偏差与样本配对效率低下——所收集的偏好对只是所有可能回答中的部分,往往偏向某些模型或风格。有限的配对多样性可能导致模型捕捉到虚假线索(例如,不管质量如何都偏好冗长的回答),这类似于观察研究中的混杂因素[8]。(2)偏好多样性与异质性不足——人类偏好十分复杂,将其视为统一的二元标签会忽略不同程度的偏好以及受情境影响的评判标准。传统的成对训练无法捕捉到不同的处理效应——有些回答可能仅略好于其他回答,而有些则明显更优,这种区分对于实现稳健的泛化能力非常重要[9]、[10]。从因果推断的角度来看,通过比较来训练奖励模型可以视为因果效应估计的问题。根本问题在于,对于任何给定的查询(情境),我们无法同时观察到用户对所有可能回答的反应——我们只能看到实际呈现的回答的结果(每次比较只有一个潜在结果)[11]、[12]。这种不完整的观察情况类似于因果推断中的基本问题,即总是缺少一个潜在结果[11]、[12]。因此,简单的偏好学习可能会抓住偏好的相关因素而非真正的因果因素,尤其是在数据稀缺且可能存在偏差的少样本场景中。例如,在一个有限的数据集中,所有质量较高的答案恰好都较长(可能是由于数据收集方式所致),那么奖励模型可能会错误地推断出“更长的答案会导致更高的偏好”。此处,答案长度既是与处理分配(哪种答案更受青睐)相关的混杂因素,也是与结果(偏好判断)相关的混杂因素。如果不纠正这类偏差,模型可能无法正确泛化——这类似于因果模型将效应错误归因于混杂变量[13]、[14]。在本文中,我们提出将奖励建模重新定义为具有因果驱动的学习问题,并引入GFRIEND(通过高效DPO实现生成式少样本奖励推断)这一框架,该框架借鉴因果推理原理来提升偏好学习效果。我们需要强调的是,我们的方法是以因果为导向的,而非提供正式的因果保证:我们是将因果概念作为方法设计的指导框架,而非严格的理论基础。GFRIEND通过三个主要理念来解决上述问题:将偏好数据视为因果系统:我们将用户提示、LLM的回答以及人类偏好视为一个因果三元组。提示(情境)会影响回答内容;而回答又会影响人类的偏好结果。不过,如果不予考虑,潜在因素(如回答的清晰度、正确性、风格)可能会干扰这种关系[15]、[16]。通过明确承认这种结构(例如通过结构因果模型,如图1概念性展示)[17],我们可以促使方法去近似模拟干预措施并考虑偏差。具体而言,我们旨在近似模拟理想实验,即为同一查询展示多种不同的回答(处理方式),并观察用户的偏好,这样就能揭示真正受青睐的回答以及偏好的程度。虽然真实用户无法对每一个假设性回答进行评分,但我们的方法可以利用LLM的生成能力来模拟这一过程[13]、[18]、[19]。通过思维链采样实现反事实数据增强:我们引入了一个偏好优化模块,利用LLM本身为某个提示生成不同的回答和推理过程,从而模拟出反事实结果[20]。从少量人工标注的对比数据开始,模型(经过少量思维链示例的微调)会不断推理出哪种回答更优以及原因,进而产生多样化的思维链和修改后的回答[21]。每一次生成都相当于一次干预,用于探索同一查询的不同推理路径,从而揭示之前隐含的偏好标准[22]。基于困惑度的多级偏好评分:为了不仅能判断哪个回答更受青睐,还能了解偏好的强度,我们引入了一种基于困惑度的评分方法,该方法给出的是多级评分而非二元评分。某个回答在参考模型下的困惑度可作为其质量的替代指标:结构清晰、组织良好的回答往往具有较低的困惑度,而质量较差或偏离主题的回答则具有较高的困惑度[23]、[24]。对于包含优选回答A和非优选回答B的同一个提示,我们会比较二者的困惑度。如果A出现的概率远高于B,我们就认为偏好程度很强;如果两者的出现概率相近,则认为偏好程度较弱[25]。这些级别被编码为序数值,由困惑度差距的阈值或对推理过程的置信度来确定[26]。这种多级监督方式反映了偏好的多样性,因为它认识到并非所有正确的回答都同样优秀,也并非所有被否决的回答都同样糟糕。我们需要明确的是,困惑度只是偏好强度的启发式替代指标,并非正式推导出的因果量。通过纳入偏好强度,奖励模型可以学习到类似因果效应大小的概念,从而相比二元信号能提供更有价值的更新信息,提升后续学习的效率[13]。加权多级DPO训练:我们将多级偏好标签整合到改进后的DPO目标函数中,根据每对数据之间的偏好差距大小为其赋予不同的权重。DPO通过概率排序来微调语言模型,无需额外的奖励模块;而我们的改进版本(M-DPO)会将对数似然项乘以权重w(Δ),其中Δ=|g+?g?|用于表示所分配的偏好级别之间的差异[27]、[28]。一种平滑递增的加权函数(例如w=log(1+eαΔ))会让那些表现出明显较大偏好差异的配对受到更多重视,同时降低那些模糊对比的权重[29]、[30]。从因果角度来看,这相当于一种重要性加权方案:那些能更清晰地展现处理效应(噪声更少或混杂因素更少)的样本会对训练产生更大影响[31]、[32]。这有助于模型聚焦于核心的偏好信号,提高在数据量较少的情况下的稳定性,避免噪声较大或边界情况明显的配对主导梯度计算[33]、[34]。我们证明,这种加权方式在保持DPO理论收敛特性的同时,还能更细致、更可靠地区分不同回答。通过这种基于因果原理的框架来重新设计奖励模型训练方式,GFRIEND能够在使用极少人类数据的情况下实现更出色的对齐性能。总之,我们的贡献包括:•基于因果驱动的偏好建模:我们从因果效应估计的角度重新解读偏好学习问题。这一视角为框架的设计提供了指导,有助于解决少样本奖励建模中的选择偏差和混杂问题。我们为RLHF偏好数据引入了概念性的结构因果模型,并展示了如何利用干预措施(回答)和结果(偏好)来提升奖励模型的可靠性。需要强调的是,我们的贡献属于方法层面,而非理论层面——我们是将因果概念作为设计原则来运用。•反事实数据增强:我们提出了一种新的思维链采样机制,用于生成多样化、高质量的人工合成偏好数据。通过模拟不同的回答和推理路径(即反事实场景),我们的方法能够挖掘出隐藏的偏好信息,提升在资源匮乏条件下的模型稳定性。这可以被视为一种受反事实推理启发的数据增强方法,能够增加每个查询对应潜在结果的覆盖范围。•多级偏好推断:我们引入了基于困惑度的评分方式,用以确定更精细的偏好级别,从而超越单纯的二元对比。这种多级偏好建模方式能够捕捉到回答质量上的差异,为奖励模型提供更丰富的监督信息。我们将其与因果效应大小相类比,证明这种分层处理方式能够实现更精细的奖励学习。•高效的加权DPO优化:我们通过为每对样本添加偏好差异权重,提升了DPO损失函数的效能。这种M-DPO方法会优先学习那些偏好差异明显、因果影响较大的对比案例,同时降低对那些模糊案例的关注度,从而提升少样本场景下的模型泛化能力和训练稳定性。我们的公式在一致性及凸性方面仍保持理论上的保证,将加权处理视为最大似然框架中的重要性采样修正。•全面的实证验证:我们在公共基准测试以及特定的医疗数据集上对GFRIEND进行了评估,同时与包括序数偏好优化和自我优化型DPO变体在内的最新方法进行了比较。即便只有几千个训练样本,GFRIEND的性能也能与在更大规模数据集上训练的奖励模型相媲美甚至更优。大量的消融实验表明,思维链增强、多级评分以及加权DPO这些组件各自都对整体性能的提升有所贡献,而验证实验也证明了困惑度作为偏好强度替代指标的有效性。片段摘录奖励建模与RLHF语言任务的奖励建模起源于Christiano等人的研究[3],他们让模型在成对的人类偏好数据上训练,然后再利用强化学习来优化策略;Ouyang等人[4]则进一步验证了这一流程在经过指令微调的LLM上的适用性。主流方法依赖于Bradley–Terry(BT)公式[5]、[35],但这些方法需要大量偏好数据,且难以处理复杂或受情境影响的信号,还常常存在诸如冗长性之类的偏差[36]、[37]。由于轻微的偏好建模任务我们设想这样一个场景:拥有一个名为D=(qi,ai+,ai?)i=1N的人类偏好数据集,其中每个样本包含一个用户提示或查询qi、一个优选回答ai+以及一个非优选回答ai?。这里的a+与a?表示人类标注者(或可靠的评判者)认为a+是比a?更好的回答。我们的目标是训练一个奖励模型,该模型能够接收一个查询q和一个候选回答a,然后输出一个评分r(q,a),使得对于来自该数据集的配对来说,有r(q,a+)>r(q,a?)。基线模型与数据集我们选择Llama-3-8B-Instruct [91]作为基础模型。我们将自己的模型与其他标量奖励模型以及采用不同架构训练的生成式奖励模型进行了比较。标量奖励模型包括BT-model和ArmoRM [42],生成式奖励模型则包括Auto-J [92]、Prometheus2 [93]以及GenRM [94]。此外,我们还对比了GPT-4o1和Claude-3-Sonnet [95]等商业闭源模型。同时,我们也尝试使用了其他开源模型方法论贡献与因果主张我们需要明确的是,GFRIEND是基于因果原理设计的,而非能提供正式的因果保证。我们的贡献在于将因果概念作为偏好学习的设计原则,而非建立严格的因果识别机制。具体而言:•基于困惑度的评分仅是一种用于估计不确定性的启发式替代指标,并非正式的倾向得分。尽管它受到了因果推理的启发,但并不具备适当倾向得分加权的理论保障。•结论我们提出了GFRIEND,这是一种基于因果推理原理的少样本RLHF生成式奖励建模框架。通过从因果驱动的角度来解读偏好数据——将回答视为干预措施,将人类评判视为结果——我们设计出了一个方法,能够解决传统奖励模型在资源匮乏环境下的诸多局限性。我们通过整合思维链推理(用于模拟反事实结果)和多级偏好建模(用于……)来提升模型性能。CRediT作者贡献说明Yiyang Zhao:撰写——初稿、可视化、验证、方法论、研究分析、形式化分析、数据整理、概念构建。Zhiqi Shen:撰写——审阅与编辑、监督、资源协调、项目管理、概念构建。Xuejiao Zhao:撰写——审阅与编辑、监督、资源协调、项目管理、数据整理、概念构建。利益冲突声明作者声明自己没有已知的、可能影响本文研究结果的财务利益或个人关系。致谢本研究部分得到了新加坡国立大学-不列颠哥伦比亚大学老年人主动生活联合卓越研究中心(LILY)、阿里巴巴-新加坡国立大学全球电子可持续性企业实验室(ANGEL)以及由Knut和Alice Wallenberg基金会资助的Wallenberg Al自主系统与软件计划(WASP)的支持。Yiyang Zhao|Zhiqi Shen|Xuejiao Zhao
生物通微信公众号
生物通新浪微博
今日动态 |
人才市场 |
新技术专栏 |
中国科学人 |
云展台 |
BioHot |
云讲堂直播 |
会展中心 |
特价专栏 |
技术快讯 |
免费试用
版权所有 生物通
Copyright© eBiotrade.com, All Rights Reserved
联系信箱:
粤ICP备09063491号