通过基于多样性的策略优化恢复基于搜索的大型语言模型(LLM)代理的探索能力

《Information Processing & Management》:Restoring exploration via Diversity-Driven Policy Optimization in search-based LLM agents

【字体: 时间:2026年09月09日 来源:Information Processing & Management 8.1

编辑推荐:

  • DDPO在基于搜索的LLM代理的强化学习微调过程中恢复了探索行为。 • 子模块对数行列式奖励使查询多样化并扩展了检索覆盖范围。 • 自适应门控机制调节了探索激励,以实现稳定的策略优化。 • 在七个问答基准测试中,DDPO获得了最佳的平均准确率。 **引言**

  • DDPO在基于搜索的LLM代理的强化学习微调过程中恢复了探索行为。
• 子模块对数行列式奖励使查询多样化并扩展了检索覆盖范围。
• 自适应门控机制调节了探索激励,以实现稳定的策略优化。
• 在七个问答基准测试中,DDPO获得了最佳的平均准确率。

**引言**
强化学习微调(RLFT)对于大型语言模型(LLM)在复杂推理和决策任务中展现出了强大的能力(DeepSeek-AI, 2025; Wang et al., 2025a)。然而,基于LLM的代理仍然面临一个持续存在的挑战:探索性崩溃。在这种情况下,策略会变得过于贪婪,产生高置信度的输出但多样性有限。强化学习理论强调了广泛探索的必要性,但先前的研究表明这些代理通常不会探索超出熟悉模式的动作(Feng, Yu, Xiong and Zhang, 2025; Schmied et al., 2025)。在增强检索的场景中(M. Chen et al., 2025; Jin et al., 2025),LLM必须决定何时以及如何搜索信息,这种崩溃表现为重复的查询和对知识空间的有限覆盖(见图1左侧)。
LLM中探索性崩溃的根本原因在于强大的预训练先验和Kullback–Leibler(KL)惩罚,这两者都限制了策略的发展,阻碍了新行为的发现。因此,仅靠随机采样不足以保证有效的探索。为了解决这个问题,最近的研究引入了明确的激励机制来引导策略朝向更有效和新的行为。例如,先前的工作(Eysenbach et al., 2019; Haarnoja et al., 2018)使用最大熵或基于互信息的奖励来鼓励探索和多样性。其他方法(Yu et al., 2025)消除了KL惩罚以放松策略约束。一些方法(Chen, Chakraborty et al., 2025; X. Chen et al., 2025)利用全生成中的语义差异来提供多样性奖励。最近的研究(L. Feng et al., 2025)进一步将状态聚类在一起以提供额外的多样性信号。
尽管这些方法鼓励了探索,但仍然存在一个重大挑战:“伪探索”。通过生成语法上不同但语义上相同的意图(如“他是谁?”和“告诉我关于这个男人的事情”),可以实现高级别的令牌级熵。即使是具有明显语义变化的输出,也可能检索到高度重叠的语料库,从而导致仅限于表面的探索。例如,“运动的主要好处是什么?”和“人们为什么应该运动?”可能会得到几乎相同的证据。这些情况暴露了现有代理激励的一个局限性:它们没有直接评估模型是否进行了真正有意义的探索。
为了弥合这一差距,我们认为有效的探索行为应该是“有能力和独特的”:它应该同时涉及区分性动作和对状态的广泛覆盖。搜索代理为实施这一理念提供了一个自然的场景,因为它们明确地构建查询并检索文档。在这种设置中,探索意味着生成多样化的查询,从而引导代理到达环境中的未探索区域(见图1右侧)。基于这一观点,我们引入了基于搜索行为的结构化信息增益作为精确的探索激励,以促进搜索多样性并恢复这些代理的探索能力。
这种方法产生了两个互补的信号:查询的语义信息增益和检索的覆盖信息增益。我们将它们整合到RLFT中,使用GRPO风格的分组采样。为了量化这两个信号,我们使用对数行列式目标,该目标对新颖的方向奖励自然递减的回报(Kulesza and Taskar, 2012; Parker-Holder et al., 2020)。然后我们应用一个自适应门控机制,在训练初期加强多样性激励,并在探索变得足够时逐渐放松这种压力。还引入了一个小的轨迹级折扣,以减少奖励作弊行为。
强化学习的成功本质上依赖于有效的探索。尽管大型语言模型试图利用RLFT来提高任务性能,但它们经常受到探索性崩溃和多样性不足的困扰。因此,这项研究的主要目标是利用检索过程中产生的结构化信息增益,在RL训练期间恢复探索行为,从而提高学习效率和最终的任务性能。

**我们发现**
- 在增强检索的LLM的RLFT中,存在持续的贪婪行为,表明标准优化抑制了探索并导致冗余的搜索行为。
- 我们提出了DDPO,这是一种基于多样性的优化框架,利用搜索行为的结构化信息增益来精确地驱动搜索代理,从而恢复探索能力并避免伪探索。
- 在增强检索的问答基准测试中的广泛实验表明,DDPO在任务准确性和搜索多样性方面 consistently 平均优于强多样性意识的基线。

**相关工作**
我们的研究位于信息检索(IR)、RAG和用于工具使用的语言模型代理的RLFT的交叉点。在IR和信息科学领域,最近的研究强调了LLM如何重塑核心IR流程,并在检索用于下游生成而不是人类浏览时重新审视检索目标(Zhai, 2024; Zhu et al., 2025)。同时,IR和NLP社区都观察到,检索质量和检索-生成耦合对RAG有关键影响。

**探索和多样性的目标**
为了明确我们的贡献,我们首先将RLFT中的探索挑战表述为任务性能和多样性的联合优化。设 ???(??) 为输出 ?? 的任务奖励,??div?(???) 为衡量 ??? 相对于一组其他候选项的新颖性的多样性奖励。总体目标是优化预期的增强奖励:???(??)=????~???????~???(?|??)?[???(??)+?????div?(???~???(?|??))]。

**方法**
我们的方法DDPO通过明确的探索信号增强了GRPO。核心原则是有效的强化学习要求策略在广泛探索动作和状态的同时保持其能力。我们通过查询中的语义变化和检索文档中的覆盖范围来衡量信息增益,并在轨迹和组级别计算这两个信号,如图2所示。动态门控机制在训练期间调节这些信号:当...

**理论分析**
本节为提出的多样性度量、门控和 shaping 规则提供了技术保证。我们首先收集了方法部分中使用的对数行列式集合函数的核心代数事实,然后建立了有界性、稳定性,以及至关重要的,在提出的 shaping 机制下防止方差崩溃。最后,我们提供了高效的更新身份和多轮一致性结果。这些结果描述了奖励 shaping 机制及其诱导的效果。

**数据集**
我们在七个公开的问答基准测试上进行了评估,涵盖了单跳和多跳推理,以全面评估所提出代理的探索和信息检索能力。这些多样化的数据集都包含在FlashRAG工具包(Jin et al., 2024)中,并被主流的RAG研究广泛采用。在所有实验中,我们使用了FlashRAG提供的精确的训练/测试划分。

**讨论与启示**
我们的评估结果表明,尽管标准RLFT方法应用了CoT或放宽采样等技术,但仍可能抑制探索,而倾向于利用早期的次优路径。通过直接测量和奖励搜索行为的信息增益,DDPO解决了这种探索性崩溃问题。在本节中,我们详细阐述了我们的研究的理论和实际影响,并澄清了它与现有工作的区别。

**结论**
在本文中,我们提出了基于多样性的策略优化(DDPO)作为恢复基于搜索的LLM代理探索行为的简单而有效的方法。基于GRPO,DDPO奖励查询和检索文档的对数行列式信息增益,利用标准搜索流程中已有的信号,而无需引入额外的模型或外部监督。通过结合内部和跨轨迹的多样性以及自适应门控机制,DDPO鼓励...

**作者贡献声明**
Xinyue Chen:写作 - 审稿与编辑,写作 - 原稿撰写,资源管理,方法论,调查,形式分析,数据管理,概念化。
Pengyu Gao:写作 - 审稿与编辑,方法论,调查,形式分析,概念化。
Jiangjiang Song:可视化,软件,资源管理,方法论,数据管理。
Liqian Chen:可视化,软件,资源管理,数据管理。
Kehang Zeng:写作 - 原稿撰写,可视化,验证。

**利益冲突声明**
作者声明他们没有已知的竞争性财务利益或个人关系可能影响本文报告的工作。

**致谢**
资助:本工作部分得到了中国国家自然科学基金(62476128)的支持。

**作者列表**
Xinyue Chen | Pengyu Gao | Jiangjiang Song | Liqian Chen | Kehang Zeng | Xin Yang | Xinjian Chen | Xiaoyang Tan
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号