← 最新论文
💬 NLP

Training Multi-Turn Search Agent via Contrastive Dynamic Branch Sampling

本文介绍了 BranPO,这是一种无价值函数(value-free)的强化学习方法,通过利用对比动态分支采样从轨迹尾部生成步级监督,从而在长程设置中改进多轮搜索智能体,进而克服稀疏奖励和计算效率低下的问题,并在问答基准测试中实现了更高的准确率。

原作者: Yubao Zhao, Weiquan Huang, Sudong Wang, Ruochen Zhao, Chen Chen, Yao Shu, Chengwei Qin

发布于 2026-02-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Yubao Zhao, Weiquan Huang, Sudong Wang, Ruochen Zhao, Chen Chen, Yao Shu, Chengwei Qin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

大局观:教导一名侦探破解谜题

想象一下,你正在训练一名初级侦探(AI智能体)去破解复杂的谜案。这些案件需要多个步骤:提出问题、收集线索,最后还要撰写报告。

这篇论文解决的问题是:当你只能在最后得到反馈——即**“案件破获”“案件失败”**时,该如何教导这位侦探。

如果侦探在报告的最后一句话上出了错,旧的训练方法会说:“你失败了”,并因此惩罚侦探之前所做的所有事情,即便他在前90%的调查过程中表现得完美无缺。这就像一个学生因为在期末考试中写错了名字而导致整场考试不及格,尽管他所有的数学题都答对了。这既令人困惑又效率低下。

核心问题:“责任归属”中的博弈

在 AI 世界中,这被称为信用分配问题(Credit Assignment Problem)

  • 旧方法 (GRPO): AI 尝试从头到尾走完整个路径。如果最后失败了,AI 会认为:“也许我不该问第一个问题。”但实际上,第一个问题可能是完美的!错误其实发生在最后一步。
  • 树状方法 (The Tree Method): 一些研究人员尝试构建一个“可能性之树”,在每一步都进行分支以观察结果。但这就像是在每一次转折处都派出 100 名侦探去尝试所有可能的路径。这极其昂贵且缓慢。

发现:错误究竟发生在何处

作者分析了数千个这类 AI 侦探故事,并发现了一个模式:

  1. 开头通常没问题: AI 擅长开始调查并提出前几个问题。
  2. 结尾才是崩溃的地方: 错误几乎总是发生在最后的步骤——要么是 AI 过早放弃,要么是在试图撰写最终答案时开始“幻觉”(捏造事实)。

类比: 想象你在烤蛋糕。AI 擅长搅拌面糊和把蛋糕放入烤箱(早期步骤)。但通常,它会把蛋糕烤焦或者忘了涂抹糖霜(后期步骤)。如果你因为蛋糕烤焦了就扔掉整个蛋糕,那就浪费了那份搅拌得完美的面糊。

解决方案:BranPO(分支相对策略优化)

作者提出了一种名为 BranPO 的新训练方法。以下是它的工作原理,分步详解:

1. “回溯并重试”策略

与其每次失败时都让 AI 从头开始,BranPO 说:“让我们保留好的部分。”

  • 行动: 当 AI 完成任务后,系统会观察结尾。如果答案错误,它会**截断(truncate)**最后几个步骤。
  • 分支: 它保持“前缀”(良好的早期步骤)完全不变,然后要求 AI 仅对最后几个步骤进行重采样(resample)(即重试)。
  • 结果: 它创造了一个“对比”对:
    • 路径 A: 原本的尝试(在结尾失败了)。
    • 路径 B: 新的尝试(在相同的开头下,于结尾成功了)。

类比: 想象你在写一篇论文。你写了一个很棒的引言和正文,但结论写得很烂。与其重写整篇论文,不如保留前 90% 的内容,只尝试写 10 个不同的结尾。然后你教导 AI:“看,开头是对的。问题只出在结尾。下次,试着换个结尾。”

2. 智能采样(感知难度)

并非所有的任务都需要同等程度的帮助。

  • 简单任务: 如果 AI 轻松得到了正确答案,系统就不会浪费时间让它重试,而是直接进入下一步。
  • 困难任务: 如果 AI 陷入挣扎,系统就会变得激进。它会在不同的点截断任务,并强迫 AI 尝试许多不同的结尾,以找到那个行得通的结尾。
  • 类比: 把它想象成一名教练。如果球员轻松射门得分,教练会说“做得好,下一球!”但如果球员一直射偏,教练会暂停比赛,说“让我们针对这个特定的动作练习 10 次”,并只专注于修正那个特定的动作。

3. “冗余步骤”过滤器

有时,AI 虽然得到了答案,却仍在进行不必要的搜索(就像一个侦探找到了凶手,却还在屋子里搜寻了 10 分钟)。

  • 修复方案: 系统拥有一个“冗余步骤掩码(Redundant Step Mask)”。如果 AI 找到了答案,但随后又采取了额外的步骤,系统会在训练期间忽略这些多余的步骤。它教会 AI 在任务完成后立即停止搜索。
  • 类比: 这就像告诉学生:“你用 5 分钟就解出了这道数学题。很好!但之后你又花了 10 分钟反复检查。下次,请在 5 分钟时就停下来。我们不需要额外的 10 分钟。”

为什么这种方法更好

  1. 精准度: 它防止了 AI 因为后期的错误而责怪其早期的正确决策。
  2. 高效性: 它不会浪费金钱和时间去重新模拟整个过程。它只模拟需要修复的部分(结尾)。
  3. 稳定性: 通过在保持起始部分相同的情况下,将一个“好的结尾”与一个“坏的结尾”进行对比,AI 能准确学习到需要改变什么。

结果

作者在各种问答基准测试(如解决多步谜题)上测试了该方法。

  • 结果: BranPO 始终优于其他强力方法。
  • 关键优势: 它在处理长篇、复杂任务时表现得显著更好,且不需要比标准方法更多的计算资源或时间。

一句话总结

BranPO 通过保留 AI 优秀的早期工作成果,并仅强制它们重试混乱的最后步骤,有效地向它们展示哪里出了错,而无需浪费时间去重做那些已经做对的部分。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →