← 最新论文
💬 NLP

DecoupleSearch: Decouple Planning and Search via Hierarchical Reward Modeling

本文提出了 DecoupleSearch,这是一个新颖的框架,通过双价值模型和分层束搜索将规划与搜索过程解耦,以增强代理式检索增强生成(Agentic RAG),从而应对步骤监督和候选空间复杂性方面的挑战。

原作者: Hao Sun, Zile Qiao, Bo Wang, Guoxin Chen, Yingyan Hou, Yong Jiang, Pengjun Xie, Fei Huang, Yan Zhang

发布于 2026-05-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Hao Sun, Zile Qiao, Bo Wang, Guoxin Chen, Yingyan Hou, Yong Jiang, Pengjun Xie, Fei Huang, Yan Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试解决一个非常棘手的谜题,比如“古尔奇切克哈顿的岳父是谁?”你有一位非常聪明的助手(即人工智能),它知识渊博,但有时会凭空捏造或陷入死胡同。为了提供帮助,你给助手一张借书证,让它可以查阅事实。这被称为检索增强生成(RAG)

然而,这篇论文指出,仅仅拥有一张借书证是不够的。助手需要知道如何使用它。这就是**代理式 RAG(Agentic RAG)**发挥作用的地方:助手像侦探一样行动,规划其调查步骤,并逐步搜寻线索。

问题在于,这位侦探经常迷路。它可能会规划出一条糟糕的调查路径,或者搜寻错误的线索。这篇论文DecoupleSearch提出了一种训练这位侦探的新方法,使其不再迷路。

以下是其工作原理,使用简单的类比:

1. 问题:“全有或全无”的侦探

在旧系统中,侦探会制定一个计划,进行一次搜索,然后听天由命。如果计划稍有偏差,或者搜索返回了一本枯燥的书,整个答案就会出错。这就像试图通过只查看一个位置来在干草堆里找针。

2. 解决方案:“双教练”系统

作者创建了一个名为DecoupleSearch的系统。你可以把它想象成为你的侦探聘请两位专门的教练:

  • 规划教练: 这位教练只关注计划。“这是解决谜题的好策略吗?”
  • 搜索教练: 这位教练只关注线索。“这本书对我们当前的计划真的有帮助吗?”

通过分离这两项工作,系统可以在不担心搜索的情况下修复糟糕的计划,反之亦然。

3. 训练:“实战锦标赛”(MCTS)

你如何训练这些教练?你不能仅仅向他们展示答案键,因为中间的步骤很棘手。
相反,这篇论文使用了一种称为**蒙特卡洛树搜索(MCTS)**的方法。想象一个电子游戏,AI 在同一关卡中玩数千次。

  • 它尝试不同的路径(计划)和搜索。
  • 有时它会赢(得到正确答案),有时它会输。
  • 在每局游戏结束时,它会回顾自己做出的每一个动作。“那个动作导致了胜利,所以它是好的。那个动作导致了死胡同,所以它是坏的。”
  • 它为每一个步骤赋予一个“分数”。这就生成了一张巨大的地图,标明了什么有效、什么无效。

4. 推理:“剪枝”过程

当 AI 实际上为用户回答问题时,它不会只是猜测。它使用一种称为**分层束搜索(Hierarchical Beam Search)**的技术。
想象你正在爬树寻找特定的果实。

  • 分枝: 在每一个分叉口,AI 不会只选择一条路径。它会生长出几条新分支(计划),并搜寻几条不同的线索。
  • 修剪: 这就是规划教练搜索教练介入的地方。他们会审视所有新分支。
    • 规划教练说:“这个分支看起来有希望,但那个是死胡同。剪掉死胡同。”
    • 搜索教练说:“我们找到的这本书没用。扔掉它。保留这一本。”
  • 结果: AI 只保留最好的分支,剪掉其余的。它会重复这一过程,直到到达树顶(最终答案)。

为什么有效

这篇论文在许多困难问题(如多步骤历史谜题)上测试了这种方法。他们发现:

  1. 更好的规划是关键: 如果侦探有一个糟糕的计划,再多的搜索也无济于事。“规划教练”至关重要。
  2. 小模型也可以很聪明: 即使是一个较小的 AI 模型(例如 70 亿参数模型),如果使用了这种“剪枝”技术,其表现也能与更大、更昂贵的模型相媲美。这就像一支受过良好指导的小团队击败了一支庞大但无人指导的团队。
  3. 它胜过竞争对手: 该系统优于其他未将规划与搜索分离或未使用这种“实战锦标赛”训练的方法。

总结

DecoupleSearch就像给你的 AI 侦探配备了两位专家教练和一个实战模拟器。AI 不再盲目猜测,而是尝试许多路径,在模拟器中从错误中学习,然后在解决实际问题时,它会积极地剔除坏主意,只保留最好的那些。这能带来更准确的答案,特别是对于那些需要深入挖掘的复杂问题。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →