← 最新论文
💬 NLP

RICE-PO: Turning Retrieval Interactions into Credit Signals for Reasoning Agents

本文提出了 RICE-PO,这是一种无需批评家的策略优化框架,它利用高不确定性的可执行动作作为锚点,将检索交互转化为局部学习信号,从而为潜在推理步骤分配信用,进而提升交互式推理智能体在 BRIGHT 和 BEIR 等基准测试上的训练效果。

原作者: Mingchen Li, Hansi Zeng, Zhuo Qian, Jiatan Huang, Hamed Zamani, Hong Yu

发布于 2026-05-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Mingchen Li, Hansi Zeng, Zhuo Qian, Jiatan Huang, Hamed Zamani, Hong Yu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个智能机器人如何为一道极其棘手的问题找到完美答案。机器人并非只输入一个搜索查询就听天由命。相反,它像一名侦探:进行搜索、阅读发现的内容、思考缺失了什么、撰写新的搜索查询,然后再次搜索。它如此循环往复,直到找到答案。

这篇论文要解决的核心难题是:如何教会机器人识别其步骤中哪些实际上是有效的。

问题:思维的“黑箱”

在这场侦探游戏中,机器人有两种类型的行动:

  1. “执行”行动(可执行): 即它实际输入的搜索查询。搜索引擎可以立即告诉机器人:“干得好!那个查询找到了 10 篇很棒的文章,”或者“干得糟!那个查询一无所获。”这很容易衡量。
  2. “思考”行动(潜在): 即机器人在输入查询之前产生的内部思维。它可能会想:“我需要查找事件发生的年份,”或者“我应该检查作者的背景。”搜索引擎无法看到这些思维。它只能看到最终的查询。

信用分配困境:
如果机器人最终找到了完美的文章,我们如何知道哪一个思维导致了这一成功?

  • 是“检查作者”这个思维导致了成功吗?
  • 还是机器人仅仅在最终查询上运气好,而之前的思维实际上是错误的?

如果我们仅仅因为机器人最终得到了结果就给它颁发“金星”,并告诉它:“你产生的每一个思维都很棒”,机器人可能会学到错误的教训。它可能会开始想:“哦,我虽然错了,但依然拿到了金星,所以我将继续这样做。”这被称为信用错配

解决方案:RICE-PO(“智能教练”)

作者提出了一种名为RICE-PO的新训练方法。这种方法不再仅仅关注最终结果,而是像一位智能教练,在机器人练习过程中实时观察并给予反馈。

以下是 RICE-PO 的工作原理,使用一个简单的类比:

1. 寻找“摇摆时刻”(不确定性锚点)

教练并不观察每一秒。相反,教练寻找机器人显得不确定的时刻。

  • 类比: 想象机器人正在两个搜索查询之间做决定。一个是“京都的历史”,另一个是“可再生能源技术”。如果机器人非常自信,它就直接选一个。但如果它感到困惑并生成了许多不同且奇怪的选项,教练就会说:“好吧,这是一个关键时刻。让我们暂停并分析这一点。”
  • 在论文中: 他们使用“熵”(一种衡量困惑程度的指标)来挑选这些高风险时刻。

2. “如果……会怎样?”模拟(局部反事实)

一旦教练识别出一个“摇摆时刻”,他们不会只是等待机器人完成。他们会运行一个快速模拟。

  • 类比: 教练说:“好吧,你当时正在思考‘京都’。但如果在那一刻你思考的是‘东京’会怎样?让我们假设你那样做了,看看你会写出什么样的搜索查询,并检查该查询是否会找到更好的结果。”
  • 在论文中: 他们从相同的历史记录中生成多个“如果……会怎样”的分支,以观察改变思维是否真的改变了搜索结果

3. “稳定性检查”(门控传播)

这是最重要的一部分。教练在将功劳归于思维之前,会提出两个问题:

  • 问题 A(影响力): 该思维是否真的改变了搜索查询?(如果机器人思考了“京都”与“东京”,但写出了完全相同的查询,那么该思维就不重要。不予 credit。)
  • 问题 B(稳定性): 该思维带来的益处是否持续到了最后?(有时一个思维引出了一个很好的搜索查询,但随后机器人在下一步犯了一个极糟的错误,导致全盘皆输。如果最终结果糟糕是因为下一步,我们就不应将功劳归于第一个思维。)
  • 在论文中: 他们测量“残差稳定性”。如果局部奖励(来自即时搜索)即使在后续步骤后仍保持一致,教练就会说:“是的,这个思维是英雄。给它 credit!”如果后续步骤搞砸了,教练就会说:“不,暂时不要给这个思维 credit。”

结果

通过这种方法,机器人学习得更快。

  • 旧方法: “你答对了!所有事情都干得好。”(机器人会困惑于究竟什么起了作用。)
  • RICE-PO 方法: “你在这里感到困惑,但你特定的思维引出了一个更好的搜索查询,并且这一优势保持到了最后。那个特定的思维很棒。请再次这样做。”

为何重要

该论文在两个大型数据集(BRIGHT 和 BEIR)上测试了这种方法,它们就像是充满棘手问题的巨型图书馆。

  • 他们发现,RICE-PO 帮助机器人(即使是更小、更便宜的机器人)找到了比先前方法更好的答案。
  • 它证明了你不需要一个超级昂贵的“裁判”AI 来告诉机器人该做什么。搜索过程本身的结构(即查询是可测试的这一事实)提供了机器人所需的所有反馈。

简而言之: RICE-PO 是一种教导 AI 智能体从自身搜索历史中学习的方法,通过仔细检查其思维是否真正导致了其成功,而不是仅仅根据最终得分进行猜测。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →