← 最新论文
📊 statistics

Maximizing Rollout Informativeness under a Fixed Budget: A Submodular View of Tree Search for Tool-Use Agentic Reinforcement Learning

本文介绍了 InfoTree,这是一种面向工具使用智能体强化学习的训练期树搜索框架,它将 rollout 的信息量形式化为子模最大化问题,从而推导出一种不确定性感知的选择策略(UUCB)和自适应预算分配器,进而在保持鲁棒性和效率的同时,在多种推理与工具使用基准测试中显著优于现有方法。

原作者: Yuelin Hu, Zhenbo Yu, Zhengxue Cheng, Wei Liu, Li Song

发布于 2026-05-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Yuelin Hu, Zhenbo Yu, Zhengxue Cheng, Wei Liu, Li Song

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试通过让机器人反复练习,教它如何解决复杂谜题(如数学问题或编程任务)。在人工智能领域,这种练习被称为“ rollout( rollout)”。机器人尝试解决问题,如果正确则获得奖励,如果错误则受到惩罚。目标是从这些尝试中学习。

然而,存在一个大问题:“回声室”效应

如果你让机器人对同一道难题尝试 16 次,它可能会连续 16 次给出完全相同的错误答案。或者,如果是一道简单谜题,它可能会连续 16 次给出完全相同的正确答案。在这两种情况下,机器人都学不到任何新东西,因为缺乏多样性。这就像让学生参加同一份选择题测试 16 次;如果每次都答错,他们并不会明白为什么错了,只会感到沮丧。

本文介绍了一种名为INFOTREE的新方法来解决这一问题。以下是其工作原理,辅以简单的类比:

1. 问题:“无聊的课堂”

作者将这种现象称为“坍缩”。如果机器人的所有尝试都完全相同,训练信号(即课程)就会消失。他们从数学上证明,无论让机器人尝试多少次(即使给予巨大的尝试预算),如果是难题,它最终都会陷入重复且无益的答案循环中。这就像一位老师只允许已经知道答案的学生举手,而那些不知道答案的学生永远没有机会学习。

2. 解决方案:“好奇的探索者”(次模最大化)

INFOTREE 不再让机器人随机选择答案,而是采用一种智能策略来选择下一步探索哪条路径。作者将这一过程视为一场**“最大化多样性”**的游戏。

他们使用了一个名为次模性的数学概念。可以将其想象为打包行李箱:

  • 如果你装进一件衬衫,它会增加价值。
  • 如果你装进第二件颜色完全相同的衬衫,它带来的新价值微乎其微。
  • 但如果你装进一件不同的物品(比如帽子或鞋子),它就能带来巨大的新价值。

INFOTREE 就像一个聪明的打包者。它会审视机器人当前的尝试,并问道:“哪一步能给我们提供最多的信息?”它不仅仅寻找“最好”的答案,而是寻找与其他答案不同的答案。

3. “智能选择器”的三种成分

为了决定探索哪条路径,该系统使用了一个公式(称为UUCB),混合了三种成分,就像炖一锅好汤的食谱:

  1. “自信”成分(覆盖率):“我们之前尝试过这条路径吗?”如果机器人很有信心且经常看到这条路径,它就不需要再次前往。
  2. “好奇”成分(新颖性):“我们曾经到过地图的这个部分吗?”如果一条路径是新的且未被探索,机器人会被鼓励前往那里。
  3. “混乱”成分(对比/熵):“这里的答案是否杂乱且各不相同?”系统主动寻找机器人感到困惑的地方,或者不同尝试导致不同结果的地方。这种“混乱”实际上是好消息,因为它意味着有很多东西可以学习。

通过平衡这三者,机器人避免了“无聊的课堂”,并确保每一次练习都能教会它一些新东西。

4. 安全网:“救援队”(自适应预算分配器)

有时,即使是智能选择器也会陷入困境。也许机器人如此困惑,以至于它尝试的每一条路径都通向死胡同。

  • 解决方法:INFOTREE 拥有一个小小的“救援队”(自适应预算分配器)。它会监视机器人的练习情况。如果它发现机器人即将把所有时间浪费在死胡同上,救援队就会说:“停下!让我们做一个疯狂的大胆猜测,看看能否打破这种模式。”
  • 结果:这挽救了原本会被浪费的训练过程,将一轮“无用”的练习转化为有用的练习。

5. 速度提升:“推测性扩展”

通常,这种智能选择过程非常缓慢,因为计算机必须等待一个计算完成才能开始下一个。

  • 解决方法:INFOTREE 使用了一种“推测性”技巧。它让计算机在之前的计算完全结束之前就猜测下一步。如果猜测正确,那就太好了!如果错误,它只需回滚并重试。
  • 结果:这使得整个过程快得多(减少了超过 10% 的浪费时间),因此机器人可以在更短的时间内学到更多。

总结

本文在九种不同类型的挑战上测试了这种新方法(INFOTREE),从解决高难度数学竞赛(如 AIME)到帮助机器人浏览网页和编写代码。

结果:

  • 更好的学习:机器人学习速度显著加快,解决问题的数量超过了以往的方法。
  • 不再浪费时间:它阻止了机器人陷入重复答案的循环。
  • 鲁棒性:即使设置发生轻微变化,该系统也能良好运行,这意味着它不是一个仅在完美条件下才有效的“脆弱”技巧。

简而言之,INFOTREE是一种通过确保 AI 智能体从不会重复练习同一个错误来教导它们的方法。它迫使它们探索问题空间中“混乱”和“不同”的部分,将徒劳的努力转化为宝贵的教训。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →