← 最新论文
💬 NLP

TRACE: A Unified Rollout Budget Allocation Framework for Efficient Agentic Reinforcement Learning

本文介绍了 TRACE,这是一个统一的框架,通过将交互建模为树状结构的节点,并动态地针对提示词根(prompt roots)和中间前缀(intermediate prefixes)结合混合终端奖励(mixed terminal rewards),以增强奖励对比度和策略学习效率,从而优化多轮智能体强化学习中的展开预算分配(rollout budget allocation)。

原作者: Heming Zou, Qi Wang, Yun Qu, Yuhang Jiang, Lizhou Cai, Yixiu Mao, Ru Peng, Xin Xu, Weijie Liu, Kai Yang, Saiyong Yang, Xiangyang Ji

发布于 2026-06-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Heming Zou, Qi Wang, Yun Qu, Yuhang Jiang, Lizhou Cai, Yixiu Mao, Ru Peng, Xin Xu, Weijie Liu, Kai Yang, Saiyong Yang, Xiangyang Ji

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一位老师,正试图教导一名非常聪明但缺乏经验的学生(一个人工智能)如何解决复杂的谜题,比如数学题或在巨大的图书馆中寻找答案。这个学生通过尝试来学习,并通过在尝试结束时得到一个简单的“是”或“否”来进步。

问题在于,老师拥有的练习时间(“预算”)是有限的。如果老师让学生把 100 次机会都花在同一个简单的谜题上,或者同一个不可能完成的谜题上,学生将学不到任何东西。他们需要尝试那些难度适中的谜题——即在那里他们可能会成功,也可能会失败——这样才能学会区分成功与失败。

这篇论文介绍了一种名为 TRACE 的新方法来解决这个问题。以下是它的工作原理,我将使用简单的类比来解释:

1. 问题所在:在“无聊”路径上浪费时间

在过去,当教导人工智能时,研究人员会挑选一个谜题,然后让人工智能从头到尾尝试解决它。

  • 问题: 如果谜题太简单,人工智能总是赢;如果太难,人工智能总是输。在这两种情况下,结尾处的“是/否”回答都无法告诉人工智能它究竟是在哪里出错的。
  • 旧方法: 研究人员曾尝试挑选更好的初始谜题,但一旦人工智能开始解决谜题,他们就任其运行到底。他们不会在中途停下来检查人工智能是否陷入了困境。

2. 解决方案:“分支路径”(TRACE)

TRACE 通过将人工智能的尝试视为一棵拥有许多分叉的,而不是一条直线,从而改变了游戏规则。

想象人工智能正在爬一座山去寻找宝藏(正确答案)。

  • 根部(起点): 首先,TRACE 查看起点(谜题)。它会预测:“这个谜题是否可能呈现出成功与失败并存的状态?”如果太简单或太难,它会跳过。如果这是一个好的“学习型”谜题,它才会让人工智能开始登山。
  • 分支(中间过程): 这是神奇之处。当人工智能登山时,它会遇到一个分岔路口(一个决策点)。此时 TRACE 会停下来询问:“如果人工智能走这条特定的路径,它更有可能导致成功还是失败?”
    • 如果这条路径看起来注定会导致成功或注定会导致失败,TRACE 就不会浪费时间继续探索它。
    • 如果这条路径看起来具有不确定性(成功或失败的概率各占 50%),TRACE 会说:“让我们派更多的登山者走这条特定的路径,看看究竟会发生什么!”

3. “水晶球”(预测器)

TRACE 如何知道哪些路径是不确定的呢?它使用了一个“水晶球”(预测模型)。

  • 这个水晶球会观察登山至今的历史记录(人工智能所进行的思考和采取的行动)。
  • 它会估算成功的概率。
  • 如果水晶球说:“这里有 50% 的成功概率”,那么这就是最值得投入时间的地方。这意味着人工智能正处于一个“学习区”,在这里它可以对比成功路径与失败路径。

4. 结果:用更少的努力实现更聪明的学习

通过将有限的时间仅集中在这些“不确定”的部分,TRACE 创建了一张丰富的对比图

  • 人工智能不再仅仅知道“我失败了”,而是能学到:“我失败是因为我在分岔路口选择了左边的路径,但如果我选右边,我就会成功。”
  • 即使总的练习时间(预算)与以前完全相同,这也创造了一个更强大的学习信号。

总结

可以将 TRACE 想象成一位聪明的教练,他不会只是让运动员随机跑圈。

  1. 选择正确的比赛: 它挑选那些具有挑战性但又可以获胜的比赛。
  2. 停在棘手的转弯处: 它观察运动员奔跑。如果运动员遇到了一个可能滑倒也可能站稳的棘手转弯,教练会派更多的运动员去尝试那个完全相同的转弯,以观察滑倒与站稳之间的区别。
  3. 节省时间: 它忽略了平坦的直道和无法逾越的悬崖。

论文表明,通过使用这种方法,人工智能模型(特别是 Qwen3)在数学、多步问题和工具使用方面变得更加出色,同时使用的计算能力与旧方法持平。它将一次平淡、枯燥的练习变成了一场动态的、分支式的探索,让每一步都能教会人工智能新的知识。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →