TRACE: A Unified Rollout Budget Allocation Framework for Efficient Agentic Reinforcement Learning
本文介绍了 TRACE,这是一个统一的框架,通过将交互建模为树状结构的节点,并动态地针对提示词根(prompt roots)和中间前缀(intermediate prefixes)结合混合终端奖励(mixed terminal rewards),以增强奖励对比度和策略学习效率,从而优化多轮智能体强化学习中的展开预算分配(rollout budget allocation)。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一位老师,正试图教导一名非常聪明但缺乏经验的学生(一个人工智能)如何解决复杂的谜题,比如数学题或在巨大的图书馆中寻找答案。这个学生通过尝试来学习,并通过在尝试结束时得到一个简单的“是”或“否”来进步。
问题在于,老师拥有的练习时间(“预算”)是有限的。如果老师让学生把 100 次机会都花在同一个简单的谜题上,或者同一个不可能完成的谜题上,学生将学不到任何东西。他们需要尝试那些难度适中的谜题——即在那里他们可能会成功,也可能会失败——这样才能学会区分成功与失败。
这篇论文介绍了一种名为 TRACE 的新方法来解决这个问题。以下是它的工作原理,我将使用简单的类比来解释:
1. 问题所在:在“无聊”路径上浪费时间
在过去,当教导人工智能时,研究人员会挑选一个谜题,然后让人工智能从头到尾尝试解决它。
- 问题: 如果谜题太简单,人工智能总是赢;如果太难,人工智能总是输。在这两种情况下,结尾处的“是/否”回答都无法告诉人工智能它究竟是在哪里出错的。
- 旧方法: 研究人员曾尝试挑选更好的初始谜题,但一旦人工智能开始解决谜题,他们就任其运行到底。他们不会在中途停下来检查人工智能是否陷入了困境。
2. 解决方案:“分支路径”(TRACE)
TRACE 通过将人工智能的尝试视为一棵拥有许多分叉的树,而不是一条直线,从而改变了游戏规则。
想象人工智能正在爬一座山去寻找宝藏(正确答案)。
- 根部(起点): 首先,TRACE 查看起点(谜题)。它会预测:“这个谜题是否可能呈现出成功与失败并存的状态?”如果太简单或太难,它会跳过。如果这是一个好的“学习型”谜题,它才会让人工智能开始登山。
- 分支(中间过程): 这是神奇之处。当人工智能登山时,它会遇到一个分岔路口(一个决策点)。此时 TRACE 会停下来询问:“如果人工智能走这条特定的路径,它更有可能导致成功还是失败?”
- 如果这条路径看起来注定会导致成功或注定会导致失败,TRACE 就不会浪费时间继续探索它。
- 如果这条路径看起来具有不确定性(成功或失败的概率各占 50%),TRACE 会说:“让我们派更多的登山者走这条特定的路径,看看究竟会发生什么!”
3. “水晶球”(预测器)
TRACE 如何知道哪些路径是不确定的呢?它使用了一个“水晶球”(预测模型)。
- 这个水晶球会观察登山至今的历史记录(人工智能所进行的思考和采取的行动)。
- 它会估算成功的概率。
- 如果水晶球说:“这里有 50% 的成功概率”,那么这就是最值得投入时间的地方。这意味着人工智能正处于一个“学习区”,在这里它可以对比成功路径与失败路径。
4. 结果:用更少的努力实现更聪明的学习
通过将有限的时间仅集中在这些“不确定”的部分,TRACE 创建了一张丰富的对比图。
- 人工智能不再仅仅知道“我失败了”,而是能学到:“我失败是因为我在分岔路口选择了左边的路径,但如果我选右边,我就会成功。”
- 即使总的练习时间(预算)与以前完全相同,这也创造了一个更强大的学习信号。
总结
可以将 TRACE 想象成一位聪明的教练,他不会只是让运动员随机跑圈。
- 选择正确的比赛: 它挑选那些具有挑战性但又可以获胜的比赛。
- 停在棘手的转弯处: 它观察运动员奔跑。如果运动员遇到了一个可能滑倒也可能站稳的棘手转弯,教练会派更多的运动员去尝试那个完全相同的转弯,以观察滑倒与站稳之间的区别。
- 节省时间: 它忽略了平坦的直道和无法逾越的悬崖。
论文表明,通过使用这种方法,人工智能模型(特别是 Qwen3)在数学、多步问题和工具使用方面变得更加出色,同时使用的计算能力与旧方法持平。它将一次平淡、枯燥的练习变成了一场动态的、分支式的探索,让每一步都能教会人工智能新的知识。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。