TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents
TRACE 引入了一种针对长程智能体的稠密、无评论家(critic-free)信用分配方法,该方法通过从对数比例状态值的时序差分变化中推导每轮奖励,使得纯强化学习能够在无需监督微调或实时网络数据的情况下,显著提升在复杂搜索基准测试上的工具使用性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个机器人去解决一个巨大的、多步骤的谜题。在人工智能的世界里,这被称为“智能体强化学习”(agentic reinforcement learning)。把这个机器人想象成一名侦探,他不仅仅是猜一次答案,而是会花上好几个小时去搜寻图书馆、打开文件、提问并收集线索,最后才大喊一声:“我找到凶手了!” 难点在于如何教导这个侦探。如果侦探在最后时刻猜错了答案,一个简单的老师可能只会说:“做得不好,”然后给一个零分。但这并不公平!也许侦探在第一个小时里找到了正确的线索,却在最后一分钟被一块松动的地板绊倒了。如果你因为最后的一个错误就惩罚整个小时的努力工作,侦探会感到困惑并停止收集线索。这就是“信用分配”(credit assignment)的问题:当奖励只在最后才出现时,你该如何为好的步骤给予荣誉,又该如何为坏的步骤承担责任?
这篇名为 TRACE 的论文正是针对那些需要通过许多回合来解决问题的 AI 智能体所面临的这种头疼问题。研究人员提出了一种巧妙的方法,在每一个步骤(比如每一次搜索或打开文件)之后都给侦探一个“赞”或“踩”,而不是等到最后。他们这样做并不需要人类去为每一步打分,也不需要一个超级聪明的裁判来观看整部电影。相反,他们使用了一个“冻结的参考模型”——把它想象成一个冷静、不变的图书管理员,他手里握着答案解析。在侦探做出每一次动作后,图书管理员都会检查:“这个新线索是否让最终答案变得更容易被猜中?”如果是,侦视为侦探提供一个小奖励;如果不是,则给予微小的惩罚。这种被称为 TRACE 的方法,能让 AI 比起单纯等待最终成绩的学习得更快、更好。
侦探的困境
想象一下,你正在训练一个机器人去寻找一位虚构作家“埃琳娜·克鲁兹”(Elena Cruz)的出生地。机器人必须使用浏览器进行搜索、打开页面并阅读文本。它可能需要点击 20 次才能到达目的地。在旧有的机器人训练方法(称为“仅基于结果”训练)中,机器人会经历所有 20 次点击,也许最后猜错了答案,然后计算机就会说:“失败。”机器人随后会再次尝试,但它并不知道这 20 次点击中哪些是有帮助的。也许前 15 次点击找到了正确的书,但第 16 次点击打开了一个关于另一个埃琳娜的页面,导致了错误的答案。旧方法将有用的前 15 次点击与无用的第 16 次点击同等对待:两者都会受到惩罚。这就像是因为你在数学考试最后犯了一个微小的算术错误,就被判了不及格,尽管你前面已经正确解出了复杂的代数题。
研究人员发现,这种“全有或全无”的方法使得机器人很难学习复杂的长任务。机器人会感到困惑,训练过程会变得异常漫长,并且由于害怕在最后时刻出错,它往往会放弃探索新想法。
TRACE 解决方案:每一步都有记分卡
论文的作者提出了 TRACE(通过信用估计实现的轮次级奖励分配)。TRACE 不再等待最终答案来给机器人评分,而是在每一次工具调用(每一次搜索、每一次打开、每一次点击)之后都给机器人一个分数。
以下是使用我们的侦探类比来解释其工作原理:
- 冻结的图书管理员: 系统使用一个“冻结的参考模型”。想象一位已经读过答案解析且永远不会改变主意的图书管理员。这位图书管理员是“冻结”的,意味着他们不会学习或感到困惑;他们只是作为一个稳定的衡量标准。
- 进度检查: 在机器人做出一个动作(比如搜索“埃琳娜·克鲁兹”)后,图书管理员会检查机器人的当前笔记。图书管理员会问:“基于机器人目前所发现的内容,猜中正确答案有多容易?”
- 分数的变化: 如果机器人的新搜索让答案变得更容易猜中,机器人就会获得正分。如果这次搜索导致了死胡同或令人困惑的页面,分数就会下降。
- “叠层”的魔力: 论文使用了一种叫做“时序差分”(Temporal-Difference, TD)的数学技巧。把它想象成一把梯子。如果你向上爬了一级,你就为这一级获得荣誉。如果你向上爬的过程中不小心滑了下来,你就会失去荣誉。系统会将这些微小的变化累加起来。如果机器人在收集了 10 轮好线索后做出了一个错误的举动,系统会将这 10 个好的步骤视为正向,并将那一个坏的步骤视为负向。它不会仅仅因为最终答案错了,就惩罚那 10 个好的步骤。
这种方法很特别,因为它既不需要人类在每一步后写下“做得好”,也不需要第二个超级聪明的 AI 来观察机器人并给它评分。它只是利用“冻结的图书管理员”来观察机器人是否正在接近真相。
他们的发现
研究人员在极其困难的任务上测试了 TRACE:在海量文档集合中寻找隐藏的特定事实(即“闭域网络”搜索)。他们使用了两种不同规模的 AI 模型:一个较小的模型(Qwen3-4B)和一个较大的模型(Qwen3-30B-A3B)。
结果令人印象深刻。在使用 TRACE 之前,较小的模型只能解决大约 7.2% 的困难搜索问题。在使用 TRACE 进行训练后,它跃升至 35.6%。较大的模型从 8.4% 提升到了 42.6%。考虑到他们没有使用任何“冷启动”训练(即先用完美的例子来教导机器人)或实时互联网数据,这些进步是非常巨大的。他们只是在原始模型上使用了 TRACE 方法。
论文还表明,即使机器人在训练过的库之外的“开域”互联网上接受测试,TRACE 依然有效。机器人学会了一种通用的搜索和阅读技能,这种技能可以迁移到新的地方。例如,较大的模型在名为 BrowseComp 的基准测试中得分为 12.9,在 GAIA 中得分为 52.0,在中文深度搜索测试中得分为 45.0。
为什么它很重要以及它的局限性
论文指出,这种方法让学习变得更快。在实验中,使用 TRACE 训练的机器人比使用旧有的“等待到底”方法的机器人更早开始变好,并更快地达到了巅峰性能。学习曲线显示,机器人正在学习如何更有效地探索和收集证据。
然而,作者也谨慎地指出了他们工作的局限性。这种方法在最终答案简短且明确(如名字、日期或数字)时效果最好。如果机器人的任务是写一个长篇复杂的故事,或者修理一个损坏的计算机程序,而“正确”的答案是开放式且难以定义的,那么这种方法可能效果不佳。因为“冻结的图书管理员”需要一个清晰的答案解析来对照。如果答案是模糊的,图书管理员就无法判断机器人是否正在接近真相。
简而言之,TRACE 是一种教导 AI 智能体成为优秀侦探的新方法。它不再等到案件结束才说“做得好”或“做得不好”,而是在发现每一个线索后都给出一个记分卡。这有助于 AI 理解,即便最终猜测不完美,收集证据本身也是有价值的,从而引导出更聪明、更快速且更可靠的搜索智能体。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。