← 最新论文
🤖 AI

TRCA: Transition-wise Rubric Credit Assignment for Long-horizon LLM Agents

本文提出了基于转换维度的评分准则信用分配(Transition-wise Rubric Credit Assignment, TRCA),该方法通过根据证据(Evidence)、执行(Execution)和无效性(Invalidity)准则对动作引发的转换进行评估,为长程大语言模型(LLM)智能体生成细粒度的步骤级奖励,从而克服了成功轨迹稀缺的问题,并在无需依赖学习型评估器的情况下提升了在 WebShop 和 SearchQA 等基准测试上的性能。

原作者: Huan Zhang, Mingju Chen, Dongxu Zhou, Can Lv, Heng Chang, Sen Cui, Faguo Wu, Shiji Zhou

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Huan Zhang, Mingju Chen, Dongxu Zhou, Can Lv, Heng Chang, Sen Cui, Faguo Wu, Shiji Zhou

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人工智能这一快速发展的领域中,研究人员正在教计算机程序扮演能够进行规划、搜索并能在长时间内与世界互动的智能体。想象一个数字助手,其任务是在庞大的在线商店中寻找特定物品,或组织一系列复杂的家务活;这些任务需要一系列许多个微小的决策,而非仅仅是一个快速的答案。为了教授这些智能体,科学家们经常使用一种称为强化学习的方法,即计算机通过尝试行动并接收反馈来进行学习。传统方法严重依赖于任务结束时一个简单的“是”或“否”:智能体是成功了还是失败了?这创造了一个困难的学习环境,因为智能体无法获得关于哪些具体步骤是有益的、哪些是有害的任何指导,就像一名学生在从未见过其作业评分的情况下参加期末考试一样。

这种中间反馈的缺失成为了一个主要障碍,当任务变得复杂且成功尝试非常罕见时,问题尤为突出。如果智能体在训练初期失败了95%的时间,那么一个只关注最终结果的系统几乎没有任何有用的数据可以利用。它无法区分一个导致死胡同的好主意与一个单纯错误的步骤。这使得智能体陷入停滞,无法从频繁的错误中学习,因为反馈回路过于粗糙,无法提供有效信息。因此,挑战在于找到一种方法,即使在整体任务最终失败时,也能为正确的微小行动给予肯定。

一个研究小组提出了一种名为“转移维度准则信用分配”(Transition-wise Rubric Credit Assignment,简称 TRCA)的新方法来解决这个问题。TRCA 不再等待成功的结局,也不依赖昂贵的、经过预训练的评判器来评估每一步,而是直接观察行动对环境造成的即时变化。研究人员观察到,即使在失败的尝试中,智能体也经常执行逻辑合理的行动,例如收集正确的信息或执行有效的命令,即便最终目标未能达成。TRCA 将这些时刻视为宝贵的学习机会。它根据三个特定标准来评估智能体做出的每一个动作:该动作是否揭示了新的相关信息;它是否成功执行了要求的操作;或者它是否导致了无效或损坏的动作。

通过将智能体的旅程分解为这些细粒度的检查,该系统可以独立于最终结果为每一步分配分数。如果智能体收集了任务所需的证据,它会获得正向信用;如果它执行了一个推动任务前进的有效动作,它会获得更多信用;如果它尝试做一些环境无法理解或执行的事情,它则会受到惩罚。至关重要的是,该系统还会奖励“突破”,即智能体满足了此前未满足条件的时刻,例如找到了正确的商品颜色或选择了正确的尺寸。这使得智能体能够了解到进展正在发生,即便最终的购买或任务完成尚未实现。

研究人员在几个具有挑战性的基准测试上测试了这种方法,包括模拟在线购物环境和一个智能体必须完成家务任务的文本世界。他们发现,与其它领先方法相比,TRCA 始终能提高智能体的表现。在在线购物测试中,使用特定的模型规模,该新方法比竞争基准提高了 6.0% 到 12.6%。在基于搜索的问题回答任务中,提升幅度在 1.9% 到 18.3% 之间,平均得分显著上升。这些收益的取得并不需要大量的成功案例作为开端,证明了该系统可以有效地从失败尝试中发现的大量数据中学习。

这项研究表明,教导长程智能体的关键在于认识到失败并非一张白纸。即使智能体没有完成任务,它所走的路径通常也包含了关于哪些做得正确以及哪些做得不对的清晰信号。通过关注这些即时的、可观察的变化,而不是等待罕见的成功,这种新方法提供了稳定的引导,帮助智能体更快地改进。这种方法使系统能够从更广泛的经验中学习,将绝大多数失败的尝试转化为丰富的教学来源,而非浪费的数据。结果表明,对于复杂的、多步骤的任务,逐步评估进展的能力远比等待最终裁决更为有效。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →