← 最新论文
🤖 machine learning

Reinforcing Multi-Turn Reasoning in LLM Agents via Fine-Grained Reward Structure and Credit Assignment

本文提出并验证了一个用于增强多轮场景下大语言模型智能体的框架,该框架通过推导定制化的 GRPO 和 PPO 算法,利用稠密的逐轮奖励结构,以实现比稀疏终端或延迟奖励方法更优的信用分配、训练稳定性和性能。

原作者: Quan Wei, Siliang Zeng, Chenliang Li, Zhongruo Wang, William Brown, Oana Frunza, Wei Deng, Anderson Schneider, Yuriy Nevmyvaka, Yang Katie Zhao, Alfredo Garcia, Mingyi Hong

发布于 2026-08-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Quan Wei, Siliang Zeng, Chenliang Li, Zhongruo Wang, William Brown, Oana Frunza, Wei Deng, Anderson Schneider, Yuriy Nevmyvaka, Yang Katie Zhao, Alfredo Garcia, Mingyi Hong

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

大型语言模型是当今最先进人工智能系统的引擎,它们能够生成类人文本、解决复杂问题,甚至编写代码。然而,当这些模型被要求执行需要长链条推理的任务时——例如在网上搜索信息、使用计算器或玩多步游戏——它们往往会表现挣扎。核心难点在于它们如何从错误中学习。在机器学习领域,这些系统通常使用一种称为强化学习的方法进行训练,即模型尝试不同的动作并接收以奖励形式呈现的反馈。如果最终答案正确,模型会获得奖励;如果错误,则没有任何奖励。这种方法对于简单任务效果良好,但对于复杂的、多步骤的交互,等到最后才给出反馈,就像是在试图通过在完成一整场对话后才被告知对或错来学习一门新语言一样。学习者不知道是哪个具体的词或句子导致了成功或失败,这使得改进变得异常困难。

一个研究团队致力于通过改变这些 AI 智能体在交互过程中接收反馈的方式来解决这个问题。他们不再等待最终结果,而是设计了一个系统,在智能体采取每一步行动后都提供一个微小且具体的奖励。想象一个试图通过搜索网络寻找答案的智能体。在旧方法中,智能体可能会进行一次错误的搜索查询,阅读无关的结果,然后猜错答案,直到最后才收到“失败”信号。而新方法在每次搜索查询后都会给智能体即时反馈:为找到相关信息提供小额奖励,或为糟糕的查询施加惩罚。这使得智能体能够准确了解哪些步骤是有帮助的,哪些是没有帮助的,从而以更高的精度优化其行为。

研究人员使用两种流行的训练算法测试了这个想法,一种是将不同的尝试分组进行比较,另一种是从连续的动作流中学习。他们将这些方法应用于两类截然不同的任务:一个必须使用维基百科数据库寻找问题答案的搜索智能体,以及一个必须解决名为 Sokoban(推箱子)的谜题的游戏智能体,在该游戏中,箱子必须被推到网格上的特定目标位置。在 Sokoban 游戏中,一步错棋就可能让玩家陷入死胡同,导致无法完成关卡。这使得该游戏成为测试智能体是否能学会规划后续数步动作的完美测试场。研究人员将这种新的“逐步”奖励系统与传统的等待最终结果的方法,以及一种延迟并组合奖励的中庸方法进行了对比。

结果在搜索和游戏任务中都表现得清晰且一致。使用密集型、逐步奖励训练的智能体比使用旧方法的智能体学习得更快,且表现得更加稳定。在搜索任务中,新方法不仅帮助智能体更频繁地找到正确答案,还帮助它们遵循与搜索引擎交互所需的严格格式规则。在 Sokoban 游戏中,接受逐步反馈训练的智能体学会了避免死胡同,并以显著更高的成功率解决了谜题。研究人员发现,等待最终答案的传统方法往往导致训练不稳定,智能体的表现会剧烈波动或无法提升。相比之下,逐步法提供了一个稳定的引导,使智能体能够在不迷失方向的情况下构建复杂的推理能力。

这项工作表明,对于人工智能要掌握复杂的、多轮的交互,它需要的不仅仅是对其表现的一个最终评分。它需要一场关于它正在做什么、做得对与错的持续对话。研究显示,通过将学习过程分解为更小、更易处理的部分,并为每个动作提供即时且具体的反馈,AI 智能体可以变得更加强大且可靠。这一发现为构建更聪明的助手指明了方向,使它们能够应对现实世界、解决复杂问题,并以一种自然且有效的方式与工具进行交互,从而从简单的文本生成迈向真正的、多步推理的阶段。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →