← 最新论文
💬 NLP

RC-GRPO: Reward-Conditioned Group Relative Policy Optimization for Multi-Turn Tool Calling Agents

该论文提出了 RC-GRPO,一种通过注入离散奖励标记来调节轨迹生成并使展开多样化,从而克服由组内奖励变化低导致的梯度消失更新问题,进而增强大语言模型多轮工具调用能力的创新框架,并在 BFCLv4 基准测试上实现了最先进的性能。

原作者: Haitian Zhong, Jixiu Zhai, Lei Song, Jiang Bian, Qiang Liu, Tieniu Tan

发布于 2026-02-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Haitian Zhong, Jixiu Zhai, Lei Song, Jiang Bian, Qiang Liu, Tieniu Tan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个非常聪明但又刻板的机器人助手如何使用一套工具(比如计算器、日历或搜索引擎)来解决一个复杂的、多步骤的谜题。

问题所在:“完美学生”陷阱

通常,为了教这个机器人,你会先给它展示一些完美解决方案的示例(监督微调,即 SFT)。机器人会完美地学习这些内容,成为一名“全优生”。

然后,你尝试用一种叫做 GRPO(群体相对策略优化)的方法来教它变得更好。把 GRPO 想象成一位教练,他召集了一群学生,给他们同一个谜题,并让他们尝试不同的解决方案。教练会对比他们的结果:“你做得很好,你做得不好,你表现平平。”做得更好的学生会获得提升,而做得差的学生则会受到提醒去尝试其他方法。

症结在于: 因为机器人之前在“完美”示例上训练得太好了,所以每当你要求这组学生进行尝试时,他们都会给出完全相同的解决方案。他们都是以那种一模一样且乏味的“完美”方式在行动。

  • 教练看着这组学生说:“嗯,大家都得了 10 分(满分)。”
  • 由于他们之间没有任何差异,教练无法告诉谁需要改进。学习信号消失了。机器人因此陷入了僵局,无法探索解决谜题的新方法,因为它太害怕偏离它已经掌握的那个“完美”路径了。

解决方案:RC-GRPO(“情绪戒指”策略)

作者提出了一种名为 RC-GRPO 的新方法来解决这个问题。他们不再仅仅寄希望于机器人随机尝试不同的做法,而是在机器人开始工作之前,给它一个“情绪戒指”或是一个特定的指令标记(token)。

第一步:教机器人根据指令做出不同反应 (RCTP)
首先,他们在混合的一堆故事上训练机器人:有些故事中它成功了(高奖励),有些则失败了(低奖励)。至关重要的一点是,他们在每个故事上都附带了一个特殊的标签,比如 <|High Reward|><|Low Reward|>

  • 机器人学到:“当我看到 <|High Reward|> 标签时,我应该努力做到完美。当我看到 <|Low Reward|> 标签时,我应该尝试不同的、也许是更冒险或更简单的路径。”
  • 现在,机器人不再只是一个刻板的学生;它是一个可以根据看到的标签在不同“模式”之间切换的变色龙。

第二步:教练的新游戏 (Reward-Conditioned GRPO)
现在,当教练(RL 算法)召集这组学生来解决谜题时,他们不再只是说“开始!”

  • 他们给每个学生发一个不同的标签。
  • 学生 A 得到了 <|High Reward|>,并尝试做到完美。
  • 学生 B 得到了 <|Low Reward|>,并尝试一种不同的、也许是比较混乱的方法。
  • 学生 C 再次得到了 <|High Reward|>,但可能会尝试一条略有不同的完美路径。
  • 由于学生们现在会根据他们的标签来调整行为,这组学生产生了多样性
  • 教练现在可以看到:“学生 A 得了 10 分,学生 B 得了 2 分,学生 C 得了 9 分。”
  • 现在有了明显的差异!教练可以给出有用的反馈:“学生 B,试着向学生 A 看齐。”
  • 这让学习引擎得以持续运转。

为什么有效(类比)

在旧的方法中,机器人就像一个合唱团,每个人都在完美地唱出完全相同的音符。指挥家无法分辨谁唱得更好,因为他们都是一模一样的。

在新的 RC-GRPO 方法中,指挥家给每个歌手发了不同的乐谱(高奖励 vs 低奖励标签)。突然间,合唱团听起来变得多样化了。指挥家可以听到其中的差异,挑选出最好的音符,并引导歌手们不断进步。

结果

论文在名为 BFCLv4 的基准测试上测试了该方法,这是一个针对使用工具的 AI 智能体的严苛考试。

  • 旧方法: 机器人陷入停滞,进步不大。
  • 新方法 (RC-GRPO): 机器人的学习速度更快,解决谜题的正确率更高。
  • 巨大的胜利: 在针对特定测试模型(Qwen-2.5-7B)时,这种新方法让这个开源机器人击败了那些通常在这些考试中胜出的、著名的、昂贵的“闭源”机器人(例如来自大型科技公司的机器人)。

总结

这篇论文解决了一个 AI 因为过度模仿示例而停止学习的问题。通过教 AI 根据一个简单的“奖励标签”有意识地表现得不同,他们迫使 AI 去探索不同的路径,从而让 AI 能够学得更快,并在使用工具方面变得更加聪明。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →