← 最新论文
🤖 AI

TCPO: Turn-Level Credit Policy Optimization

本文提出了 TCPO,一种轮次级信用分配方法,通过回顾性、后验性和反事实比较将验证器评分转化为稠密信用,从而显著提升推理和智能体任务中多轮强化学习的性能。

原作者: Sicong Liao, Zhi Chen, Yaohua Tang

发布于 2026-08-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Sicong Liao, Zhi Chen, Yaohua Tang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人解决一个棘手的谜题。在过去,你会让机器人尝试、失败,然后在最后才说:“不行,那不对,”或者“没错,你成功了!”但如果机器人在做每一步动作时都能得到一点分数呢?这就是**带有可验证奖励的强化学习(Reinforcement Learning with Verifiable Rewards)**的世界。这就像玩电子游戏,你在每一跳之后都会得到分数,而不仅仅是在关卡结束时。这能帮助机器人学得更快,因为它知道哪些动作是好的,哪些是坏的。

然而,这里有一个狡猾的问题。仅仅因为一个动作得到了高分,并不意味着它导致了成功。也许机器人本来就已经处于获胜的路径上,而那个动作只是维持了现状。又或者,某个动作在当时看起来很糟糕,但实际上为三步之后的精彩方案铺平了道路。如果机器人因为错误的原因而获得了荣誉,它可能会学着一遍又一遍地犯同样的错误。科学家们面临的大问题是:我们如何利用这些分数,并弄清楚究竟是哪一步动作值得这份荣誉?

这就是名为 TCPO(Turn-Level Credit Policy Optimization,回合级信用策略优化)的新方法发挥作用的地方。把 TCPO 想象成一位超级聪明的教练,他不仅看记分牌,还会观看回放,并问道:“这个动作是真的有帮助,还是仅仅运气好?”TCPO 的研究人员意识到,仅仅给机器人每个回合的分数是不够的。你必须将分数转化为“信用”,告诉机器人那个特定的回合在多大程度上改变了它获胜的机会。

以下是 TCPO 如何运作的,它使用了几个聪明的技巧:

  1. 向后看(回顾性信用/Retrospective Credit): 想象你在爬山。如果你迈出一步,让你达到了比之前达到的任何高度都高的位置,TCPO 会给你一个大大的“做得好!”如果你迈出一步,让你保持在同样的高点(维持你的成功),TCPO 会说“继续保持!”但如果你迈出一步,让你在你已经到达顶峰后滑了下来,TCPO 则会说:“嘿,那是个坏动作!”这有助于机器人学习如何爬得更高,而不是跌落下来。

  2. 向前看(后瞻性信用/Hindsight Credit): 有时候,一个动作看起来很枯燥,甚至看起来很糟。也许机器人发出了一种奇怪的声音,看起来似乎没有什么帮助。但稍后,那个声音竟然成了解锁一扇门的钥匙。TCPO 会观察未来。如果一个“枯燥”的动作最终导致了胜利,TCPO 会给予它信用,说:“我知道你当时看起来没用,但你实际上是英雄。”这能防止机器人放弃那些需要时间才能见效的动作。

  3. “如果……会怎样?”测试(反事实信用/Counterfactual Credit): 这是最神奇的部分。有时,机器人做出的动作非常令人困惑。它是有帮助吗?是有害吗?TCPO 会运行一个快速的“如果……会怎样?”模拟。它会问:“如果机器人当时做了完全不同的事情,情况会更好吗?”如果机器人的实际动作比随机的替代方案更好,它就会获得额外的信用。如果它更差,则会受到惩罚。这有助于机器人在最令人困惑的时刻进行学习,而不浪费时间在简单的时刻。

研究人员在三个非常不同的挑战上测试了这个新教练:解决数学问题、编写计算机代码,以及玩一个复杂的智能体游戏 AppWorld。他们使用了不同规模的机器人大脑(模型)来观察 TCPO 是否在所有地方都有效。

结果令人印象深刻。在数学和编程任务中,TCPO 不仅帮助机器人更频繁地得到正确答案,而且至关重要的是,它能以更少的步骤找到答案。例如,在一项名为 MATH-500 的难题测试中,经过 TCPO 训练的机器人正确率达到了 86.8%,击败了之前的最佳方法。在代码生成方面,它也取得了显著进步。在 AppWorld 游戏中,机器人需要使用工具并记住状态,TCPO 帮助它比其他方法更可靠地完成任务。

论文指出,秘诀不在于拥有更多的数据或更大的机器人,而在于你如何解读反馈。通过仔细地将分数转化为智能的、逐回合的信用,TCPO 帮助机器人学习修复错误、保持成功,并识别出何时一个看似糟糕的动作实际上是通往胜利的天才布局。它将一个简单的计分板变成了一份详细的教学计划,使学习过程更加高效且有效。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →