← 最新论文
🤖 AI

RREDCoT: Segment-Level Reward Redistribution for Reasoning Models

本文介绍了 RREDCoT,这是一种利用推理模型本身来近似思维链(Chain-of-Thought)轨迹的最优分段级奖励重分配的新方法,从而解决了强化学习微调中传统蒙特卡洛信用分配存在的高方差和计算低效问题。

原作者: Mykyta Ielanskyi, Kajetan Schweighofer, Lukas Aichberger, Sepp Hochreiter

发布于 2026-06-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Mykyta Ielanskyi, Kajetan Schweighofer, Lukas Aichberger, Sepp Hochreiter

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是关于 RREDCoT 论文的解释,采用了通俗易懂的语言和富有创意的类比。

核心问题:推理过程中的“黑盒”现象

想象你正在教一名学生解决一道非常困难的数学题。学生在写出最终答案之前,会写下一长串逐步的思考过程(即“思维链”,Chain of Thought)。

在目前的 AI 训练方法中,老师只在最后时刻给出反馈。

  • 学生: 写了 50 页的思考过程,在第 10 页犯了一个错误,但随后继续写了下去,并最终在第 50 页猜对了答案。
  • 老师: 说:“做得好!你答对了。”
  • 结果: 学生心想:“哇,我第 10 页的那个错误居然还有用!”或者“我不知道这 50 页里到底哪一部分才是真正有用的。”

这就是所谓的延迟奖励问题(delayed reward problem)。因为 AI 不知道究竟是哪些具体的想法导致了成功,所以它的学习过程既缓慢又低效。这就像学开车,你只有在停好车后才会得到一个“做得好”或“做得差”的信号,却完全不知道自己是转弯太早了,还是刹车踩晚了。

解决方案:RREDCoT(“回溯与重新分配”工具)

作者创造了一种名为 RREDCoT(用于思维链的奖励重新分配,Reward REDistribution for Chain of Thoughts)的新方法。

把 RREDCoT 想象成一位聪明的编辑,他正在审阅学生那 50 页的草稿。这位编辑不仅仅是给最终答案打分,还会回到过去,为每一个段落分配一个“分数”。

  • 第 1-5 段: “开场不错,但并不关键。”(低分)
  • 第 10 段: “这里走错了路,但你又绕回来了。”(负分)
  • 第 25 段: “这是解开谜题的关键洞察!”(高分)
  • 第 50 段: “正确答案。”(加分)

通过将功劳(或责任)归于具体的思考环节,AI 能更快地学会哪些想法才是真正有用的。

它如何运作(无需数学公式)

论文解释说,以往的方法尝试过两种解决方式,但两者都存在缺陷:

  1. “猜谜游戏”(蒙特卡洛采样/Monte Carlo Sampling): 让 AI 将同一个问题生成 100 次,看看哪些步骤通常能导向成功。这种方法很准确,但极其耗时(就像为了找出最佳路线而把马拉松跑了 100 遍)。
  2. “责备游戏”(归因/Attribution): 通过观察 AI 内部的“注意力”机制来猜测哪些部分很重要。论文指出,这种方法往往具有误导性,因为它观察的是 AI 看向了哪里,而不是 什么才是真正起作用的

RREDCoT 的妙招:
RREDCoT 并没有让 AI 多跑 100 次,也没有盲目猜测,而是利用 AI 自身的知识来估算每一步的价值。

  • 它观察“参考解法”(正确路径)。
  • 它会问:“如果我采取了这特定的某一步,我会离正确答案更近多少?”
  • 它使用了一种巧妙的数学捷径(灵感来自我们预测句子中下一个词的方式)来即时计算这一点,而不需要生成 100 个额外的故事版本。

“混合分割”(切蛋糕)

为了实现这一点,AI 需要知道一个“想法”在哪里结束,另一个又在哪里开始。你不能仅仅观察每一个字母(token),因为那样数据量太大了。

  • 论文的想法: 他们使用了一种“混合分割”(Hybrid Segmentation)策略。想象在切一个长长的蛋糕:
    • 首先,他们在明显的地点切开(比如新的段落,或者像“等等”、“因此”之类的关键词)。
    • 然后,他们观察文本的“困惑度”(entropy)。如果 AI 对接下来要写什么感到非常不确定,那么那里就是一个很好的切蛋糕位置。
    • 这样就创造出了逻辑性的“块”(chunks),便于进行评分。

研究发现(结果)

研究人员在数学问题(如 AIME 和 MATH 数据集)上测试了该方法。

  • 学习更快: 使用 RREDCoT 的模型比使用标准方法(GRPO)的模型学得更好、更快。
  • 效率更高: 即使在 AI 生成极长的思维链(高达 25,000 个 token)时,它们也能获得更好的结果。
  • 无需额外模型: 不同于其他需要第二个“裁判”AI 来评分的方法,RREDCoT 使用主 AI 自身来进行评分,节省了时间和资源。

局限性(不足之处)

论文诚实地指出了该方法可能面临的挑战:

  1. 你需要标准答案: RREDCoT 在你已经掌握正确解题路径(或至少有一个良好的提示)时效果最好。如果你试图解决一个解法未知或“正确路径”模糊的问题,这种方法就帮不上什么忙。
  2. 成本略高: 它比标准方法大约需要多出 1.5 到 2 倍的计算能力,但作者认为,考虑到它带来的学习速度提升,这是一个公平的权衡。

总结

RREDCoT 是一种训练 AI 更好思考的新方法。它不再是等到最后才说“做得好”,而是将思考过程分解成小的块,并告诉 AI 哪些想法是有帮助的,哪些是干扰项。它做到了快速且高效,使得 AI 能够比以前更快地掌握复杂的推理技能。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →