← 最新论文
🤖 machine learning

Reward Granularity in RLVR: Comparing Process and Outcome Reward Structures for Mathematical Reasoning in Small Language Models

本文表明,对于在数学推理任务上进行 RLVR 训练的小语言模型而言,过程级奖励监督在准确率和推理轨迹保真度方面均显著优于仅结果级监督,且混合奖励结构通常受益于更高的过程权重。

原作者: Anagha Radhakrishna Palandye, Rebecca Glick, Osheen Kaul

发布于 2026-07-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Anagha Radhakrishna Palandye, Rebecca Glick, Osheen Kaul

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个非常年幼、充满求知欲的学生(一个小型的 AI 模型)如何解决数学应用题。你不仅希望他能得到正确答案,更希望他学会“如何思考”,而不仅仅是靠猜。

这篇论文就像是在比较两种不同的评分方式:只检查最终答案 versus 检查每一个解题步骤

以下是他们实验内容的简单拆解:

设置:这个“小脑袋”学生

研究人员使用了一个非常小的 AI 模型(称为 Qwen2.5-0.5B)。你可以把这个模型想象成一个聪明但瘦小的孩子,他的记忆力或脑力并不大。因为规模较小,如果指令不够清晰,他很容易感到困惑。

他们给这个学生布置了 1,319 道数学题(来自一个名为 GSM8K 的数据集)。他们使用了一种叫做“强化学习”的方法来训练这个学生,这基本上是一种奖励机制:答对了给“做得好!”,答错了说“再试一次”。

两种教学风格(奖励结构)

研究人员测试了五种不同的给予奖励的方式:

  1. “仅看结果”型教练(最终成绩单):

    • 运作方式: 老师只看方框里的最终数字。如果答案正确,学生就会得到一颗小星星;如果错误,则什么都没有。
    • 结果: 这个学生大约在 54% 的情况下答对了题目。
    • 问题: 学生开始“作弊”或瞎猜了。他们会直接跳到答案,跳过步骤,或者编造逻辑,只为了拿到那颗小星星。他们的推理过程很混乱,即使最终数字碰巧对了,逻辑也往往是错误的。
  2. “仅看过程”型教练(步步检查员):

    • 运作方式: 老师会检查学生写下的每一个步骤。他们加法算对了吗?他们定义变量了吗?如果某一步是对的,就给一分;如果某一步错了,就扣一分。
    • 结果: 这个学生答对题目的概率达到了 64%
    • 好处: 他们的思维变得更加逻辑化且有据可依。他们真的学会了如何解决问题。
    • 副作用: 这个学生变得有点啰嗦。他们有时会写太多步骤或重复自己,就像一个因为太害怕犯错而为了解 2+22+2 就写出一篇长篇大论的学生。
  3. “混合型”教练(混合两种风格):

    • 研究人员尝试将这两种风格混合在一起。他们给学生的评分既基于步骤,也结合了一点最终答案的权重(或反之亦然)。
    • 惊喜之处: 最好的组合是 90% 关注步骤,10% 关注最终答案。这个学生的表现几乎接近“仅看过程”的学生(准确率 61%),但他们的回答更简洁、更干净。
    • 警告: 当他们尝试一种 90% 关注最终答案,仅 10% 关注步骤 的混合方式时,学生的表现甚至比“仅看结果”的学生还要差。看来,当“最终答案”的奖励声过大时,会干扰学生,使“步步拆解”的指令变得毫无意义。

他们发现了什么?(类比)

把 AI 想象成一个正在尝试登顶高峰(正确答案)的徒步旅行者。

  • 仅看结果: 你告诉徒步者,“如果你到达了顶峰,你就能得到奖品。”徒步者可能会走捷径、从悬崖滑下或迷路,但如果他们靠运气撞到了顶峰,他们就赢了。他们并没有学会路径。
  • 仅看过程: 你告诉徒步者,“每当你沿着正确的路径迈出安全的一步,你就能得到一份零食。”徒步者学会了路径。他们可能会为了安全多走几步,但他们能可靠地到达目的地。
  • 混合型: 你为安全的步伐提供零食,但也为到达顶峰提供大奖。如果奖品相对于零食来说太大了,徒步者就会忽略路径,试图飞翔或跳跃,从而导致失败更多。

核心启示

论文的结论是:如何评分比你想象的更重要。

对于小型 AI 模型,仅仅奖励最终答案是不够的。这会产生“幻觉”(虚假逻辑),即模型为了得到正确的数字而编造步骤。为了让模型真正进行正确的思考,你必须大力奖励其过程(步骤)。

“仅看过程”的方法显著提高了模型的智能度和准确度,证明了对于“小脑袋”来说,展示解题过程与得到正确答案同样重要。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →