← 最新论文
💬 NLP

Rethinking RL for LLM Reasoning: It's Sparse Policy Selection, Not Capability Learning

本文认为,强化学习提升大语言模型推理能力并非通过传授新能力,而是通过在熵值较高的决策点实施稀疏且可预测的修正,从而催生了 ReasonMaxxer——一种无需强化学习的高效方法,其以极低的训练成本实现了与完整强化学习相当的性能。

原作者: Ömer Faruk Akgül, Rajgopal Kannan, Willie Neiswanger, Viktor Prasanna

发布于 2026-05-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Ömer Faruk Akgül, Rajgopal Kannan, Willie Neiswanger, Viktor Prasanna

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用简单语言和创意类比对论文《REASONMAXXER:令人尴尬的廉价后训练》的解释。

核心理念:模型早已知晓答案

想象你有一位非常聪明的学生(基础模型)正在参加数学考试。这位学生大多数时候其实知道正确答案,但他有点优柔寡断。当他遇到棘手的步骤时,可能会犹豫,并在两三条可能的路径之间抛硬币决定。

长期以来,研究人员认为**强化学习(RL)*就像一位超级严厉教练,教会学生新的*解题方法,从零开始发明全新的策略。

这篇论文认为这是错误的。

作者发现,这位“教练”(RL)并没有教给学生新把戏。相反,教练只是在低语:“嘿,当你在第 5 步犹豫时,你选错了路径。只需选择你原本就在考虑的次优选项即可。”

学生早已知道正确答案;他们只是需要一个微小的推动来下定决心。

发现:关键在于“分岔路口”

研究人员仔细查看了 AI 通过强化学习时计算机内部发生的具体过程。他们发现了三个令人惊讶的事实:

  1. 极其罕见: RL 教练只改变学生想法的约 1% 到 3% 的步骤。在 97% 的考试过程中,学生完全按照自己原本想做的去做。
  2. 总是“安全”的更改: 教练从未告诉学生去选择一个他们从未考虑过的疯狂、怪异的答案。他们只告诉学生切换到学生原本就在考虑的第二或第三优选项
  3. 仅发生在“分岔路口”时刻: 这些更改仅发生在学生感到困惑(高“熵”)时。如果学生很自信,教练保持沉默。如果学生不确定,教练就会指出正确的分岔路口。

类比:
想象你正驾驶一辆车行驶在熟悉的道路上。你完全清楚路线。

  • 基础模型就是正在开车的你。
  • RL 教练就是 GPS。
  • 旧观点: 我们曾以为 GPS 是在教你驾驶一辆你从未见过的车。
  • 新观点: GPS 只是在说:“你正处在一个令人困惑的十字路口。你原本打算左转,但应该右转。”你本来就知道如何右转;你只是需要被提醒一下。

问题:教练太昂贵了

目前,训练这些“教练”(RL)就像雇佣一支庞大的工程师团队来监视学生参加考试,模拟数百万种场景,并计算复杂的数学公式,只为找出那个微小的推动。这需要数千美元的成本和数周的计算机运行时间。

这篇论文问道:如果教练只是在我们已有的地图上指出几个特定位置,我们还需要整个昂贵的教练团队吗?

解决方案:REASONMAXXER(“智能推动”)

作者构建了一种新的、超级廉价的方法,称为 REASONMAXXER。它不使用庞大的教练,而是使用一个微小、廉价的工具。

以下是其工作原理,分步说明:

  1. 寻找困惑: 系统查看学生(基础模型)自己的思考过程。它会问:“你在哪里感到困惑?”它使用一种简单的数学技巧,称为熵(Entropy),来找出学生不确定的“分岔路口”时刻。
  2. 对比推动: 它选取几个学生答对的例子和几个答错的例子。然后它说:“在这些困惑时刻,当你答对时,你选择了这条路径。当你答错时,你选择了那条路径。记住要选择前者。”
  3. 微小更改: 它只更新模型大脑中极微小的部分(少于 1% 的参数)来记住这个规则。

结果:同样的智能,极低的成本

这篇论文在六个不同的数学基准测试中,将这种新方法与昂贵的标准 RL 教练进行了对比测试。

  • 性能: REASONMAXXER 的表现与昂贵的 RL 模型一样好,甚至更好。
  • 成本: 这是最大的震撼。
    • 标准 RL: 训练成本在 200 美元到 100,000 美元 之间。
    • REASONMAXXER: 训练成本约为 4 美元到 25 美元
    • 时间: 它在单张计算机显卡上只需几分钟,而 RL 则需要数天或数周。

结论

这篇论文总结道,利用大规模、昂贵的强化学习来教授 AI 推理能力的行业趋势可能有些杀鸡用牛刀了。

“推理”并不是我们正在解锁的新超能力;它只是在 AI 不确定时,帮助其坚定选择正确选项的问题。

我们不需要一支庞大的建筑队来建造一栋已经基本建好的房子;我们只需要一名 handyman(杂工)在关键时刻拧紧几颗松动的螺丝。REASONMAXXER 就是这名杂工,而且它只需花费几分钱就能完成工作。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →