← 最新论文
💬 NLP

A Relative-Budget Theory for Reinforcement Learning with Verifiable Rewards in Large Language Model Reasoning

本文针对大语言模型推理中的强化学习提出了一种相对预算理论,定义了一个控制匮乏、平衡及充足状态下样本效率的关键量 ξ\xi,并从经验上验证了在 1.5 到 2.0 之间的相对预算能使学习性能最大化。

原作者: Akifumi Wachi, Hirota Kinoshita, Shokichi Takakura, Rei Higuchi, Taiji Suzuki

发布于 2026-02-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Akifumi Wachi, Hirota Kinoshita, Shokichi Takakura, Rei Higuchi, Taiji Suzuki

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心思想:AI 思考的“金发姑娘”区(适中区间)

想象一下,你正在教一名学生(AI)如何解决一道很难的数学题。你给他的时间或“Token”(词元/字数)是有限的,他必须利用这些资源来思考并写下答案。

这篇论文引入了一个简单的规则,叫做相对预算 (ξ\xi)。你可以把它理解为一个比例,比较的是你给学生的时间学生通常解决该问题所需的时间之间的关系。

  • ξ\xi (Xi) = (你给的时间) / (学生通常需要的时间)。

作者发现,AI 的学习效果完全取决于这个比例。存在三个截然不同的“区域”或“机制”,AI 在每个区域的表现都大不相同。


三种学习区域

1. “太紧”区域(匮乏机制,ξ0\xi \approx 0

类比: 想象你给学生 10 分钟去解决一道通常需要 100 分钟才能解出的题目。

  • 发生的情况: 学生几乎永远无法完成任务。他们在找到答案之前就用尽了时间。
  • 结果: 老师(AI 训练系统)几乎拿不到任何可以用来学习的“正确”范例。因为 AI 很少看到成功案例,它无法学习任何东西。这就像试图通过把一个人扔进一个连底都摸不到的泳池里来教他游泳;他只会感到恐慌并沉下去。
  • 论文观点: 在这个区域,学习在理论上是不可能的,因为“信息丰富的轨迹”(成功的尝试)过于稀缺。

2. “刚刚好”区域(平衡机制,ξ1.52.0\xi \approx 1.5 - 2.0

类比: 现在,你给学生大约 1.5 到 2 倍于他通常需要的时间。

  • 发生的情况: 学生有足够的时间来解决问题,但任务仍然具有挑战性。有时他们解题很快;有时则会挣扎并耗尽全部时间。
  • 结果: 这是黄金分割点。老师看到了轻松获胜和艰苦胜利的结合。这种多样性创造了强大的“学习信号”。AI 可以清晰地看到哪些做法有效,哪些无效。
  • 论文观点: 这是强化学习(RL)效率最高的阶段。AI 在这里学习得最快。有趣的是,对于另一种方法——“监督微调”(SFT)来说,这反而是最难的区域,因为解决方案的多样性会让这种简单的“模仿型老师”感到困惑。

3. “太容易”区域(充裕机制,ξ\xi \to \infty

类比: 你给学生 100 个小时去解决一个只需要 10 分钟就能搞定的问题。

  • 发生的情况: 学生每次都能几乎瞬间解决问题。他们拥有大量的额外时间,以至于这项任务显得微不足道。
  • 结果: AI 确实在学习,但效率不高。由于学生总是能立即成功,因此缺乏可以学习的“挣扎”或变化。AI 的进步会停滞,因为它已经对这项任务过于精通了。这就像让一位国际象棋大师去解一道 5 岁小孩都能解开的谜题;他不会通过做这种题来提高棋艺。
  • 论文观点: 学习保持稳定,但“边际收益”(每步带来的进步)变得越来越小。你是在浪费计算资源。

“相变”现象

论文描述了在相对预算为 1.0 左右发生的相变

  • 低于 1.0:AI 处于黑暗之中,极少看到成功。
  • 高于 1.0:AI 突然开始看到成功,学习爆发式增长。
  • 巅峰值: 作者发现,当预算略高于平均需求,特别是处于 1.5 到 2.0 之间时,表现达到最佳。这给了 AI 足够的“活动空间”去探索不同的解题路径,而不会浪费时间。

这对 AI 训练意味着什么

论文指出,目前许多人正在浪费金钱和计算能力。

  • 如果你给 AI 的时间太少,它学不到任何东西。
  • 如果你给它的时间太多,它的学习速度会变慢,并浪费资源。
  • 解决方案: 你应该调整你的计算预算,使 AI 拥有的 Token 数大约是它通常解决问题所需数量的 1.5 到 2 倍。这能确保 AI 既受到足够的挑战以进行学习,又不至于因为挑战过大而失败。

关于“模仿”与“试错”的说明

论文还对比了两种教学风格:

  1. 监督微调 (SFT): 像是一个学生在照抄老师的每一个步骤。论文指出,这种方法在“刚刚好”区域会失效,因为解题方式太多样化,会导致学生感到混乱。
  2. 强化学习 (RL): 像是一个学生尝试不同的方法,并在得到正确答案时获得一个“对勾”。这种方法在“刚刚好”区域表现出色,因为它能够处理这种多样性并找到最佳路径。

总结

要获得 AI 最好的推理能力,不要仅仅向它投入无限的计算能力。相反,要找到那个**“金发姑娘”预算**:给 AI 刚好多出一点点的时间(大约是它通常所需时间的 50% 到 100%)来解决问题。这能为它创造一个既能快速学习、又能高效学习的完美环境。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →