← 最新论文
🤖 machine learning

Not only where, But when: Temporal Scheduling for RLVR

本文介绍了用于可验证奖励强化学习(RLVR)的“时序调度”方法,该方法在训练过程中动态调整信用分配标准,以在转向通用优化之前优先强化特定的策略行为,从而在保持策略熵的同时实现更稳定且高效的学习动态。

原作者: Jinghao Zhang, Ruilin Li, Feng Zhao, Jiaqi Wang

发布于 2026-05-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Jinghao Zhang, Ruilin Li, Feng Zhao, Jiaqi Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在训练一位非常聪明的学生(即人工智能)来解决复杂的数学问题。在旧的方法(称为RLVR)中,你只在学生写完文章的最后给予一次评分。如果他们得了"A",你就告诉他们:“干得漂亮!”然后他们就会努力记住写下的每一个字,以确保下次也能拿到"A"。

问题在于,学生写了成千上万个字。其中一些是至关重要的“顿悟”时刻,他们正是在这些时刻理清了逻辑。而另一些则只是填充词,比如“然后”、“因此”或“总之”。旧方法将每个字视为同等重要,这就像因为学生写了“的”字就给予金星星,其奖励程度与解出实际方程一样。

旧方法:静态聚光灯

之前的研究人员试图通过使用“聚光灯”来解决这个问题。他们构建了工具来确定哪些字是重要的(比如逻辑步骤),并在训练过程中对这些字投射更亮的光。这被称为信用分配

然而,该论文指出这种方法存在一个缺陷:聚光灯从不移动。一旦工具决定“第 500 个字很重要”,它就会从第一天到最后一天,在整个训练期间持续照射第 500 个字。这就像一位教练只对着四分卫大喊大叫,而忽视球队的其他成员,即使四分卫已经掌握了他们的角色并需要关注其他事情。这种僵化的关注最终会阻碍学生进一步进步。

新想法:动态时间表(时间调度)

作者提出了一个新想法:重要的不仅仅是你在哪里投射光线,还有你何时投射光线。

他们建议将训练过程视为一部电影剧本,而不是一张静态照片。

  • 电影早期(训练初期): 学生刚刚开始。他们需要学习如何搭建场景(即“推理脚手架”)。论文建议首先将训练重点放在学生答案的末尾,因为那是最可靠的部分(即最终答案)。
  • 电影后期(训练后期): 一旦学生擅长完成答案,你就慢慢将焦点向后推移到文章的开头。现在,你训练他们从一开始就构建更好的论证和逻辑。

这被称为时间调度。你拥有的不再是一盏静态的聚光灯,而是一位随着场景推进而改变镜头焦点的导演。

“轨迹百分位”技巧

他们如何知道应该关注文章的哪一部分?他们使用了一个简单的技巧,称为轨迹百分位

想象学生的答案是一条 100 米的跑道。

  • 第 95 百分位是终点线(即最终答案)。
  • 第 50 百分位是赛程的中段(即推理过程)。
  • 第 5 百分位是起跑线(即引言)。

论文发现,如果你最初只训练学生答案中“终点线”的部分,然后逐渐扩展训练范围以包含“中段”,最后包含“起点”,学生就能学得更快、更稳定。这就像学习开车:你首先掌握停车(即最终目标),然后在直路上驾驶,最后才驾驭复杂的十字路口(即思维过程的开始)。

实验中发生了什么?

研究人员在大型 AI 模型(如 Qwen)上测试了这种方法,使用了数学和推理谜题。

  1. 更高的分数: 使用这种“调度”方法的模型在数学测试(如 AIME 和 HMMT)以及通用推理测试中的得分高于标准模型。
  2. 更健康的学習: 他们发现,旧有的僵化方法会让 AI“恐慌”并丧失创造力(称为)。AI 会变得过于僵化,停止探索解决问题的新方法。而新的“调度”方法保持了 AI 学习过程的健康和灵活性,使其能够持续进步而不会陷入停滞。
  3. 与旧工具兼容: 这种新的调度方法即使与旧的“聚光灯”工具结合使用也有效。这就像在现有的教练层之上增加了一层新的指导。

核心结论

该论文声称,为了让 AI 更聪明,我们不应仅仅决定哪些字需要训练;我们需要决定何时训练它们。通过从答案中最可靠的部分开始,然后慢慢向后推进到复杂的推理部分,AI 能更高效地学习,保持更具创造力,并取得更好的结果。这将僵化、一刀切的训练课程转变为动态、时机恰当的辅导课程。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →