想象你是一位老师,试图帮助全班学生学会解决数学问题。过去,标准方法(如 GRPO 和 DAPO 等 AI 模型所采用的)是给予每一位学生完全相同的关注度和练习时间,无论他们已经是专家还是完全跟不上。
问题所在:老师浪费时间在那些已经完美掌握答案的学生身上(他们并不需要帮助),同时也浪费时间在试图教导那些远远落后、尚无法理解课程的学生身上。而“中间”学生——那些正在挣扎但恰好处于即将领悟边缘的学生——才是真正学得最多的群体,但他们却得到了与其他人完全相同的通用对待。
解决方案(LZE):这篇名为《学习区能量》(Learning-Zone Energy,简称 LZE)的论文作者提出了一种更聪明的课堂管理方式。他们创建了一个系统,如同一个动态聚光灯,持续扫描教室,寻找处于“学习区”的学生。
“聚光灯”如何运作
该系统为 AI 尝试的每道数学题计算一个“学习区能量分数”。它利用三个简单信号来决定谁获得聚光灯的聚焦:
难度锚点(“难”的过滤器):
想象一个一直是数学天才的学生。即使他们今天在某道题上 stumbled(犯错),系统也会记得他们通常很优秀,不会浪费精力将他们当作初学者对待。反之,系统也会记住哪些题目一直是不可能的。这防止了系统因暂时的偶然性而陷入混乱。
不确定性仪表("50/50"的最佳区间):
这是最重要的部分。系统寻找 AI 正在猜测的问题。
- 如果 AI 100% 正确?忽略它。(太简单)。
- 如果 AI 100% 错误?忽略它。(太难)。
- 如果 AI 大约一半时间正确?**聚焦于此!**这就是“学习区”。这正是大脑正在拓展和学习的时刻。系统给予这些问题最高的能量分数。
动量追踪器(“进步”信号):
有时学生卡在中间,但实际上并没有进步;他们只是停滞不前。系统会检查:“这位学生相比昨天是否真的在进步?”如果他们确实在进步,系统会给予额外关注;如果他们只是在原地打转,系统就会转向其他目标。
两步策略
该论文描述了一个巧妙的两步流程,旨在节省时间和金钱(计算资源):
向后过滤器(选择作业):
在训练的每一步,系统会为所有问题生成答案以检查分数。然后,它只挑选**前 40%**的问题(即处于学习区的问题)用于实际更新 AI 的“大脑”。它丢弃了该特定课程中其余的“作业”。
向前修剪器(跳过简单内容):
如果一个问题连续几天都被完美解决,系统会将其放入“跳过列表”。它会完全停止为该问题生成答案以节省时间。不过,它会偶尔进行回查(“重放”),以确保 AI 没有忘记如何解决它。
结果
作者在各种 AI 模型(从 15 亿参数的小模型到 80 亿参数的大模型)上,使用 GSM8K 和 MATH 等数学数据集测试了该方法。
- 效率:通过只关注那 40% 有意义的问题,他们将总计算工作量(FLOPs)减少了约36%。
- 速度:AI 学得更快。在某些情况下,它达到相同性能水平所需的时间比标准方法少了1.6 倍。
- 更智能的 AI:AI 不仅变得更快,而且在解决从未见过的新类型问题上也表现更佳(分布外提升)。例如,在非常困难的数学竞赛(AIME25)中,提升幅度巨大(+45.9%)。
核心结论
将 LZE 想象成一位聪明的教练,不再将时间浪费在职业选手的热身或初学者的讲座上。相反,他们将 100% 的精力集中在运动员“挣扎得恰到好处从而变得更强”的那个“区”内。这使得训练过程更快、更便宜,并造就了一个更聪明的 AI。
技术摘要:用于高效强化学习后训练的学习区能量(LZE)
1. 问题陈述
强化学习(RL)后训练已成为激发大语言模型(LLM)数学推理能力的主导范式,其利用了如组相对策略优化(GRPO)和 DAPO 等算法。然而,现有技术几乎均匀地将 rollout( rollout 生成)和梯度预算分配给所有提示。这种方法存在根本性的低效:
- 已掌握提示: 模型已能可靠解决的样本,由于优势项消失,贡献的学习信号微乎其微。
- 超出能力范围的提示: 远超模型当前能力的样本几乎不产生可操作的梯度信息。
- 低效性: 大量计算预算被浪费在这些“无信息”的组别上,而模型“学习区”(即结果混合且梯度最具信息量的区域)却未被充分利用。
现有的解决方案,如静态课程学习或基于全对或全错结果的二元在线拒绝(保留/丢弃),要么过于僵化,无法适应不断演变的策略,要么依赖昂贵的辅助模型(例如隐马尔可夫模型)来预测可解性。
2. 方法论:学习区能量(LZE)
作者提出了学习区能量(LZE),这是一个完全在线、轻量级的数据选择框架,将计算集中在模型的主动学习前沿。LZE 的核心是为每个训练步中的每个提示组计算的一个闭式学习区能量分数(Ei(t))。
能量分数
该分数将三个互补信号融合为一个标量:
Ei(t)=难度锚点Di(0)⋅结果不确定性4pi(t)(1−pi(t))⋅动量(1+αmi(t))
- 结果不确定性(4p(1−p)): 基于当前组的通过率 pi(t)。该项在 p=0.5 时达到峰值,在 p=0 或 p=1 时消失。它直接针对“学习区”,即模型既非持续失败也非持续成功的区域。理论上,该项与 GRPO 梯度估计量的方差一致。
- 难度锚点(Di(0)): 定义为 1−pi(0) 的固定先验,其中 pi(0) 是初始通过率。这防止课程学习坍缩到那些初始简单但因策略噪声暂时处于 p=0.5 附近的提示上,确保模型专注于历史上具有挑战性的问题。
- 通过率动量(pi(t)−μi(t−1)): 定义为 pi(t)−μi(t−1),其中 μ 是过去通过率的指数移动平均(EMA)。该项充当因果高通滤波器,放大策略正在积极改进的提示,并抑制学习停滞的提示。
训练算法
LZE 采用双阶段选择过程:
- 向后选择(Top-K): 在每一步,系统计算所有活跃提示的能量分数。它保留前 κ 比例(例如 40%)用于策略梯度更新。为了平衡探索,在排名前添加 Gumbel 噪声。
- 带重放的向前剪枝: 在 epoch 级别,连续 Tprune 个 epoch 达到 100% 正确率的提示被移至“剪枝池”,并在 rollout 生成期间跳过。定期地,一部分被剪枝的提示会被重新评估(重放),以检测并从遗忘中恢复。
3. 理论贡献
本文为设计选择提供了理论依据:
- 梯度信息量: 作者证明(定理 1),在标准固定基线近似下,提示的 GRPO 梯度估计量的方差大致与伯努利方差 p(1−p) 成正比。这证实了能量分数中的不确定性项是梯度信息量的主要驱动因素。
- 信号处理解释: 动量项被证明(命题 2)等同于应用于通过率序列的因果高通滤波器的输出,从数学上论证了其在捕捉快速策略变化中的作用。
- 注意力类比: 能量分数被解释为样本级别的注意力机制,其中难度锚点充当键(key),当前状态充当查询(query),分数充当注意力权重。
4. 实验结果
LZE 在 Qwen 系列模型(1.5B 到 8B)上进行了评估,数据集涵盖 GSM8K、MATH 和 DAPO-MATH,并在 AMC23 和 AIME25 上进行分布外(OOD)测试。
- 性能: 尽管每步仅使用40% 的训练数据,LZE 在所有配置中均匹配或超越了全数据基线。
- OOD 泛化: 该方法在 OOD 基准测试中产生了显著增益,特定模型/数据集组合在 AIME25 上提升了**+45.9%,在 AMC23 上提升了+18.2%**。
- 效率: 通过将反向传播限制在前 40% 的提示,同时为分数更新保持完整的 rollout 覆盖,LZE 实现了估计的36% 训练 FLOPs 减少。
- 挂钟时间: 该方法显著减少了训练时间,收敛速度比基线快 1.40 倍至 1.65 倍,当向前剪枝器激活时,速度进一步提升(高达 1.91 倍)。
- 消融研究: 移除不确定性项导致性能下降最大,验证了学习区假设。动量项对 OOD 泛化至关重要,而难度锚点防止选择坍缩到初始简单的提示上。
5. 意义与主张
本文主张 LZE 提供了一种原则性、轻量级且完全在线的解决方案,以解决 RL 后训练的低效问题。其意义在于:
- 消除辅助开销: 与之前需要学习生成状态模型或离线预处理的方案不同,LZE 使用无需额外模型的闭式分数。
- 动态适应: 它持续适应不断演变的策略,不同于静态课程方法。
- 理论对齐: 选择标准在数学上与策略梯度更新的预期幅度一致,确保计算资源被花费在能产生最高学习信号的地方。
- 可扩展性: 该方法兼容任何基于组的 RL 算法(如 GRPO、DAPO),且无需修改底层优化器,使其在不同模型规模上具有广泛的适用性。
作者指出,他们的实验目前仅限于具有二元可验证奖励的数学推理任务,向开放式或噪声奖励场景的迁移仍是未来工作的开放方向。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。