← 最新论文
🤖 machine learning

Learning-Zone Energy: Online Data Selection for Efficient RL Post-Training

本文介绍了学习区能量(LZE),这是一种在线数据选择框架,通过动态将计算资源集中于模型主动学习前沿内的提示,优化大语言模型的强化学习后训练,从而在显著降低数据用量和训练成本的同时实现更优的数学推理性能。

原作者: Peng Cui, Boyao Yang, Jun Zhu

发布于 2026-05-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Peng Cui, Boyao Yang, Jun Zhu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你是一位老师,试图帮助全班学生学会解决数学问题。过去,标准方法(如 GRPO 和 DAPO 等 AI 模型所采用的)是给予每一位学生完全相同的关注度和练习时间,无论他们已经是专家还是完全跟不上。

  • 问题所在:老师浪费时间在那些已经完美掌握答案的学生身上(他们并不需要帮助),同时也浪费时间在试图教导那些远远落后、尚无法理解课程的学生身上。而“中间”学生——那些正在挣扎但恰好处于即将领悟边缘的学生——才是真正学得最多的群体,但他们却得到了与其他人完全相同的通用对待。

  • 解决方案(LZE):这篇名为《学习区能量》(Learning-Zone Energy,简称 LZE)的论文作者提出了一种更聪明的课堂管理方式。他们创建了一个系统,如同一个动态聚光灯,持续扫描教室,寻找处于“学习区”的学生。

“聚光灯”如何运作

该系统为 AI 尝试的每道数学题计算一个“学习区能量分数”。它利用三个简单信号来决定谁获得聚光灯的聚焦:

  1. 难度锚点(“难”的过滤器)
    想象一个一直是数学天才的学生。即使他们今天在某道题上 stumbled(犯错),系统也会记得他们通常很优秀,不会浪费精力将他们当作初学者对待。反之,系统也会记住哪些题目一直是不可能的。这防止了系统因暂时的偶然性而陷入混乱。

  2. 不确定性仪表("50/50"的最佳区间)
    这是最重要的部分。系统寻找 AI 正在猜测的问题。

    • 如果 AI 100% 正确?忽略它。(太简单)。
    • 如果 AI 100% 错误?忽略它。(太难)。
    • 如果 AI 大约一半时间正确?**聚焦于此!**这就是“学习区”。这正是大脑正在拓展和学习的时刻。系统给予这些问题最高的能量分数。
  3. 动量追踪器(“进步”信号)
    有时学生卡在中间,但实际上并没有进步;他们只是停滞不前。系统会检查:“这位学生相比昨天是否真的在进步?”如果他们确实在进步,系统会给予额外关注;如果他们只是在原地打转,系统就会转向其他目标。

两步策略

该论文描述了一个巧妙的两步流程,旨在节省时间和金钱(计算资源):

  1. 向后过滤器(选择作业)
    在训练的每一步,系统会为所有问题生成答案以检查分数。然后,它只挑选**前 40%**的问题(即处于学习区的问题)用于实际更新 AI 的“大脑”。它丢弃了该特定课程中其余的“作业”。

  2. 向前修剪器(跳过简单内容)
    如果一个问题连续几天都被完美解决,系统会将其放入“跳过列表”。它会完全停止为该问题生成答案以节省时间。不过,它会偶尔进行回查(“重放”),以确保 AI 没有忘记如何解决它。

结果

作者在各种 AI 模型(从 15 亿参数的小模型到 80 亿参数的大模型)上,使用 GSM8K 和 MATH 等数学数据集测试了该方法。

  • 效率:通过只关注那 40% 有意义的问题,他们将总计算工作量(FLOPs)减少了约36%
  • 速度:AI 学得更快。在某些情况下,它达到相同性能水平所需的时间比标准方法少了1.6 倍
  • 更智能的 AI:AI 不仅变得更快,而且在解决从未见过的新类型问题上也表现更佳(分布外提升)。例如,在非常困难的数学竞赛(AIME25)中,提升幅度巨大(+45.9%)。

核心结论

将 LZE 想象成一位聪明的教练,不再将时间浪费在职业选手的热身或初学者的讲座上。相反,他们将 100% 的精力集中在运动员“挣扎得恰到好处从而变得更强”的那个“区”内。这使得训练过程更快、更便宜,并造就了一个更聪明的 AI。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →