← 最新论文
🤖 AI

Reference-Sampled Boltzmann Projection for KL-Regularized RLVR: Target-Matched Weighted SFT, Finite One-Shot Gaps, and Policy Mirror Descent

本文介绍了参考采样玻尔兹曼投影(BOLT),该方法推导出一种独特的、提示归一化的加权监督微调目标,以精确匹配KL正则化的RLVR目标策略,从而消除在线 rollout 瓶颈,同时提供有限的单次分析,阐明静态训练的局限性与刷新采样的优势。

原作者: Yao Shu, Chenxing Wei, Hongbin Lin, Shuang Qiu, Hui Xiong

发布于 2026-05-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Yao Shu, Chenxing Wei, Hongbin Lin, Shuang Qiu, Hui Xiong

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一名学生(一个 AI 模型)如何解决高难度的数学问题。你有一位非常严格的老师(一个“验证器”),他能瞬间判断答案是对是错,但这位老师不会解释为什么是对的,只是给出一个分数。

这篇论文解决了一个具体问题:我们如何利用这些分数来教导学生,而无需在每次更新学生“大脑”时都生成新的练习题?

以下是用简单类比对论文核心思想的拆解:

1. 旧方法:“实时”训练循环

目前,大多数先进的 AI 训练工作就像一场现场烹饪比赛

  • 厨师(AI)做出一道菜(生成一个答案)。
  • 评委(验证器)品尝并给出分数。
  • 厨师根据该分数立即调整食谱。
  • 然后,厨师做一道菜,评委再次品尝,如此循环往复。

问题所在: 这极其昂贵且缓慢。每当厨师学到一点东西,他就必须回到厨房,购买新鲜食材,重新烹饪,仅仅为了获得下一课。而“厨房”(计算能力)就是瓶颈。

2. 提出的捷径:“冻结菜单”

论文提出了一种不同的方法:对厨房拍一张快照。

  • 与其现场烹饪,不如让厨师用当前的食谱一次性烹饪 100 道菜。
  • 让评委给这 100 道菜全部打分。
  • 我们将这份菜肴和分数的列表“冻结”下来。
  • 现在,我们可以在这份静态列表上反复训练厨师,而无需再次回到厨房。

潜在陷阱: 如果你只是在这份列表上进行训练,你必须决定对每道菜投入多少注意力

  • 错误做法: “这道菜得了 10 分,所以我们要比那道得 1 分的菜多研究 10 次。”
  • 论文的洞见: 这种简单的数学行不通。这份菜肴列表是由厨师的食谱生成的。如果旧食谱很少做出“完美”菜肴,那么无论你怎么研究,你的列表里都不会有它们。

3. 核心发现:“完美食谱”(Boltzmann 投影)

作者发现了精确的数学公式,用于对这些“冻结菜肴”进行加权,使学生能够学到与在昂贵的“现场”比赛中所学到的相同内容。

他们将其称为BOLT(Boltzmann-Targeted SFT,基于玻尔兹曼目标的监督微调)。

可以这样理解:

  • 想象“完美食谱”是一张描绘应该在哪里找到最佳菜肴的地图。
  • “冻结菜单”是一张描绘菜肴实际所在位置的地图。
  • 论文证明,为了让“冻结菜单”传授“完美食谱”,你不能只看分数。你必须为每道菜计算一个特殊权重
  • 这个权重基于:这道菜比平均水平好多少,并根据其原本出现的稀有程度进行调整。

如果厨师很少做出完美菜肴,但评委给了高分,这个公式会说:“这道菜是稀世珍宝!我们必须 intensely 研究它。”如果厨师很容易就做出了完美菜肴,公式则会说:“我们以前见过这个;按正常程度研究即可。”

4. “单次”限制:缺失的食材

论文还解释了一个硬性限制。

  • 类比: 想象你正在教厨师制作“金龙蛋糕”。
  • 如果厨师的旧食谱从未做出过金龙蛋糕(哪怕是糟糕的),而你只有一份包含 1000 份普通蛋糕的冻结菜单,你就无法教他们制作金龙蛋糕。
  • 无论多么努力地研究这份冻结菜单,如果食材(数据)不存在,就无法创造出金龙蛋糕。
  • 教训: 你无法通过更努力地学习来修复缺失的食材。你必须回到厨房,先尝试制作金龙蛋糕(这被称为“刷新采样器”)。

5. “刷新”策略:迭代学习

如果厨师差点做出了金龙蛋糕怎么办?

  • 论文提出了一种称为迭代 BOLT的策略。
  • 第一步: 在冻结菜单上训练。厨师变得稍微好了一点。
  • 第二步: 让这位厨师去烹饪一批菜肴。
  • 第三步: 冻结这批新菜肴并再次训练。
  • 为何有效: 因为厨师现在更强了,他们在新批次中更有可能偶然做出“金龙蛋糕”。通过重复这个循环,厨师可以逐步学会制作这道不可能的菜肴,一步一个脚印。

6. 结果:更快、更智能

作者在数学和编程问题(如 GSM8K 和 HumanEval)上测试了这种方法。

  • 速度: 由于他们将“烹饪”(生成答案)和“评分”移出了主训练循环,他们节省了巨大的时间和计算机内存(在某些测试中快达 85%)。
  • 准确性: 通过使用他们特殊的"BOLT"权重,而不是仅仅使用原始分数,AI 的学习效果优于仅使用原始分数的方法。
  • “饱和”点: 他们表明,如果你只是在同一份冻结列表上持续训练,AI 最终会停止进步(撞上天花板)。但如果你“刷新”列表(回到厨房获取新批次),AI 就会跃升至新的性能水平。

总结

这篇论文提供了一份高效 AI 训练的蓝图。它指出:

  1. 不要只训练“好”答案;要训练那些根据特定公式加权的 answers,该公式考虑了找到它们的难度。
  2. 你无法学习未曾采样过的内容;如果你的数据中没有答案,再多的训练也无法创造出它。
  3. 要学习困难的事物,你需要定期回去,基于当前的技能生成数据,然后重新训练。

它将一个缓慢、昂贵、实时反馈的循环,转变为一个快速、高效的两步过程:生成一次,正确加权,深度学习。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →