The Invisible Leash: Why RLVR May or May Not Escape Its Origin
本文通过实证研究表明,尽管具有可验证奖励的强化学习(RLVR)显著提高了大语言模型的精度,但由于其受支持集约束的优化过程收窄了模型的解空间,导致其往往会忽略原本基础模型可以获取的正确答案,因此最终未能扩大推理边界。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
大局观:“隐形的牵引绳”
想象你有一个非常有天赋的学生(基座模型),他读过大量的书籍,掌握了丰富的知识。他能解决数学问题,但有时会卡住,或者给出一个略显混乱的答案。
为了让他变得更好,你引入了一位严厉的教练(RLVR 系统)。这位教练并不教学生全新的学科,而是观察学生解决问题的过程。每当学生给出了完全正确的答案时,教练就会给他一个击掌作为奖励(正向反馈);如果答案错了,教练就会温柔地提醒他“再试一次”。
这篇论文提出了一个至关重要的问题:这种教练训练真的教会了学生“新的思考方式”,还是仅仅训练他们以更高的自信度去重复那些他们原本就已经知道的特定答案?
作者将这种现象称为**“隐形的牵引绳”**。他们发现,虽然学生在拿到“第一个正确答案”的能力上有了很大提升,但他们实际上仍然被束缚在最初那套有限的思想集合中。他们无法轻易地跳过围栏,去发现那些他们原本并未察觉到的全新解决方案。
核心发现详解
1. “支持集”陷阱:保留旧地图
把学生的知识想象成一张城市地图。 “基座模型”拥有一张显示通往目的地之各种可能路径的地图,其中也包括一些偏僻、蜿蜒的小径。
- RLVR 在做什么: 它看着地图说:“嘿,这条路线完美!让我们用黄金铺设它,并让它成为我们行驶的唯一道路。”
- 结果: 学生在这条铺设好的道路上变得极其快速且准确。然而,他们开始遗忘原始地图上那些其他有效的、蜿蜒的小径。
- 论文的发现: 在几乎所有的测试(数学、逻辑、编程)中,经过 RLVR 训练的模型保留了它们原本已知的“好”答案(约 93–99%),但却失去了获取其他原本基座模型可以找到的正确答案的能力。它们并没有在地图上增加新的道路,只是将交通流量收窄到了单车道。
2. “精准度 vs. 多样性”的权衡
想象你正在湖中钓鱼。
- 基座模型 撒开了一张大网。它捕捉到了一些大鱼,但也捕捉到了一些不同种类的小鱼。它可能有点乱,但它能找到那里存在的所有东西。
- RLVR 模型 使用的是一柄长矛。它极其精准。如果它看到一条鱼,它每次都能刺中。但因为过于专注于击中目标,它不再像那样广撒网。
症结所在: 如果你只需要一条鱼(一个正确答案),长矛(RLVR)更好。但如果你需要在一个大桶里捕捉任何鱼(尝试多次以寻找解法),宽大的网(基座模型)其实更好,因为它覆盖的面更广。论文发现,虽然 RLVR 在第一次尝试时表现出色,但如果你给基座模型很多次尝试的机会,它往往会胜出。
3. “混乱噪声”的错觉
有时,经过 RLVR 训练的学生看起来像是思考得更深入了。他们可能会停顿更久,说更多的词,或者在说话时显得更加“不确定”(这被称为Token 级熵)。
- 类比: 想象一位厨师在非常响亮且混乱地切菜。看起来他似乎在尝试新的烹饪技巧。
- 现实: 尽管伴随着这些噪声,他其实仍在制作那原本就有的三种菜肴。他并没有发明新食谱,只是把旧食谱做得更有戏剧性了。
- 论文的发现: 尽管模型在每一步的表达上听起来更具“不确定性”,但它们最终收敛到的最终答案集合却小得多。它们的最终多样性反而降低了。
4. 何时它真的学到了新东西?
论文确实发现了两个极少数的例外,在这些场景下 RLVR 模型确实找到了新的解决方案。这仅发生在两种特定情况下:
- 重新组合拼图碎片: 学生已经知道了单个拼图碎片(子技能),但无法将它们正确地组合在一起。教练帮助他们把这些碎片拼合在了一起。
- 修正格式: 学生知道答案,但不知道如何按照教练要求的特定格式写下来。教练教会了他们格式规则,从而释放了原本就隐藏在那里的答案。
在这些案例中,模型并不是在发现一个“新的宇宙”,而是在打磨那些原本就隐藏在初始知识阴影中的内容。
结论:打破牵引绳
论文得出结论:目前的 RLVR 方法更像是一种精密工具,而非创造力引擎。它们非常擅长精炼和完善模型已知的内容,但它们被“拴”在了基座模型的初始分布之中。它们无法轻易发现那些基座模型概率为零的解决方案。
要真正扩展模型的推理能力——让它去发现从未见过的东西——我们需要在其中加入一些新的东西:显式的探索(Explicit Exploration)。我们需要刻意将概率质量推向解空间的“黑暗角落”,而不是仅仅通过锐化已知亮点处的焦点来工作。
简而言之: RLVR 让模型成为了已知思想的更佳执行者,但不一定让它成为新思想的更佳思考者。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。