← 最新论文
🤖 AI

Where Rollouts Begin: Low-Load, High-Leverage First-Token Diversification for RLVR

该论文介绍了 REFT,这是一种轻量级方法,通过多样化推理标记后的首个 token 来拓宽 rollout 探索,从而在不改变核心训练流程的情况下提升模型在不同规模和难度水平下的性能,以此改进可验证奖励强化学习(RLVR)。

原作者: Soeun Kim, Albert No

发布于 2026-05-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Soeun Kim, Albert No

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

几乎总是相同的。

  • 类比:想象一下,你让一群学生解一道数学题。尽管他们都很聪明,但他们都会本能地以“首先,让我们……"或“要解决这个问题……"开头。
  • 问题所在:机器人对这些开场白过于自信,几乎从不尝试以“让我们……"、“鉴于……"或“起初……"开头。它陷入了死胡同,反复重复相同的开场短语。

作者们发现了一个令人惊讶的事实:第一个词实际上并不会改变数学结果。

  • 类比:这就像一名旅客选择乘坐红色、蓝色或绿色的公交车前往同一个城市。公交车的颜色(即第一个词)并不会改变目的地或车内的行驶路线。然而,如果你只让机器人乘坐红色公交车,你就永远无法看到蓝色或绿色公交车是什么样子。
  • 发现:尽管机器人认为“红色公交车”(最常见的第一个词)是最佳选择,但“蓝色”和“绿色”公交车(较少见的第一个词)同样有可能导向正确答案。机器人只是对公交车的颜色过于挑剔了。

解决方案:REFT(通过首词多样化进行展开探索)

作者们提出了一种简单的修复方法,称为REFT。它不再让机器人自然地选择第一个词(这通常会导致选择同一个词),而是强制机器人刻意尝试几种不同的开场词。

  • 工作原理

    1. 机器人查看其最喜爱的前 20 个开场词。
    2. REFT 从该列表中挑选 4 个不同的词(例如:“首先”、“让我们”、“鉴于”、“起初”)。
    3. 随后,它让机器人沿着 4 条不同的路径前进,每条路径对应一个开场词。
    4. 一旦确定了第一个词,机器人就会像往常一样继续解决其余的问题。
  • 类比:想象一位教练告诉一支跑步团队:“与其所有人都用同一首热身曲开始,不如让四个小组分别用四首不同的歌曲开始。”音乐响起后,他们都会跑同一场比赛。教练并没有改变比赛本身;他们只是确保团队探索不同的起步氛围,看看其中是否有一种能带来更好的终点表现。

为何这很重要

该论文表明,通过强制机器人尝试这些不同的“开场白”,它能在不增加计算能力或改变训练背后复杂数学原理的情况下,发现更多正确的解决方案。

  • 更好的结果:机器人在解决数学问题方面表现更佳(通过其一次尝试、八次尝试或六十四次尝试中答对的频率来衡量)。
  • 无额外成本:训练时间并未延长。事实上,由于机器人更快地找到了正确答案,它有时甚至能稍微更快地完成任务。
  • 避免“全错”群体:有时,整个尝试群体都会失败,因为它们都始于同一种“错误”的思维模式。通过多样化起步,REFT 确保至少有一个群体能找到正确的路径。

总结

该论文认为,在人工智能推理中,我们往往关注思维过程中间的多样性(即那些困难的数学步骤)。但作者们发现,第一个词实际上是一个“低负荷、高杠杆”的关键点。改变它很容易(毕竟只是一个词),但它对人工智能所探索的解决方案多样性有着巨大的影响。只需打乱第一个词,人工智能就能成为更出色的问题解决者。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →