← 最新论文
💬 NLP

Exploration vs Exploitation: Rethinking RLVR through Clipping, Entropy, and Spurious Reward

本文通过证明伪奖励并非通过直接对齐,而是通过诱导降低策略熵度的裁剪偏差(clipping bias)来提升性能,从而阐明了该框架中探索与利用的截然不同的角色,进而研究了带有可验证奖励的强化学习(RLVR)在增强大语言模型推理能力方面的悖论式成功。

原作者: Peter Chen, Xiaopeng Li, Ziniu Li, Wotao Yin, Xi Chen, Tianyi Lin

发布于 2026-01-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Peter Chen, Xiaopeng Li, Ziniu Li, Wotao Yin, Xi Chen, Tianyi Lin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个非常聪明但有点困惑的学生(一个大语言模型)如何解决复杂的数学问题。你希望通过让他们尝试不同的解决方案并获取反馈来进行教学。这就是**带有可验证奖励的强化学习(RLVR)**的核心。

通常情况下,老师只在最后给出“是”或“否”的反馈:“你得到正确答案了吗?”如果是,太棒了;如果不是,再试一次。

这篇论文研究了一个奇怪的现象:如果老师不再给出真实的反馈,而是通过抛硬币来决定答案是正确还是错误,会发生什么?令人惊讶的是,在某些情况下,尽管老师在撒谎,学生竟然变得更擅长数学了。作者深入挖掘了为什么会发生这种情况,并重点研究了三个角色:裁剪(Clipping)熵(Entropy)伪奖励(Spurious Rewards)

以下是他们研究结果的简单类比拆解:

1. “抛硬币”老师(伪奖励)

在正常的课堂上,老师会奖励正确的答案。但在这次实验中,老师抛硬币。正面 = “做得好!”(奖励),反面 = “再试一次”(无奖励),无论数学题实际是否正确。

  • 悖论: 逻辑告诉我们,这应该会让学生感到困惑并变得更差。但论文发现,对于更强、更聪明的学生来说,这种随机噪声实际上帮助他们提高了分数。对于较弱的学生来说,这只会让他们感到困惑和不稳定。
  • 教训: 关键不在于奖励的“真实性”。关键在于学生对噪声的反应。如果学生已经很优秀,噪声就像是一个温柔的推动,帮助他们集中注意力。如果学生正在挣扎,噪声只会淹没他们。

2. “减速带”(裁剪)

在训练过程中,有一个叫做**裁剪(Clipping)**的安全机制。想象一下学生正在飞快奔跑。如果他们试图在一步之内过于剧烈地改变答案,老师会设置一个“减速带”(即裁剪)来阻止他们过度反应。

  • 旧观点: 人们认为这个减速带是让学生变聪明的“英雄”,因为它放大了好的答案。
  • 论文的发现: 作者通过计算发现,这个减速带实际上是一个微小的、几乎看不见的凸起。它并不能提供主要的学习信号。它太小了,不足以成为学生进步的原因。
  • 减速带的真正职责: 它的真正作用是防止学生惊慌失措。如果没有它,学生可能会做出巨大的、疯狂的逻辑跳跃,从而导致“大脑崩溃”(梯度爆炸)。裁剪让训练保持稳定,但它并不教数学。

3. “信心计”(熵)

**熵(Entropy)**是一个高级词汇,指的是“学生有多不确定”。

  • 高熵: 学生在瞎猜。“也许是5,也许是10,也许是个香蕉。”(高探索性)。
  • 低熵: 学生非常有信心。“它肯定就是5。”(高利用性)。

通常在学习过程中,你需要一种平衡:既要探索,也要利用已知的知识。但在这次数学训练中,论文发现,**降低学生的信心(降低熵)**往往能带来更好的分数。

  • 联系: “减速带”(裁剪)在无意中充当了一个信心提升器。通过阻止学生进行剧烈的波动,它迫使他们更贴近当前更有信心的答案。
  • 代价: 拥有信心并不总是好事。
    • 如果学生已经很聪明且题目很简单,变得更有信心有助于他们锁定正确答案。
    • 如果学生很弱或者题目很难,强迫他们变得有信心只会让他们固执己见(错得离谱)。他们会停止探索新想法,并陷入错误的习惯中。

大局观:到底发生了什么?

这篇论文解开了一个谜团:为什么向学生撒谎(随机奖励)有时反而会让他们变得更聪明?

  1. 不是因为谎言本身: 随机的硬币投掷并不能教数学。
  2. 不是因为减速带: 裁剪机制太小了,不足以作为主要的老师。
  3. 而是关于“信心锁定”: 随机噪声和减速带的结合,迫使学生变得更加确定性(减少随机性,增加信心)。
    • 对于优秀的学生,这种“信心锁定”帮助他们停止自我怀疑,并坚持正确的路径。
    • 对于较弱的学生,这种锁定将他们困在了错误之中,导致表现变差。

一句话总结

论文揭示了在 AI 数学训练中,“随机噪声”之所以能帮助强大的模型,并不是因为噪声本身有用,而是因为训练规则(裁剪)在无意中迫使模型停止猜测并开始变得自信且具有确定性,而这只有在模型本身已经足够聪明且能得出正确答案时才有效。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →