← 最新论文
🤖 machine learning

On the Implicit Reward Overfitting and the Low-rank Dynamics in RLVR

本文揭示,具有可验证奖励的强化学习(RLVR)表现出隐式奖励过拟合,并通过低秩动态运作,其中增强的推理能力集中于秩-1 分量,这些分量优化特定的重尾奇异谱,同时舍弃其他模型知识。

原作者: Hao Ye, Jisheng Dang, Junfeng Fang, Bimei Wang, Yizhou Zhang, Ning Lv, Wencan Zhang, Hong Peng, Bin Hu, Tat-Seng Chua

发布于 2026-05-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Hao Ye, Jisheng Dang, Junfeng Fang, Bimei Wang, Yizhou Zhang, Ning Lv, Wencan Zhang, Hong Peng, Bin Hu, Tat-Seng Chua

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是论文《关于 RLVR 中的隐式奖励过拟合与低秩动力学》的解释,已转化为通俗易懂的语言并辅以富有创意的类比。

宏观图景:强化学习的“魔法”

想象你有一位非常聪明的学生(大型语言模型),他擅长许多领域,但在解决复杂的数学谜题方面表现不佳。你决定采用一种名为**可验证奖励强化学习(RLVR)**的特殊训练方法。这就好比一位严格的教练,每当学生答对一道数学题,就奖励他一颗金星。

经过训练后,这位学生变成了数学天才。但本文的研究人员提出了一个棘手的问题:这位学生究竟是真正掌握了新的逻辑,还是仅仅学会了如何“钻教练评分系统的空子”?

1. “单音”天才(秩 1 主导)

研究人员发现了一个令人惊讶的事实:几乎所有的“数学天才”提升,都发生在大脑的极小一部分中。

  • 类比:想象学生的脑内是一座拥有数百万本书的巨型图书馆。当他擅长数学时,并不是因为他读了更多的书,而是因为他找到了一个特定的、神奇的书签(称为“秩 1 分量”),能瞬间指向正确答案。
  • 发现:如果你将训练好的模型中除了那个“神奇书签”以外的所有内容都丢弃,该模型在数学上的表现依然与完整训练版本一样出色。其余的“大脑更新”(那数百万页内容)似乎对数学技能几乎没有贡献。

2. “假装直到成功”的问题(隐式奖励过拟合)

这里是反直觉的部分。研究人员设计了一种训练方法,强迫学生只保留那个“神奇书签”,并在每几步之后丢弃其余的更新。

  • 结果:学生在训练测试(教练提供的练习题)上的得分下降了。教练很不高兴,因为学生在练习中拿到的金星变少了。
  • 转折:然而,当学生参加期末考试(一套从未见过的新题目)时,他们的表现与那些保留了所有额外更新的学生一样好。
  • 含义:学生通常学到的那些“额外更新”实际上是噪声。这是学生在试图死记硬背特定的练习题以获取更多金星,而不是学习真正的逻辑。研究人员将这种现象称为**“隐式奖励过拟合”**。模型只是在训练数据上“伪装”出高分,而实际上并没有变得更聪明。

3. “安全网”(为什么我们需要其余部分)

如果那些“额外更新”对数学来说只是噪声,为什么要保留它们?研究人员发现,这些额外更新实际上是学生的个性和常识

  • 类比:如果你剥离掉“额外更新”,只保留“数学书签”,学生就会变成数学天才,但会失去遵循指令、保持安全或了解世界基本事实的能力。
  • 发现:“秩 1"部分用于推理。“非秩 1"部分用于安全性、世界知识和遵循规则。如果你丢弃它们,模型可能会完美地解决数学问题,但开始说粗鲁的话,或者忘记如何与人类交流。

4. 学习的形状(重尾分布)

研究人员使用一种名为 SVD 的数学工具(将复杂数据分解为简单的线)来观察模型大脑中变化的“形状”。

  • 模式:他们发现了一个一致的规律:一个巨大的尖峰(数学书签),后面跟着一长串缓慢衰减的微小变化。
  • 隐喻:想象一片山脉。那里有一座高耸、尖锐的山峰(数学推理)。在它后面,是一片漫长、起伏的山坡(安全与知识)。山峰让模型成为数学巫师,但山坡让模型保持脚踏实地和安全。

5. “单行道”(几何不对称性)

最后,论文解释了模型是如何学习这一点的。他们发现学习过程是失衡的。

  • 类比:想象模型是一家工厂。
    • 输出(答案):工厂学会非常轻松地改变最终产品(答案)。这就像有一条传送带,可以快速调整以包装正确的物品。这是数学的“左侧”,它与“秩 1"书签完美对齐。
    • 输入(问题):工厂很难改变它阅读 incoming 问题的方式。问题是混乱且复杂的。模型无法用一个简单的“书签”轻易地重组它理解输入的方式。
  • 结论:RLVR 主要关于优化输出(模型如何选择正确答案),而不是从根本上重写模型理解世界的方式。这就像教学生在考试中猜出正确答案,而不一定教他们如何更好地阅读题目。

总结

这篇论文告诉我们,当 AI 模型通过强化学习在数学上变得“更聪明”时:

  1. 大部分魔法都集中在一个微小的、一维的“书签”(秩 1)中。
  2. 其余的训练往往只是死记硬背练习题(过拟合),并未为期末考试增加真正的价值。
  3. 我们需要那些“噪声”(非秩 1 部分)来保持模型的安全性和知识储备,即使它们对数学没有帮助。
  4. 模型正在学习输出更好的答案,而不一定是为了更好地理解输入。

研究人员建议,通过理解这一点,我们可以更高效地训练模型,专注于利用“书签”进行推理,同时保护“山坡”以维持安全性和知识。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →