← 最新论文
🤖 machine learning

Dropout-GRPO: Variational Stochasticity for Continuous Latent Reasoning

该论文提出了 Dropout-GRPO,这是一种引入结构化 Dropout 的方法,旨在为连续潜性推理模型(continuous latent-reasoning models)生成必要的轨迹方差,从而实现有效的组相对策略优化(Group Relative Policy Optimization),并展示了在 GSM8K 上的性能提升。

原作者: Wooil Jung

发布于 2026-06-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Wooil Jung

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

DROPOUT-GRPO 论文解析:使用简单语言与创意类比

核心问题:“机器人克隆”困境

想象一下,你正在试图教一个机器人解决数学题。你有一种特殊的训练方法叫做 GRPO(组相对策略优化)。

通常 GRPO 是如何工作的:
想象一位老师在向一个由 32 名学生组成的班级提问,让他们解决同一个数学问题。

  1. 每位学生尝试独立解决问题。
  2. 因为每个人的思考方式不同,他们会采取不同的路径。有些人会犯错,有些人会做对。
  3. 老师观察全班的平均分数。
  4. 如果某个学生的表现优于平均水平,他们会获得“做得好”的奖励;如果表现低于平均水平,则会受到“再试一次”的惩罚。
  5. 这种对比有助于整个班级更快地学习,因为每个人都能看到自己与同伴相比处于什么位置。

“潜性推理”(Latent Reasoning)模型的缺陷:
这篇论文关注的是一种新型 AI(例如 COCONUT),这类 AI 不会用文字“大声思考”。相反,它在一种隐藏的、连续的“大脑状态”中进行思考(就像一段秘密的内部代码)。

  • 问题在于: 如果你要求这种特定的 AI 解决同一个问题 32 次,它表现得就像一个完美的机器人克隆体。因为它的内部思考过程是确定性的(在数学上是固定的),所以这 32 个“学生”每次都会产生完全相同的答案。
  • 结果: 老师(GRPO)观察班级,发现所有人的得分都完全一样,并计算出“平均分”。由于每个人都是完全相同的,任何学生与平均值之间的差异都为
  • 崩溃: 当差异为零时,老师就无法告诉学生该如何改进。学习过程陷入停滞。这就像试图驾驶一辆没有方向盘的汽车;你无法左转或右转,因为系统认为你已经处于完美中心了。

解决方案:“共享掩码”技巧

作者 Wooil Jung 意识到,他们需要引入一些“混乱”或随机性,让这 32 名学生表现得各不相同,但他们不能直接随机改变 AI 的大脑(因为那会破坏数学逻辑)。

他们使用了一个被称为结构化 Dropout 的聪明技巧。

类比:“共享墨镜”
想象 AI 正通过一副墨镜在观察数学题。

  1. 设置: 对于 3 2 名学生(rollouts)中的每一位,老师都递给他们一副不同的墨镜。
  2. 掩码(Mask): 这些墨镜的镜片上有随机的孔洞(这就是“dropout”)。有些学生的孔洞在数字上,而有些学生的孔洞在运算符上。
  3. 规则: 一旦学生戴上墨镜,他们在解决问题的整个过程中都会一直戴着。他们不会在中途摘下或更换墨镜。
  4. 效果: 因为学生 A 是通过一副“有孔”的眼镜看问题,而学生 B 是通过另一副不同的“有孔”眼镜看问题,所以他们看到的题目版本略有不同。他们采取了不同的路径,并得到了不同的结果。
  5. 学习: 现在,老师终于能看到谁的表现比平均水平更好。 “做得好”和“再试一次”的信号重新回归,AI 开始学习了。

“重放”(Replay)的秘密:
这里有一个细节。为了正确地教导 AI,老师需要知道学生在得到答案时究竟看到了什么。

  • 论文指出:“我们保存了每个学生所使用的墨镜(掩码)的具体模式。”
  • 随后,当老师更新学生的脑部参数时,他们会将同样的墨镜重新戴回学生身上。这确保了老师是在针对他们之前看到的那个精确的思考过程进行评分,只是此时大脑已略有更新。这保持了数学上的诚实,并防止了混乱。

为什么这很重要

  1. 它解锁了一种新型 AI: 在此之前,你无法在这类“沉默思考者”AI 模型上使用这种强大的组学习方法(GRPO),因为它们太完美且太容易预测了。这种方法恰到好处地打破了那种完美,从而实现了学习。
  2. 它行之有效: 作者在 GSM8K 数学数据集上进行了测试。
    • AI 最初的分数是 27.29%
    • 使用了这个“共享墨镜”技巧后,分数上升到了 29.01%
    • 它还解决了一个问题,即 AI 在训练过程中实际上变得更差了;新方法帮助它找回了失去的技能。
  3. 它在理论上是成立的: 论文从数学上证明了这不仅仅是运气好。通过将“墨镜”视为采样 AI 大脑不同版本的一种方式,该方法在统计学上是有效且高效的。

一句话总结

这篇论文解决了一个问题:由于 AI 模型过于完美而无法相互学习,通过给每个“克隆体”一副独特的、临时的“遮眼布”(dropout 掩码),使他们看到的世界各不相同,从而让组学习算法终于找到了提升它们的方法。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →