← 最新论文
🤖 machine learning

Weight-Space Geometry of Offline Reasoning Training

本文分析了六种在 Qwen3-4B 模型上进行的离线推理训练方法的权重空间几何结构,揭示了虽然 SFT、RFT 和 RIFT 收敛至近乎共线的更新且具有相似的准确率,但 DPO 采用了一个截然不同的、近乎正交的子空间,并在 GSM8K 和 AIME26 基准测试中取得了显著优越的性能,而 Offline GRPO 则在保持在 SFT 损失盆地内的同时引入了一个实质性的正交分量。

原作者: Aleksandr Nikolich, Igor Kiselev, Vladimir Platonov, Karina Romanova

发布于 2026-06-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Aleksandr Nikolich, Igor Kiselev, Vladimir Platonov, Karina Romanova

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个才华横溢、巨大的数学导师(“老师”),他能够解决复杂的难题。你想教一个更小、更便宜的学生(“学生”)如何像那位导师一样思考。你把老师的逐步解题过程(称为“轨迹/rollouts”)交给学生,并要求学生从中学习。

这篇论文提出了一个简单而深刻的问题:我们告诉学生如何学习的方式,真的重要吗?

研究人员使用了许多不同的“教学公式”(损失函数)。有人说:“只看正确答案。”有人说:“看所有的答案,但给好的答案额外的加分。”还有人说:“将好的答案与坏的答案进行比较。”

作者想知道:这些不同的公式会让学生的脑回路(计算机权重)发生相同的变化,还是会创造出完全不同类型的思考者?

以下是他们研究结果的拆解,使用了简单的类比:

1. “复印机”组 (SFT, RFT, RIFT)

类比: 想象三个试图模仿画作的学生。

  • 学生 A 复制每一条线。
  • 学生 B 只复制完美的线条。
  • 学生 C 复制每一条线,但把完美的线条画得稍微深一点。

发现: 尽管他们使用的规则略有不同,但他们最终画出的图像几乎完全一样。

  • 从数学上看,他们大脑的变化极其相似(97% 相似)。
  • 他们在数学测试上的得分也差不多(大约 87–88%)。
  • 结论: 如果你只是想让学生模仿老师的推理过程,那么使用这三种特定的公式中的任何一种其实并无大碍。它们实际上是在做同样的事情。

2. “自我调节者” (DFT)

类比: 这个学生使用的是和学生 A 相同的纸张,但他们有一个奇怪的习惯:当他们已经很有信心时,会自动把笔触变浅;当不确定时,则把笔触变深。

发现: 这个微小的调整显著改变了绘画的方向。这个学生的大脑变化方式与“复印机”组截然不同,尽管他们并没有使用任何“奖励”分数来引导。这是一个独特的路径,但并不一定能带来更高的分数。

3. “侧步走” (Offline GRPO)

类比: 这个学生看着老师的工作,但决定采取一个大的侧步。他们仍然留在同一个大致的区域(“损失盆地/loss basin”),但他们走的是一条不同的路径。

发现: 这种方法将学生的大脑推向了一个与“复印机”组有 67% 差异的方向。在脑部的后期层级(“最终思考”)中,这种差异增长到了近 86%。

  • 然而,他们的测试得分仍然相似(大约 87%)。
  • 结论: 这种方法探索了一个新的方向,但它似乎并没有在准确性方面解锁比“复印机”组更高的“超能力”。

4. “异类” (DPO)

类比: 当其他所有人都拿着同一张纸在同一个房间里画画时,这个学生是在完全不同的画布上,在不同的房间里,用完全不同的风格在画画。

发现:

  • 几何结构: 这个学生大脑的变化与其他人几乎是**垂直(正交)**的。他们在做一些本质上不同的事情。
  • 障碍: 如果你尝试将这个学生的大脑与“复印机”的大脑进行混合(线性插值),结果会崩溃。他们处于不同的“宇宙”中,拥有不同的解决方案。
  • 得分: 尽管如此不同,这个学生获得了最高的得分(数学 93.5%,难题 30%)。
  • 代价: 这个学生使用了 10 倍更小的学习率(他们采取了更小、更谨慎的步伐)。作者警告说,我们不能 100% 确定高分是因为公式本身,还是仅仅因为他们采取了更小、更精确的步伐。

5. “实时 vs 录制”的惊喜

论文还研究了学生是从实时练习中学习,还是从录制的练习中学习(Offline)。

  • 离线 (Offline): 当从一组固定的录制老师答案中学习时,“侧步走”的学生(Offline GRPO)与“复印机”保持在某种程度上的接近。
  • 在线 (Online): 当学生生成自己的练习题时(Online GRPO),他们变得与“复印机”组完全正交(完全不同)
  • 结论: “离线”方法之所以看起来与“复印机”相似,部分原因是它们都在盯着完全相同的固定老师答案。如果让他们生成自己的练习,他们会产生巨大的分歧。

总结

  • 大多数方法 (SFT, RFT, RIFT) 只是在以不同的方式表达“模仿老师”。它们导致了相似的大脑结构和相似的分数。
  • DPO 是异类。它构建了一个完全不同的脑结构。它获得了最高的得分,但它是通过一种非常特定、谨慎的训练风格(小学习率)实现的,这使得它与其他方法难以直接比较。
  • “离线”性质 的训练数据是导致许多这些方法看起来如此相似的主要原因。

这篇论文本质上绘制了这些学习方法的“地理图”,展示了哪些方法是邻居,而哪些方法则生活在不同的星球上。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →