← 最新论文
🤖 machine learning

Distributional Biases in Post-Training: A Markovian Analysis of Reasoning Trajectories

本文通过将推理建模为马尔可夫转移,解决了后训练阶段探索的悖论,在理论上证明了诸如 RLVR 以及 ORM/PRM 等标准方法会使模型偏向高概率路径并遗忘稀有的推理步骤,同时论证了诸如实例拒绝和 KL 正则化等探索策略有助于保留这些关键轨迹。

原作者: Dake Bu, Wei Huang, Andi Han, Atsushi Nitanda, Bo Xue, Qingfu Zhang, Hau-San Wong, Taiji Suzuki

发布于 2026-06-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Dake Bu, Wei Huang, Andi Han, Atsushi Nitanda, Bo Xue, Qingfu Zhang, Hau-San Wong, Taiji Suzuki

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心观点:“聪明但固执”的学生

想象一位非常聪明的学生(基础模型),他读遍了图书馆里的每一本书,博学多才。然而,当你给他一道特定的、棘手的数学难题时,他有时会卡住或犯错。

为了解决这个问题,老师们使用后训练(例如带有可验证奖励的强化学习,即 RLVR)。这就像是给学生考试,检查答案,然后说:“答对了就做得好!下次继续保持。”

问题所在: 本文指出,这种“练习”往往会适得其反。学生并没有学会新的解题方法,反而变得痴迷于他们已经掌握的最简单的方法。如果一个问题需要一种巧妙且罕见的技巧,学生会因为忙于练习那些通常奏效的简单、常见方法而忘记了这种技巧。

作者将这种现象称为**“挤压效应”(Squeezing Effect)**。这就像挤压海绵:你虽然挤出了所有的水,但也把海绵的形状给挤扁了。模型在处理常见任务时变得非常出色,但失去了处理罕见、困难任务的能力。


类比:推理的迷宫

为了理解为什么会发生这种情况,作者将推理想象成一个巨大的树状迷宫

  • 起点: 你在入口处(问题)。
  • 路径: 你可以采取的通往出口(答案)的路径有很多条。
  • 易行路径(高概率): 这些是宽阔、铺设好的高速公路。大多数人都会走这些路。它们适用于大多数问题。
  • 难行路径(低概率): 这些是狭窄、杂草丛生的林间小径。很少有人走这些路。但对于特定的棘手问题,这些是唯一能通向正确答案的路径。

1. 预训练:发现地图

在学生开始练习之前,他们在迷宫中进行探索。他们发现了高速公路,也发现了隐藏的小径。他们知道这张地图的存在。

2. 后训练:“挤压”

当老师开始为正确答案给予奖励时,学生看着地图心想:“嘿,高速公路又宽又好走,而且我通常都能做对。我就一直走高速公路好了。”

论文从数学上证明了标准的训练方法(如 RLVRPPORAFT)就像磁铁一样。它们将学生的注意力完全吸引到了高速公路上。

  • 结果: 学生成为了高速公路上的大师。但如果某个特定问题只有通过隐藏小径才能解决,学生就会忘记如何找到它。他们在难题面前折戟沉沙。

3. “一致性”陷阱 (ORM/PRM)

论文还研究了另一种方法,即使用一个“评分器”(神经网络)在学生思考的过程中对其步骤进行评判。

  • 陷阱: 评分器倾向于一致性。它喜欢看到重复出现的步骤,因为那是通常奏效的做法。它会对“高速公路”上的步骤给出高分,而对“隐藏小径”上的步骤给出低分,即便隐藏小径是解决当前问题的唯一途径。
  • 结果: 学生在还没到达隐藏小径之前,就被引导离开了那条路。

解决方案:如何保持学生的灵活性

论文不仅指出了问题,还提出了理论上的解决方案,以防止学生忘记那些困难的路径。

方案 A:拒绝简单问题 (RL-rej)

想象老师说:“如果你能用简单的快速公路解决这个问题,我不想看到它。我只想看到你在高速公路失效时解决问题的样子。”

  • 运作方式: 通过拒绝奖励那些容易获得的成功,老师迫使学生去探索隐藏的小径。
  • 论文的观点: 这迫使模型在学习罕见、困难路径的同时,不会忘记它们。

方案 B:“温度”旋钮 (KL Regularization)

想象学生有点过于急于留在高速公路上。老师增加了一个“温度”旋钮(KL 正则化)。

  • 运作方式: 这个旋钮告诉学生:“不要对自己太自信。保留一点你最初的好奇心。” 它防止学生 100% 地专注于高速公路,确保他们仍然记得隐藏小径的存在。
  • 论文的观点: 这保持了模型的“多任务”能力,使其在专注于某一类问题时,不会忘记解决其他类型问题的方法。

方案 C:“Doob h-变换” (DPRM)

这是针对“评分器”方法的一种更高级的数学技巧。

  • 类比: 评分器不再仅仅观察当前的步骤,而是观察路径的整个未来。它会计算:“如果我现在走这条狭窄的小径,我到达目标的概率是多少?”
  • 论文的观点: 这种方法(称为 DPRM)在数学上等同于一种“软性”的选择最佳答案的过程。它允许模型保持隐藏小径的开放性和可及性,而不是将其压碎。

结论

论文用数学证明了一个简单的真理:如果你只奖励“容易”的思考方式,你最终会忘记“困难”的思考方式。

  • 标准训练: 使模型成为简单任务的专家,但在困难、罕见的任务面前表现糟糕。
  • 解决方法: 你必须主动防止模型过度专注于简单的事情。你可以通过忽略容易的胜利、增加保持多样性的“温度”,或者使用更聪明的评分方法来识别并重视罕见路径的潜力

作者强调,虽然他们的数学推导是基于一个简化的“玩具模型”(一个理论上的迷宫),但这解释了当今大型 AI 模型中观察到的现实世界行为:为什么它们有时会“卡”在简单的模式上,从而无法找到解决困难问题所需的巧妙且罕见的解决方案。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →