How Fast Should a Model Commit to Supervision? Training Reasoning Models on the Tsallis Loss Continuum
本文引入了一种在强化学习与密度估计之间进行插值的 Tsallis 损失连续体,以解决推理模型中的冷启动停滞问题,并提出了两种实用估计器(GARL 和 PAFT),它们通过在低成功概率下的逃逸速度与训练稳定性之间取得平衡,在复杂推理基准测试中显著优于 GRPO 等标准方法。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教导一位非常聪明但目前极度困惑的学生去解决复杂的谜题。这位学生有一个笔记本,可以在写下最终答案之前,在上面草拟他们的思路(即“思维链”)。
你分享的这篇论文探讨了一个具体问题:当这位学生从零开始时,你该如何教导他?
问题:“冷启动”停滞
当学生完全是新手时,他们几乎不可能立即给出正确答案。
- 旧方法(RLVR/GRPO): 这种方法就像一位严厉的老师,仅根据最终答案给出“做得好!”或“再试一次”的反馈。如果学生连续 99 次答错,他们就得不到任何“做得好”的信号。老师一直在等待奇迹,但学生却陷入了失败的循环。论文将这种现象称为**“冷启动停滞”**。
- 陷阱: 如果你试图强迫学生从他们仅有的几次答对经历中过于激进地学习,他们可能会开始死记硬背老师的错误,或者死记硬背测试题的具体怪癖(称为“噪声记忆”)。
解决方案:“承诺”旋钮
作者引入了一类基于Tsallis 损失这一数学概念的新教学方法。你可以将其想象为一个标有**“承诺”**(用字母 q 表示)的旋钮。
这个旋钮控制着老师是更关心学生当前的理解水平,还是更倾向于推动学生从任何尝试中学习,哪怕是一次混乱的尝试。
将旋钮调至 0(“安全”模式):
- 类比: 老师非常谨慎。只有当学生已经在做他们熟悉的事情时,老师才会关注学生。
- 结果: 老师忽略了那些混乱的、错误的尝试。这有助于避免混淆(噪声),但如果学生从零知识开始,老师就永远不会给他们推动力。学生将永远停滞不前。
- 论文观点: 这种方法太慢,无法摆脱“冷启动”。
将旋钮调至 1(“激进”模式):
- 类比: 老师极其热情。他们对待每一次尝试,哪怕是糟糕透顶的尝试,都视为宝贵的学习机会。他们放大学生偶尔答对时的信号,大声喊道:“看!你做到了!从中学习!”
- 结果: 学生在开始时学习得极快。他们能迅速摆脱“冷启动”。
- 风险: 因为老师太“大声”了,学生可能会开始死记硬背老师自己的错误,或者死记硬背问题的具体措辞,而不是学习实际的逻辑。
将旋钮调至 0.75(“甜蜜点”):
- 类比: 老师处于平衡状态。他们足够“大声”,能将学生推出起跑线(摆脱冷启动),但又不会大到用噪声淹没信号。
- 论文观点: 这种设置允许模型在初期快速学习,而不会立即撞上困惑的墙壁。
转动旋钮的两种方式:GARL 和 PAFT
由于数学计算过于复杂,无法完美求解,作者构建了两种实用工具(估计器)来转动这个旋钮。你可以将它们视为使用同一旋钮的两种不同教学风格。
GARL(“广播者”):
- 工作原理: 老师从学生那里生成许多随机的“思路”(轨迹)。即使大多数是错误的,老师也会审视那少数正确的,并根据旋钮设置放大它们的重要性。
- 优点: 速度非常快,非常适合在学生陷入停滞(冷启动)时推动他们起步。
- 缺点: 有时,老师会变得过于兴奋,混入坏例子,导致学生在训练后期感到困惑或崩溃(不稳定)。
PAFT(“过滤器”):
- 工作原理: 老师生成许多思路,然后进行过滤。他们丢弃那些混乱、错误的思路,只保留那些实际上与正确答案匹配的。然后,他们仅使用这些“好”样本来教导学生,但会根据旋钮减弱强度。
- 优点: 非常稳定。学生从清晰、连贯的示例中学习。它不会崩溃。
- 缺点: 启动较慢,因为它丢弃了太多数据。
实验中发生了什么?
作者在三个困难的推理谜题(FinQA、HotPotQA 和 MuSiQue)上测试了这种方法。
当学生完全迷失时(冷启动):
- 旧方法(旋钮在 0)完全失败。学生从未学会任何东西。
- 带有高旋钮设置(0.75)的“广播者”(GARL)力挽狂澜。它将学生推出了其他方法失败时的起跑线。
- 有趣的是,旋钮为 0.75 的“广播者”表现优于旋钮为 1 的“激进”模式,证明即使在开始时,少量的噪声过滤也是有益的。
当学生已经在学习时(暖启动):
- 在某些谜题(FinQA)上,低旋钮设置下的“广播者”(GARL)表现良好。
- 在更难的谜题(HotPotQA、MuSiQue)上,“广播者”变得过于兴奋,导致学生的表现崩溃至零。
- 在这里,“过滤器”(PAFT)成为了英雄。尽管它速度较慢,但它保持了学生的稳定性,并取得了最高的最终分数。
主要启示
论文认为,训练推理模型并没有一种“完美”的方法。
- 如果你的模型停滞在零,你需要高承诺(使用高旋钮设置的 GARL)来迫使其学习。
- 如果你的模型正在学习但不稳定,你需要稳定性(PAFT)来保持其正轨。
作者创建了一个“连续体”(平滑的滑动刻度),让你能够动态地调整这种平衡,而不必在“安全但缓慢”或“快速但风险高”之间做出选择。他们发现,中间设置(约 0.75)通常能提供两全其美的效果:快得足以摆脱起步阶段,又稳得足以完成比赛。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。