Provable Benefits of RLVR over SFT for Reasoning Models: Learning to Backtrack Efficiently
本文从理论上证明了,通过使模型能够高效地学习从死胡同中回溯,带有可验证奖励的强化学习(RLVR)在推理任务中的表现优于监督微调(SFT),从而实现了推理时计算成本的指数级降低。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在教一个机器人如何破解迷宫。这个迷宫有一个起点、一个分叉路口,然后是许多长长的、蜿蜒曲折的路径(分支)。只有一条路径通向宝藏(正确答案),其他的都是死胡同。
这篇论文比较了两种教机器人导航的方法:监督微调 (SFT) 和 带有可验证奖励的强化学习 (RLVR)。
两种老师
1. “完美向导”型老师 (SFT)
想象一位老师只给机器人看一段有人完美破解迷宫的视频。机器人看着向导从起点直奔宝藏,从未出错,从未回头,也从未走进死胡同。
- 结果: 机器人学会了完美地模仿向导。如果它处于正确的路径上,它知道该怎么走。
- 问题: 机器人从未见过走错路时会发生什么。它不知道在死胡同里该如何脱身。如果它不小心踏上了错误的路径,它会一直向前走直到撞到墙,然后变得困惑并漫无目的地徘徊,试图寻找出路。它不知道如何高效地“回溯”。
2. “试错型”老师 (RLVR)
想象一位老师让机器人自己尝试解决迷宫。每当机器人完成任务时,老师会给它一个评分:“如果你快速找到了宝藏,表现很棒!如果你迷路了或耗时太长,得分很低。”
- 结果: 机器人尝试了许多路径。有时它选对了路径;有时它选错了路径,撞到了死胡同,并意识到:“噢不,我被困住了。”因为它会因为浪费时间而得到低分,它学会了一项至关重要的技能:如何快速转身返回。
- 益处: 机器人不仅学会了正确的路径,还学会了如何从错误的路径中高效撤退并尝试另一条路径。
重大发现:“回溯”差距
论文通过数学证明,这两种机器人之间的差异是巨大的,尤其是在迷宫变得更深的时候。
- SFT 机器人(向导型学生): 如果它选错了分支,它就会被困住。它会在那个死胡同的分支里来回徘徊很长时间,最后才会放弃并尝试回到分叉口。随着迷宫变深,它浪费的时间呈指数级增长。这就像是在草堆里找针,每次选错位置时都要把整个草堆都挖一遍。
- RLVR 机器人(尝试型学生): 因为学会了高效回溯,它意识到自己走错了分支,会立即转身并尝试下一个分支。它寻找宝藏的时间随迷宫规模呈线性(缓慢且稳定地)增长。
类比:
想象你正在一个拥有 100 个走廊的图书馆里寻找一本特定的书。
- SFT 机器人 就像是一个只看过正确走廊地图的人。如果他不小心走进了错误的走廊,他会一直走到走廊的最尽头,意识到自己迷路了,然后不得不走回走廊开头再去尝试下一个走廊。他浪费了大量的时间。
- RLVR 机器人 就像是一个曾经在图书馆待过的人,知道如果走几步还没看到书,就应该立即转身尝试下一个走廊。他能更快地找到书。
“蒸馏”的转折
论文还发现了一个聪明的解决方法。如果你记录下 RLVR 机器人(那个学会了回溯的机器人)的整个旅程——包括它所有被困住以及如何脱身的时刻——你可以利用这些记录来教一个新的机器人使用“完美向导”法 (SFT)。
通过向新机器人展示聪明机器人的整个故事(包括错误和恢复过程),新机器人也能学会高效回溯。这就像是将一个通过失败中学习的学生的笔记交给另一个学生;新学生无需亲自经历失败,就能学会其中的教训。
总结论点
- SFT(仅从完美示例中学习)无法教会模型如何从错误中高效恢复。当模型犯错时,会导致指数级的缓慢。
- RLVR(从奖励和失败中学习)教会模型如何高效回溯。它能实现线性速度,对于复杂问题要快得多。
- 蒸馏(利用 RLVR 模型的成功轨迹来教导模型)可以将这种高效回溯的能力转移给新模型。
该论文并未声称这适用于医疗诊断、自动驾驶汽车或特定的未来技术;它严格专注于数学证明,即为什么一种训练方法在被建模为路径寻找的逻辑推理任务中优于另一种。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。