How Much Backtracking is Enough? Exploring the Interplay of SFT and RL in Enhancing LLM Reasoning
本文表明,在监督微调预热阶段显式地引入回溯对于优化大语言模型的强化学习至关重要,且回溯的最佳深度随任务难度直接缩放,从而实现有效的非线性树搜索推理。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个机器人如何走迷宫。在过去,你可能会直接告诉机器人:“向前走直到撞到墙,然后右转。”这就像是监督微调(SFT):你向机器人展示一个完美的范例,然后让它去模仿。但如果迷宫是一个巨大的、扭曲的迷宫,而“正确”的路径并不明显呢?机器人可能会走进死胡同,继续走下去,然后被困住。
为了解决这个问题,科学家们开始使用强化学习(RL)。把这想象成一个电子游戏教练。机器人尝试解决迷宫,如果它得到了正确答案,教练就会给它一个击掌(奖励)。如果失败了,教练会说:“再试一次。”随着时间的推移,机器人学会了探索不同的路径,有时甚至在意识到走错路时进行回溯。最近,我们看到机器人在这方面变得异常出色,但研究人员感到困惑:机器人究竟是如何学会“回溯”的?它只是在瞎猜,还是在训练过程中有一个秘密配方,教会了它如何说:“等等,我犯了个错误,让我退回去”?这个问题至关重要,因为如果我们能找到训练这些大脑的完美配方,我们就能让它们解决更难的问题,从复杂的数学到逻辑谜题,而不会让它们彻底迷失方向。
这篇题为《需要多少回溯量?》("How Much Backtracking is Enough?")的论文,深入探讨了那个谜团。来自杜克大学和 Mila 的作者们想要寻找训练 AI 处理推理任务时的“金发姑娘区”(即最理想的状态)。他们问道:在开始强化学习游戏之前,我们应该向 AI 展示多少“回溯”(即意识到错误并返回尝试不同路径的行为)?
他们在八种不同类型的逻辑游戏中测试了他们的想法,范围从简单的“Arc 1D”(识别网格中的模式)到中等难度的“Countdown”(通过数字组合达到目标值),再到超难难度的“数独”(在网格中填入数字)。
以下是他们发现的研究结果,我们使用一个有趣的类比:训练 AI 就像是在教一名徒步旅行者在森林中导航。
“只管走路”法(纯强化学习/Pure RL)
首先,他们尝试让徒步旅行者(AI)在没有任何地图和练习的情况下进入森林,仅仅让他们通过试错来学习(纯 RL)。
- 结果: 徒步旅行者可以学会走直线,有时甚至能偶然发现解决方案。但对于那些真正茂密且复杂的森林(如数独),徒步旅行者只会原地打转或者陷入困境。他们无法学会如何在撞到死胡同时返回。
“模仿地图”法(标准监督微调/Standard SFT)
接下来,他们给了徒步旅行者一张成功旅程的地图(自我采样 SFT)。在开始强化学习训练之前,他们让 AI 在自己生成的路径上进行练习。
- 结果: 这有所帮助!徒步旅行者走路变得稍微好了一点。但对于最难的森林,这还不够。徒历旅行者仍然不知道在迷路时该怎么办。这就像是给徒步旅行者一张简单路径的地图,然后却把他们丢进了一片丛林。
“学习回头”法(合成回溯/Synthetic Backtracking)
这就是奇迹发生的地方。研究人员意识到,秘诀不仅仅是向 AI 展示一条正确的路径,而是展示一条 AI 犯错、意识到错误并返回的路径。他们创建了“合成”训练数据,强迫 AI 练习这项特定技能:
- 沿着一条路径走下去。
- 意识到错了。
- 说:“等等!”并回到上一个安全点。
- 尝试另一条路径。
他们测试了这种练习的不同“深度”:
- 对于简单的森林(Arc 1D): 徒步旅行者完全不需要练习回头。事实上,向他们展示如何回溯反而会让他们变慢!最好的策略就是直接展示那条完美的直线路径。零回溯是获胜者。
- 对于中等的森林(Countdown): 徒步旅行者需要练习回头一次。他们需要学习如果一个数学计算看起来很奇怪,他们应该停下来并尝试另一种组合。一次回溯是最佳平衡点。
- 对于超难的丛林(Sudoku): 徒步旅行者需要练习回头五次或更多次。这些谜题非常复杂,你必须愿意撤销你的工作很多很多次才能找到解决方案。如果你只教他们回溯一次,他们仍然会卡住。
核心启示
论文发现,并非一种方法适用于所有场景。
- 如果你在处理简单任务时教 AI 过多回溯,它会感到困惑并表现得更差。
- 如果你在处理困难任务时教得回溯不够,它就会放弃。
- “完美”的回溯量完全取决于谜题的难度。
他们还发现了一些令人惊讶的事实:只要具备“回溯”的结构,练习地图是否错误并不重要。 即使他们向 AI 展示了一条充满错误但仍包含“等等,让我们回去”步骤的路径,AI 学习解决问题的能力仍然比只展示一条直线要好。这就像是通过让孩子在摔倒后爬起来来教他们骑自行车,而不是仅仅给他们看别人骑行完美的视频。从跌倒中恢复的过程才是建立肌肉记忆的关键。
最后,作者们建议,要让 AI 在复杂的推理方面真正变得聪明,我们需要停止仅仅展示答案,而是开始教它们如何从错误中恢复。通过调整与任务难度相匹配的“回溯”旋钮,我们可以解锁更高水平的智能,让即使是较小的模型也能解决那些以前需要超级强大计算机才能解决的谜题。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。