From Reasoning Traces to Reusable Modules: Understanding Compositional Generalization in Language Model Reasoning
本文提出,监督微调(SFT)与强化学习(RL)在增强语言模型推理能力方面的结合之所以成功,源于组合泛化,即 SFT 在轨迹中提供原始的原子模块,而 RL 则通过分解并重新组合这些模块来解决新颖的配置,这一理论已通过实验得到验证,实验表明,在复合轨迹上进行训练比在孤立模块上进行训练具有更优越的泛化能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
大局观:AI 如何学习“思考”
想象一下,你正在教一个机器人解决复杂的谜题。你有两种主要的教学方式:
- 示范与讲解 (SFT): 你向机器人展示一个针对特定谜题的完美、分步骤的解决方案。
- 试错法 (RL): 你让机器人尝试自己解决谜题。如果它最后得到了正确答案,你就给它一颗“小红星”(奖励);如果失败了,它就什么也得不到。
长期以来,研究人员注意到,结合这两种方法效果最好。机器人通过“示范与讲解”学习步骤,但在经过“试错法”之后,它在解决从未见过的新谜题时会变得出色得多。
问题在于: 为什么这种结合方式如此有效?机器人的大脑内部究竟发生了什么?
核心思想:“乐高”理论
本文作者提出了一种理解这一过程的新方法。他们认为,推理不仅仅是记忆一段长长的故事;它就像是用乐高积木进行搭建。
他们将一段推理轨迹(机器人的思考过程)分解为两类可重用的部分:
- 技能(积木): 这些是微小的、局部的动作。例如:“把这两个数字相加”、“删除这个词”或“检查这是否为真”。
- 路由(指令): 这些是连接积木的规则。例如:“将第 1 步的结果输入到第 2 步中”,或者“如果数字很大,则跳到第 4 步”。
“示范与讲解”(SFT)的问题:
当你向机器人展示一个完美的解决方案时,“积木”和“指令”是以特定的顺序粘在一起的。机器人看到的是一个长长的、实心的乐高块。它学会了模仿整个块,但它并没有意识到这个块是由独立的、可重用的零件组成的。如果你给它一个需要以不同顺序排列这些积木的谜题,机器人就会卡住,因为它只知道如何复制原始的那个块。
“试错法”(RL)的魔力:
当机器人开始尝试独立解决问题,并因得到正确答案而获得小红星时,神奇的事情发生了。它开始意识到:“等等,我在三个不同的地方都使用了那个相同的‘加法’积木,而且每次都奏效了!”
RL 过程充当了一个解构者。它将“示范与讲解”阶段那些粘在一起的模块重新拆解,还原成单个的、可重用的积木和指令。一旦机器人拥有了一盒松散且可重用的积木,它就能以新的方式将它们组合在一起,从而解决从未见过的谜题。
关键发现(成功的配方)
论文通过实验证明了这一理论。以下是简单易懂的实验结果:
1. 你需要先准备好原材料。
如果你从未向机器人展示过乐高积木长什么样,你就无法教它用乐高搭建。因此,“示范与讲解”阶段至关重要,因为它提供了原材料(原子级的技能和路由机制)。没有这个阶段,机器人就没有可以拆解的对象。
2. “拆解”比“单纯展示”更好。
如果你只是向机器人展示孤立的积木(例如:“这是如何做加法的”),它学会了加法,但它没学会如何将加法与其他步骤结合起来。
- 研究发现: 向机器人展示一个完整的、复杂的解决方案(复合轨迹),然后让“试错法”阶段去负责如何将其拆解,效果要好得多。机器人学习如何重新组合这些零件的速度和效率,远高于你直接给它一堆孤立积木的情况。
3. “胶水”必须在正确的地方被打破。
作者发现了一个能获得最佳结果的具体配方:
- 第一阶段(示范与讲解): 向机器人展示许多不同的复杂解决方案,涵盖每一种可能类型的积木和指令。确保它看到了工具箱里的所有工具。
- 第二阶段(试错法): 让机器人在由这些工具组成的全新、奇特组合的谜题上进行练习。
- 为什么? 如果你让机器人在与第一阶段相同的组合上练习,它只会死记硬背。但如果你让它在新的组合上练习,它就会被迫学习如何在现场将松散的积木拼凑在一起。这就是“泛化”(解决新问题的能力)发生的地方。
一个简单的类比:厨师
想象一下你在训练一名厨师。
- SFT(示范与讲解): 你向厨师展示一份“培根蛋面”的食谱。你展示了如何打蛋、如何煮面以及如何调制酱汁。厨师学会了完美地复制这道菜。
- RL(试错法): 现在,你对厨师说:“给我做一顿美味的晚餐”,但你没有提供食谱。你让他们去尝试。如果他们做了一顿美餐,你就说“做得好!”
论文的洞察:
如果仅仅向厨师展示培根蛋面的食谱,他们可能会认为“打蛋”和“煮面”是一个名为“制作培根蛋面”的单一、不可分割的动作。
但当让他们进行实验(RL)时,他们会意识到:“噢!我可以为了做煎蛋而打蛋,也可以为了做沙拉而煮面。”他们意识到技能(打蛋、煮面)与路由(接下来对面条做什么)是相互独立的。
一旦意识到这一点,他们就可以发明一道从未见过的全新菜肴(比如“面条煎蛋”),因为他们已经学会了将食材视为独立的、可重用的工具,而不是一个固定的脚本。
总结
- 推理是模块化的: 它由微小的技能和连接它们的规则组成。
- SFT 提供零件: 它为模型提供了原材料(技能)。
- RL 进行组装: 它迫使模型将材料拆解开,并学习如何以新的方式将它们拼凑在一起。
- 最佳策略: 先向模型展示大量复杂的例子(以获取所有零件),然后让它在这些零件的新组合上进行练习(以学习如何搭建)。
这篇论文解释了为什么目前的“先示范讲解,后试错法”模式如此强大:它将一个僵化的记忆机器变成了一个灵活的构建者。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。