Beyond Correctness: Learning Robust Reasoning via Transfer
本文介绍了可迁移奖励强化学习(Reinforcement Learning with Transferable Reward, RLTR),这是一种通过训练模型生成在迁移至引导独立模型时仍能保持有效性的推理步骤,而非仅仅关注最终答案正确性,从而增强大语言模型推理的鲁棒性和样本效率的新颖方法。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在教一名学生解决一道复杂的数学题。
旧方法 (RLVR):“你得到正确答案了吗?”
目前的 AI 训练大多像一位只看试卷最终答案的严厉老师。如果学生写了一堆混乱、令人费解或仅仅是靠运气猜出的过程,但最后结果对了,老师会给一个“A”。如果学生写了一段完美的、逻辑严密的解释,但最后在一步微小的算术上出了错,老师会给一个“F”。
论文称之为 RLVR(具有可验证奖励的强化学习)。它擅长获得正确答案,但它并不关心学生是如何得出答案的。其结果是?学生可能会学会“钻空子”或者依赖脆弱的逻辑,一旦要求他们向别人解释清楚,这种逻辑就会崩溃。
新思路 (RLTR):“别人能接手你的工作吗?”
该论文的作者 Hyunseok Lee 及其同事提出了另一种哲学。他们认为,真正的推理就像一场接力赛。 一个优秀的跑者(AI)不应该只是冲过终点线;他们应该以一种让下一位跑者能够轻松接棒、且不会因踉跄而中断的方式来传递接力棒。
他们将这种新方法称为 RLTR(具有可传递奖励的强化学习)。
它是这样运作的,我们可以用一个简单的类比来说明:
- 生成器(第一位跑者): AI 开始解决一个问题并写下它的思考过程(推理)。
- 截断(剪断胶带): 系统在 AI 中途停止。它取出推理过程的第一部分并将其切断。
- 接收器(第二位跑者): 另一个不同的 AI(“接收器”)被递交了这段被切断的文本。它必须阅读第一位 AI 写下的内容并完成整个解题过程。
- 奖励:
- 如果接收器能够成功完成问题并得到正确答案,则第一位 AI 获得一个加分。
- 如果接收器因为第一部分内容混乱或逻辑不清而感到困惑、卡住或给出了错误答案,则第一位 AI 没有加分。
为什么这更好?
把这想象成写故事。
- RLVR 只关心故事是否以“全书完”结束。你可以写一个毫无意义的故事,但只要最后一个词是“全书完”,你就赢了。
- RLTR 则关心故事是否足够清晰和逻辑连贯,以至于任何读到前半部分的人都能轻松推测出结局。它迫使 AI 编写“鲁棒”的推理——即稳定、清晰且可复用的逻辑。
他们发现了什么?
他们在困难的数学和科学问题上测试了这一点。以下是主要的结论:
- 更具一致性: 当他们要求 AI 解决同一个问题 64 次时,采用“传递”方法(RLTR)在进行多数投票时获得正确答案的频率更高。旧方法(RLVR)有时是对的,但其推理过程非常不稳定,导致不同的尝试之间经常出现分歧。
- 学习速度更快: 新方法学习得更快。它达到与旧方法相同的性能水平仅用了大约 2.5 倍少的训练步骤。这就像是因为课程更清晰,所以用一半的时间就接受了更好的教育。
- 适用于更难的问题: 在最难的数学竞赛(如 AIME 和 AMC)中,这种优势更加明显。当问题变得极其困难时,拥有清晰、可传递的思维过程比仅仅猜对一个数字更为重要。
- 不限于数学: 他们也在科学问题上进行了测试,并且该方法在这些领域同样有效,这表明这种“清晰思考”的能力适用于许多类型的题目。
简而言之:
论文指出,仅仅“正确”是不够的。AI 的推理应该是如此稳固和清晰,以至于如果你在中间阶段将它交给另一个 AI,第二个 AI 能够顺利接手并完美地完成任务。通过训练 AI 具备“可传递性”,它们变得更聪明、更一致,且学习速度更快。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。