Learning from Failures: Correction-Oriented Policy Optimization with Verifiable Rewards
该论文提出了面向修正的策略优化(CIPO),这是一种新颖的方法,它将失败的轨迹转化为自监督修正信号,以克服可验证奖励强化学习中的稀疏奖励问题,从而显著提升大语言模型在数学和编程基准测试中的推理与纠错能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教导一位聪明但固执的学生如何解决复杂的数学问题或编写计算机代码。你给他们一个题目,他们尝试解答,然后你检查答案。
旧方法(标准 RLVR):
在当前的标准方法(称为 RLVR)中,如果学生答对了,你就给他们一颗金星;如果答错了,你只是说“不,错了”,然后继续下一题。
问题在于,“错了”这个反馈并没有太大帮助。
- 他们是在最后一步犯了一个微小的计算错误吗?
- 他们是否误解了第一句话?
- 他们是否使用了正确的逻辑却选错了工具?
旧方法将所有这些不同的错误视为完全相同的事情:失败。它只是告诉学生“少做那样的事”。它抛弃了隐藏在错误中的宝贵教训。这就像教练告诉运动员“你投丢了”,却没有解释下次该如何调整瞄准方向。
新方法(CIPO):
这篇论文介绍了一种名为 CIPO(面向修正的策略优化)的新方法。CIPO 不再仅仅说“错了”,而是将错误转化为第二次机会。
以下是其运作方式,借助一个富有创意的类比:
1. “重做”策略
想象学生犯了一个错误。老师没有丢弃那次尝试,而是说:
“好的,你尝试解决这个问题并在第 3 步卡住了。现在,看着你自己的错误答案,尝试修正它并得出正确结果。”
学生被迫审视自己的错误,理解出错之处,并生成修正后的解决方案。
- 为何有效: 如果学生几乎答对了(即“差之毫厘”),他们可以轻松修正。这教会了他们如何具体修正这类错误。如果他们完全迷失了方向,可能仍然会失败,但系统会了解到这条特定路径是死胡同。
- 结果: 学生不仅学会了如何解决问题,还学会了如何调试和修正自己的思维。
2. “智能播放列表”(自适应重放)
如果你强迫学生每天只练习他们最困难、最困惑的错误,他们可能会感到沮丧,并忘记他们已经掌握的简单内容。
CIPO 使用一个智能播放列表:
- 它将“困难”的失败尝试与“简单”的成功案例混合在一起。
- 它观察学生的表现。如果他们开始忘记简单内容,播放列表会自动播放更多“成功”示例以保持他们的信心。
- 如果他们表现优异,播放列表就会播放更多“失败”示例以推动他们更进一步。
- 目标: 它平衡了学习新事物与不遗忘已有知识之间的关系。
3. “安全网”(风险规避塑造)
有时,当学生尝试修正错误时,可能会无意中让情况变得更糟,或者忘记他们原本知道的规则。
CIPO 设有一个安全网:
- 如果学生从一个正确的想法开始,但在修正过程中搞砸了,系统会给予他们“双重惩罚”。
- 这教会学生:“不要仅仅修正错误;确保不要破坏原本就有效的部分。”这防止他们变得“过度修正”并丧失原有的技能。
4. “金发姑娘”区域(难度偏好)
该系统很聪明地知道应该练习哪些错误。
- 它忽略太简单的问题(学生已经掌握了)。
- 它忽略极其困难的问题(学生目前还无法从中学习)。
- 它专注于**“金发姑娘”区域**:那些难度适中、具有挑战性但稍加帮助即可解决的问题。这是学习发生最多的地方。
结果
研究人员在 11 个不同的挑战上测试了这种方法,包括高难度的数学竞赛和编程任务。
- 更强的推理能力: 使用 CIPO 训练的模型在从头解决问题方面有了显著提升。
- 更强的修正能力: 它们在将错误答案转化为正确答案方面(这种技能称为“修正”)也表现得更好。
- 真正的进步: 论文表明,这不仅仅是模型在死记硬背答案;它实际上提升了模型内在的思考和推理能力。
总结:
CIPO 改变了 AI 从失败中学习的方式。它不再仅仅惩罚错误,而是将错误用作训练场,教导 AI 如何发现并修正自己的错误,同时小心翼翼地确保它不会忘记已经掌握的知识。它将“失败”转化为一份详细、循序渐进的教学计划。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。