SRPO: Self-Reflective Policy Optimization for Long-Horizon Reasoning
本文介绍了自我反思策略优化(Self-Reflective Policy Optimization, SRPO),这是一个高效的数据利用框架,它通过从已完成的轨迹中合成错误“补丁”来生成密集的标记级训练信号,使大语言模型能够内化自我反思,从而在无需外部评论家或奖励模型的情况下,在数学推理和长程智能体任务中达到最先进的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
大语言模型是强大的工具,能够解决复杂问题、编写代码并驾驭数字环境,但当任务需要长链条推理时,它们往往会表现挣扎。想象一下,要求一名学生解决一道很难的数学题或规划一次多步骤的购物行程。如果学生最后得出了错误的答案,他们收到的只是一个简单的“错误”信号。这个反馈告诉他们结果很糟糕,但并没有解释其长链条思维中究竟是哪一个具体步骤导致了错误。是中间的一个计算失误?还是开始时的错误假设?如果不知道哪里出了问题,模型就无法轻易学会下次做得更好。这被称为“信用分配问题”(credit assignment problem),是教导人工智能处理长程复杂任务的一大障碍。
研究人员曾尝试通过让模型反思自己的错误来解决这个问题,就像人类在复习试卷以理解出错原因一样。然而,以往在训练中使用这种自我反思的方法通常效率低下或不稳定。它们有时会导致模型被自己积累的想法所迷惑,或者无法将“我错了”这种模糊的感觉转化为对其生成的每一个词的具体教训。一种被称为“自我反思策略优化”(Self-Reflective Policy Optimization,简称 SRPO)的新方法提供了一条不同的路径。SRPO 不再等待最终成绩,而是通过分析其完成的尝试,识别出究竟在哪里走偏了,并利用这些洞察来指导下一次尝试,从而教会模型扮演自己的老师。
由刘家隆(Jialong Liu)及其同事领导的 SRPO 研究团队设计了一个系统,让语言模型通过回顾自己的工作来进行学习。这一过程分为两个截然不同的阶段。首先,模型尝试执行一项任务,例如解决数学题或在虚拟商店中导航。一旦尝试结束,模型会停下来进行反思。它会回顾整个行动序列和最终结果,然后写下一段简短、精炼的笔记,总结哪里出了错或哪些关键决策是正确的。作者称这段笔记为“反思补丁”(reflection patch),它不是一篇长篇大论,而是一组紧凑且具有行动力的提示,通常仅由几个要点组成。
在第二阶段,模型再次尝试同一项任务,但这一次,它在开始时会携带刚才写的反思笔记。这种新的组合起到了引导作用,实际上是让模型在拥有后见之明的优势下获得第二次机会。模型基于这种丰富的上下文生成一次更高质量的尝试。至关重要的一点是,研究人员并不将这次更好的尝试作为最终答案,而是将其作为一种教学信号。他们将模型新的、改进后的想法与最初未受引导的想法进行对比。通过分析两者之间的差异,系统创造了一个密集的学习流。模型原始尝试中的每一个词都会被评分:如果一个词符合反思中的智慧,它就会受到奖励;如果偏离了,则会被纠正。这把任务结束时单一的“正确”或“错误”等级,转化为了针对模型写下的每一个词的数千个微小且具体的教训。
这种方法被证明非常有效。团队在包括高级数学竞赛和需要导航数字环境的复杂智能体任务在内的多种挑战性基准测试中测试了 SRPO。在名为 AIME'24 的困难数学测试中,使用 SRPO 的模型达到了 73.3% 的平均得分(在五次独立运行中标准差为 ±1.4)。这比其他领先方法有了显著提升,并且仅使用了通常此类训练所需的 8% 的训练 FLOPs(浮点运算次数)。该系统在长程任务中也表现出色,例如在 WebShop 中成功完成了 64.7% 的购物任务,并在 ALFWorld 中解决了 76.8% 的家庭模拟任务。这些结果表明,通过内化反思的能力,模型学会了在不需要更大的外部教师引导的情况下,纠正自身的推理路径。
研究还探讨了人工智能研究中的一个普遍担忧:即教导模型一项新技能可能会导致它忘记已掌握的知识。当研究人员在模型学习完数学后对其进行编程任务训练时,SRPO 方法帮助模型保留了 95.2% 的原始数学能力。相比之下,其他方法出现了更大幅度的性能下降。这表明,由于模型是从自身的思维分布而非模仿外部专家中学习,因此它能保持对其自身能力的更稳定的理解。
研究人员非常谨慎地验证了成功是源于反思的内容,而非仅仅是添加的额外文本。他们通过向系统输入为完全不同的问题生成的反思进行了测试。当反思与任务不匹配时,模型的性能回落到了基准水平,这证明了特定的、相关的建议才是推动进步的动力。他们还发现反思需要保持简洁;过于冗长或啰嗦的笔记实际上会损害性能,这可能是因为它们引入了噪声和困惑。
最终,SRPO 证明了语言模型可以通过学习如何批判和引导自身而变得更加强大。通过将稀疏的最终结果转化为密集的、逐词的引导,该方法允许模型以比以往认为的更少的示例和更少的计算能力,来学习复杂的推理模式。这项工作预示着这样一个未来:人工智能系统可以持续改进自身的推理过程,在解决定义现实世界挑战的长程、复杂问题时,变得更加可靠和高效。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。