AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning
本文介绍了 AIRL-S,这是一个将对抗逆强化学习(Adversarial Inverse Reinforcement Learning)与组相对策略优化(Group Relative Policy Optimization)相结合的统一框架,旨在从参考轨迹中推断出稠密的、逐步的奖励,从而在无需标注过程数据的情况下,实现稳健且具成本效益的测试时扩展,并在数学、科学和代码生成基准测试中达到了 GPT-4o 级别的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
大语言模型是许多现代人工智能系统背后的强大引擎,能够生成文本、解决问题并编写代码。多年来,研究人员一直试图通过教它们进行“思维链”(chain of thought)式逐步思考的方法,使这些系统变得更加聪明。然而,教导模型进行良好的推理非常困难,因为计算机通常只知道最终答案是正确还是错误,而不知道通往该答案的步骤是否符合逻辑。为了解决这个问题,科学家们尝试了两种主要方法。一种涉及仅在任务结束时给予模型奖励,但这可能导致不稳定和低效;另一种则是使用一个独立的引导器来检查推理过程中的每一个步骤,但创建这种引导器通常需要昂贵的专家来为数千个示例进行标注,且当模型开始以新的方式思考时,该引导器往往会失效。
一组研究人员推出了一种名为 AIRL-S 的新系统,它将这两种方法统一成了一个单一的、自我改进的循环。该系统不再依赖人类对每一步进行标注,而是通过观察高质量的推理示例,学习创建自己的内部引导器。随后,它利用这个引导器来进行模型训练,并在实际应用中帮助其寻找最佳答案。在涉及数学、科学和编程的八个不同基准测试中,研究人员发现,这种方法使模型的性能比初始版本平均提高了 9%。由此产生的系统表现出了与 GPT-4o 等最先进的商业模型相当的水平,且无需以往方法那样依赖昂贵的人类监督。
其核心创新在于系统如何学习判断自己的工作。传统上,为了教导模型进行逐步推理,研究人员需要一个“过程奖励模型”——这是一个在人类标记了每一个正确和错误步骤的数据集上训练的独立程序。这种方式既缓慢又昂贵。新方法通过使用一种称为“对抗学习”的技术绕过了这一限制。想象一下,系统正在玩一场游戏:其中一部分试图生成推理步骤,而另一部分则试图区分这些生成的步骤与一组高质量的参考示例。通过这种竞争,系统学会了识别什么是良好的推理步骤,而无需人类明确告知。这个学到的引导器(或称奖励模型)变得密集且细致,能够针对推理过程中的每一个步骤提供反馈,而非仅仅针对最终结果。
一旦系统学会了这个内部引导器,它就会同时以两种方式使用它。首先,它利用该引导器来训练主模型,鼓励模型在学习阶段采取更好的步骤。其次,它保留同一个引导器,在实际解决问题的阶段充当验证器。当模型被要求解决难题时,它可以生成许多种可能的解决方案。学到的引导器会对这些潜在解决方案的每一步进行评分,从而帮助系统选择最符合逻辑的路径。这创造了一个统一的流水线,即用于教导模型的工具与在测试期间辅助其思考的工具是同一个。研究人员证明,该引导器具有鲁棒性;即使应用于不同的模型或不同的搜索策略,它也能有效工作,这表明它所学到的知识是通用且可迁移的。
该方法的成果是在广泛的挑战性任务中衡量的。研究人员在包括复杂数学竞赛、科学推理问题和编程挑战在内的八个标准基准测试中测试了该模型。该模型最初是一个标准的开源语言模型,在使用这种新方法训练后,其平均准确率提高了 9%。在特定的数学和科学任务中,这种提升甚至更高,达到了 13%。与那些使用昂贵的人类标注数据或其他先进强化学习技术训练的模型相比,这个新系统表现得更为出色。它甚至匹配了 GPT-4o 这一顶尖商业模型的性能,尽管其参数量显著较少。这表明,由这种自学奖励系统引导的推理过程质量,比单纯拥有更大的模型规模更为重要。
该研究的一个关键发现是两种不同类型的学习信号是如何协同工作的。系统将来自自学引导器的详细逐步反馈与来自传统方法的最终结果奖励相结合。研究人员发现,仅依赖其中一种类型的信号效果较差。逐步引导器有助于模型探索更好的推理路径,而最终结果信号则确保模型专注于获得正确答案。当两者得到正确平衡时,这些信号会相互增强,从而带来更稳定的训练和更好的结果。此外,该系统显示出它可以利用这个学到的引导器来改进各种搜索方法,例如那些尝试多种不同解决方案的方法,或构建可能性树的方法。在复杂的搜索场景中,当模型必须评估中间步骤的价值以做出最佳选择时,该引导器表现得尤为有效。
这项工作的意义不仅在于获得更高的测试分数。通过消除对昂贵的人类逐步推理标注的依赖,该方法为提高人工智能提供了一种更具扩展性且更具成本效益的方式。它表明,模型可以通过观察高质量的示例并与自身竞争,来实现自我教学,并不断精炼其推理能力。研究人员指出,他们的方法特别适用于那些最终答案可以被自动验证的任务,例如数学和编程。虽然该方法很强大,但作者承认它目前依赖于这些可验证的结果,并且可能需要进一步发展,以处理不存在单一正确答案的开放式任务。尽管如此,将训练与推理时搜索统一为一个高效系统的能力,标志着向使大语言模型成为更可靠、更强大的推理者迈出了重要的一步。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。