GRLO: Towards Generalizable Reinforcement Learning in Open-Ended Environments from Zero
本文介绍了 GRLO,这是一种高效的强化学习方法,它从零开始在小规模开放式对话交互数据集上训练模型,实现在数学和编程等多样化领域的强泛化能力,相比传统的领域内 RLVR 方法显著降低了数据和计算需求。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一位非常聪明、博览群书的学生(一个大语言模型),它在“预训练”阶段已经阅读了数百万本书。它知识渊博,但在遵循指令、解决谜题或编写代码方面却有些笨拙。为了将其培养成顶尖专家,我们通常需要为其安排一门“后训练”课程。
传统上,运行这门课程有两种方式:
- 专科导师(RLVR):你聘请一位只教授数学或编程的导师。他们使用严格的答案键(“验证器”)来批改每一个步骤。如果学生做对了数学题,就会得到一颗金星;如果做错了,就会得到一个红叉。这种方法在数学方面效果极佳,但学生往往因为只针对考试进行练习,而忘记了如何进行正常对话或撰写创意故事。
- 通用聊天教练(RLHF):你聘请一位教练,教导学生如何在一般对话中变得礼貌、乐于助人且引人入胜。他们使用的是人类反馈(例如“这个答案很棒”),而不是严格的答案键。
问题所在:
“专科导师”方法成本高昂,且需要巨大的计算能力。它虽然能让学生精通数学,却使其在聊天方面表现糟糕。“通用聊天教练”成本较低,但尚未被证明能让学生提升数学或编程等困难推理任务的能力。
新想法:GRLO(“开放式健身房”)
本文作者提出了一种名为GRLO的新训练方法。他们不是将学生送往仅限数学的训练营或通用的聊天课程,而是将他们送入一个拥有开放式挑战的健身房。
想象这样一个健身房,其中的器材不仅仅是跑步机(数学)或沙袋(聊天)。相反,学生将面对 5,000 个多样、棘手且开放的问题,例如:
- “分析月球南极的历史。”
- “解释某种特定哲学如何与现代政治相联系。”
- “设计一份饲养 exotic 宠物的指南。”
这些问题没有单一的“正确答案”供计算机核查。相反,学生会根据他们长篇、详细回答的结构是否清晰、逻辑是否严密以及内容是否有帮助而获得反馈。
巨大的惊喜(“零”的魔力)
论文声称发生了一件令人惊讶的事:仅仅通过在“开放式健身房”进行练习,学生在数学、编程和聊天方面都取得了显著进步。
- 结果:他们选取了一个基础模型(Qwen3-4B),仅用少量数据(5,000 个提示)对其进行了22.7 小时的训练。
- 对比:这微量的训练将模型的平均性能从24.1 提升至 63.1。
- 效率:与通常获得类似结果所需的庞大“专科导师”(RLVR)方法相比,这减少了46 倍的数据量和68 倍的计算能力。
- 迁移:模型不仅聊天能力变强了;它隐式地学会了如何更好地思考,从而帮助它解决数学问题和编写代码,尽管在特定的训练阶段,它从未见过任何数学问题或编程任务。
接下来会发生什么?
作者在“开放式健身房”训练之后,尝试加入少量的“专科导师”训练(仅限数学)。这带来了一点点帮助,但仅体现在最难的比赛级数学问题上。主要的提升完全来自于开放式训练。
核心启示
论文表明,你无需构建庞大、昂贵且专门针对数学的训练管道,就能获得具备智能和推理能力的 AI。如果你选择一个强大的基础模型,并在少量多样化的开放式对话中进行训练,要求它深入思考并组织思路,它自然会在其他所有方面变得更好,包括困难的推理任务。这就像说:“如果你训练一名运动员成为多才多艺、适应性强的全能选手,他们自然会在跑步、跳跃和投掷方面变得更强,即使你从未让他们专门练习过这些特定运动。”
简而言之:少量的智能、开放式对话训练可以释放模型在推理和编程方面的隐藏潜力,与传统方法相比,节省了巨额的资金和时间。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。