GFlowRL: Scaling Distribution-Matching RL to Large Language Models
GFlowRL 为大语言模型引入了一种可扩展、稳定的 GFlowNet 式强化学习算法,该算法通过使用批次内蒙特卡洛估计和专门的稳定器,消除了对学习型配分函数的需求,并在高达 235B 参数的稠密与稀疏架构上,于数学、代码及对抗性基准测试中实现了最先进的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一位才华横溢、反应极快的学生去解决世界上最难的谜题,从复杂的数学问题到永不崩溃的计算机代码。在人工智能的世界里,这个学生就是一个“大语言模型”(LLM),而我们教导他们的方法被称为“强化学习”(Reinforcement Learning)。把这想象成一场电子游戏,AI 通过做正确的事情来获得分数(奖励)。长期以来,标准的策略就像是一个贪婪的玩家:“寻找当前能获得最高分的单一动作,并一遍又一遍地重复它。”这虽然有效,但有一个缺陷。这就像一个学生死记硬背了一种特定的解题方法,即使另一种方法同样出色,他也拒绝尝试其他方法。他们会“困”在一种思维方式中,错失了处理新颖、棘手情况时所需的创造力和多样性。
为了解决这个问题,科学家们最近尝试了一种不同的方法,叫做“生成流网络”(GFlowNets)。GFlowNets 不仅仅是寻找单一的最佳动作,而是教会 AI 去探索所有好的动作,并根据这些动作的表现给予它们被使用的机会。这就像是告诉学生:“尝试迷宫中的每一条有效路径,而不只是看起来最快的那一条。”目标是创造一个多样化、灵活的思考者。然而,将这种方法扩展到大规模、超智能的 AI 模型上却成了一场噩梦。科学家们构建的工具过于复杂且不稳定,经常导致 AI 崩溃或无法学到任何东西,尤其是在模型变得巨大或任务变得混乱时。
这篇名为“GFlowRL”的论文正是针对这一痛点而写的。作者发现,之前那种“多样化思维”配方中最复杂的部分,恰恰就是问题所在。他们发现,一个原本旨在帮助平衡 AI 学习的特定数学工具,实际上更像是一个嘈杂、破损的收音机,而不是一个有用的向导。通过丢弃这个破损的工具,并用一种更简单的、即时的计算来替换它,他们创造了一种新的方法,称为 GFlowRL。这种新方法既稳定又快速,而且效果惊人。它允许大规模 AI 模型学习多样化的解题策略,即使是在最难的数学和编程挑战中也不会崩溃。事实上,他们的新方法超越了之前的纪录保持者,在竞争性编程中达到了足以媲美目前最顶尖 AI 系统的水平,同时保持了训练过程的平稳与稳定。
问题所在:让一切崩溃的“神奇计算器”
要理解这一突破,我们首先需要看看旧的做法。当研究人员试图使用 GFlowNets 教导 AI 实现多样性时,他们依赖于一个特殊的“计算器”(技术上称为“配分函数”,partition function)来帮助平衡奖励。想象一下,你是一位正在为 1,000 名学生评分的老师。你想确保如果一名学生找到了一个巧妙且独特的解决方案,他能获得认可,但你也需要确保分数不会高到让整个系统崩溃。
旧方法试图构建一个全新的、微小的 AI 模型来充当这个计算器。问题在于,这个微小的计算器必须在巨大的学生(主 AI)已经在展现天才才华的同时,从零开始学习。这就像是要求一个蹒跚学步的幼儿去管理一家价值数十亿美元公司的预算,而首席执行官(CEO)正在做决策。这个幼儿(计算器)会感到困惑,大喊乱码数字,并导致整个系统陷入恐慌。研究人员发现,这个“计算器”实际上弊大于利。它非常不稳定,导致 AI 的学习过程因错误而爆炸,在许多情况下,AI 学到的东西甚至还不如直接用随机噪声替换掉这个计算器。
解决方案:丢掉计算器,利用群体
GFlowRL 的作者提出了一个简单而大胆的问题:“我们真的需要这个破损的计算器吗?”
他们意识到,AI 本身已经在做计算器本该做的工作了。当 AI 进行练习时,它不仅仅是尝试一个答案;它会同时尝试一组答案(就像一个焦点小组)。研究人员注意到,他们可以直接观察 AI 已经生成的这组答案,从而推算出他们所需的平衡。与其构建一个单独的、脆弱的机器来进行数学运算,他们只需利用眼前的现有数据即可。
可以这样想:与其雇佣一个紧张不安的会计来告诉你团队赚了多少钱,你只需要查看团队刚刚递交给你的收据。信息是一样的,但它是即时的、真实的,而且不需要一台可能会坏掉的新型昂贵机器。
这种简单的转变——用快速的、即时的群体估算取代复杂的、经过学习的计算器——改变了一切。
- 稳定性: 那些疯狂、爆炸式的错误消失了。训练过程变得像当今的标准方法一样平滑。
- 简洁性: 他们不再需要训练第二个额外的模型。这节省了大量的计算能力和时间。
- 性能: 出人意料的是,AI 不仅没有崩溃,反而变得更强了。
结果:从崩溃到冠军
团队在 AI 最难的一些挑战上测试了这种新方法 GFlowRL:
- 数学: 他们在困难的数学竞赛上训练模型。新方法帮助 AI 解决的问题比以往任何试图鼓励多样性的方法都要多。
- 编程: 他们在 Codeforces 等竞争性编程网站上进行了测试。一个使用 GFlowRL 训练的 140 亿参数模型达到了 2048 的评分。换句话说,这是一个极高的水平,击败了之前的开源纪录,并仅以 25 分之差接近了目前最顶尖的闭源 AI(o3-mini)。
- 安全性(红队测试): 他们还测试了“红队测试”,这是一种试图破坏 AI 安全规则以观察其是否稳固的方法。在这样一个以往方法完全失效的嘈杂且混乱的环境中,GFlowRL 取得了成功,实现了最高的攻击安全过滤器的成功率,证明了即使在反馈混乱的情况下,它也能学习复杂的、多样化的策略。
或许最令人印象深刻的部分是它的扩展能力。当他们尝试将这种方法应用于大规模的“混合专家模型”(Mixture of Experts, MoE)——即拥有数千亿参数的 AI 系统时,以往的方法会立即崩溃。然而,GFlowRL 却能完美运行,即使是在一个拥有 2350 亿参数的模型上。
为什么这很重要
这里的核心启示不仅仅是他们构建了一个更好的 AI 训练器;而是他们意识到,追求“最好”的方法并不总是最复杂的方法。通过剥离掉旧配方中不必要且不稳定的部分,他们找到了一条既简单又强大的路径。
GFlowRL 表明,要让 AI 真正聪明且具有多样性,我们并不需要添加更多复杂的机器层。有时,教导一位超级智能的学生,最好的办法不是过度设计教学计划,而是让他们直接从已有的想法群体中学习。事实证明,扩展 AI 推理能力的关键不在于增加更多工具,而在于准确知道该丢弃哪些工具。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。