Beyond the Best Guess: Improving LLM Solution Coverage with Evolution Strategies
本文证明了在针对发现领域的语言模型进行训练后,进化策略(ES)通过保持更广泛的解覆盖范围和更高的 pass@k 分数,优于强化学习(RL),从而避免了限制 RL 在生成多样化候选解方面有效性的输出分布坍缩问题。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图在一座大雾弥漫的广阔岛屿上寻找隐藏的宝藏。在人工智能的世界里,大型语言模型(LLM)就像是极其聪明的探险家,能够阅读地图并推测宝藏可能所在的位置。长期以来,训练这些探险家的最佳方式是展示一个问题,让他们进行猜测,然后只有在他们的单次最佳猜测完全正确时才给予奖励。这种方法被称为强化学习(RL),它就像一位严厉的教练,每当猜错时就大声呵斥“错!”,只有在猜对时才说“完美!”。这个问题的在于,这位教练过于痴迷于寻找那一个完美的答案,以至于探险家停止了在其他地方寻找的可能性。他们不再去探索岛屿那些被迷雾笼罩的边缘地带,那里可能隐藏着其他的宝藏;他们只专注于那个他们认为正确的点。
但如果宝藏不仅仅是一件东西呢?如果解决一个数学问题或发现一个新的科学事实有许多种不同的方式呢?在这些“发现型”领域中,仅仅有一个完美的猜测是不够的;你需要一张宽广的网来捕捉任何正确的解法。这就是为什么“测试时缩放”(test-time scaling)这一新概念应运而生。我们不再只是要求模型给出一个答案,而是要求它生成数十个甚至数百个不同的尝试,并观察其中是否有任何一个是正确的。这篇你即将阅读的论文正在研究:我们的严厉教练(RL)还是另一种不同的训练方法,更能帮助探险家撒下一张宽广的网?研究人员发现,虽然严厉的教练让探险家在某一个点上变得非常自信,但另一种被称为“进化策略”(ES)的方法却能让探险家保持好奇心和游历,确保只要解法存在于迷雾中的任何地方,探险家就更有可能找到它。
论文:超越最佳猜测
这篇论文探讨了训练人工智能时的一个棘手问题:我们如何确保 AI 模型不仅仅擅长猜测那一个正确答案,而是实际上能保持多种选择的可能性,以找到任何一个正确答案?作者是来自 Cognizant AI 实验室和德克萨斯大学奥斯汀分校的研究人员,他们对比了两种训练方法:标准的**强化学习(RL)**和一种较新的方法——进化策略(ES)。
把强化学习想象成一个通过背诵精确答案解析来为考试做准备的学生。如果学生答对了,就会得到奖励;如果答错了,就什么也得不到。久而久之,这个学生会成为特定问题的专家,但却停止了对底层概念的理解。在 AI 世界中,这会导致一种被称为“分布坍缩”(distribution collapse)的现象。模型变得如此专注于它的“最佳猜测”,以至于它停止生成多样化的答案。这就像一位音乐家,因为只有弹奏一个音符才能获得掌声,于是便只弹奏那一个音符,却忘记了如何演奏一整首曲子。
相比之下,**进化策略(ES)**的工作方式更像是一个自然生态系统。ES 不是训练单个模型,而是创造一整个由略微不同的模型版本组成的“种群”。它会随机微调它们的“大脑”(权重),就像自然界中的基因突变一样,并观察哪些版本表现最好。至关重要的一点是,它不仅仅挑选唯一的赢家并丢弃其余部分;它从整个群体中学习。这保持了 AI “大脑”的灵活性和多样性,使其能够探索通往解决方案的许多不同路径。
研究人员在数学问题上测试了这些方法,范围涵盖了从简单的算术到复杂的奥林匹克竞赛级别的挑战,并使用了不同规模的模型(从 15 亿到 320 亿个参数)。他们使用一个名为 pass@k 的指标来衡量成功率。想象一下,要求 AI 对一个问题生成 100 个不同的答案。pass@1 问的是:“第一个答案正确吗?” pass@k 问的是:“这 100 个答案中是否至少有一个是正确的?”
以下是他们的发现:
1. “最佳猜测”陷阱
当研究人员观察 pass@1(单次最佳猜测)时,经过 RL 训练的模型通常表现得非常好。它们敏锐且自信。然而,当研究人员增加猜测次数(k)到 2、8、16 甚至 128 时,RL 模型遇到了瓶颈。它们的表现停止了提升。事实上,对于一些困难的问题,当给予多次猜测机会时,RL 模型的表现甚至比原始的、未经训练的模型还要差。RL 模型在思维上变得如此狭隘,以至于即使尝试 100 次,它也无法找到那些与它“最爱”的答案略有不同的正确答案。
2. 多样性的力量
相比之下,经 ES 训练的模型展现出了不同的模式。虽然它们在第一次猜测时也很出色,但它们的真正超能力在增加猜测次数时才显现出来。随着研究人员要求更多的样本(高达 128 个),ES 模型不断找到新的正确解。论文显示,在他们测试的所有模型规模和数学基准测试中,ES 模型在 pass@k 指标上始终优于 RL。
3. 为什么会这样
作者深入研究了为什么会发生这种情况。他们发现,RL 训练倾向于“修剪”AI 的知识。它删除了那些通向正确但较不常见的答案的路径,实际上使得某些问题即便 AI 尝试 100 次也无法解决。然而,ES 方法保留了 AI 知识的“广度”。它不仅学习正确答案,还学习如何保持多扇门开启。当研究人员观察 AI 的“熵”(衡量答案多样性的指标)时,他们看到,当 RL 模型失败时,它们是“自信地错误”(低多样性)。而当 ES 模型失败时,它们仍然保持着多样性和不确定性,这意味着它们仍在探索,并且如果给予更多的时间或计算资源,它们更有可能找到正确答案。
4. 现实世界的影响
该论文指出,对于我们需要发现新事物的领域——比如解决一个困难的数学证明、编写代码或发现一个新的科学事实——拥有一个能够生成广泛正确解法的模型,比拥有一个仅仅擅长某一个特定猜测的模型更有价值。通过使用 ES,我们可以获得更好的结果,因为在这些发现型领域中,模型不太可能陷入“局部陷阱”,而更有可能找到全局最优解。
简而言之,该论文认为,如果你想让 AI 成为未知领域的伟大探险家,你不应该仅仅训练它成为当天的最佳猜测者。你应该训练它保持多种选择的可能性,稍微游历一下,并准备好无论宝藏藏在哪里都能找到它。事实证明,进化策略才是这种冒险活动的更好教练。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。