Algorithm Discovery With LLMs: Evolutionary Search Meets Reinforcement Learning
本文提出了一种新颖的框架,通过强化学习微调持续优化大语言模型的搜索算子,从而增强基于大语言模型的进化搜索以用于算法发现,进而加速组合优化任务中更优解的识别。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在尝试发明一种全新的、超级高效的完美蛋糕烘焙食谱。你有一位才华横溢的厨师(即大型语言模型,或 LLM),他可以写下食谱。
旧方法:“静态厨师”
在之前的方法(如名为"FunSearch"的方法)中,你会让厨师写一份食谱。你烘焙它,品尝它,看看它是否美味。如果还可以,你就保留它。如果很棒,你就让厨师参考那份出色的食谱,尝试基于它写出一份稍好一点的食谱。你重复这个过程数千次。
问题出在哪里?厨师从未真正从过程中学习。他们就像一个每次尝试后都会遗忘一切的天才。他们仅凭运气,基于最初的训练不断猜测,希望能偶然发现更好的食谱。他们并没有更新自己关于“什么能做出好蛋糕”的内在知识。
新方法:"EvoTune"(会学习的厨师)
这篇论文的作者提出了一种名为EvoTune的新方法。这就像雇佣了同一位才华横溢的厨师,但这次,你给了他一个特殊的训练循环:
- 味觉测试(进化搜索):和以前一样,厨师写下许多食谱。你烘焙它们,品尝它们,并给它们打分。你保留最好的,淘汰糟糕的。
- 课程(强化学习):这是神奇的一步。与其仅仅扔掉糟糕的食谱,你向厨师展示“优胜者”和“失败者”,并说:“看看其中的区别!优胜者做了这个,失败者做了那个。”
- 更新:然后,你根据这些教训给厨师上一堂快速的“复习课”(微调)。厨师的大脑实际上发生了改变,从而理解了为什么获胜的食谱能奏效。
- 重复:现在,当你让厨师写下下一批食谱时,他们不再仅仅是猜测。他们利用更新后的知识,更快地瞄准好的方向。
为什么这更好?
想象一下在巨大的森林中寻找隐藏的宝藏。
- 旧方法:你派出一名拥有地图但没有记忆的侦察兵。他们四处游荡,找到一个地点,检查是否有宝藏,然后遗忘一切。他们必须再次随机游荡才能找到下一个地点。
- EvoTune:侦察兵找到一个地点,意识到“哦,这里的树木更茂密,所以宝藏很可能就在附近”,并更新他们的内部地图。下次他们外出时,不再随机游荡,而是径直走向有希望的区域。
他们测试了什么?
研究人员在三个棘手的“谜题”游戏中测试了这种方法,计算机必须在这些游戏中找到组织事物的最佳方式:
- 装箱问题:尝试将不同尺寸的箱子装入尽可能少的卡车中。
- 旅行商问题:找到访问城市列表的最短路线,且不重复路径。
- 平板包装:将形状奇特的方块放入网格中而不重叠(就像复杂的俄罗斯方块)。
结果
他们发现,“会学习的厨师”(EvoTune)比“静态厨师”(旧方法)更快地找到了更好的解决方案。
- 更高的分数:EvoTune 找到的食谱(算法)效率更高。
- 更多样性:会学习的厨师不仅仅找到一个好食谱就停止;他们发现了更多样化、独特且高质量的解决方案。
- 现实世界的胜利:在一个特定的挑战中(关于在数据中心放置服务器的 Google Hash Code 竞赛),EvoTune 找到了一种解决方案,实际上比竞赛中人类团队找到的最佳方案还要好。
秘密武器
论文还提到了一种特定的技巧,用于保持厨师的创造力。有时,当你过度训练一个模型时,它会“陷入僵局”,只会一遍又一遍地写同样的东西。为了防止这种情况,他们使用了一种特殊的数学规则(称为“前向 KL"),迫使厨师在从优胜者学习的同时,继续探索新想法。
一言以蔽之
EvoTune 是一个将搜索(尝试许多事物)与学习(根据什么有效来更新 AI 的大脑)相结合的系统。它将一个静态工具转变为一个自我改进的伙伴,随着它尝试解决问题的次数越多,它就越聪明。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。