Discovering Multiagent Learning Algorithms with Large Language Models
本文证明大语言模型能够自动化发现适用于非完美信息博弈的竞争性多智能体强化学习算法,并表明将这些复杂且特定于环境的发现提炼为最小算法核心,可带来更优越的泛化能力并降低结构复杂度。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教一群机器人如何玩扑克、围棋,甚至是“吹牛骰子”游戏。几十年来,人类一直担任教练的角色,手动调整机器人的“大脑”,尝试不同的数学公式,并寄希望于它们能变得更强。这是一个缓慢、枯燥的试错过程。
本文描述了一种全新的教练方式:研究人员不再由人类手动调整代码,而是让一个大型语言模型(LLM)——一种能够理解代码的超级智能人工智能——扮演进化生物学家的角色。他们将此系统称为AlphaEvolve。
以下是他们发现的故事,拆解为几个简单的概念。
1. 进化实验室
研究人员建立了一个数字“实验室”,其中包含两种不同类型的游戏算法:
- CFR(反事实遗憾最小化):把它想象成一个通过审视自己犯下的每一个错误来学习的学生,他会问:“如果我当时做了别的,我会赢吗?”
- PSRO(策略空间响应 oracle):这就像一位教练,他组建一支由不同玩家组成的团队,让他们相互对抗,并不断在阵容中加入新的、更聪明的玩家,以击败当前的最佳选手。
研究人员将上述算法的源代码交给了 LLM,并指示它:“改进这些算法。减少机器人所犯的错误(可被利用性)。”
LLM 并没有只是微调几个数字,而是重写了代码本身的逻辑,像 DNA 突变一样对算法进行变异。经过许多代“适者生存”的演化后,LLM 生成了两个全新的、高度复杂的算法:
- VAD-CFR:这是“遗憾”学生的一种变体,它能根据游戏的混乱程度进行剧烈适应。
- SHOR-PSRO:这是“团队教练”的一种变体,它以非常具体且复杂的方式混合不同的策略。
2. “过度工程化”的陷阱
当他们测试这些由 AI 发现的新算法时,结果令人惊叹。在它们接受训练的具体游戏中,它们击败了所有人类设计的冠军。
然而,研究人员注意到了一些可疑之处。LLM 构建这些算法的方式,就像一位主厨为了一位极其挑剔的食客专门制作一道菜。代码中充满了复杂且纠缠的机制,这些机制在训练游戏中表现完美,但很可能只是“过拟合”——即死记硬背了训练数据,而非掌握了游戏的通用规则。
这就像 LLM 制造了一辆汽车,配备了涡轮增压、氮气加速系统以及专为某条特定赛道调校的悬挂系统。它能在该赛道上获胜,但如果你把它开到颠簸的土路上,它可能会散架。
3. “消融”手术(侦探工作)
为了找出究竟是什么让这些算法变得聪明,研究人员进行了“手术”。他们系统地移除代码的各个部分,观察会发生什么。这被称为消融。
他们发现,那些花哨、复杂的部分(例如追踪波动性或以特定方式混合策略)大多是多余的。它们帮助算法在训练赛道上获胜,但无助于将其泛化到新的游戏中。
当他们剥去“华丽的外衣”后,发现了真正让引擎运转的核心骨架。
4. 提炼后的赢家
通过只保留最本质、最基本的原则,并剔除过度复杂的代码,他们创建了两个新的、更简单的算法:
WOP-CFR(暖启动乐观预测性 CFR):
- 类比:想象一个学生在上课的前 500 天拒绝记笔记(“暖启动”),以避免写下坏习惯。然后,他开始记笔记,但他持有“乐观”态度——他假设下一步会比实际情况稍好一些,这有助于他更快地学习。
- 结果:这个简化版本在泛化到新游戏方面实际上比复杂的原始版本更出色。它不太容易因新情况而感到困惑。
PM-PSRO(投影匹配 PSRO):
- 类比:想象一位教练忽略了人群的“噪音”。与其查看每一个分数,他们关注的是球员相对于整个团队平均水平的表现。如果球员低于平均水平,他们会被立即遗忘;如果高于平均水平,他们就会获得聚光灯。
- 结果:这个精简版本也优于复杂的原始版本,证明了 LLM 复杂的混合逻辑并非必要。
5. 核心启示
该论文的结论是:LLM 擅长提出想法,但需要人类来提炼它们。
LLM 就像一位富有创造力的发明家,制造出了一台拥有 500 个运动部件的机器。而研究人员则像工程师一样意识到:“嘿,我们只需要其中的 3 个部件就能让它运转,移除另外 497 个部件会让它更快、更可靠。”
主张总结:
研究人员成功利用 AI 发现了击败人类专家的新游戏算法。然而,AI 的原始发现过于复杂且专用。通过手术式地移除不必要的复杂性,他们创造了更简单、更清晰的算法,这些算法在处理新的、未见过的游戏时甚至表现更好。这证明了 AI 可以成为科学发现的强大工具,前提是必须有人类在场来简化和解读结果。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。