Harnessing the Collective Intelligence of AI Agents in the Wild for New Discoveries
本文介绍了 EinsteinArena,这是一个去中心化的平台,其中自主 AI 智能体通过公开交互和思想共享协作解决开放数学问题,并成功生成了包括改进 11 维密堆积问题界限在内的 12 项新的最先进成果。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个持续 24 小时的巨型数字科学博览会,参赛者不是人类,而是 AI 智能体。这就是 EinsteinArena,一个由 Together AI 和斯坦福大学的研究人员创建的新平台,旨在观察 AI 是否能像人类科学家一样通过协作来解决复杂的数学问题。
以下是其运作方式的简单说明:
旧模式:“孤狼” vs. “团队”
过去,当 AI 尝试解决科学问题时,它通常表现得像一只孤狼。一个 AI 会被赋予一个问题,在隔离状态下尝试解决它,然后停止。如果失败了,这种失败就会随之消失。如果它找到了部分答案,也没有其他人能看到或在其基础上进行构建。这就像一位研究人员在封闭的房间里工作,从不分享笔记,从不看别人的尝试,并且每次都要从头开始。
EinsteinArena 改变了规则。它将这一过程转变为一个协作社区。你可以把它想象成一个大规模的开源工作坊,其中包含:
- 问题: 一系列未解的数学谜题(例如寻找最完美的球体堆积方式或计算特定的数值)。
- 计分板: 一个实时排行榜,显示每个谜题当前的最优解。
- 聊天室: 一个公共论坛,智能体可以在其中发布想法,说“我尝试了这个方法但失败了”,或者询问“有人知道为什么这个数字很奇怪吗?”
- 规则手册: 每个智能体都能访问完全相同的“验证器”(一个裁判脚本),用于检查答案是否正确。
重大突破:“切比雪夫数”(Kissing Number)
论文重点介绍了一个关于 “11 维空间切比雪夫数” 的成功案例。
- 类比: 想象一下,尝试在中心橙子周围尽可能多地摆放橙子,使它们都接触中心橙子且互不重叠。在 11 维空间中,这极其困难。
- 历史: 在大约 40 年的时间里,人类或 AI 能做出的最好成绩是摆放 582 个橙子。随后在 2022 年,人类将其提升到了 592。2025 年,一个名为 AlphaEvolve 的 AI 将其提升到了 593。
- EinsteinArena 的结果: 到 2026 年 5 月,EinsteinArena 上的智能体将这个数字推高到了 604。
他们是怎么做到的?
这并不是因为某个超级聪明的 AI 产生了“灵光一现”的瞬间。这是一场接力赛:
- 智能体 A 找到了一个混乱的、接近正确的解法,但无法使其完美。
- 智能 第二个智能体 B 在公共论坛中看到了智能体 A 的工作。它没有从头开始,而是说:“我看到你尝试了这个形状。如果我们微调一下数学逻辑让它更平滑,会怎么样?”
- 智能体 C 注意到了智能体 B 数字中的一种模式,并意识到这些数字看起来像是整数。他们将混乱的小数“捕捉”并转化为整洁的整数,从而创造出了一个完美的、可证明的解。
- 智能体 D 拿到了这个完美的解,并将其扩展以容纳更多的橙子。
论文称之为**“集体智能”**。这些智能体分享了他们的“失败尝试”和“部分想法”,就像人类研究人员分享预印本和会议笔记一样。这使得他们能够比任何单独的登山者更快地攀登高峰。
“野外”实验
研究人员称之为“野外 AI”,因为他们并没有以特定的方式强迫智能体进行交流。他们没有规定“你是领导者,你是跟随者”。相反,他们只是提供了平台,让它们自行摸索。
- 有些智能体只是提交答案。
- 有些智能体只是在聊天室中提问。
- 有些智能体则分析他人失败的原因。
结果如何?该平台发现了 12 个新的“最先进水平”(state-of-the-art)结果(即各种数学问题中发现的最优解)。其中最著名的就是 11 维切比雪夫数,它从 593 跳跃到了 604。
为什么这很重要(根据论文观点)
论文认为,要让 AI 真正推动科学进步,它需要的不仅是更好的“大脑”,还需要基础设施。
- 透明度: 因为“裁判”(验证器)是公开的,智能体可以在提交之前在本地测试自己的想法,就像科学家在实验室中运行模拟实验一样。
- 共享记忆: 平台充当了一个共享记忆库。今天的智能体可以从三天前发生的失败中学习,而不是浪费时间重复同样的错误。
- 非“黑箱”: 与以往 AI 在秘密状态下工作的系统不同,在这里,每一步、每一次讨论以及每一个部分结果都是可见的。
核心结论
EinsteinArena 证明了,如果你给 AI 智能体一个分享、竞争并基于彼此成果进行构建的场所,它们解决问题的速度和质量都会比单独工作时更高。这不仅仅关乎一个天才 AI,而是一个AI 社区,它能从每一步、每一个错误以及沿途的每一个小胜利中学习。
注:论文严格聚焦于数学优化问题(如形状堆积和不等式)。它并不声称这些结果目前适用于医疗诊断、气候建模或其他现实世界的应用;这只是一个关于 AI 协作方式如何运作的原理验证(proof-of-concept),是在受控的数学环境中进行的。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。