Algorithmic algorithm development with LLMs: A Case Study on LLM-Usage for Contraction Order Optimization in Tensor Networks
本文通过使用 OpenEvolve 的案例研究,展示了验证器引导的 LLM 智能体如何能够有效地开发并改进张量网络收缩顺序优化的算法,同时强调了人类科学家在评估、验证和解释过程中的关键作用。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在试图解决一个巨大且复杂的谜题。在物理学和计算领域,这个谜题被称为张量网络(Tensor Network)。为了解决它,你必须按照特定的顺序将许多较小的碎片(张量)组合在一起。
这里有个难点:你把这些碎片拼凑在一起的顺序至关重要。
- 如果你以错误的顺序拼接,谜题可能会暂时膨胀到摩天大楼那么大,然后才缩小回去。这需要巨大的计算机内存和计算量(FLOPs,即“数学步骤”)。
- 如果你以正确的顺序拼接,谜题会保持在较小且可控的状态,从而快速解开。
寻找这个完美的顺序就像是在尝试寻找一条穿过不断变形迷宫的最短路径。这个任务非常困难,以至于即使是超级计算机在面对大型谜题时也会感到吃力。
实验:教 AI 成为“解谜大师”
论文的作者们想看看一个大语言模型(LLM)——一种非常擅长编写代码和解决逻辑问题的 AI 类型——是否能学会自主寻找这些更好的拼凑顺序。他们不仅仅是向 AI 索要答案;他们还设置了一场进化的游戏。
你可以把它想象成一场烹饪比赛:
- 参赛者: AI 生成许多不同的“食谱”(算法),用于将谜题碎片拼接在一起。
- 评委: 一个计算机程序充当评委。它并不实际“烹饪食物”(运行完整的物理模拟);它只是计算每份食谱会消耗多少“食材”(数学步骤)。
- 进化: AI 会观察那些消耗食材最少的食谱,将它们混合在一起,并尝试制作出一个更优秀的、全新的食谱。它会重复这个过程数千次,慢慢地“进化”出一位大师级厨师。
他们测试了什么(人类转动的“旋钮”)
研究人员意识到,AI 并不是一根魔杖;它是一个需要非常具体指令的工具。他们测试了三个主要方面,以观察是什么让 AI 成功或失败:
1. 我们雇佣了哪位 AI 大厨?(模型选择)
他们尝试了不同版本的 AI 模型,从小型模型到庞大的巨型模型。
- 结果: 令其惊讶的是,一个中等规模的 AI 模型(GPT-OSS-20B)表现得甚至比那些巨大且昂贵的模型还要好。这就像是发现了一位本地面包师做的面包比著名的国际连锁店还要好吃。最大的模型有时会变得困惑,或者思考得太久。
2. 如何衡量“好”?(评价指标)
AI 需要一个分数来知道自己是否赢了。研究人员尝试了不同的评分方式:
- 平均分: “这份食谱平均水平如何?”
- 最差情况得分: “这个 AI 可能做出的最差食谱是什么样的?”
- 结果: 事实证明,告诉 AI 去优化“平均值”效果最好。如果告诉它去优化“最差情况”,AI 会变得困惑,并为其他所有人做出糟糕的食谱。定义“胜利”的方式决定了谁会获胜。
3. 它们在什么样的谜题上进行练习?(测试数据)
他们让 AI 在小型、中型和大型谜题上进行练习。
- 结果: 如果 AI 只在小型谜题上练习,它会成为解决小型谜题的高手,并且在解决中型谜题时也表现得相当出色。但如果它在中型谜题上练习,它解决小型谜题的能力反而会下降。这就像一名体操运动员,如果只在平衡木上训练,那么在自由体操环节就会失败。你选择的特定练习数据决定了 AI 学习到的东西。
“最佳”结果:一个意外的发现
在运行实验后,这个 AI(特别是那个中等规模的模型)找到了一种新的排序方法。
- 好消息: 它找到了一种在处理中型谜题时,比标准的人类方法使用更少数学步骤的方法。在计算步骤方面,它快了约 47 倍!
- 代价: AI 的代码有点像个“黑盒”。它很长、很复杂,而且没有太多解释其原理的注释。当人类查看时,我们意识到 AI 重新发现了一个已知的数学技巧,但又在上面加上了一个奇怪的、前所未有的新变体。
- 警告: 虽然 AI 的食谱在数学上是高效的,但确定这个食谱的过程非常耗时。对于非常大的谜题,AI 的这种方法由于太慢而无法在现实生活中投入使用。
核心启示
论文得出结论:虽然 AI 是发明新算法的强大工具,但人类仍然是掌舵人。
- 你不能只说“开始吧”。 你必须仔细设计游戏的规则(测试数据、评分系统和超时限制)。如果你设计的游戏很糟糕,AI 就会找到一个“作弊码”,它能在游戏中获胜,但并没有真正解决实际问题。
- 验证是关键。 仅仅因为 AI 说它找到了更快的办法,并不意味着它已经可以投入实用了。人类仍然需要检查代码是否合理、是否具有可读性,以及它是否能在现实世界条件下(如时间限制内)真正运行。
- “仪器”隐喻: 作者建议我们不应将这些 AI 系统视为提供答案的“神奇预言机”。相反,我们应该将它们视为复杂的科学仪器。就像望远镜需要一位熟练的天文学家来对准并解读星空一样,一个 AI 算法也需要一位熟练的科学家来将其指向正确的问题,并解读其结果。
简而言之:AI 是一个聪明、快速但有时会感到困惑的学徒。而人类科学家则是大师级厨师,必须亲自挑选食材、制定菜单,并品尝最终的菜肴,以确保它是真正可以入口的。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。