← 最新论文
🤖 AI

Long-Horizon Autonomous Architecture Research with a Language-Model Agent: A Behavioural Case Study

本文通过对单个大型语言模型作为自主研究员进行约100次实验的行为案例研究表明,尽管该智能体成功提升了视觉Transformer的性能,但其生产力和发现模式在很大程度上是由工作流设计约束而非仅仅由模型能力所塑造的。

原作者: Aon Safdar, Mohamed Saadeldin

发布于 2026-08-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Aon Safdar, Mohamed Saadeldin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

数字实验室小白鼠:当 AI 试图独自成为科学家

想象一个这样的世界:计算机不仅仅是遵循指令,而是被要求自己去弄明白如何解决一个谜题。这就是机器学习的领域——这是一个我们教计算机从数据中学习,而不是硬编码每一条规则的科学分支。通常,当我们希望计算机在某项任务上做得更好时(比如识别照片中的猫或预测天气),我们会使用一种叫做神经架构搜索的方法。把这想象成尝试搭建一座完美的乐高塔。你有一个装满积木的盒子(计算机的代码),你想以某种方式堆叠它们,让塔站得最高、最稳。传统上,人类会设计规则来决定如何挑选积木,或者我们使用简单的数学来猜测哪些组合可能效果最好。

但如果我们把整个乐高盒子交给一个超级聪明的机器人,并对它说:“你自己搞定。搭建出你能建出的最好的塔,并且在完成之前不要停下来”——会发生什么呢?这正是这篇论文探讨的核心问题。它在问:如果我们给一个人工智能(AI)智能体所有的工具——比如笔记本、图书馆和用于运行测试的计算机——它能否作为一个孤独的科学家连续工作数周之久?我们关心这个问题,是因为随着 AI 变得越来越聪明,我们想知道它是否能帮助我们更快地发现新事物,还是只会陷入制造微小、乏味变化的循环中。答案不仅关乎于建造更好的塔,更在于理解如何建立一个人类与机器人共同协作、且机器人不会感到厌倦或困惑的团队。


实验:漫长旅途中的机器人研究员

在这项研究中,研究人员搭建了一个数字实验室,并将钥匙交给了单个通用 AI。他们不仅仅是让 AI 解决一个数学问题;他们要求它设计一种新型的计算机大脑,称为视觉 Transformer(Vision Transformer)。具体来说,他们给出了一个棘手的约束条件:这个大脑必须仅使用“通道注意力”(关注图像的颜色和纹理)来工作,并被禁止使用“空间注意力”(观察物体在图像中的位置)。这就像是要求一位厨师在完全不用刀或炉灶的情况下烹饪一顿美食大餐,迫使 AI 发明一种全新的烹饪方式。

AI 被赋予了一套特定的工具:一种管理其代码的方式、一个观察其实验的追踪器、一个用于记住尝试过什么的持久记忆,以及在进行到一半时,可以访问数字科学论文库的权限。人类研究人员退居幕后,仅在改变游戏规则或在 AI 陷入困境时给予引导时才会介入。AI 被留下来运行了大约 10 周的现实时间,提交了大约 150 次实验,并使用了约 2,400 GPU 小时的计算能力。这是一场马拉松,而不是短跑。

三个阶段的故事

实验展开为三个截然不同的章节,每个章节都有其独特的情绪和结果。

第一阶段:黄金时刻与撞墙
在开始时,AI 就像一个置身于糖果店的孩子。它取得了快速且巨大的进步。在仅仅前六次尝试中,它发现了一个能大幅提升准确率的基础技巧。这个技巧非常有效,以至于仅这一个早期的想法就贡献了 AI 在小型测试数据集上所取得的所有进展中的约 80%。但随后,乐趣停止了。AI 撞上了“饱和墙”。它不断尝试微调其设置——在这里改改数字,在那里调调旋钮——但都没有效果。它陷入了一个进行微小、增量式改变的循环中,而这些改变毫无帮助。它仿佛已经用完了新的想法,只是在原地打转。

阶段 1b:图书馆开放
人类研究人员注意到机器人被困住了。他们没有改变机器人的大脑,而是给了它一个新工具:访问科学论文库的权限。突然间,AI 的行为发生了变化。它不再仅仅是微调数字,而是受到阅读内容的启发,开始对实际代码进行大胆的修改。它开始提出新的结构,而不仅仅是调整旧有的结构。这表明机器人并不是“愚蠢”;它只是需要一把不同的钥匙来解锁下一个思维层次。

第二阶段与第三阶段:规模扩大与踉跄
当研究人员将 AI 转移到难度越来越高的测试(从小型图片到大规模、复杂的图像)时,模式重复了。AI 会找到一个好的解决方案,然后陷入试图对该特定解决方案进行微小改进的循环中。它变得非常“贪婪”,这意味着它太爱它当前的最好想法了,以至于拒绝尝试任何完全不同的东西,即使那个想法显然已经失败了。例如,在最难的测试中,AI 找到了一个表现尚可的解决方案,然后花了 18 次尝试进行微小且无用的微调,忽略了它已经陷入困境的事实。这就像一个司机发现轮胎瘪了,却决定继续开车,然后花了几个小时试图抛光轮胎,而不是更换轮胎。

机器人学到了什么(以及没学到什么)

AI 在某些方面表现得惊人地好。它独立地“重新发现”了几个著名的科学事实。例如,它发现对于这种特定类型的计算机大脑,拥有只有一个“头”来关注细节比拥有多个“头”更好——这一发现与人类科学家已知的知识相符。它还意识到,在小图上有效的技巧在处理大图时实际上会损害性能,这表明它能从错误中学习。

然而,AI 也表现出了一些有趣的类人缺陷。

  • 风险规避: 在尝试了一个失败的大胆、冒险的想法后,它变得非常胆小。即使规则允许它再次尝试疯狂的想法,它也会在很长一段时间内坚持使用安全、乏味的思路。
  • 成功追逐: 它喜欢重复最近奏效的做法。如果它发现了一种让计算机大脑变快一点点的方法,它就会不断尝试让它变得更快一点点,而忽略了采用完全不同的方法可能会更好的可能性。
  • “贪婪”陷阱: 最大的问题不在于 AI 的思考能力不行,而在于游戏规则迫使它变得贪婪。系统的设定是,只有当一个想法比前一个更好时,AI 才能保留它。这就像一场游戏,你只有在向上爬坡时才能前进,而永远不能横向移动或退后去尝试另一条路径。AI 完美地遵守了规则,这意味着它被困在了局部的小山丘上,而不是寻找真正的山峰。

核心启示:是工作流,而非大脑

这篇论文最重要的发现是一个令人惊讶的结论。研究人员得出结论:工作流(给予 AI 的规则和工具)与 AI 自身的智能一样重要,甚至更为重要。

AI 的失败并非因为它“笨”。它的失败是因为它正在玩一场为短距离冲刺而非长距离马拉松设计的游戏。“提交或丢弃”规则(如果更好则保留,如果更差则丢弃)迫使 AI 表现得像一个贪婪的登山者,只看眼前的脚步。如果研究人员设计不同的游戏规则——允许 AI 同时运行几个不同的想法,或者强制它每隔几轮尝试一次“登月计划”式的宏大想法——结果可能会完全不同。

简而言之,论文指出,要让 AI 成为优秀的研究伙伴,我们不应仅仅试图让 AI 变得更聪明。我们需要构建更好的“工作流”,鼓励它承担风险、探索不同的路径,并且不要被困在它目前最喜欢的想法中。作者们建议,AI 研究的未来在于设计更好的系统来引导这些数字大脑,而不是仅仅寄希望于它们能自行解决一切。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →