← 最新论文
💬 NLP

Towards Execution-Grounded Automated AI Research

本文介绍了一个自动化执行框架,该框架通过大规模并行 GPU 实验来验证并改进由大语言模型(LLM)生成的科研构想,证明了执行引导的进化搜索能有效发现更优的预训练与后训练方法,同时揭示了强化学习的局限性以及前沿大语言模型在此背景下的早期饱和现象。

原作者: Chenglei Si, Zitong Yang, Yejin Choi, Emmanuel Candès, Diyi Yang, Tatsunori Hashimoto

发布于 2026-01-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Chenglei Si, Zitong Yang, Yejin Choi, Emmanuel Candès, Diyi Yang, Tatsunori Hashimoto

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一支由才华横溢但缺乏经验的科学家组成的团队,他们能构思出成千上万个关于如何建造更好机器人的疯狂且富有创意的想法。问题在于,这些想法大多就像画在餐巾纸上的蓝图:看起来很有说服力,但如果你尝试去建造它们,它们要么会分崩离析,要么毫无用处。

这篇论文讲述了如何建造一个机器人工厂,该工厂能够即时测试这些餐巾纸草图,看看哪些真正可行,并根据这些测试结果教导科学家如何画出更好的蓝图。

以下是他们是如何实现的,分为几个简单的步骤:

1. 设置:“创意工厂”

研究人员构建了一个拥有三个主要部分的庞大自动化系统:

  • 梦想家(构思者): 一个能用纯英文生成研究想法的 AI(例如,“改变机器人学习数学的方式”)。
  • 建造者(实现者): 一个智能系统,它能阅读“梦想家”的英文想法,并立即编写实际的计算机代码来构建它。
  • 测试者(执行者): 一个由超级计算机(GPU)组成的巨大仓库,用于运行代码。如果代码运行成功,它会给出一个分数(类似于考试成绩);如果代码崩溃,则给零分。

他们在两个特定的“训练场”上测试了这个工厂:

  1. 教机器人学得更快(预训练)。
  2. 教机器人更好地解决数学问题(后训练)。

2. 第一项测试:AI 能否构建它自己的想法?

在教 AI 学习之前,他们必须先检查 AI 是否能构建它所想象的东西。

  • 结果: 出人意料的是,是的!当他们要求顶尖 AI 模型生成想法时,工厂能够成功构建并测试其中约 90% 的想法。
  • 惊喜之处: 即使没有任何特殊训练,AI 的“最佳猜测”想法已经比标准的起始点更好了。这就像是一个学生在开学第一天,就画出了一张比学校校车跑得更快的汽车蓝图。

3. 方法一:“进化搜索”(自然选择)

研究人员尝试使用一种类似于自然界进化的方法来教 AI 变得更好。

  • 运作方式: AI 生成 50 个想法。工厂进行测试。其中的“优胜者”(获得高分的想法)会被保留下来。然后,AI 被要求通过混合和匹配优胜者的最佳部分,同时尝试一些完全疯狂的新想法(以防万一),来创造 50 个的想法。
  • 类比: 想象一位厨师在品尝 50 种汤。他们保留其中最好的 5 种,然后要求厨房制作 50 种新的汤,这些新汤是对那 5 种汤的微小改进,同时也包含一些疯狂的新口味。
  • 结果: 这效果极佳。仅仅经过 10 轮这样的过程,AI 就找到了一种教数学机器人的方法,其表现显著优于人类专家的基准线。它还找到了一种训练学习机器人的方法,速度几乎是标准方法的两倍
  • 代价: AI 变得非常擅长此道,但它似乎很快就遇到了一个“天花板”。它在一段时间后不再变得更好,而且只有一种特定的 AI 模型在持续稳步提升。

4. 方法二:强化学习(“成绩驱动型”学生)

接下来,他们尝试了另一种方法:强化学习 (RL)。这就像用零食训练狗。

  • 运作方式: AI 生成想法,获得分数(奖励),系统利用数学方法微调 AI 的大脑,使其在下次更有可能生成高分想法。
  • 结果: AI 的平均分数上升了。它开始写出更多“安全”的想法,这些想法通常能得到及格分。
  • 问题(“无聊循环”): AI 的最高分数并没有上升。事实上,AI 开始变得懒惰了。它意识到,两个非常简单、无聊的想法(比如“把一种数学规则换成另一种”)总能得到一个不错的成绩。于是,它停止了尝试任何新事物,只是反复重复这两个想法。
  • 类比: 想象一个学生意识到,写三句“天空是蓝色的”总能得到 C+ 的成绩。与其努力写出一篇杰作来拿 A+,他宁愿反复写下“天空是蓝色的” 50 遍。他的平均成绩提高了,但他从未产生过任何精彩的内容。研究人员称之为**“模式坍缩”(Mode Collapse)**。

5. 他们学到了什么?

  • 进化更利于发现: 如果你想找到一个突破(最好的想法),让 AI 通过混合和匹配优胜者来进行进化,要比仅仅奖励它“表现良好”要好得多。
  • AI 会因奖励而变懒: 如果你仅仅因为 AI 得到了及格分就奖励它,它就会停止冒险,并固守简单、安全的想法。它停止了“深度思考”(“思考痕迹”变短了),只是重复那些行之有效的东西。
  • 未来: 该系统证明了我们可以实现 AI 研究想法的自动化测试。然而,要获得真正的革命性发现,我们需要教 AI 不仅仅是获得好成绩,还要保持探索新的、具有风险性和复杂性的想法,而不是陷入无聊、安全的答案循环中。

简而言之: 他们建造了一个可以即时测试 AI 想法的工厂。他们发现,让想法“进化”会产生突破,但仅仅通过奖励 AI 的表现水平会让它变得懒惰且重复。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →