← 最新论文
💬 NLP

Toward Autonomous Long-Horizon Engineering for ML Research

本文介绍了 AiScientist 系统,该系统通过结合分层编排与基于持久化文件状态(File-as-Bus)的工作空间管理,有效解决了机器学习研究中长周期工程任务的连贯性问题,并在 PaperBench 和 MLE-Bench Lite 基准测试中显著超越了现有基线。

原作者: Guoxin Chen, Jie Chen, Lei Chen, Jiale Zhao, Fanzhe Meng, Wayne Xin Zhao, Ruihua Song, Cheng Chen, Ji-Rong Wen, Kai Jia

发布于 2026-04-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Guoxin Chen, Jie Chen, Lei Chen, Jiale Zhao, Fanzhe Meng, Wayne Xin Zhao, Ruihua Song, Cheng Chen, Ji-Rong Wen, Kai Jia

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 AiScientist 的超级智能系统,它的目标是让 AI 能够像人类科学家一样,独立、长时间地从事复杂的机器学习(ML)研究工程。

为了让你更容易理解,我们可以把这项研究想象成**“建造一座摩天大楼”,而传统的 AI 助手就像是一个“只会听指令的短工”**。

1. 核心难题:为什么让 AI 做科研这么难?

想象一下,你雇佣了一个非常聪明的建筑工(AI),让他根据一张模糊的图纸(科研论文)去盖一栋大楼。

  • 传统 AI 的困境(短视与遗忘):
    这个建筑工很聪明,能看懂图纸的一部分,也能砌几块砖。但是,盖大楼需要几天甚至几周的时间。

    • 当他砌到第 10 层时,他可能已经忘了第 1 层地基是怎么打的。
    • 如果第 5 层漏水了,他可能想不起是因为第 2 层的管道没装好,还是因为第 3 层的材料选错了。
    • 他每次和老板(人类)沟通,都要把之前的所有事情重新讲一遍,结果老板听得头昏脑涨,他也记不住重点。
    • 结果: 大楼盖了一半就塌了,或者因为记性不好,一直在原地打转,修修补补却永远盖不完。
  • 真正的挑战: 科研不仅仅是“想出一个好点子”,更重要的是漫长的执行过程:搭建环境、写代码、跑实验、发现错误、分析原因、修改代码、再跑实验……这个过程可能持续几十个小时。AI 必须在这个漫长的过程中,保持记忆的连贯性逻辑的一致性

2. AiScientist 的解决方案:两个核心绝招

为了解决这个问题,作者设计了一套全新的系统,核心思想可以概括为:“薄指挥,厚档案”

绝招一:文件即总线(File-as-Bus)—— 建立“永不遗忘的公共档案室”

这是 AiScientist 最厉害的地方。

  • 以前的做法(对话式交接): 就像两个工人交接班,A 告诉 B:“嘿,昨天我们修了水管,今天记得去修电路。”如果 A 忘了说细节,或者 B 没听清,第二天就全乱了。
  • AiScientist 的做法(档案室模式):
    想象有一个巨大的、分类清晰的公共档案室(共享工作空间)。
    • 当 AI 分析完论文,它不是把结论“告诉”下一个 AI,而是把详细的分析报告写进档案室分析.md 文件里。
    • 当 AI 写完代码,它把代码存进 代码库 文件夹。
    • 当实验失败了,它把错误日志和原因分析记在 实验日志.md 里。
    • 关键点: 下一个 AI 来干活时,它不需要听别人“转述”,而是直接打开档案室,阅读最新的文件。
    • 比喻: 这就像是一个**“永不遗忘的黑板”。无论过了多久,无论换了多少个工人,只要他们走进档案室,就能立刻看到项目的全貌、之前的尝试和失败的原因。这保证了项目状态的连续性**。

绝招二:分层指挥系统(Hierarchical Orchestration)—— 聪明的“项目经理”与“专业工匠”

AiScientist 不是一个人在战斗,它有一个团队

  • 顶层指挥官(Orchestrator): 这是一个“项目经理”。它不亲自去砌砖或写代码,它只负责看大局。它手里拿着一张精简的地图(工作空间概览),知道现在该修电路了,还是该铺地板了。它只给下面的工人下达简短的指令。
  • 专业工匠(Specialist Agents): 下面有专门的“论文分析员”、“代码工程师”、“实验测试员”。
    • 当指挥官说“去修电路”时,电路专家会接手。它会去档案室查阅之前的电路图纸,然后专注地干活。
    • 干完活后,它把结果写回档案室,然后告诉指挥官:“电路修好了,这是报告。”
    • 比喻: 就像一家大型建筑公司。老板(指挥官)只负责定战略,具体的活由不同工种的专家(工匠)去干。专家之间不直接吵架或传话,而是通过公共档案室来协作。

3. 实验结果:它真的行吗?

作者把 AiScientist 放在两个极其困难的“考场”里进行测试:

  1. PaperBench(复刻论文): 让 AI 从零开始,根据一篇顶级会议论文,重新写出代码并跑出相同的结果。
    • 结果: AiScientist 的得分比之前最好的 AI 高了 10 分以上,甚至接近了人类博士生的水平。
  2. MLE-Bench Lite(竞赛优化): 让 AI 在机器学习竞赛中,通过不断尝试来优化模型,争取拿奖牌。
    • 结果: AiScientist 获得了 81.82% 的获奖率,远超其他对手。

最有趣的发现(消融实验):
作者做了一次“破坏性实验”:把“档案室”(File-as-Bus)关掉,让 AI 只用“对话”来交接工作。

  • 结果: 性能断崖式下跌!在竞赛中,获奖率直接掉了 30 多个百分点
  • 结论: 这证明了,对于长周期的科研任务,“记得住之前的细节”(档案室)比“多聊几句”(增加对话轮数)重要得多。

4. 总结:这对我们意味着什么?

这篇论文告诉我们,让 AI 真正独立做科研,关键不在于让 AI 变得更“聪明”(推理能力更强),而在于改变它的“工作方式”

  • 以前: 我们试图让 AI 像人脑一样,把所有事情都记在脑子里(上下文窗口),结果记不住,容易乱。
  • 现在(AiScientist): 我们给 AI 配了一个超级档案室专业团队。AI 不需要记住所有事,它只需要学会查阅档案分工协作

一句话总结:
AiScientist 就像是一个拥有“无限记忆档案室”和“专业分工团队”的超级科研管家。它不再依赖脆弱的口头传话,而是通过扎实的文件记录清晰的指挥链,让 AI 能够像人类科学家一样,日日夜夜地、连贯地攻克难关,最终独立完成复杂的科研工程。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →