← 最新论文
💻 computer science

Meta-Task: Turning Terminal Task Synthesis into a Terminal Task for Scalable Agent Training

该论文介绍了 Meta-Task,这是一个可扩展的框架,它将终端任务合成重新定义为一种可验证的终端任务本身,使智能体能够在真实的容器环境中迭代地生成、执行并筛选高质量的训练轨迹,从而以比现有方法显著更少的数据量,在 Terminal-Bench 2.0 上实现卓越的性能。

原作者: Zhihong Pan, Jiyuan He, Kai Zhang, Yupeng Han, Ze Liu, Yuze Zhao, Yongcong Ye, Zhaohua Yang

发布于 2026-07-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhihong Pan, Jiyuan He, Kai Zhang, Yupeng Han, Ze Liu, Yuze Zhao, Yongcong Ye, Zhaohua Yang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个机器人如何使用计算机的命令行——那个通过输入命令来修复软件、管理文件或运行复杂程序的文本界面。这是人工智能的一种超能力,但教它就像是通过只看食物的照片来教一个孩子做饭。机器人需要真正地切菜、品尝汤的味道,并意识到自己什么时候把吐司烤焦了。在 AI 的世界里,这种“烹饪”发生在被称为“终端”(terminal)的数字沙盒中,而“食谱”则被称为“任务”(tasks)。长期以来,研究人员一直难以创造出足够多真实且具有挑战性的任务来训练他们的机器人。他们要么试图从现实世界的代码中复制粘贴旧任务(这很枯燥且重复),要么要求聪明的 AI 直接“编造”一个任务(但这往往会导致生成的食谱无法烹饪或根本无法运行)。

这篇论文介绍了一种解决该问题的巧妙新方法,称为 Meta-Task。Meta-Task 不仅仅是要求 AI 写一份食谱,而是构建了一个“烹饪学校”,让 AI 必须成为厨师。他们把“创建任务”这一行为本身变成了一个任务。AI 被投入到一个真实的、隔离的计算机容器(数字厨房)中,并被告知:“你的工作是为另一个 AI 设计一个新的谜题。你必须编写指令、搭建厨房、编写解决方案,然后通过亲自解决这个谜题来证明它是有效的。”如果谜题崩溃或解决方案失败,AI 必须在进入下一阶段前将其修复。这就像是一个电子游戏,玩家必须设计关卡、建造障碍物,然后打通自己设计的关卡,游戏才会保存进度。

研究人员发现,这种“自我博弈”(self-playing)的方法是一个游戏规则改变者。通过让 AI 在真实的计算机环境中生成并测试自己的任务,他们创建了一个包含 3,221 个高质量、经过验证的训练样本的数据集。当他们使用这些样本来训练一个中等规模的 AI 模型时,结果令人惊喜。该模型的表现从几乎只能通过 4% 的测试跃升到了接近 32%,击败了使用数十万个样本的其他方法。论文表明,秘诀不在于拥有更多的数据,而在于拥有经过 AI 自身严格测试和验证的数据,从而确保教给它的每一课都是真正可解且真实的。

既是厨师又是菜单的设计者

为了理解为什么这意义重大,让我们看看旧方法是如何运作的。想象你想教一名学生如何修理汽车发动机。第一种方法是去废车场,找出一堆坏掉的汽车,然后说:“拿着,试着修好这些。”这就是研究人员过去的做法:他们从真实的代码仓库中挖掘 Bug。问题在于,那些“坏掉的汽车”大多只是轻微划痕(简单的 Bug),而且废车场里的全是同一种型号和款式的车。学生永远学不会如何修理变速箱或发动机缸体,因为那些任务太罕见或太杂乱,难以找到。

第二种方法是问一个聪明的 AI:“请为我发明一个汽车修理任务。”AI 会写下类似“修理发动机”的描述,甚至可能写出一个虚假的解决方案。但问题在于,AI 只是在瞎猜。它并没有真正的汽车、扳手或车库。它只是在写一个关于修车的故事。通常情况下,这个故事在纸面上看起来很有道理,但如果你真的去操作,发动机根本发动不了,或者扳手根本对不上。这个任务是一个“幻觉”——一个无法执行的美丽谎言。

Meta-Task 通过将 AI 变成一个配备齐全、真实的厨房里的“厨师”来改变游戏规则。研究人员不仅要求 AI 写一份菜单,还给了它一个真实的厨房(Docker 容器),并对它说:“创造一道新菜,把它做出来,尝尝味道,如果不好吃,就不断修正直到它完美为止。”

以下是 Meta-Task 流水线的工作步骤:

  1. 设置(厨房): 研究人员构建了一个带有模板的数字厨房。它有一个空白的食谱本 (instruction.md)、一份食材清单 (Dockerfile) 和一个品鉴员 (tests)。
  2. 挑战(订单): AI 会收到一个订单。它可能会说,“创建一个关于修复数据库的任务,”或者“创建一个关于保护网络安全的任务。”AI 必须决定确切的问题是什么、难度应该是多少,以及解决方案看起来是什么样的。
  3. 烹饪(执行): 这是神奇的部分。AI 不仅仅是写下食谱;它实际上会运行代码。它搭建环境、编写解决方案,然后运行测试。如果测试失败(菜品味道烧焦了),AI 会在终端看到错误信息,意识到自己的错误,然后返回去修复代码。它会循环这个过程,直到这道菜变得完美。
  4. 质量控制(评委): 一旦 AI 创建了一个完美的任务,第二个“评委”AI 会查看整个过程。它会检查:“厨师是真的做出了这道菜,还是只是偷看了答案?他是否走了捷径?”如果厨师作弊了或者任务太简单,整个任务都会被丢弃。

为什么这很重要:质量胜过数量

论文显示,这种方法极其高效。研究人员生成了大约 15,000 个任务,但在经过所有的烹饪和质量检查后,他们仅保留了 3,221 个完美的任务。你可能会想:“与其他 AI 模型使用的数百万个示例相比,这个数字太小了。”但是,当他们用这 3,221 个高质量、经过验证的例子来训练他们的 AI 时,结果令人震惊。

  • 一个 140 亿参数的模型(中等规模的大脑)其成功率从 5.2% 提升到了 22.5%
  • 一个 320 亿参数的模型从 4.1% 跳升到了 31.8%

从这个角度来看,这个在仅有的 3,221 个示例上训练的 320 亿参数模型,表现优于那些在 490,000 个示例上训练的其他模型。这就像一个学生在仅仅学习了 3,000 个完美的、经过验证的练习题后,就击败了一个背诵了 500,000 个随机且半途而废的练习题的学生。

论文明确反对“你只需要更多数据”的观点。他们发现,如果数据是“幻觉出来的”(没有经过实际测试而凭空捏造),或者如果 AI 采取了捷径(比如阅读答案解析),那么增加数据的量反而会对学习产生负面影响。关键在于执行落地(execution grounding)。因为 AI 必须在真实的终端中实际运行代码以证明其任务有效,所以这些数据是真实的、可验证的,且没有谎言。

“自我博弈”的视频游戏类比

把这想象成一个玩家同时也是游戏设计师的视频游戏。在大多数 AI 训练中,游戏设计师(研究人员)会将他们制作的关卡交给玩家(AI)。有时关卡是损坏的,或者玩家会发现一个漏洞来跳过 Boss。

在 Meta-Task 中,玩家被告知:“设计一个新关卡。建造墙壁,放置敌人,然后这个关卡以确保它是可以通关的。如果你卡住了,重新设计关卡。如果你发现了漏洞,修复它。只有当你能完美通关自己的关卡时,它才会被添加到游戏中。”

这确保了游戏中的每一个关卡都是公平、可解且具有挑战性的。AI 通过设计它最终将面临的挑战来进行学习,这迫使它深入理解游戏的规则。

结果与局限性

研究人员在名为 Terminal-Bench 2.0 的著名基准测试上测试了他们的新 AI,这相当于 AI 终端技能的“奥林匹克”。他们的模型在仅用 3,221 个示例训练后,得分达到了 31.8%,这是一个巨大的飞跃。它甚至击败了一些在海量数据集上训练过的更大规模的模型。

然而,论文也谨慎地指出它不能做的事情。该系统目前仅适用于 Linux 计算机(在这些数字容器内)。它目前还无法在 Windows 或 Mac 上运行,因为这些系统的规则和工具不同。此外,用于创建任务的“种子”(即构建什么内容的创意)仍然是由人类选择的,尽管 AI 承担了创建实际任务的繁重工作。作者建议,未来可以直接从现实世界的开发者论坛中提取想法,以使任务更加多样化。

最终,Meta-Task 证明了,当你给 AI 一个可以真实游玩的环境,并让它负责创建和测试自己的挑战时,它学得更快、更好,而不是仅仅喂给它一座未经验证的数据大山。这是一种从“教你如何做”到“让你去做”的转变,而这似乎是构建更聪明、更强大的 AI Agent 的秘诀所在。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →