SETA: Scaling Environments for Terminal Agents
该论文介绍了 SETA,这是一个用于生成可验证终端环境的可扩展框架,它产生了同类规模最大的开源数据集(SETA-Env),使像 Qwen3-8B 这样经过强化学习训练的模型能够在终端智能体基准测试中达到最先进的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在试图教一个超级聪明的机器人如何使用电脑的命令行(那个只能通过输入像 ls 或 cd 这样的命令来操作的纯文本界面)。这有点像在教一位巫师施展咒语,但只能通过向一个非常刻板、非常严厉的精灵低声耳语来进行。这个精灵(电脑)会完全按照你的指令行事,但如果你漏掉了一个微小的细节,咒语就会失效,房间就会陷入黑暗。
长期以来,教导这些“终端智能体”(terminal agents)一直是一场噩梦。为什么呢?因为你不能要求人类写下他们曾经输入过的每一个可能的命令。而且,如果你让机器人自己编造练习题,它往往会创造出一些无法解决的谜题,或者根本学不到任何有用的东西。这就像是试图通过阅读一本从未摸过自行车的人写的书来学习骑自行车一样。
于是有了 SETA(用于终端智能体的规模化环境)。你可以把 SETA 想象成一个自动更新的魔法“训练馆”。它不再只是给这些机器人巫师提供一份静态的任务清单,而是构建了一个完整的世界,让它们可以在其中进行实时练习、失败并学习。
两步走的魔术技巧
研究人员利用两个巧妙的流水线构建了 SETA,它们像主厨和副厨一样协同工作:
“主厨”(SETA-Synth): 这个部分负责从互联网上抓取真实的“食谱”。它会寻找人类解决问题的真实场所,比如 Stack Overflow(人们在那里询问“我该如何修复这段破碎的代码?”)或 Kaggle(数据科学家分享他们的笔记本的地方)。它将这些现实生活中的难题转化为一个标准化的“训练环境”。这就像是将一个混乱的、现实世界的厨房灾难,变成一个干净、安全的练习厨房,并设定一个明确的目标:“修好炉灶,这样汤就不会烧焦了。”
- 关键检查: 系统不会盲目信任机器人厨师。它会运行一个“no-op”测试(不做任何操作并检查厨房是否依然安全)和一个“预言家”(oracle)测试(检查完美方案是否有效)。如果机器人的解决方案失败了,一个特殊的“轨迹判定员”(Trajectory Judge)就会介入。这个判定员就像一名严格的裁判,观察机器人为何失败。如果机器人是因为谜题本身有问题(设计缺陷)而失败,那么这个谜题会被扔进垃圾桶;如果机器人只是因为需要更多练习而失败,那么谜题会被保留下来。
“副厨”(SETA-Evol): 这是自适应的部分。想象一下你在训练一个机器人。如果谜题太简单,机器人会感到无聊且学不到东西;如果谜题太难,它就会放弃。SETA-Evol 会观察机器人的表现。
- 如果机器人轻松应对任务(100% 解决问题),系统会通过增加步骤或棘手的边缘情况来让它变得更难。
- 如果机器人陷入困境并不断失败,系统会通过减少步骤或给予提示来让它变得更容易。
- 如果机器人表现尚可但需要多样性,系统会更换上下文。也许它刚才是在修复一台 Linux 服务器;现在,它是在修复一台 Windows 服务器,但背后的逻辑是一样的。这能让机器人保持敏锐度和适应力。
结果:一个真正学会思考的机器人
团队对这个系统进行了测试。他们采用了一个名为 Qwen3-8B 的模型(一个拥有 80 亿个“神经元”的机器人大脑),并使用这个全新的训练馆对其进行训练。
- 得分: 在训练之前,该机器人在一个名为 Terminal-Bench 2.0 的标准测试中,只能解决大约 3.6% 的高难度终端挑战。经过 SETA 训练后,它的成功率跃升至 12%。这意味着实现了 3.3 倍 的提升!
- 对比: 这个结果是目前为止,在同等规模(80 亿参数)的机器人使用强化学习(通过试错学习)方面所能报告的最佳成绩。它甚至接近了一些规模更大的闭源模型。
- 迁移能力: 他们还在另一个更强大的机器人 DeepSeek-V4-Flash 上进行了测试。尽管这个机器人本身已经相当出色,但 SETA 的训练仍然给了它助力,将其成功率从 40% 提升到了 43%。这表明这种训练不仅仅是针对某一个特定机器人的小技巧,而是一种真正的提升终端技能的方法。
SETA 不是 什么
了解这篇论文没有声称什么也很重要。作者非常谨慎,并没有说他们“解决了”终端智能体的问题。
- 他们没有说这适用于每一个机器人。他们只测试了几个特定的模型(Qwen 和 DeepSeek)。
- 他们没有说这适用于所有计算机界面。这专门针对基于文本的命令行,而不是点击屏幕上的图标或使用鼠标的图形用户界面(GUI)。
- 他们没有声称数据是完美的。他们明确提到必须过滤掉“损坏的”谜题,并且该系统依赖于机器人验证自身工作的能力。
核心启示
这篇论文表明,如果你想教一个机器人成为电脑巫师,你不能只给它一本教科书。你必须为它建立一个训练馆,随着它变得越来越强,练习也会变得越来越难,并且每一项练习都要经过检查,以确保它是确实可以被解决的。
通过将现实世界的难题与一个不断调整难度的系统相结合,SETA 创建了一个包含超过 4,500 个经过验证的训练环境的数据库。它并不是让机器人一夜之间变得完美的魔杖,但它是一个强大的新工具,表明我们可以以一种真正有效的方式来扩展机器人的学习规模。机器人不仅仅是在死记硬背答案;它学会了如何在电脑终端那混乱且不可预测的现实中进行思考。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。