TerminalWorld: Benchmarking Agents on Real-World Terminal Tasks
本文介绍了 TerminalWorld,这是一个可扩展的数据引擎,能够从 80,870 条真实世界记录中自动逆向工程出 1,530 个高保真终端任务以用于基准测试 AI 智能体,结果表明当前最先进模型在处理真实工作流方面存在困难,且其表现远逊于现有的专家策划基准。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教机器人如何使用计算机的“命令行”——那个程序员输入文本命令而非点击图标的黑色屏幕。长期以来,我们测试这些机器人的方式,就像让一位严格的老师出题考它们:“这里有个棘手的谜题,解出来!”如果机器人解开了谜题,我们就认为它很聪明。
但本文的作者,TERMINALWORLD,意识到一个问题:现实生活不是谜题。 现实生活是混乱的、不可预测的,并且充满了人们日常实际使用的具体工具。一个能解开谜题的机器人,在被要求实际修复服务器或在真实办公室中整理文件时,仍可能失败。
以下是他们如何改进这一点的简明解释:
1. “墙上的苍蝇”方法
研究人员没有凭空捏造虚假任务,而是前往一个名为asciinema的公共网站。这就像一个面向电脑屏幕的 YouTube 频道。开发者自愿上传他们实际工作会话的录制视频。
- 类比: 想象你想教学生如何烹饪。与其从头编写一本食谱(可能过于完美或怪异),不如走进厨房,录制 80,000 小时真实厨师烹饪真实餐食的过程,然后问:“好吧,他们刚才做了什么?”
- 结果: 他们收集了80,870个开发者实际工作的真实录制视频。
2. “机器人厨师”引擎
原始录制视频是混乱的:包含拼写错误、失败的尝试,以及大量无关的系统消息。研究人员构建了一个特殊的“数据引擎”(一种智能软件系统)来清理这些数据。
- 步骤 1:理解目标。 该引擎审视一段混乱的录制,并向一个超级智能的 AI 提问:“这个人实际上想达成什么目标?”它将混乱的日志转化为清晰的指令:“屏蔽这些恶意 IP 地址,并将列表保存到该文件中。”
- 步骤 2:搭建厨房。 录制视频并未告知你厨师拥有哪些工具。引擎必须推测需要哪些软件和文件,构建该计算机环境的完美数字副本(使用所谓的"Docker 容器”),并确保原始命令在该环境中确实能够运行。
- 步骤 3:安全网。 由于没有老师来评分,引擎会自行创建“测试”。它运行解决方案并检查:“文件出现了吗?列表正确吗?”如果测试失败,它会修正测试直到完美。
3. 新的“现实世界”考试
从这 80,000 个录制视频中,他们创建了一个名为TERMINALWORLD的大型新题库。
- 它包含1,530个经过验证的任务。
- 它涵盖18 种不同类型的真实工作,从设置云服务器到修复数据库错误。
- 它使用了1,280 种不同的计算机命令,其中 91% 在以往的测试中从未出现过。
他们还创建了一个更小、难度极高的版本,称为TERMINALWORLD-VERIFIED(200 个任务),由人类进行了双重核查,以确保其 100% 准确。
4. 令人震惊的结果
他们将世界上最聪明的 AI 模型(如最新版本的 Claude、GPT 和 Gemini)及其“代理”框架(帮助 AI 使用计算机的软件)投入这项新测试。
以下是他们的发现:
- “效率悖论”: AI 越聪明,有时反而越挣扎。最好的 AI 仅通过了**62.5%**的任务。当它们失败时,并没有放弃,而是不断尝试,浪费大量时间和金钱探索错误的路径。这就像一个学生反复重读同一段令人困惑的文字,而不是寻求帮助。
- “谜题与现实”的差距: AI 在旧版“谜题”测试(Terminal-Bench)中的表现与在新版“现实生活”测试中的表现之间,几乎没有任何关联。
- 类比: 一个 AI 可能是解决数独谜题(旧测试)的冠军,但在实际交通中驾驶汽车(新测试)时却完全失败。旧测试与实际工作过于不同。
- 代理与人类: 当 AI 完成任务时,它很少以录制视频中人类相同的方式完成。它们通往同一目的地的路径各不相同。这实际上是好事!这意味着 AI 不仅仅是在模仿;它正在找出自己的方法,即使那条路比人类的路径更长。
核心结论
该论文认为,我们不能再信任由实验室专家编造的测试。要判断一个 AI 是否真正准备好在现实世界中工作,我们必须用真实的人类工作流程来测试它——这些流程是混乱的、复杂的,并且不断变化的。
TERMINALWORLD是一个工具,它能自动将真实的人类工作转化为测试,确保随着开发者改变工作方式,我们对 AI 的测试也能随之演进。这是一个从测试“你能解出谜题吗?”转向“你能胜任工作吗?”的转变。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。