ChainWorld: Composing Long-Horizon Desktop Workloads from Atomic OSWorld Tasks
该论文介绍了 ChainWorld,这是一个通过将原子级的 OSWorld 任务组合成长程桌面工作负载来评估计算机使用智能体的框架,并揭示了当前模型在多步完成方面存在困难,且在任务以单轮或多轮形式呈现时表现出截然不同的失败特征。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在测试一个新型机器人助手。到目前为止,每个人都只是通过让它执行一次简单的单一任务来进行测试,比如“打开烤面包机”或“打开灯”。机器人在处理这些单一任务时表现出色。
但在现实生活中,人类并不只是做一件事;人们会做一系列连贯的任务来完成一项工作。你不仅仅是“打开烤面包机”;你会打开烤面包机,放入面包,等待面包弹出,拿取盘子,然后涂抹黄油。如果机器人在面包弹出后忘记了盘子,那么整个任务就失败了,即使它完美地完成了“打开烤面包机”这一步。
这篇名为 ChainWorld 的论文,旨在通过这些更长的任务链来测试计算机智能体(AI 机器人),而不是仅仅测试单个任务。
问题所在:“单任务”陷阱
目前的测试就像是一场驾驶考试,你只需要完成一次侧方位停车。你可能会通过,但如果你无法在整个城市中驾驶而不迷路,说明你还没准备好应对现实世界。作者发现,仅仅因为一个 AI 擅长单项任务,并不意味着它能够处理一系列连续的任务。
解决方案:构建“任务链”
研究人员利用了一个庞大的现有简单计算机任务库(称为 OSWorld),并尝试将它们像串珠子一样连接在一起。
- 挑战: 你不能随机地把任何两个任务粘在一起。如果任务 A 删除了任务 B 需要的文件,这个链条就会断裂。这就像是尝试烤蛋糕,而第一步却是“扔掉面粉”。
- 方法: 他们构建了一个智能的“兼容性地图”。他们检查了每一对可能的任务组合,以查看它们是否可以在不导致计算机崩溃或删除必要文件的情况下,在逻辑上紧随其后。然后,他们在地图中搜索,构建出由 2、3 或 4 个任务组成的、逻辑合理的单次工作会话链条。
他们创建了 347 个这样的“链条” 来作为一种新的、更难的测试。
实验:两种提问方式
他们使用两种不同的“规则”在这些链条上测试了四种不同的 AI 模型:
- “一次性”测试(单轮对话/Single Turn): AI 会在一个巨大的提示词中获得整个任务列表。“执行任务 A,然后执行任务 B,接着执行任务 C。”它必须在动一下手指之前,就在脑海中规划好整个旅程。
- “循序渐进”测试(多轮对话/Multi Turn): AI 被给予任务 A。完成任务 A 后,它会得到任务 B。然后是任务 C。这就像是一个人类老板逐条下达指令,让你在完成一项任务后再进行下一项。
结果:差距是真实存在的
结果令人惊讶,甚至有些发人深省:
- 成功率很低: 即便是最优秀的 AI 模型,也只能在约 31% 的情况下完成完整的任务链。这意味着它们失败的次数超过了三分之二。
- “循序渐进”略有帮助: 给 AI 提供逐条指令的任务方式(多轮对话)让四个模型中的三个表现得更好。专注于一个步骤比在脑海中记住整个计划要容易。但即便有了这种帮助,它们仍然经常失败。
- 不同的失败类型:
- 在“一次性”测试中: AI 通常理解了“思路”,但在“细节”上出错。这就像一个学生理解了数学题,但在最后写错了数字。他们犯了“差一点就对了”的错误。
- 在“循序渐进”测试中: AI 在管理会话方面遇到了困难。它们会分心、忘记下一步该做什么,或者在完成一半时放弃。这就像一个工人开始了一项项目,但做着做着就觉得无聊了,在完成之前就走开了。
核心启示
论文得出结论,我们不能仅仅通过观察 AI 执行单项任务的表现,就假设它已经准备好进行实际工作了。在“执行一项任务”和“管理一个工作流”之间存在着巨大的鸿沟。
作者构建了 ChainWorld,它作为一个新的测试,充当了 AI 注意力集中度和记忆力的“压力测试”。它表明,虽然 AI 在视觉识别和点击操作方面正变得越来越好,但当一项工作需要多个步骤且需要记住五分钟前发生了什么时,它仍然难以保持专注。
简而言之: AI 擅长表演单项技巧,但它仍在学习如何在不掉球的情况下,玩转一整套复杂的动作组合。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。