OpenComputer: Verifiable Software Worlds for Computer-Use Agents
本文介绍了 OpenComputer,这是一个以验证器为基础的框架,通过整合特定应用的状态验证器、自演进验证层、任务生成流程以及评估工具包,为计算机使用智能体构建可验证的软件世界,从而揭示尽管当前前沿及开源智能体已取得部分进展,但其鲁棒性仍存在显著差距。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个机器人完成你的日常琐事,比如整理数字文件、编辑照片或发送电子邮件。你希望机器人做到完美,但你如何知道它是否真正正确地完成了任务?
这正是《OpenComputer》论文所解决的问题。作者为使用计算机的 AI 智能体构建了一个全新的“训练健身房”,但有一个非常具体的转折:他们不仅查看机器人的工作成果,更以严格、目不转睛的目光检查机器人的“作业”。
以下是 OpenComputer 的工作原理,通过简单的类比进行解释:
1. 问题:“假装做到直到真正做到”的陷阱
过去,在计算机上测试 AI 就像只通过看封面来给学生的论文打分。如果封面看起来很漂亮,老师(一个 AI 裁判)可能会给个 A。但学生可能实际上留白了正文,或者填满了胡言乱语。
在数字世界中,AI 可能会截取一张看起来已完成的文档的截图,但如果内部文件实际上是空的,或者设置不正确,"AI 裁判”可能会忽略这个错误,因为它只看到了图片,而没有看到数据。
2. 解决方案:“数字检查员”
OpenComputer 通过构建一个可验证的软件世界来改变游戏规则。它不再仅仅观察屏幕,而是在 AI 使用的每个应用程序内部安装了一支专门的“检查员”团队(称为验证器)。
- 检查员的工作: 想象一位图书管理员,他们不仅仅看书的封面。他们会打开书,检查页码,核实作者姓名,并确保文本与图书馆的数据库相匹配。
- 工作原理: 对于每个应用程序(如网页浏览器、照片编辑器或电子表格),OpenComputer 都会构建一个自定义脚本,能够直接与应用程序的“大脑”对话。它会提出问题,例如:“文件真的保存了吗?”“用户真的点击了那个按钮吗?”“文本是否在正确的单元格中?”
3. 四步构建流程
该论文描述了一条用于构建这些完美测试场景的四步流水线:
- 步骤 1:构建检查员。 他们为每个应用程序创建一把“钥匙”,使系统能够窥探软件隐藏的状态(文件、设置、历史记录),而不仅仅是根据屏幕进行猜测。
- 步骤 2:自我改进循环。 他们用“强大”的 AI 来测试这些检查员。如果检查员说“干得好”,但 AI 实际上搞砸了,系统就会捕捉到错误。随后,它会修复检查员的代码,使其下次变得更聪明。这就像教练观察球员练习,然后调整训练设备以提高准确性。
- 步骤 3:创建任务。 一旦检查员变得可靠,系统就会生成 1,000 个逼真的任务(例如“整理这 50 个文件”或“编辑这张照片”)。由于检查员已经准备就绪,每个任务都有清晰、机器可验证的“通过”或“失败”标准。
- 步骤 4:期末考试。 他们在一个新的、干净的数字房间里运行 AI 智能体。智能体尝试解决这些任务,而检查员则根据实际数据(而不仅仅是图片)立即对它们进行评分。
4. 他们的发现
当他们在这一新健身房中测试最先进的 AI 模型(如 GPT-5.4 和 Claude)时,发现了一些令人惊讶的事情:
- “差点”问题: 即使是最聪明的 AI 也难以完美地完成整个任务。它们通常能完成 80% 的工作,但在微小的最终细节上失败(例如将文件保存在错误的文件夹中)。
- “虚假”成功: 旧的评判方式(使用 AI 查看截图)过于宽容。它给那些看起来成功了但实际未通过数据检查的智能体打了高分。新的“硬编码验证器”要严格得多,并且更符合人类的判断。
- 开源模型的差距: 一些在其他测试中表现出色的开源模型在这里突然表现得很差。这表明它们擅长为简单测试“猜测”正确答案,但无法应对真实、混乱的计算机软件复杂性。
5. 核心启示
OpenComputer 不仅仅是一份任务清单;它是一个新的真理标准。
可以将其想象为从“荣誉制度”考试(AI 声称:“我做到了!”)转变为“监考考试”,其中机器人监考员根据答案键检查每一个答案。该论文得出结论,虽然 AI 在查看屏幕方面变得越来越擅长,但在能够可靠地执行复杂的现实世界计算机工作而不犯下微妙但关键的错误之前,它还有很长的路要走。
简而言之: OpenComputer 构建了一个数字游乐场,其中的规则由代码而非猜测来核查,揭示了当今的 AI 智能体仍在努力学习如何成为真正可靠的数字劳动者。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。