WorldGUI: An Interactive Benchmark for Desktop GUI Automation from Any Starting Point
本文介绍了 WorldGUI,这是一个基准测试及其配套框架,旨在评估并提升图形用户界面(GUI)代理在处理反映现实世界任务多样性的各类非默认初始状态时的鲁棒性,并揭示了当前最先进模型存在的显著性能差距。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一位非常聪明的机器人助手,它擅长遵循指令来操作你的电脑。你告诉它:“打开电子表格并排序这些数字”,如果电脑处于出厂时的正常状态,它通常能很好地完成任务。
然而,在现实生活中,电脑很少处于“崭新”的状态。也许你已经打开了电子表格但只完成了一半,也许你不小心点击了某个菜单改变了布局,或者也许你开始了另一项任务并分心了。如果你现在立刻要求你的机器人助手帮忙,在这样一片混乱中,它往往会感到困惑并失败。这就像当你已经偏离计划路线 10 英里时,要求 GPS 为你指路;GPS 可能会只说“重新计算……"然后放弃。
本文介绍了WorldGUI,这是一个全新的“训练场”和“智能教练”,旨在解决这一问题。
1. 问题:“完美起点”陷阱
以往大多数针对电脑机器人的测试都假设电脑总是从完美的默认状态开始。这就像只在早上 8 点空旷笔直的公路上测试司机。但真实的驾驶发生在交通中,伴随着施工区域,并且当你已经错过转弯时。
作者们意识到,现有的测试并未检查机器人能否处理“任务中途”的状态。他们想知道:机器人能否观察混乱的屏幕,意识到已完成的部分,并在不惊慌的情况下确定下一步?
2. 解决方案:WorldGUI(“混乱房间”模拟器)
团队建立了一个名为WorldGUI的新基准。你可以把它想象成一个模拟器,它会在机器人开始工作之前故意把电脑弄乱。
- 工作原理:在给予机器人任务(如“编辑此 Word 文档”)之前,系统会运行几个“预动作”。
- 添加步骤:它可能会打开一个不需要的随机菜单或标签页,从而迷惑机器人。
- 修剪步骤:它可能已经完成了任务的前半部分,因此机器人需要跳过这些步骤。
- 调整步骤:它可能会稍微改变布局,例如将按钮移动到不同的位置。
这在 10 个常用应用程序(如 Excel、Word 和网页浏览器)中创造了 611 种不同的场景。这就像一位驾驶教练在你即将接近时,突然在路中间放置一个路锥,或改变交通信号灯的颜色。
3. 新教练:WorldGUI-Agent
为了应对这些混乱的情况,作者们创建了一个名为WorldGUI-Agent的新框架。与其仅仅“计划 -> 行动”(像是一个盲目遵循脚本的机器人),该智能体使用了一个包含三个安全检查的“批判性思维”循环,类似于谨慎的人类在行动前的思考方式:
- 规划者批评者(编辑):在机器人移动之前,它会查看计划并问道:“等等,屏幕看起来和我预期的不一样。我还需要执行步骤 1 吗,还是它已经完成了?”如有必要,它会重写计划。
- 步骤检查(守门人):在点击按钮之前,它会暂停并问道:“这个按钮真的存在吗,还是我漏掉了什么?我需要跳过这一步吗?”
- 执行者批评者(质量控制):在机器人点击后,它会立即检查:“那真的起作用了吗?屏幕是否按我想要的方式改变了?”如果没有,它会立即尝试修复错误。
4. 结果:机器人仍在学习
作者们在这一新的、混乱的基准上测试了现有最好的机器人大脑(AI 模型)。结果令人震惊:
- 人类与机器人:人类(观看了简短的视频教程)即使在电脑混乱的情况下也能解决约85%的任务。而最好的机器人仅能完成约46%。
- “混乱”因素:当电脑处于正常状态时,机器人的表现尚可。但当状态被“增强”(混乱)时,它们的性能急剧下降。它们难以意识到自己已经处于任务的中途。
- 教练的作用:当他们使用新的WorldGUI-Agent框架(带有三个安全检查)时,机器人的表现显著提高。它们变得更加稳健,能够从错误中恢复并适应混乱的起点。
结论
本文并不声称机器人已准备好取代你的办公室员工。相反,它指出:“我们发现了一个巨大的差距,即我们测试机器人的方式。它们擅长遵循完美的脚本,但极不擅长处理现实生活的混乱。”
通过创建WorldGUI,他们为研究人员提供了一种测试机器人能否随机应变的方法。通过构建WorldGUI-Agent,他们展示了添加简单的“检查点”,让机器人暂停并批判其自身计划,能使其在现实世界中更加可靠。这是迈向制造不仅遵循指令,而且真正理解屏幕上发生情境的 AI 助手的一步。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。