← 最新论文
🤖 AI

GUI vs. CLI: Execution Bottlenecks in Screen-Only and Skill-Mediated Computer-Use Agents

本文引入了一个受控基准测试,旨在证明虽然 GUI 智能体目前因更好的交互可靠性而优于 CLI 智能体,但 CLI 的性能差距主要是由技能覆盖不全而非模型固有局限性驱动的,因为通过验证器引导的技能增强显著提升了 CLI 的成功率。

原作者: Xiao Zhou, Siyue Zhang, Yilun Zhao, Jinbiao Wei, Tingyu Song, Arman Cohan, Chen Zhao

发布于 2026-06-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Xiao Zhou, Siyue Zhang, Yilun Zhao, Jinbiao Wei, Tingyu Song, Arman Cohan, Chen Zhao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个非常聪明的机器人助手,它需要帮你处理电脑上的家务。你可以给这个机器人两种不同的工作方式:

  1. “人类”方式 (GUI): 机器人像人类一样观察你的电脑屏幕。它能看到图标、按钮和菜单。它使用鼠标进行点击、拖拽和打字,就像你做的那样。
  2. “代码”方式 (CLI): 机器人不看屏幕。相反,它通过一组预设的指令(技能)与电脑进行交流。它会说,“添加一条轨道”,然后电脑就会立即执行,而机器人甚至不需要看到那个“添加轨道”的按钮。

这篇论文是一个大型实验,旨在弄清楚哪种方式更好。但问题在于,过去人们在比较这两种方法时并不公平。他们经常给“代码”机器人分配更简单的任务或不同的目标,这就像是在比较赛车和自行车,却给自行车安排了下坡路,而给赛车安排了爬山路。

大型实验:一场公平的比赛

研究人员建立了一个公平的竞技场。他们创建了 440 个不同的电脑任务(例如编辑视频、整理音乐或制作电子表格)。

  • 目标一致: 两个机器人得到了完全相同的指令(例如,“重命名这三首歌”)。
  • 起点一致: 两个机器人开始时,电脑的状态完全相同。
  • 终点一致: 一个电脑程序会检查结果,以判断任务是否完成正确。
  • 工具不同: 唯一的区别在于它们被允许完成工作的方式不同。一个必须点击按钮;另一个必须使用指令列表。

结果:谁赢了?

第一轮:原始比赛

  • “人类”机器人 (GUI): 它以 59.1% 的成功率获胜。它非常擅长根据屏幕上的视觉线索进行操作。
  • “代码”机器人 (CLI): 它以 48.2% 的成功率落败。它表现得更为吃力。

为什么代码机器人输了?
研究人员深入调查了失败的原因,发现了一个令人惊讶的原因。代码机器人并不一定是“更笨”。它只是拥有一本破损的说明书

  • 想象一下,代码机器人有一份包含 100 项技能的清单,但任务需要“技能 #42”,而这个技能并不存在于它的清单中。机器人无法完成工作,不是因为它糊涂了,而是因为工具缺失。
  • 在原始的技能清单下,只有约 37% 的任务是可以完成的。

第二轮:“修复手册”比赛
研究人员随后修复了代码机器人的手册。他们添加了机器人完成测试所需的缺失技能。

  • 新得分: 代码机器人的成功率跃升至 69.3%
  • 核心结论: 一旦代码机器人拥有了正确的工具,它实际上变得比人类机器人更出色了!这证明了代码机器人最初的失败并非因为它无法思考,而是因为它没有可以按下的正确按钮。

每个机器人的闪光点(与短板)

论文发现,每个机器人都有不同的“超能力”和“弱点”:

  • 人类机器人 (GUI):

    • 超能力: 非常擅长那些步骤在屏幕上显而易见的任务,比如浏览网站或整理视频时间轴。
    • 弱点: 它很容易迷失方向。如果一个菜单被隐藏了,或者它必须连续点击 20 次,它往往会忘记自己在做什么,或者点错东西。这就像是在蒙着眼睛走迷宫,虽然你能看到墙壁,但你会不断被绊倒。
  • 代码机器人 (CLI):

    • 超能力: 非常擅长那些像搭乐高积木一样的任务,即结构清晰的任务(如整理文件或 3D 建模)。只要它拥有正确的指令,它就会既快速又精准。
    • 弱点: 它非常不擅长“猜测”。如果电脑有一个人类会不假思索直接点击的“默认”设置,代码机器人必须被明确告知那个默认值是什么。如果手册里没写“默认名称是‘轨道 1’”,机器人可能会把名字定为“轨道 2”并导致失败。这就像一位厨师可以做出完美的牛排,但除非你写下来,否则他不知道你通常会在烹饪前撒盐。

总结

论文的结论是,比较这两种方法并不是要说哪一种“更好”,而是关于逻辑存在于何处

  • 人类 (GUI) 方法中,逻辑构建在可见的界面中。电脑展示了步骤,但你必须亲手去寻找并点击它们。
  • 代码 (CLI) 方法中,逻辑构建在隐藏的技能层中。电脑承担了繁重的体力活,但前提是有人必须把每一个步骤都写进手册里。

教训: 如果你想让机器人处理电脑任务,你必须做出决定:你是希望它去“看”并“点击”(这在处理长任务时很难做对),还是希望它去“下令”(这很快,但前提是你必须建立一个完美、完整的指令库)?最好的系统可能需要将两者结合起来。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →