← 最新论文
💻 computer science

CUADebug: Diagnosing and Repairing Computer-Use Agent Failures

本文介绍了 CUADebug,这是一个包含错误分类法、人工标注基准测试以及一种主动式工具增强型调试器的框架,该框架通过精准定位多模态轨迹中的根本原因,显著提升了对计算机使用智能体(Computer-Use Agent)失败情况的诊断与修复能力,从而实现有效的任务重执行。

原作者: Weijia Zhang, Kunlun Zhu, Zeyi Liu, Yinting Chen, Tianyi Ma, Jiateng Liu, Jiaxun Zhang, Bingxuan Li, Xiangru Tang, Heng Ji, Jiaxuan You

发布于 2026-08-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Weijia Zhang, Kunlun Zhu, Zeyi Liu, Yinting Chen, Tianyi Ma, Jiateng Liu, Jiaxun Zhang, Bingxuan Li, Xiangru Tang, Heng Ji, Jiaxuan You

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你构建了一个超级聪明的机器人助手,它能像人类一样观察你的电脑屏幕、移动鼠标并敲击键盘。这不仅仅是一个讨论代码的聊天机器人,而是一个真正的“计算机使用智能体”(Computer-Use Agent),它能在真实的数字世界中执行任务,比如填写表格、编辑文档或整理文件。但问题在于,就像人类学习新电子游戏一样,这些机器人也会犯错。有时它们会点错按钮,有时它们会误解所见之物,或者在冗长的指令列表中迷失方向。科学家们面临的一个大问题是:当机器人失败时,我们如何确定究竟是在哪里出了错?是因为它看不清屏幕上的微小文字?是因为它忘记了五步之前制定的计划?还是因为它仅仅点错了地方?修复这些错误非常困难,因为错误可能早在开始阶段就发生了,但机器人最后呈现给你的只是一个失败的结果。

这篇论文介绍了一支全新的数字侦探团队——CUADebug,旨在破解这个谜团。CUADebug 不仅仅是问机器人“你为什么失败?”,然后寄希望于得到一个好的回答,它更像是一名法医调查员。它拥有一套特殊的工具,可以让它暂停机器人的历史记录,查看每一次点击前后的“前后对比图”,并将这些图片与机器人“认为”自己正在做的事情进行对比。研究人员构建了一个包含 204 个真实生活机器人失败案例的大型库(称为 CUAErrorBench),在这些案例中,人类对到底哪里出了错进行了精确的标注。他们发现,虽然机器人在宏观规划方面经常出错,但它们在处理一些简单事情(如识别微小细节或点击正确位置)方面也表现挣扎。通过这种侦探式的工作,该团队证明了他们不仅可以解释机器人为何失败,还能为机器人提供一份具体的“修复配方”以便重试。当他们让机器人利用这些配方进行重试时,其成功率远高于盲目继续尝试。

侦探的工具箱:CUADebug 如何运作

把一个使用计算机的智能体想象成一名正在白板上解复杂数学题的学生。如果学生最后的答案错了,老师可能只会说:“再试一次。”但一位聪明的老师(比如 CUADebug)会逐步检查学生的解题过程。他们会问:“你在第 3 步读错数字了吗?你在第 5 步用了错误的公式吗?还是你只是累了跳过了一行?”

研究人员意识到,对于计算机智能体来说,“白板”就是电脑屏幕,而“步骤”就是鼠标点击和键盘按键。问题在于,这些智能体的失败方式往往难以察觉。机器人可能会因为误以为一个小图标是一个按钮而点错窗口,或者可能忘记了在关闭程序前需要保存文件。这些失败是视觉感知(它看到了什么)、空间定位(物体在哪里)、交互(如何点击)以及推理(计划是什么)的综合结果。

为了解决这个问题,团队创建了 CUADebugger,一个具备工具增强能力的侦探。它不会让 AI 一次性面对海量数据去猜测整个故事,而是主动进行调查。它使用一个“ReAct”循环,就像侦探在说:“我怀疑第 12 步有问题。让我看看第 12 步之前的屏幕和第 12 步之后的屏幕。”它将这两张截图与机器人对自己“意图”做的记录进行对比。如果机器人说“我要点击红色的按钮”,但截图显示它点击了蓝色的,侦探就会将其标记为失败。

谜团库:CUAErrorBench

没有训练数据,你就无法教导一名侦探。研究人员构建了 CUAErrorBench,这是一个由不同机器人智能体(使用 Claude 4.5、Gemini 2.5 Pro 和 Qwen 3.5 等模型)执行的 204 个失败任务库。人类观察了这些失败案例,并用一套特定的“分类法”(即一种错误归档系统)对其进行了标注。他们发现,最大的失败类别是任务推理与控制(204 例中的 110 例)。这就像是机器人忘记了计划或对目标产生了困惑。接下来的主要类别是感知(36 例,机器人看不见某些东西)和定位/交互(25 例,它点错了东西)。

论文指出,你不能仅仅让机器人自行发明规则来定义失败。在一项实验中,他们尝试让一个强大的 AI 从头开始创建自己的错误类别列表。结果如何?这个 AI 不断改变主意。有一次它把一个错误称为“视觉错误”,而下一次它又把同样的情况称为“动作策略失效”。研究人员发现,如果没有人类专家的引导,AI 无法建立起一套稳定的描述问题的标准。这表明,在调试过程中,人类专家仍然是定义“游戏规则”所必需的。

修复:从解释到行动

这篇论文最令人兴奋的部分是侦探找到线索之后发生的事情。许多 AI 系统可以给你一个长篇大论、辞藻华丽的失败原因解释,但这并不能真正解决问题。CUADebugger 的不同之处在于,它能将诊断转化为修复信号

想象一下,机器人正试图更改演示文稿中幻灯片编号的颜色。

  1. 失败: 机器人点击了错误的框,它以为是在选择文本,但实际上选择了框架。随后,数字仍然是灰色的,而不是红色的。
  2. 诊断: CUADebugger 回溯发现,看到错误的点击,并指出:“错误发生在第 2 步。机器人以为自己在点击文本,但实际点击了框架。修复方法是专门双击文本。”
  3. 修复: 机器人带着这条新指令被送回第 2 步。

这种“修复”的结果令人印象深刻。当机器人被允许使用侦探的建议从错误处重新开始时:

  • 单次重试: 如果机器人只是在没有帮助的情况下继续尝试,其成功率仅为 13.89%。而在使用了侦探提供的具体修复指令后,成功率跃升至 29.90%
  • 持续重试: 如果允许机器人不断尝试,其成功率从 12.2% 提升到了 25.86%。这已经非常接近人类专家所能达到的水平(29.21%)。

这对未来意味着什么

论文表明,修复机器人智能体的未来不仅仅在于让它们变得更聪明或赋予它们更多的记忆,而在于构建更好的“调试”系统,使其能够精准定位机器人偏离轨道的时刻,并给出具体的修复方法。研究人员发现,虽然推理错误是最常见的,但视觉和交互错误同样重要。

他们还证明,一个主动观察截图和动作的侦探(CUADebugger)比一个仅仅阅读行为描述的侦探(标准方法)更能发现真相。例如,在主要测试组中,主动侦探将发现确切错误的能力从 11.2% 提高到了 19.6%。虽然这个数字看起来可能并不巨大,但在复杂的机器人任务领域,找到准确的修复步骤是非常困难的。

最终,这项工作表明,我们正在跨越那个只能眼睁睁看着机器人失败并感叹“噢,真遗憾”的时代。我们正在进入一个可以构建调试系统的时代,这些系统能像法医科学家一样,找出失败的根本原因,并为机器人递上一张地图,让它这次能够走上正确的道路。论文并未声称已经永久解决了所有的机器人失败问题,但它提供了一个强大的新工具包,使修复过程变得更加容易且高效。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →