← 最新论文
🤖 AI

WatchAct: A Benchmark for Behavior-Grounded Robot Manipulation

本文介绍了 WatchAct,这是一个包含 3,000 个长时程实例的综合基准测试,用于评估机器人操控系统通过视频对观察到的人类行为进行推理的能力,研究揭示了当前最先进的模型在需要事件接地、过程推理、意图推断和情节追踪的任务中表现得非常吃力。

原作者: Baiqi Li, Ce Zhang, Yu Fang, Yue Yang, Shangzhe Li, Mingyu Ding, Gedas Bertasius

发布于 2026-06-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Baiqi Li, Ce Zhang, Yu Fang, Yue Yang, Shangzhe Li, Mingyu Ding, Gedas Bertasius

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你走进一个厨房,看到一片狼藉:一个人打开了抽屉,拿出了三个调料罐准备烹饪,然后把它们散落在柜台上。你对机器人说:“把所有东西都放回原处。”

对于人类来说,这很容易。你会记得发生了什么(调料罐是从抽屉里拿出来的)、顺序如何(它们是一个接一个被拿出来的)以及原因(为了烹饪)。你会利用脑海中关于人动作的视频来推导出解决方案。

但对于今天的机器人来说,这是一场噩梦。大多数机器人基准测试只向机器人展示一张混乱柜台的静态照片,并要求它清理干净。它们没有给机器人关于“混乱是如何产生的”这段“电影”的过程。没有这种上下文,机器人只能靠猜。

WatchAct 是一个全新的测试(一个基准测试),旨在观察机器人是否真的能够观看人类的视频,理解人类做了什么,并根据其记忆进行清理或继续执行任务。

以下是它的工作原理分解,使用了简单的类比:

1. 测试:“侦探与演员”

把机器人想象成一名侦探,把视频想象成犯罪现场的警戒线。

  • 输入: 机器人接收一段人类做某事(如移动一个碗)的视频和一条文本指令(如“把碗放回去”)。
  • 目标: 机器人必须破解隐藏的故事。人类移动这个碗是因为饿了吗?他们是向左还是向右移动的?它最初是从哪里来的?
  • 规模: 该测试包含 3,000 个不同的场景(就像一个由短片组成的庞大图书馆),涵盖了 14 种不同类型的挑战。

2. 四种“大脑技能”测试

研究人员将任务分为四类,这些类别就像不同等级的侦探工作:

  • 事件落地 (Event Grounding,寻找线索): 机器人能否观看视频并说:“啊,在 3 秒时,人类拿起了一个红色的杯子”?这就像是在电影中找到那个重要的特定时刻。
  • 程序推理 (Procedural Reasoning,理解食谱): 机器人能否理解事件的顺序?如果一个人把书放在架子上,然后把杯子放在桌子上,机器人需要知道这个序列才能将其逆转或继续执行。
  • 隐性意图推断 (Implicit Intent Inference,读心术): 有时人类并不直接表达需求,只是做出手势。如果人类模糊地指向一个罐子,机器人能否猜到:“哦,他们想要我打开那个”?
  • 情景推理 (Episodic Reasoning,记忆力测试): 机器人能否记住场景是如何变化的?如果一个人把椅子从角落移到了中间,机器人需要知道椅子的“原始家园”在哪里,才能把它放回去。

3. 他们是如何测试机器人的

研究人员并没有仅仅要求机器人“去做”,而是将机器人的大脑拆分为两个部分,以观察它在哪里失败:

  1. 规划器 (大脑): 机器人能否观看视频并写出一个逐步的计划?(例如:“1. 拿起罐子。2. 移动到架子。”)
  2. 执行器 (双手): 如果你给机器人一个完美的计划,它能否实际移动手臂去完成它?

他们在计算机模拟环境和真实的机器人手臂(Franka Research 3)上进行了这些测试。

4. 结果:“机器人仍在学习中”

结果令人警醒。即使是目前最智能的 AI 模型也表现得非常吃力。

  • “大脑”失败了: 当被要求观看视频并编写计划时,最好的 AI(Gemini-3.1-Pro)的正确率仅为 36.8%。人类的正确率为 97.1%。AI 本质上在超过一半的任务中都在靠猜。
  • “双手”失败了: 即使研究人员给了机器人一个完美的计划(因此“大脑”部分不再是问题),机器人的“双手”(策略)成功率也仅为 21.5%。这就像你有一份完美的食谱,却因为不知道如何使用烤箱而烧焦了蛋糕。
  • 现实世界更难: 当他们在真实的机器人手臂上尝试时,成功率进一步下降到了 14.0%

5. 为什么它们会失败?

论文发现了机器人失败的三个主要原因:

  • 长篇故事: 如果视频很长且包含许多步骤(比如一个 6 步的烹饪过程),机器人就会感到困惑,并在到达结尾时忘记了开头。
  • 视角问题: 如果视频是从奇怪的角度拍摄的(比如从人类身后拍摄),或者指令说“向人类的左侧”,机器人就会迷失方向。它无法将“人类的左”转化为“机器人的左”。
  • 新事物: 如果机器人看到了它以前没见过的物体(比如一种新型号的盒子),它就会陷入停滞。它无法泛化其已有的知识。

总结

WatchAct 是一次现实检验。它表明,虽然机器人在处理静态房间中的移动物体方面做得很好,但它们在观察人类、理解混乱背后的故事以及思考下一步该做什么方面表现得很糟糕。

论文得出结论,我们距离拥有能在家里真正与我们协作的机器人还很遥远,因为它们仍然无法像人类那样通过“观察并学习”来获取知识。在它们能被信任协助我们在厨房干活之前,它们需要变得更加擅长在视频中建立逻辑联系。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →