IMBench: A Benchmark for Intuitive Robotic Manipulation
本文介绍了 IMBench,这是一个包含 35 个任务和 1.4 万条轨迹的综合基准测试,旨在评估“直觉操控”(结合了物理推理、感知和动作生成)的综合能力,揭示了当前视觉-语言及视觉-语言-动作模型在规划和执行复杂的、受约束丰富的机器人任务方面存在的显著差距。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个这样的世界:机器人就像是那些背熟了数百万个剧本、才华横溢的演员。它们可以完美地背诵台词,如果舞台设置得与它们见过的完全一致,它们甚至能精准地移动手臂。但如果要求它们即兴表演一场地板很滑,或者道具比看起来更重的戏份,它们往往会陷入僵局或踉跄跌倒。这就是目前机器人技术的现状:它们擅长遵循指令,但在“直觉”方面却表现挣扎。
为了理解为什么这很重要,我们需要观察人类拥有而机器人目前尚不具备的两项“超能力”。第一项是直觉物理学(intuitive physics)。这并不是一门复杂的数学课,而是大脑仅通过观察就能猜测物体如何移动、落下或弹跳的能力。比如,你知道如果推得太用力,一叠高高的、摇摇欲坠的书就会倒下;或者知道桌上的一只薄盘子不能直接从顶部抓取,否则会从边缘滑落。第二项是手段-目的推理(means-end reasoning),即即便直接路径被阻挡,也能弄清楚如何从当前状态到达目标状态的能力。这就是当你想要从高架子上拿饼干时,意识到你需要先找一把椅子,而不是死磕那个高度之间的区别。
科学家们之所以关注这一点,是因为如果机器人要在杂乱真实的家庭环境中真正帮助我们,它们就不能仅仅是预先编程好的机器。它们需要像我们一样理解物理世界,这样在事情未按计划进行时,它们才能进行调整。如果机器人无法判断一个杯子是否太滑而无法抓握,或者无法发现一扇门卡住了,那么它就没太大用处。
于是,由 Manav Robotics 的研究人员设计的名为 IMBench 的全新机器人“试驾测试”出现了。请不要把 IMBench 仅仅看作是一场带有选择题的标准考试,而应将其视为一系列棘手的、现实生活中的谜题。研究人员构建了 35 个不同的场景——比如在微小的脊部平衡一根杆子、使用钩子将够不到的玩具拉出来,或者堆叠形状奇特的积木而不使其倒塌。这些任务旨在“戏弄”那些仅依赖记忆模式的机器人。它们迫使机器人停下来,思考物理规律,并即时制定出新的计划。
该论文测试了三种不同类型的“大脑”在这些谜题上的表现。首先,研究人员要求功能强大的 AI 聊天机器人(视觉语言模型,Vision-Language Models)仅仅通过“观察”场景并解释正在发生的事情。令人惊讶的是,这些 AI 模型在识别规则方面表现得相当出色。它们大约有 74% 的概率能告诉你:“嘿,那个盘子太薄了,不能从顶部抓取。”它们理解其中的“理论”。
然而,当情节变得复杂时,研究人员要求这些同样的 AI 去“制定计划”来解决问题。成功率下降了。AI 可以解释问题,但在确定解决问题的具体步骤时却显得力不从心。这就像是一个学生能完美解释足球规则,却不知道如何踢球进球。
最后,研究人员测试了旨在执行动作的实际机器人控制系统(策略)。在这里,结果则显得相当令人沮丧。即使是最先进的机器人策略,即便已经经过了数千个案例的训练,在这些直觉类任务上也表现得一败涂地。当被要求平衡一根杆子或使用工具时,它们的成功率不足 25%,甚至经常完全失败。论文表明,虽然这些机器人在模仿人类动作方面做得越来越好,但它们仍然缺少那点关键的物理直觉火花。它们可以模仿动作,但并不真正理解动作为何有效。
研究人员得出结论,我们遗失了拼图中的关键一块。目前的机器人就像是能够背诵剧本但无法即兴发挥的演员。IMBench 向我们展示了它们究竟在哪里失败了:即在“理解物理问题”与“用双手实际解决问题”之间的鸿沟。这提醒我们,要让机器人成为我们真正的伙伴,它们不仅需要学习如何移动,还需要学习如何思考它们所处的物理世界。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。