← 最新论文
🤖 AI

IMBench: A Benchmark for Intuitive Robotic Manipulation

本文介绍了 IMBench,这是一个包含 35 个任务和 1.4 万条轨迹的综合基准测试,旨在评估“直觉操控”(结合了物理推理、感知和动作生成)的综合能力,揭示了当前视觉-语言及视觉-语言-动作模型在规划和执行复杂的、受约束丰富的机器人任务方面存在的显著差距。

原作者: Anurag Maurya, Sukhvansh Jain, Prajwal Avhad, Gautham Balachandran, Ziyi Zhou, Atharva Kshirsagar, Satyam Singh, Bowen Li. Rishabh Mukund, Ritul Singh, Jatin Vira, Suvonil Chatterjee, Devesh K. Jha

发布于 2026-07-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Anurag Maurya, Sukhvansh Jain, Prajwal Avhad, Gautham Balachandran, Ziyi Zhou, Atharva Kshirsagar, Satyam Singh, Bowen Li. Rishabh Mukund, Ritul Singh, Jatin Vira, Suvonil Chatterjee, Devesh K. Jha

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个这样的世界:机器人就像是那些背熟了数百万个剧本、才华横溢的演员。它们可以完美地背诵台词,如果舞台设置得与它们见过的完全一致,它们甚至能精准地移动手臂。但如果要求它们即兴表演一场地板很滑,或者道具比看起来更重的戏份,它们往往会陷入僵局或踉跄跌倒。这就是目前机器人技术的现状:它们擅长遵循指令,但在“直觉”方面却表现挣扎。

为了理解为什么这很重要,我们需要观察人类拥有而机器人目前尚不具备的两项“超能力”。第一项是直觉物理学(intuitive physics)。这并不是一门复杂的数学课,而是大脑仅通过观察就能猜测物体如何移动、落下或弹跳的能力。比如,你知道如果推得太用力,一叠高高的、摇摇欲坠的书就会倒下;或者知道桌上的一只薄盘子不能直接从顶部抓取,否则会从边缘滑落。第二项是手段-目的推理(means-end reasoning),即即便直接路径被阻挡,也能弄清楚如何从当前状态到达目标状态的能力。这就是当你想要从高架子上拿饼干时,意识到你需要先找一把椅子,而不是死磕那个高度之间的区别。

科学家们之所以关注这一点,是因为如果机器人要在杂乱真实的家庭环境中真正帮助我们,它们就不能仅仅是预先编程好的机器。它们需要像我们一样理解物理世界,这样在事情未按计划进行时,它们才能进行调整。如果机器人无法判断一个杯子是否太滑而无法抓握,或者无法发现一扇门卡住了,那么它就没太大用处。

于是,由 Manav Robotics 的研究人员设计的名为 IMBench 的全新机器人“试驾测试”出现了。请不要把 IMBench 仅仅看作是一场带有选择题的标准考试,而应将其视为一系列棘手的、现实生活中的谜题。研究人员构建了 35 个不同的场景——比如在微小的脊部平衡一根杆子、使用钩子将够不到的玩具拉出来,或者堆叠形状奇特的积木而不使其倒塌。这些任务旨在“戏弄”那些仅依赖记忆模式的机器人。它们迫使机器人停下来,思考物理规律,并即时制定出新的计划。

该论文测试了三种不同类型的“大脑”在这些谜题上的表现。首先,研究人员要求功能强大的 AI 聊天机器人(视觉语言模型,Vision-Language Models)仅仅通过“观察”场景并解释正在发生的事情。令人惊讶的是,这些 AI 模型在识别规则方面表现得相当出色。它们大约有 74% 的概率能告诉你:“嘿,那个盘子太薄了,不能从顶部抓取。”它们理解其中的“理论”。

然而,当情节变得复杂时,研究人员要求这些同样的 AI 去“制定计划”来解决问题。成功率下降了。AI 可以解释问题,但在确定解决问题的具体步骤时却显得力不从心。这就像是一个学生能完美解释足球规则,却不知道如何踢球进球。

最后,研究人员测试了旨在执行动作的实际机器人控制系统(策略)。在这里,结果则显得相当令人沮丧。即使是最先进的机器人策略,即便已经经过了数千个案例的训练,在这些直觉类任务上也表现得一败涂地。当被要求平衡一根杆子或使用工具时,它们的成功率不足 25%,甚至经常完全失败。论文表明,虽然这些机器人在模仿人类动作方面做得越来越好,但它们仍然缺少那点关键的物理直觉火花。它们可以模仿动作,但并不真正理解动作为何有效。

研究人员得出结论,我们遗失了拼图中的关键一块。目前的机器人就像是能够背诵剧本但无法即兴发挥的演员。IMBench 向我们展示了它们究竟在哪里失败了:即在“理解物理问题”与“用双手实际解决问题”之间的鸿沟。这提醒我们,要让机器人成为我们真正的伙伴,它们不仅需要学习如何移动,还需要学习如何思考它们所处的物理世界。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →