← 最新论文
💻 computer science

Addressing the Orchestration Gap in Generalist Robots via Physical Agency

本文介绍了“Pigey”,这是一个通过将复杂任务分解为子目标,并利用闭环物理智能管理现有的冻结视觉-语言-动作策略,从而弥合“编排差距”的高层编排器,由此在无需额外数据或微调的情况下,显著提升了在重推理机器人任务上的性能表现。

原作者: Liane Galanti, Dhruv Shah, Tri Dao

发布于 2026-07-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Liane Galanti, Dhruv Shah, Tri Dao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个机器人成为一名得力的室友。你不仅仅想要一台能移动手臂去拿起杯子的机器;你想要的是一位能弄明白自己为什么要拿起杯子的室友,能注意到杯子是否被藏在了一本书下面,能意识到一瓶胶水对幼儿来说很危险,并且能在房间变乱后记得把玩具放到了哪里。这就是“通用机器人”的世界,在这个领域,科学家们正试图制造出能够在家中完成人类几乎所有工作的机器,而不仅仅是做某一项特定的工作。

为了实现这一目标,研究人员通常依赖于两个主要成分。首先是感知与控制,这就像机器人的眼睛和肌肉——教它如何看到一个物体以及如何抓取它而不掉落。第二是推理,这是机器人的大脑——教它理解像“把安全的东西放在盘子里”或“找到那个躲起来的玩具”之类的指令。长期以来,机器人领域的一个大想法是将这两个成分合并成一个巨大的、超级聪明的脑子。人们曾希望,如果你向机器人展示足够多人类执行任务的视频,它就能同时学会观察、思考和行动。但正如论文所暗示的,这种“全能型”方法经常会碰壁。机器人可能非常擅长移动手臂,但在弄明白娃娃其实在盒子下面时却表现得很糟糕;或者它可能无法意识到自己掉落了玩具并需要重试。

这引出了论文的核心观点:与其强迫一个巨大的大脑去做所有事情,不如我们给机器人一个管理者,好吗?作者 Liane Galanti、Dhruv Shah 和 Tri Dao 提出了一个名为 Pigey(物理代理)的系统。把 Pigey 看作不是一个新的肌肉或一个新的大脑,而是一个站在机器人的“大脑”(一个预训练的 AI)和它的“肌肉”(它的物理动作)之间的项目经理。

以下是 Pigey 的运作方式:想象一下你要求你的机器人“拿起娃娃并把它放进篮子里”。一个标准的机器人可能会观察场景,看到一个盒子,然后盲目地尝试抓取盒子,因为娃娃被藏在下面而失败。然而,Pigey 表现得像个侦探。它观察场景,思考道:“等等,我没看到娃娃。它一定是藏起来了,”然后命令机器人移动盒子。一旦娃娃显露出来,Pigey 会说:“好了,现在抓起娃娃。”如果机器人掉落了娃娃,Pigey 会注意到,说:“哎呀,失败了,”然后告诉机器人再试一次。至关重要的一点是,Pigey 不需要学习如何抓取或移动;它只是利用机器人现有的技能,但用一个聪明且循序渐进的计划来引导它们。

研究人员通过使用两个“冻结”的(即未经训练且不可更改的)机器人技能——一个擅长捡起坚硬物体,另一个擅长处理柔软且棘手的物品——并让 Pigey 来统筹这些技能,对这一过程进行了测试。他们并没有教机器人任何新知识;他们只是改变了机器人被要求行动的方式。结果令人惊讶。在一项名为 LIBERO-PRO 的高难度模拟测试中,标准机器人的成功率仅为 12.8%。但当 Pigey 接管后,成功率跃升至 53.3%——提高了四倍多。在涉及复杂推理的现实任务中,比如判断哪些物品对儿童是安全的,或者为素食客人清理桌面,标准机器人往往完全失败(接近 0% 成功率),而 Pigey 的成功率则超过了 90%。

论文认为,问题不在于机器人的肌肉不够强壮,也不在于它需要更多的数据来学习如何移动。问题在于一个“编排差距”(orchestration gap)。机器人拥有这些技能,但缺乏一个管理者来告诉它何时使用它们,如何检查它们是否奏效,以及当事情出错时该做什么。通过增加这一层高层规划和验证,作者表明,我们可以在不进行昂贵且耗时的收集数千个新视频来重新训练的过程中,让现有的机器人变得更加聪明。这提醒了我们,有时升级机器人的最佳方式并不是构建一个更大的大脑,而是给它一个更好的老板。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →