← 最新论文
🤖 AI

Learning Bilevel Policies over Symbolic World Models for Long-Horizon Planning

本文介绍了 BISON,这是一个将底层神经模仿学习与高层符号抽象相结合的系统,能够生成双层策略,高效解决涉及大量物体的长视界规划任务,并在可扩展性和效率方面优于现有的端到端方法。

原作者: Dillon Z. Chen, Till Hofmann, Toryn Q. Klassen, Sheila A. McIlraith

发布于 2026-05-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Dillon Z. Chen, Till Hofmann, Toryn Q. Klassen, Sheila A. McIlraith

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试教一个机器人打扫一间杂乱的房间。如果你只是给机器人看一段某人打扫的视频,它可能学会如何捡起某只特定的袜子或折叠某件特定的衬衫。但如果你要求它打扫一个拥有 100 种不同物品的房间,或者物品在它工作时四处移动,这种简单的“模仿”方法往往会失败。它会感到不知所措。

本文介绍了一种名为BISON的机器人教学新方法。可以将 BISON 想象为一个“经理与工人”系统,它结合了两种不同教学风格的优点。

双团队方法

作者意识到,机器人需要两种不同类型的“大脑”协同工作:

  1. 工人(底层策略): 这是肌肉记忆。它就像一位技艺高超的舞者,确切知道如何移动手臂和手指以拿起杯子而不将其掉落。机器人通过观看大量人们执行物理任务的视频(演示)来学习这一点。在论文中,这是一个神经网络,负责处理现实世界中混乱且连续的细节。
  2. 经理(高层策略): 这是战略规划者。它不关心如何移动手指,而是关心接下来要做什么。它像棋手或项目经理一样,用符号和逻辑进行思考。它会说:“首先,拿起红色方块。然后,移动到桌子旁。接着,将其放置。”

问题所在: 通常,这两者沟通不畅。“工人”太笨拙,无法规划长序列;而“经理”太抽象,不知道如何实际移动机器人的手臂。

BISON 的解决方案: BISON 通过观察工人过去的成功来教导经理。它将机器人移动物品的杂乱视频转化为一个简单的、符号化的故事(像连环画一样),然后教导经理根据该故事编写脚本。

工作原理:“食谱”类比

想象你想教机器人烤蛋糕,但你只有人类烘焙师操作的视频。

  1. 观看视频(底层数据): 你记录下烘焙师搅拌、倾倒和烘烤的过程。这是“底层”数据。
  2. 总结故事(抽象化): BISON 查看视频并忽略细微细节(如搅拌器的确切速度)。相反,它创建一个摘要:“步骤 1:混合原料。步骤 2:倒入烤盘。步骤 3:烘烤。”这是“高层”故事。
  3. 学习规则(目标回归): 系统审视目标(“我们需要一个蛋糕”)并逆向推导。它问:“为了得到蛋糕,我们需要烘烤。为了烘烤,我们需要倾倒。”它将这种逆向思维转化为一组简单的“如果 - 那么”规则。
    • 规则: “如果我们有面糊且烤盘为空,那么倾倒。”
    • 规则: “如果我们有烤盘在烤箱中,那么等待。”
  4. 泛化(魔法技巧): 这是本文最大的主张。大多数机器人如果给你一份烤 1 个蛋糕的食谱,然后要求它们烤 100 个蛋糕,就会失败。BISON 的规则是用“变量”编写的(例如“如果我们有任何面糊……")。这意味着经理可以处理 1 个、10 个甚至 10,000 个蛋糕,而无需重新训练。这就像拥有一份写着“加入面粉”的食谱,而不是“为此特定碗加入 2 杯面粉”。

为何优于竞争对手

本文将 BISON 与其他方法进行了测试,包括:

  • VLA(视觉 - 语言 - 动作)模型: 这些就像试图观察世界并采取行动的大型 AI 聊天机器人。论文发现,这些模型在处理长任务时表现糟糕,且容易混淆。
  • 端到端神经网络: 这些试图一次性学习所有内容。它们就像一个试图死记硬背一本 100 页书中每一个步骤的学生。它们对短任务表现尚可,但当任务变长或物体数量增加时就会失败。
  • 传统符号规划器: 这些非常合乎逻辑,但无法处理混乱且不可预测的现实世界(例如方块意外倒下)。

BISON 的胜利:

  • 更长的任务: 它的规划能力远超其他方法。
  • 更多物体: 当物体数量超过 6 个或 10 个时,其他方法会崩溃,而 BISON 能处理包含更多物体的环境。
  • 速度: BISON 的“经理”部分效率极高,如果你忽略实际移动机器人手臂所需的时间,它可以在一分钟内解决涉及10,000 个物体的规划问题。这就像瞬间为 10,000 名宾客规划一场婚礼。

“开放世界”优势

论文还强调,BISON 在“开放世界”中运作。想象一个机器人处于一个房间,新物体可能凭空出现,或者物体可能瞬间移动。

  • 旧方法往往会失效,因为它们是在特定的一组物体上训练的。
  • BISON使用其符号化的“如果 - 那么”规则。如果出现新物体,经理只需检查:“有关于这个物体的规则吗?”如果规则说“如果有一个红色方块,就拿起它”,机器人会立即拿起新的红色方块,即使它从未见过那个特定的方块。

总结

简而言之,BISON是一个教机器人既成为熟练工人又成为聪明经理的系统。它观察工人如何工作,将工作总结为简单的逻辑规则,然后利用这些规则为任何规模的任务提前规划。它比现有方法更快、更智能、更灵活,使机器人能够处理具有许多移动部件的复杂长期目标而不会迷失方向。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →