想象一下,你正在教一个机器人整理一个堆满玩具的凌乱房间。这个机器人拥有两种思维方式:宏观大局(符号式)和微观细节(连续式)。
本文描述了一种机器人的新“大脑”,它将这两种思维方式结合使用,就像一个由战略将军和精密工程师组成的团队。
问题:机器人为什么会陷入困境
机器人生活在一个连续运动的世界中(涉及毫米、角度、力)。如果机器人试图在这个复杂的世界中计算每一种可能的移动,它会被压垮——就像试图数清沙滩上的每一粒沙来决定走哪条路。
为了解决这个问题,科学家通常教机器人使用符号(例如“积木 A 在积木 B 上面”)。这既快又容易,就像使用一张只标有城市名称的地图。但地图并不完美。地图可能会说“开车去公园”,但它不知道路上有一个巨大的坑洼或一棵倒下的树挡住了去路。如果机器人盲目地跟随地图,它就会撞上。
解决方案:双层团队
作者构建了一个在两个层级上运作的系统,根据需要在这张“地图”和“现实世界”之间切换。
层级 1:战略将军(符号规划)
这是快速、高层级的思考者。
- 工作原理:它从机器人自己的玩耍时间中学习。机器人会撞到东西、捡起东西并放下东西。机器人的大脑观察这些过程并学习简单的规则:“如果我拿起红色积木,它通常会落在蓝色积木上。”
- 升级:以前的机器人只学习最可能的结果(例如,“红色积木会放在蓝色积木上”)。这个新系统学习概率。它知道:“90% 的情况下,红色积木会放在蓝色积木上,但 10% 的情况下,它可能会滑落。”
- 类比:想象一位棋手,他不仅规划最佳走法,还会考虑对手做出奇怪走法时的“如果”情景。这使得计划更加稳健。
安全检查:检查员
在机器人实际移动之前,系统会运行一次模拟。
- 它采用“将军”的计划,并通过精密工程师(一个高精度的人工智能模型)进行运行。
- 类比:这就像飞行模拟器。飞行员(将军)说:“我们要飞往巴黎。”模拟器(工程师)检查天气、燃料和引擎物理特性。如果模拟器说:“不,我们会撞山,”那么该计划会在机器人移动任何肌肉之前被拒绝。
- 这一步能捕捉到那些在地图上看起来不错但在现实中会失败的计划。
层级 2:精密工程师(连续搜索)
如果将军的计划未能通过安全检查,或者问题过于复杂而无法用简单的地图解决,系统就会切换到层级 2。
- 工作原理:这是“蛮力”方法。它不使用简单的符号,而是实时计算每一次移动的确切物理特性。
- 权衡:这非常准确,但计算速度非常慢且成本高昂。就像为了找到一条路而计算风中每一片树叶的轨迹。
- 策略:机器人只在快速、符号式的方法失败时才使用这种重型方法。这就像只有当全科医生无法解决问题时,才呼叫专科外科医生。
他们的发现
研究人员在机器人手臂移动不同大小的积木上测试了该系统。
- 优于单纯的“地图”:新系统解决的问题比仅使用“将军”(符号)方法的机器人更多。
- 优于单纯的“工程师”:它的表现几乎与仅使用缓慢、重型“工程师”方法的机器人一样好,但速度快得多,因为它使用快速的“将军”方法解决了大多数问题。
- 安全网有效:“检查员”成功阻止了机器人尝试会失败的计划,节省了时间并防止了碰撞。
结论
本文提出了一种机器人大脑,它快速是因为使用了简单的规则,智能是因为它理解了概率(事情出错的可能性),并且安全是因为它在行动之前用物理模拟器双重检查了其计划。它只在绝对必要时才放慢速度进行复杂的数学计算,这使得它成为机器人在现实世界中学习和行动的一种非常高效的方式。
技术摘要:基于交互数据学习符号抽象的双层规划
问题定义
在连续环境中运行的机器人智能体面临一个根本性的权衡:直接在高分辨率连续状态空间中进行推理因可能解的数量无限或庞大而在计算上不可行,而纯粹的符号推理往往因丢弃关键的几何和动态信息而导致执行失败。现有从非监督机器人探索中学习符号抽象的方法通常依赖于确定性领域,缺乏验证符号计划在连续世界中是否成功的机制,且在抽象不足时无法提供回退方案。本文旨在解决对一种规划框架的需求,该框架需结合高层符号推理的效率与连续动态验证的精度。
方法论
作者提出了一种双层神经符号规划框架,该框架通过两个不同的层级运行,并支持基于非监督交互数据训练的双模型架构。
1. 双模型架构
该框架利用两个源自编码器 - 解码器架构的专用神经网络模型,该架构经过训练以预测动作效果:
- 符号模型(Msym): 在其瓶颈层使用Gumbel-Sigmoid激活函数。该模型旨在发现离散的一元对象符号和关系符号(例如“在……之上”、“在……旁边”),以生成用于高层规划的符号算子。
- 动态模型(Mdyn): 在其瓶颈层使用标准的Sigmoid激活函数。尽管共享相同的架构,但该模型针对精确的连续效果预测进行了优化,作为前向动态模型用于验证和底层搜索。
2. 学习过程
系统从交互样本数据集 (X,a,X′) 中学习,其中 X 代表连续状态(物体位置和类型),a 代表参数化的抓取 - 放置技能。
- 符号发现: 符号模型将连续状态映射为离散符号。关系符号使用适配了 Gumbel-Sigmoid 的自注意力机制计算,以允许离散符号的可微学习。
- 算子提取: 连续转换被转换为符号数据集。算子被定义为基于数据中观察到的最频繁动作后状态的一组前提条件和效果。
- 概率领域构建: 该框架构建**PPDDL(概率 PDDL)**领域,而非确定性算子。每个算子包含基于其经验频率的可能符号效果的概率分布,从而捕捉真实世界交互的随机性。
3. 双层规划算法
规划过程分为两个层级进行:
- 第一层:带验证的概率符号规划
- 系统通过从学习到的概率分布中采样效果,生成 N 个 PDDL 领域的集合。
- 经典人工智能规划器(Fast-Downward)在这些领域中搜索规划。
- 连续验证: 候选符号规划按概率排序。动态模型(Mdyn)被用作前向模拟器,以预测每个候选规划的连续结果。如果预测的最终状态在容差阈值(τverify)内接近目标,则该规划被接受。
- 第二层:连续前向搜索回退
- 如果没有符号规划通过验证,系统将在连续状态空间中调用加权 A∗ 搜索。
- 该搜索使用动态模型进行状态转换,并使用基于到目标欧几里得距离的启发式函数。
- 为确保可行性,搜索采用启发式动作剪枝,仅生成面向目标的动作(例如,将放置错误的物体移向其目标位置),而不是探索完整的动作空间。
主要贡献
- 双层框架: 一种新颖的架构,将高层的概率符号规划与作为回退方案的连续前向搜索相结合,弥合了抽象推理与连续动态之间的差距。
- 双模型方案: 引入了两个专用模型——一个用于离散符号发现,另一个用于精确的连续效果预测——证明了单一模型无法同时最优地服务于这两个目的。
- 验证机制: 一种利用连续动态模型在执行前验证符号规划的方法,有效过滤掉那些符号上有效但动态上不可行的规划。
- 概率算子学习: 超越确定性领域,学习具有随机效果的算子,使规划器能够探索概率较低但可能成功的路径。
实验结果
该框架在模拟的桌面环境中对多物体操作任务进行了评估,涉及 2 到 4 个物体以及长度为 1 到 5 的动作序列。
- 模型验证: 与符号模型(3.33 厘米)相比,动态模型实现了更低的效果预测平均误差(1.96 厘米),验证了为连续预测使用单独模型的必要性。
- 概率与确定性对比: 概率规划器显著优于确定性基线(例如,单步任务的胜率分别为 73.0% 对 64.67%),表明考虑完整的结果分布提高了鲁棒性。
- 验证性能: 连续规划验证器实现了 0.91 的平均准确率和 0.90 的 F1 分数。经过验证的规划胜率为 94.5%,而未经验证的规划失败率为 87.3%,证实了该机制在过滤失败规划方面的可靠性。
- 整体性能: 所提出的双层规划器实现的规划成功率与完整的连续前向搜索在统计上相当(p=0.71)。然而,它利用高效的符号推理解决了大多数问题,仅在必要时才诉诸计算成本高昂的连续搜索。
意义
本文声称,该方法成功缓解了纯符号规划(丢失几何细节)和纯连续规划(计算不可行)的局限性。通过将符号推理的效率与学习到的连续动态的精度相结合,该框架为机器人操作提供了一种鲁棒的解决方案。它表明,只要能够根据学习到的物理动态验证符号规划,智能体就能在保持计算效率的同时,实现与穷举连续搜索相当的高层规划性能。这项工作强调了概率建模和验证在使学习到的符号抽象适用于真实世界执行方面的重要性。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。