← 最新论文
💻 computer science

Hydra: A Navigation World Action Model with Discrete Latent Planning and Continuous Flow-Matching Execution

Hydra 是一个新颖的机器人控制框架,它通过将视觉状态与动作统一到离散潜空间中以实现高效规划,并利用连续流匹配(flow-matching)将这些离散规划转化为平滑的物理指令,从而弥合了世界模型与实时执行之间的鸿沟。

原作者: Mohammad Nazeri, Alexandyr Card, Samira Huber, Anuj Pokhrel, Yujun Wang, Ruben Hammele, Daeun Song, Sören Pirk, Xuesu Xiao

发布于 2026-09-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Mohammad Nazeri, Alexandyr Card, Samira Huber, Anuj Pokhrel, Yujun Wang, Ruben Hammele, Daeun Song, Sören Pirk, Xuesu Xiao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

长期以来,机器人一直难以像生物一样具备预见性地在世界中移动。虽然现代机器可以对所见之物做出即时反应,但它们往往缺乏想象接下来会发生什么的这种能力。传统的导航系统运作起来就像一位只盯着车前路面的驾驶员,只能对出现的障碍做出反应,却无法在陷入死胡同之前规划出绕行路线。为了赋予机器人这种预见性,科学家们开发了“世界模型”(world models),这本质上是内部模拟器,能让机器在行动之前想象不同的未来。然而,一个主要的障碍阻碍了这些模拟器在物理机器人上的实时应用:检查这些想象出的未来的过程太慢了。现有方法需要机器人生成数千条潜在路径,将每一条路径转换为详细的图像以检查安全性,然后舍弃掉糟糕的路径。这种创建和检查图像的循环计算量巨大,会导致机器人陷入停滞,使得实时导航变得不可能。

由多所大学研究人员开发的名为 Hydra 的新方法,通过改变机器人思考运动的方式解决了这个问题。Hydra 并不试图以高清晰度的细节去想象每一种可能的未来,而是学习以宽泛、离散的概念来思考运动,类似于人类可能会想到“左转”或“直行”,而不是计算每一个轮轴旋转的确切角度。研究人员构建了一个系统,让机器人的规划器直接存在于模拟器内部,在压缩且抽象的可能图谱中寻找最佳路径,而不是在一个庞大的像素空间中搜索。这使得机器人能够在不到一秒的时间内评估数千个潜在的未来,在路径被完全绘制出来之前就将其舍弃。一旦选定了安全路径,系统会将这种抽象概念转换回机器人电机可以执行的平滑、连续的运动。

其核心创新在于作者称之为“离散潜变量规划”(discrete latent planning)的技术。在之前的系统中,试图导航走廊的机器人会生成一系列连续的轨迹,其中许多轨迹会导致它直接撞向墙壁。系统随后必须将这些轨迹中的每一条都渲染成视觉图像,以观察是否发生了碰撞,而这个过程对于移动中的机器人来说耗时过长。Hydra 通过将预测强制通过一个特殊的过滤器来规避这一瓶颈,该过滤器将相似的运动归类为一组小的、固定的意图词汇。当机器人考虑一个未来时,它生成的不是一张模糊的碰撞图像;而是从其学习到的词汇表中选择一个代表“安全转向”或“碰撞”的标记(token)。因为这些标记是从一组有限的、符合物理规律的动作列表中提取的,所以机器人可以瞬间识别出通往墙壁的路径是无效的,而无需实际去可视化那次碰撞。这种从“连续猜测”到“离解选择”的转变,使得系统能够几乎立即剔除危险选项,从而将其计算能力集中在那些已知是合理的路径上。

为了确保这些抽象的选择能转化为平滑的物理运动,Hydra 将这种离散规划与连续执行方法相结合。一旦机器人选择了最佳抽象路径,第二个系统就会将该选择转换为驱动轮子所需的精确、流动的指令。这种两步走的过程——在简化且抽象的空间中进行规划,然后在现实世界中执行——使得机器人既能保持模拟器的安全性,又能拥有反应灵敏的驾驶员般的反应速度。研究人员在两种不同的物理机器人(一种轮式车辆和一种四足类狗形机器人)以及包括狭窄走廊和带有隐藏障碍物的区域在内的各种环境中测试了该系统。在这些实验中,该系统成功地在不到一秒的时间内,规划出了通往八米外目标的无碰撞路径,这一速度大约是之前依赖生成并检查完整图像的方法快了五百倍。

这些物理测试的结果凸显了旧思维方式与新思维方式之间的显著差距。当研究人员将 Hydra 与使用连续采样(continuous sampling)的现有系统进行比较时,旧方法往往无法绕过障碍物,因为它们花费了太多时间去计算不可能实现的路径,从而导致碰撞。相比之下,Hydra 在无障碍环境中实现了完美的成功率,并在绝大多数试验中成功绕过了隐藏的拐角和障碍物。该系统还能通过察觉到提议的路径不符合其学习到的安全运动词汇,从而检测到即将发生的碰撞,这种信号在机器人实际撞击之前很久就会出现。这种基于抽象结构而非视觉外观来拒绝不安全路径的能力,被证明是一种确保安全性且不会减慢决策过程的稳健方法。

尽管取得了这些成功,研究人员也承认该系统并非没有局限性。这种将运动归类为固定词汇的方法意味着机器人有时难以区分真正的障碍物与视觉上复杂但安全的区域(例如茂密的植被)。由于该系统依赖于从其抽象代码中重建场景的难度,高度纹理化的环境有时会触发误报,导致机器人在本可以安全通过的地方产生犹豫。此外,目前的系统在表示动态物体(如行人)方面存在困难,往往将其作为背景平滑处理,而不是将其视为需要避开的独立实体。这些挑战表明,虽然离散化方法是一个强大的进步,但未来的版本需要改进其表示世界的方式,以应对人类环境的完整复杂性。

最终,这项工作证明了机器人可以通过“概念”而非“像素”来进行实时、目标导向的规划。通过将规划过程移入模拟器内部,并将搜索限制在学习到的有效运动集内,研究人员创建了一个既快速又安全的系统。研究结果表明,扩展世界模型以适用于物理机器人的关键不在于使其更加精细,而在于使其更加结构化,从而让它们能够以一种计算高效且符合物理逻辑的方式来想象未来。这种方法为开发能够像人类一样利用直觉预见性在现实世界中导航的机器人提供了一条充满希望的路径。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →