← 最新论文
💻 computer science

NavOL: Navigation Policy with Online Imitation Learning

NavOL 是一个在线模仿学习框架,它利用预训练的扩散策略和全局规划器,在模拟器中迭代地收集并学习专家轨迹,从而消除奖励工程、缓解分布偏移,并在仿真和真实世界环境中实现鲁棒的视觉导航性能。

原作者: Xiaofei Wei, Chun Gu, Li Zhang

发布于 2026-05-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Xiaofei Wei, Chun Gu, Li Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人如何在不撞倒家具的情况下穿过一间杂乱的房间。这正是论文 NavOL 所解决的核心挑战。

以下是他们如何利用简单类比解决这一问题的故事:

问题:“教科书”与“现实世界”

此前,机器人导航的训练就像仅使用一本静态教科书来备考驾驶考试。

  • 离线学习(旧方法): 研究人员会在模拟器中记录成千上万条完美的驾驶路径,将其保存到硬盘,然后教机器人死记硬背这些路径。
    • 缺陷: 如果机器人在现实世界中犯了一个微小的错误(例如方向盘转动得稍早了一点点),它就会偏离它死记硬背的“完美路径”。由于它从未练习过如何修正错误,它会感到困惑、发生碰撞并放弃。这被称为“分布偏移”问题。
  • 强化学习(试错法): 另一种方法让机器人仅仅通过“尝试并失败”数百万次,希望它最终能学会。
    • 缺陷: 这极其缓慢且低效。这就像试图通过不断撞墙直到偶然发现如何刹车来学习驾驶。此外,你还必须为每一个动作发明一个复杂的“评分系统”(奖励),而这很难做到恰到好处。

解决方案:NavOL(“实时导师”系统)

作者创建了 NavOL,这就像给机器人配备了一位实时导师,在虚拟世界中与它并肩同行,实时纠正它的错误。

以下是该系统逐步的工作原理:

  1. 虚拟游乐场: 他们构建了一个巨大的、高速的虚拟世界(使用名为 IsaacLab 的工具),可以在其中同时运行 256 个机器人。这就像拥有一个拥有 256 名学生的教室,大家同时练习驾驶。
  2. “特权”导师: 在这个虚拟世界中,有一个“上帝模式”规划器。这位导师完美地知晓整张地图(墙壁、家具、目标),并能看到通往目标的绝对最佳路径。机器人在现实世界中无法看到这张地图,但导师在训练期间会利用它。
  3. “ rollout-更新”循环(练习环节):
    • 步骤 A(尝试): 机器人尝试独自导航房间。
    • 步骤 B(纠正): 在每一步,"上帝模式"导师都会检查:“如果机器人是完美的,它此刻应该在哪里?”
    • 步骤 C(教学): 机器人将其实际行为与导师所说的应有行为进行比较。它立即从这个差异中学习。
    • 步骤 D(更新): 机器人的大脑(其神经网络)在尝试下一步之前,会立即根据这一新教训进行更新。

类比: 想象学习骑自行车。

  • 旧方法: 你看一段有人完美骑行的视频,然后试图模仿。如果你摇晃,你就会摔倒,因为你从未学会如何纠正摇晃。
  • NavOL 方法: 你正在骑自行车,一位教练就在你旁边奔跑。每次你向左倾斜过多时,教练会在你仍在移动的同时,轻轻将你推回中心。你通过实时纠正自己的错误来学习平衡,而不是死记硬背视频。

为什么这很特别?

  • 无需“奖励”猜测: 机器人不需要复杂的评分系统。它只需要尝试模仿专家导师。
  • 修正错误: 因为机器人在训练期间练习了如何修正自身的偏移,所以当它在现实世界中犯错时,不会惊慌失措。
  • 速度: 他们使用了 8 块强大的显卡(RTX 4090),每小时收集超过 2,000 个新的学习经验(轨迹)。这就像一名学生在一整天内读完了整个图书馆的驾驶手册。

结果:从模拟到现实

团队通过两种方式测试了这一点:

  1. 虚拟测试: 他们在复杂、杂乱的虚拟房间中将 NavOL 与其他顶级机器人导航方法进行对抗。NavOL 几乎每次都获胜,更快、更安全地到达目标。
  2. 现实世界测试: 他们将虚拟世界中训练好的机器人放到现实机器人(Unitree Go2 机器狗)上,在真实的办公室、健身房和走廊中进行测试。
    • 结果: 使用 NavOL 训练的机器人成功导航了这些杂乱的现实房间。而旧方法(NavDP)则陷入停滞或发生碰撞。
    • “魔力”: 该机器人是在虚拟的"Dingo"机器人上训练的,但在真实的"Go2"机器人上却完美运行。这证明了所学的是如何导航,而不仅仅是死记硬背特定机器人的形状。

总结

NavOL 是一种教导机器人移动的新方法。它不再死记硬背静态地图或通过试错进行猜测,而是利用快速虚拟模拟器中的“实时导师”来实时纠正机器人的路径。这使得机器人更聪明、更安全,能够应对它从未见过的杂乱现实环境。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →