想象一下,你正在教一个机器人如何在不撞倒家具的情况下穿过一间杂乱的房间。这正是论文 NavOL 所解决的核心挑战。
以下是他们如何利用简单类比解决这一问题的故事:
问题:“教科书”与“现实世界”
此前,机器人导航的训练就像仅使用一本静态教科书来备考驾驶考试。
- 离线学习(旧方法): 研究人员会在模拟器中记录成千上万条完美的驾驶路径,将其保存到硬盘,然后教机器人死记硬背这些路径。
- 缺陷: 如果机器人在现实世界中犯了一个微小的错误(例如方向盘转动得稍早了一点点),它就会偏离它死记硬背的“完美路径”。由于它从未练习过如何修正错误,它会感到困惑、发生碰撞并放弃。这被称为“分布偏移”问题。
- 强化学习(试错法): 另一种方法让机器人仅仅通过“尝试并失败”数百万次,希望它最终能学会。
- 缺陷: 这极其缓慢且低效。这就像试图通过不断撞墙直到偶然发现如何刹车来学习驾驶。此外,你还必须为每一个动作发明一个复杂的“评分系统”(奖励),而这很难做到恰到好处。
解决方案:NavOL(“实时导师”系统)
作者创建了 NavOL,这就像给机器人配备了一位实时导师,在虚拟世界中与它并肩同行,实时纠正它的错误。
以下是该系统逐步的工作原理:
- 虚拟游乐场: 他们构建了一个巨大的、高速的虚拟世界(使用名为 IsaacLab 的工具),可以在其中同时运行 256 个机器人。这就像拥有一个拥有 256 名学生的教室,大家同时练习驾驶。
- “特权”导师: 在这个虚拟世界中,有一个“上帝模式”规划器。这位导师完美地知晓整张地图(墙壁、家具、目标),并能看到通往目标的绝对最佳路径。机器人在现实世界中无法看到这张地图,但导师在训练期间会利用它。
- “ rollout-更新”循环(练习环节):
- 步骤 A(尝试): 机器人尝试独自导航房间。
- 步骤 B(纠正): 在每一步,"上帝模式"导师都会检查:“如果机器人是完美的,它此刻应该在哪里?”
- 步骤 C(教学): 机器人将其实际行为与导师所说的应有行为进行比较。它立即从这个差异中学习。
- 步骤 D(更新): 机器人的大脑(其神经网络)在尝试下一步之前,会立即根据这一新教训进行更新。
类比: 想象学习骑自行车。
- 旧方法: 你看一段有人完美骑行的视频,然后试图模仿。如果你摇晃,你就会摔倒,因为你从未学会如何纠正摇晃。
- NavOL 方法: 你正在骑自行车,一位教练就在你旁边奔跑。每次你向左倾斜过多时,教练会在你仍在移动的同时,轻轻将你推回中心。你通过实时纠正自己的错误来学习平衡,而不是死记硬背视频。
为什么这很特别?
- 无需“奖励”猜测: 机器人不需要复杂的评分系统。它只需要尝试模仿专家导师。
- 修正错误: 因为机器人在训练期间练习了如何修正自身的偏移,所以当它在现实世界中犯错时,不会惊慌失措。
- 速度: 他们使用了 8 块强大的显卡(RTX 4090),每小时收集超过 2,000 个新的学习经验(轨迹)。这就像一名学生在一整天内读完了整个图书馆的驾驶手册。
结果:从模拟到现实
团队通过两种方式测试了这一点:
- 虚拟测试: 他们在复杂、杂乱的虚拟房间中将 NavOL 与其他顶级机器人导航方法进行对抗。NavOL 几乎每次都获胜,更快、更安全地到达目标。
- 现实世界测试: 他们将虚拟世界中训练好的机器人放到现实机器人(Unitree Go2 机器狗)上,在真实的办公室、健身房和走廊中进行测试。
- 结果: 使用 NavOL 训练的机器人成功导航了这些杂乱的现实房间。而旧方法(NavDP)则陷入停滞或发生碰撞。
- “魔力”: 该机器人是在虚拟的"Dingo"机器人上训练的,但在真实的"Go2"机器人上却完美运行。这证明了所学的是如何导航,而不仅仅是死记硬背特定机器人的形状。
总结
NavOL 是一种教导机器人移动的新方法。它不再死记硬背静态地图或通过试错进行猜测,而是利用快速虚拟模拟器中的“实时导师”来实时纠正机器人的路径。这使得机器人更聪明、更安全,能够应对它从未见过的杂乱现实环境。
技术摘要:NavOL – 基于在线模仿学习的导航策略
问题陈述
在开放世界、动态且杂乱的环境中,机器人视觉导航仍然是一个重大挑战。现有方法面临不同的局限性:
- 离线模仿学习: 虽然高效,但这些方法在 rollout( rollout 指策略执行过程)期间会遭受分布偏移和误差累积,因为它们依赖于静态的、预先收集的数据集,而这些数据集可能无法覆盖智能体在部署期间遇到的状态。
- 强化学习(RL): 尽管强化学习允许与环境交互,但它严重依赖于精心设计的奖励函数,经常遇到稀疏奖励问题,并且样本效率低下,使得在复杂环境中进行大规模训练变得困难。
- 数据稀缺: 收集大规模、高质量的真实世界轨迹成本高昂,限制了模型容量。相反,纯粹的合成数据生成(例如 NavDP)提高了效率,但仍是一个离线流程,无法在训练期间纠正分布漂移。
核心瓶颈在于缺乏一种可扩展的范式,该范式能够结合模仿学习的样本效率与在线学习的交互优势,以在不依赖奖励工程的情况下缓解分布偏移。
方法:NavOL
NavOL 提出了一种在线模仿学习范式,弥合了离线模仿与在线强化学习之间的差距。它在 IsaacLab 模拟器内运行于闭环的rollout–更新框架中。
1. 模型架构
NavOL 建立在预训练的多模态扩散策略(具体来自 NavDP)之上,由两个协同组件组成:
- 轨迹生成器(f): 一个扩散 Transformer(DiT),将 RGB-D 观测和目标指令映射为短视野的相对航点序列。它使用 DepthAnythingV2 ViT 骨干网络进行视觉编码,并使用 Transformer 解码器融合特征。
- 评论家网络(V): 与生成器共享视觉 token 和 DiT 骨干网络。它对候选轨迹的安全性和可行性进行评分,输出标量安全评分。这使得系统能够对采样的轨迹进行排序并执行最安全的计划。
2. 在线模仿学习流程
训练过程在两个阶段之间交替进行:
- Rollout 阶段:
- 智能体使用当前策略在模拟器中进行导航。
- 专家监督: 一个拥有环境地图(NavMesh)特权访问权限的全局规划器计算从当前位姿到目标的最优路径。该路径被稠密化和平滑化,用作真实轨迹标签。
- 数据聚合: 在每一步,智能体以概率 ρ 执行策略的动作,或以概率 1−ρ 执行专家的动作。这种"DAgger 风格”的交互确保策略从它实际访问的状态中学习,从而缓解协变量偏移。
- 安全标注: 基于与障碍物的距离推导目标安全评分,用于监督评论家网络。
- 更新阶段:
- 扩散策略和评论家网络在最新收集的观测 - 轨迹对上进行训练。
- 策略使用标准的去噪目标(预测噪声与目标噪声之间的均方误差)进行优化,该目标以观测、目标和专家轨迹为条件。
- 评论家网络针对目标安全评分使用均方误差损失进行优化。
- 至关重要的是,系统丢弃先前迭代的数据,仅针对最近的 rollout 进行训练,以最大化更新效率。
3. 实现与扩展
- 仿真: 基于 IsaacLab 构建,具有高保真渲染(全局光照、反射、阴影)和领域随机化(相机位姿、光照、智能体尺寸)。
- 效率: 系统在 8 块 RTX 4090 GPU 上并行运行 50 个场景,每小时收集超过 2,000 条新轨迹(平均每条轨迹 400+ 步)。
- 初始化: 策略使用预训练的 NavDP 模型权重进行初始化,以提供强大的行为先验,尽管消融研究表明,即使从头开始训练也能实现(尽管性能有所降低)。
主要贡献
- NavOL 框架: 一种新颖的在线模仿学习导航框架,通过利用在线收集的专家演示迭代更新策略,消除了对奖励工程的需求。
- 可扩展流程: 一个高度并行化的 rollout–更新流程,能够在多样化的 3D 场景中每小时收集并学习数千条高质量轨迹。
- 新基准: 引入了基于 3D-Front 数据集的室内视觉导航基准,包含 8 个域外场景和预定义的起点 - 终点对,以严格评估零样本泛化能力。
- 实证验证: 广泛的实验表明,在仿真和真实世界零样本部署中,其性能均一致优于最先进(SOTA)的基线方法。
结果
仿真基准
- NavDP 基准: NavOL 在所有指标上均优于基线方法(DD-PPO, iPlanner, ViPlanner 和原始 NavDP)。它实现了 80.4% 的平均成功率(mSR)和 76.3% 的平均成功加权路径长度(mSPL),超过了 NavDP(77.8% SR, 74.8% SPL)。
- NavOL 基准: 在新的、更具挑战性的基准上,NavOL 实现了 69.0% 的 mSR 和 63.7% 的 mSPL。这显著优于最强的基线 NavDP(42.2% SR, 37.7% SPL),以及其他方法如 ViPlanner(33.0% SR)和 iPlanner(18.7% SR)。
- 稳定性: 定性分析显示,NavOL 即使在障碍物附近也能生成稳定、无碰撞的轨迹,而 NavDP 则表现出高方差和抖动行为,导致失败。
真实世界部署
- 零样本仿真到现实: 该策略在仿真中于 Dingo 机器人上训练,随后部署在配备 RealSense D435i 相机的 Unitree Go2 机器人上。
- 性能: 在三个杂乱的真实世界场景(办公室、健身房、走廊)中,NavOL 分别实现了 80%、70% 和 100% 的成功率。相比之下,NavDP 仅分别达到 40%、20% 和 20%。
- 跨具身泛化: 结果表明,该策略在不同机器人具身形式之间具有很强的泛化能力,验证了所学空间表示的鲁棒性。
效率分析
- 从 NavDP 初始化的 NavOL 仅需 16 GPU-天(8 块 GPU 运行 2 天)即可达到 69.0% 的 mSR。
- 相比之下,原始 NavDP 需要大约 1,024 GPU-天(32 块 A100 运行 32 天)才能达到 42.2% 的 mSR。
- 即使是“从头开始”的 NavOL 变体(16 GPU-天)也优于原始 NavDP,突显了在线监督方法的数据效率。
意义与主张
本文主张,NavOL 通过以下方式成功解决了离线模仿学习和强化学习的局限性:
- 缓解分布偏移: 通过在策略自身探索的 rollout 上进行训练并纳入专家修正(DAgger 风格),该方法防止了离线策略典型的误差累积。
- 消除奖励工程: 使用特权全局规划器提供直接的轨迹监督,消除了对稀疏或手动设计奖励函数的需求。
- 可扩展性: 与 IsaacLab 的集成允许大规模并行化,使得高保真在线训练变得可行且高效。
- 鲁棒性: 该框架生成的策略能够很好地泛化到未见过的环境和不同的机器人具身形式,零样本真实世界实验证明了这一点。
作者得出结论,将在线规划器监督纳入模仿学习显著提升了导航性能,为实现鲁棒的具身智能体提供了一条更高效、可扩展的路径。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。