From Seeing to Experiencing: Scaling Navigation Foundation Models with Reinforcement Learning
本文介绍了从“视觉到体验”(Seeing-to-Experiencing, S2E)框架,该框架通过结合大规模网络视频的离线预训练以及在仿真环境中的强化学习,以提升交互式推理与安全性,从而增强导航基础模型,并由名为 NavBench-GS 的新评估基准提供支持。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
核心问题:“游客” vs. “当地人”
想象一下,你想教一个机器人如何在繁忙的城市中行走。
旧方法(仅仅是“看”):
目前的导航机器人大多像是一个通过观看数千小时城市行走 YouTube 视频来学习的“游客”。它们在屏幕上见过各种类型的街道、人群和障碍物。这被称为离线预训练 (Offline Pre-training)。
- 缺陷: 观看一段别人躲避滑板手的视频,与实际去躲避滑板手是完全不同的。机器人知道碰撞“看起来”是什么样的,但它并不理解摔倒的物理机制,也不理解停下来所需的瞬间时机。如果机器人在现实世界中尝试行走,它可能会僵住或撞车,因为它从未真正“感受”过走错路带来的后果。它缺乏因果关系 (Causality) 的理解。
新方法(S2E 框架):
作者提出了一种名为 “从观察到体验” (Seeing-to-Experiencing, S2E) 的新方法。你可以把这想象成把那个“游客”送进了一个高度真实的、安全的视频游戏模拟器中,让他们可以真正地行走、绊倒,并从错误中学习,而不会受伤。
其目标是将“视频观察者”所拥有的广泛知识,与“实地练习者”所拥有的街头智慧结合起来。
工作原理:两步走的配方
S2E 框架使用了两个主要的“技巧”来高效地实现这一目标。
1. “锚点”系统(在视频阶段)
挑战: 当机器人观看视频时,它会看到有时人们直行,有时为了避开狗而左转,有时为了红灯而停止。对于同一种情况,这些动作都是合理的。如果机器人试图只预测一条“平均路径”,它就会失败。
解决方案: 作者使用了名为锚点引导分布匹配 (Anchor-Guided Distribution Matching) 的技术。
- 类比: 想象机器人是一位试图猜出菜谱的厨师。他们不是去猜一种单一的味道,而是在桌上摆放了几个“锚点”(就像特定的风味特征:“香辣”、“甜美”、“咸鲜”)。
- 作用: 机器人学习到,对于特定的情境,答案可以是“香辣”(直行)或者“咸鲜”(左转)。通过使用这些锚点,机器人学会了预测一个可能的“优质动作菜单”,而不仅仅是一个平均的猜测。这让机器人变得更加灵活,能够应对不同的场景。
2. “残差”大脑(在练习阶段)
挑战: 一旦机器人在模拟器中开始练习,我们希望它能学会新招式(比如躲避移动的行人)。但如果我们让机器人从头开始重新学习所有东西,它可能会忘记如何直行或识别人行道。这被称为“灾难性遗忘 (Catastrophic Forgetting)”。此外,模拟器看起来可能与现实世界略有不同(光照、纹理不同),这会让机器人感到困惑。
解决方案: 他们使用了一个残差注意力模块 (Residual-Attention Module)。
- 类比: 想象机器人有一个“基础大脑”(基于视频训练的部分),它非常擅长识别街道。当它进入模拟器时,我们并不替换这个基础大脑。相反,我们在它之上安装了一个轻量级的“插件大脑”(残差模块)。
- 作用: 基础大脑保持冻结状态,保护其通用的知识。插件大脑是唯一进行学习的部分。它只专注于新的、交互性的内容:“噢,那个人在移动,我需要减速。”
- 益处: 这就像是在不删除联系人的情况下为手机安装一个新的 App。机器人获得了新的反应技能(躲避、停止),而不会丢失原有的通用知识(识别道路)。
测试驱动:NavBench-GS
为了证明其有效性,作者构建了一个新的测试场 NavBench-GS。
- 它是什么? 他们没有测试平面的 2D 图像(比如看一张街道照片),而是构建了一个拥有真实物理效果、看起来与现实世界一模一样的 3D 世界。你可以向机器人扔球,它会有反应。
- 结果:
- 仅靠视频训练的机器人(“游客”)在面对移动的人或障碍物时经常发生碰撞。
- 使用 S2E 方法训练的机器人(“当地人”)表现得更好。它们到达目的地的成功率更高,且碰撞次数大幅减少。
- 效率惊喜: S2E 机器人的学习速度更快,所需数据更少。一个通过 100 小时数据训练并配合模拟器练习的机器人,其表现优于其他训练了超过 2,000 小时视频数据的机器人。这证明了交互式练习比单纯观看更多视频更有价值。
现实世界的验证
团队不仅停留在模拟阶段。他们将机器人应用到了两台真实的机器上:
- 一台轮式机器人(类似于配送机器人)。
- 一台四足机器人(类似机器狗)。
他们在真实的城市街道中测试了这些机器人,面对真实的障碍物和行人。经过 S2E 训练的机器人成功地在这些复杂环境中导航,且无需针对这些特定街道进行专门训练(零样本泛化/Zero-Shot Generalization)。它们能够保持在人行道上并避开行人,证明了在模拟器中学到的技能可以完美地迁移到现实世界。
总结
本文认为,要让机器人成为真正的智能导航者,我们不能仅仅喂给它们更多的视频。我们必须让它们去练习。通过将稳定的“基于视频”的基础模型与一个“基于练习”且不会覆盖原有知识的学习模块相结合,机器人可以在混乱的现实世界中安全且高效地导航。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。