Robostral Navigate
Robostral Navigate 是一个 8B 参数规模的视觉语言模型,它通过利用包含 240 万条模拟轨迹的可扩展训练方案、前缀缓存效率以及图像空间路标预测技术,消除了对深度传感器或预构建地图的需求,从而在多种机器人具身形态中实现了最先进的单目导航性能。
原作者: Abdelaziz Bounhar, Abhijeet Somani, Aditi Kabra, Adrian Valente, Adrien Petralia, Adrien Sade, Alan Jeffares, Albert Jiang, Aleksandr Timashov, Alexandre Cahill, Alexandre Gavaudan, Alexandre Laval, Alexandre Sablayrolles, Amelie Heliou, Amos You, Andre Jonasson, Andrew Bai, Andrew Ehrenberg, Andrew Zhao, Angele Lenglemetz, Anmol Agarwal, Antonia Calvi, Arata Suzuki, Arjun Majumdar, Arthur Fournier, Artjom Joosen, Avinash Sooriyarachchi, Aylin Guliz Akkus, Aysenur Karaduman, Baptiste Bout, Baptiste Roziere, Baudouin De Monicault, Benjamin Holzschuh, Benjamin Lefaudeux, Benjamin Tibi, Bernhard Stadlbauer, Blazej Osinski, Camille Le Scao, Chaoran Yu, Charlotte Cronjager, Chen-Yo Sun, Chris Bamford, Christian Wallenwein, Christophe Renaudin, Clemence Lanfranchi, Corentin Barreau, Corentin Sautier, Cristiana-Diana Diaconu, Cyprien Courtot, Daniel Marczak, Darius Dabert, Diego de Las Casas, Dominik Nuss, Dylan Rubini, Dzmitry Soupel, Elizaveta Demyanenko, Elliot Chane-Sane, Emilien Fugier, Emmanuel Gottlob, Erik Aas, Etienne Goffinet, Etienne Millon, Eujeong Choi, Fabian Paischer, Fabian Schlager, Faruk Ahmed, Federico Baldassarre, Filip Szatkowski, Florian Wiesner, Gabrielle Berrada, Gaetan Ecrepont, Gaetan Lepage, Gaspard Blanchet, Gaspard Donada-Vidal, Gauthier Delerce, Gauthier Guinet, Genevieve Hayes, Georgii Novikov, Giada Pistilli, Gianluca Galletti, Guillaume Breton, Guillaume Kunsch, Guillaume Lample, Guillaume Martin, Guillaume Raille, Gunjan Dhanuka, Gunshi Gupta, Han Zhou, Harshil Shah, Hasan Furkan Vural, Hedi Hadiji, Hope McGovern, Hugo Cisneros, Hugo Thimonier, Indraneel Mukherjee, Ivan Cuevas Salazar, Jacques Sun, Jan Ludziejewski, Jason Rute, Jean Quentin, Jean-Hadrien Chabran, Jean-Malo Delignon, Jie Zhang, Joachim Studnia, Joep Barmentlo, Johannes Brandstetter, John Harvill, Jonas Amar, Jonas Schweizer, Josephine Delas, Josselin Somerville, Julien Denize, Julien Tauran, Kartik Khandelwal, Khyathi Raghavi Chandu, Kilian Tep, Kush Jain, Larissa Laich, Laura Calem, Laurence Aitchison, Laurent Callot, Laurent Fainsin, Leo Cotteleer, Leonard Blier, Lingxiao Zhao, Louis Martin, Louis Serrano, Lucile Saulnier, Ludovic Ho Fuh, Luis Montero, Maarten Buyl, Manon Chossegros, Marcin Mozejko, Margaret Jennings, Markus Hennerbichler, Martin Alexandre, Mathieu Poiree, Mathieu Schmitt, Mathilde Guillaumin, Matthieu Andre, Matthieu Dinot, Matthieu Futeral, Maurits Bleeker, Mauro Comi, Max Mynter, Maxim Berman, Maxime Darrin, Maxime Louis, Maximilian Augustin, Maximilian Muller, Melina Jingting Laimon, Mert Unsal, Mia Chiquier, Michael Pilcer, Michal Pietruszka, Michal Zajac, Mikhail Biriuchinskii, Minh-Quang Pham, Minwoo Kang, Morgane Riviere, Namit Katariya, Nathan Grinsztajn, Nathan Simpson, Neeraj Aggarwal, Neha Gupta, Ola Mysiak, Oliver Leicht, Olivier Bousquet, Olivier Duchenne, Parag Jain, Patricia Wang, Patrick Blies, Patrick von Platen, Paul Jacob, Paul Wambergue, Paula Kurylowicz, Pavan Kumar Reddy, Pavel Kuksa, Philippe Pinel, Philomene Chagniot, Pierre Stock, Pierre-Andre Savalle, Piotr Milos, Prateek Gupta, Pravesh Agrawal, Quentin Desreumaux, Quentin Torroba, Quercus Hernandez, Ram Ramrakhya, Randall Isenhour, Ranjit Parva, Raul Perez Pelaez, Reinhard Sonnleitner, Remi Delacourt, Richard Kurle, Rishi Shah, Rob Romijnders, Rohin Arora, Romain Sauvestre, Roman Soletskyi, Rosalie Millner, Rupert Menneer, Sagar Vaze, Samuel Barry, Samuel Belkadi, Samuel Humeau, Sanchit Gandhi, Sandeep Subramanian, Sarthak Mittal, Saskia Adaime, Sean Cha, Sebastian Kaltenbach, Shashwat Dalal, Shashwat Verma, Sherif Waly, Shrimai Prabhumoye, Siddhant Waghjale, Siddharth Gandhi, Simon Lepage, Simon Sorg, Soham Ghosh, Sophie Marbach, Srijan Mishra, Stanislas Lange, Steve Hong, Sumukh Aithal, Szymon Antoniak, Tarun Kumar Vangani, Teven Le Scao, Theo Cachet, Thibaut Lavril, Thomas Chabal, Thomas Coste, Thomas Defard, Thomas Foubert, Thomas Robert, Thomas Wang, Tianyu Zhang, Tim Lawson, Timothee Lacroix, Tobias Kronlachner, Tom Bewley, Tom Edwards, Tomas Hodan, Tuhin Das, Tyler Wang, Ulrick BLE, Umar Jamil, Umberto Tomasini, Valentin Mace, Van Phung, Vedant Nanda, Victor Jouault, Victor Letzelter, Victor Paltz, Victor Poucheret, Vincent Maladiere, Vincent Pfister, Virgile Richard, Vladislav Bataev, Wassim Bouaziz, Wen Ding Li, William Havard, William Marshall, Xinghui Li, Xingran Guo, Xinyu Yang, Yann Dreze, Yassine El Ouahidi, Yassir Bendou, Yihan Wang, Yimu Pan, Yves Martin des Taillades, Zaccharie Ramzi, Zhenlin Xu, Zsofia Csakany
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个机器人担任导游。在机器人领域,这被称为“具身导航”(embodied navigation)——即机器能够理解像“去厨房”这样的口头指令,并能真正走到那里而不会撞到墙壁。长期以来,最好的导游都像是高端宇航员:它们需要昂贵且沉重的装备才能胜任工作。它们戴着特殊的3D眼镜(深度传感器),像安保团队一样携带多个摄像头,或者依赖于整个建筑物的预绘地图。虽然这些机器人表现出色,但它们也既昂贵又脆弱,且难以安装在简单的送货无人机或小型仓库轮式机器人上。科学家们一直在问一个大问题:我们能否制造出一个同样聪明,但仅使用最简单、最常见工具的机器人?答案就在于单个标准的摄像头——那种几乎存在于当今每部手机和机器人上的摄像头——以及一个足够强大的大脑来解决剩下的问题。
本文介绍了 Robostral Navigate,一种新型的机器人大脑,旨在仅使用那个标准的单摄像头来解决导航难题。把它想象成一个不需要3D地图或激光扫描仪的机器人;相反,它通过观察图像,学习如何为旅程中的下一步“指向”方向。研究人员构建了一个拥有80亿参数的“视觉语言模型”(一种能够阅读和观察的超智能AI),并通过在类似视频游戏的模拟环境中向它展示数百万个示例,教会了它如何进行导航。该模型并不计算关于移动多少米之类复杂的数学问题,它只是简单地在屏幕上指向它下一步想要去的地方。如果目的地隐藏在拐角处,它会切换到向前移动特定距离的备用方案。
团队发现,这种简单的方法非常强大。通过在35万个不同场景下的240万次模拟旅程中进行训练,他们创造出的系统不仅更便宜、更容易构建,而且比许多配备了高级传感器的机器人还要聪明。在标准测试中,Robostral Navigate 实现了 77.4% 的寻路成功率,大幅超越了以往表现最好的单摄像头机器人,甚至超过了一些使用深度传感器或多个摄像头的机器人。其“秘密配方”不仅在于“指向”这个动作,还在于一种让学习过程提速22倍的新型训练技巧,以及一个教会机器人在迷失方向时如何恢复的强化学习阶段。结果是,机器人可以从轮式小车无缝切换到步行机器或飞行无人机,而无需重新学习,这证明了你并不需要一套百万美元的传感器套件就能打造出一个真正的通用型机器人。
技术摘要:Robostral Navigate
问题陈述
在大规模部署具身导航系统时面临着显著障碍:当前的先进方法通常依赖于特权感知模态(深度传感器、LiDAR、多摄像头装置)或预构建的地图。这些依赖增加了硬件成本,限制了在不同机器人形态(轮式、足式、飞行器)之间的兼容性,并需要针对特定环境进行校准。此外,训练这些系统通常需要大量且昂贵的现实世界数据采集。挑战在于开发一种导航方案,能够最大限度地减少对传感器的假设,实现跨不同机器人形态的泛化,并仅通过模拟实现高效训练。
方法论
Robostral Navigate 是一个 80 亿参数的视觉语言模型(VLM),旨在仅使用单目 RGB 图像流来解决具身导航问题。该系统将导航分解为两个截然不同的阶段:通过 VLM 进行的高层规划和通过扩散策略进行的底层控制。
1. 模型架构
- 视觉-语言规划器 (8B VLM): 核心模型初始化自一个专为空间定位(指向、计数、定位)设计的密集型 VLM。它接收自然语言指令和单目 RGB 帧的历史序列作为输入。
- 基于指向的导航: 该模型不预测与特定机器人几何结构相关的度量位移,而是通过在当前相机视图中“指向”下一个目标位置(图像坐标 u,v)以及期望的航向变化 (Δθ) 来预测路标点(waypoints)。这种基于图像空间的表述确保了对相机内参和场景尺度的鲁棒性。
- 位移回退机制: 为了处理目的地在视野之外的情况(例如需要转向),模型会在预测指向坐标的同时,共同预测度量位移 (Δx,Δy,Δθ)。如果目的地不可见,模型会省略图像坐标而仅依赖度量位移。
- 扩散策略 (121M 参数): VLM 推断出的路标点通过一个轻量级的扩散 Transformer 被转换为低层电机指令。该策略以 10 Hz 的频率输出二维相对位移和一维旋转的密集轨迹,随后由运动跟踪控制器转化为高频执行器转矩。
2. 训练策略
训练流水线旨在实现最大效率和可扩展性,完全依赖于模拟。
- 数据生成: 系统在 350,000 个模拟场景(室内和室外)中的约 240 万条专家轨迹上进行训练。数据生成采用最远点采样(farthest-point sampling),以确保多样化的起始/目标位置以及多变的场景复杂度。
- 前缀缓存与注意力掩码: 为了解决标准顺序训练中计算效率低下的问题(其中 Token 复杂度随时间 T 呈 O(T2) 缩放),作者采用了前缀缓存(prefix-caching)技术。整个回合(episodes)被打包进单个训练序列中。通过使用基于树结构的注意力掩码,防止模型在训练期间依赖于先前的真实动作(ground-truth actions)。这是必要的,因为先前的真实动作通常对未来的动作具有高度信息量(尤其是由于“最远可见路标点”范式),否则模型会依赖这些动作而非学习基于视觉定位的预测。该技术将训练 Token 减少了 22 倍,将训练时间从数月缩短至数天。
- 跨机器人泛化: 在数据生成过程中,机器人配置(高度、半径、相机位置、俯仰角)会被随机化。这使得学习到的策略可以在不同的具身形态之间迁移,而无需重新训练。
- 在线强化学习 (RL): 在监督微调 (SFT) 之后,模型通过 CISPO(一种组相对优势估计方法)进行在线强化学习。智能体在经过筛选的、SFT 策略失败的“困难”轨迹子集上与模拟器进行交互。奖励函数定义为 −max(2,dist_to_goal),旨在激励智能体到达目标并发出
STOP动作,同时避免在目标附近进行不必要的机动。
核心贡献
- 极简传感器依赖: 证明了 8B VLM 可以仅使用单个 RGB 相机实现最先进的导航性能,消除了对深度传感器、LiDAR 或多摄像头装置的需求。
- 图像空间指向: 引入了一种在图像空间而非度量坐标中运行的基于指向的路标点预测机制,天然实现了无需重新校准的跨具身泛化。
- 高效训练方案: 开发了一种前缀缓存训练方法,将 Token 复杂度降低了 22 倍,使得利用模拟数据在数天而非数月内完成大规模导航策略的训练。
- 强化学习集成: 成功应用在线强化学习以提升探索和恢复能力,弥合了行为克隆与鲁棒的长程导航之间的差距。
结果
系统在 Room-to-Room in Continuous Environments (R2R-CE) 和 Room-Across-Room (RxR-CE) 基准测试上进行了评估。
- R2R-CE (验证集未见数据): Robostral Navigate 实现了 77.4% 的成功率 (SR) 和 74.2% 的路径长度加权成功率 (SPL)。
- 这比最佳单相机基准模型 (Qwen-RobotNav-4B, 66.9% SR) 高出 10.5 个百分点。
- 尽管未使用辅助传感器,它也超越了最佳深度/多相机系统 (Qwen-RobotNav-8B, 72.1% SR) 5.3 个百分点。
- RxR-CE (验证集未见数据): 该模型实现了 75.1% 的 SR 和 68.7% 的 SPL,优于所有单相机基准模型,并展示了比深度辅助模型更优的路径效率。
- 跨机器人部署: 相同的模型权重成功部署在两种不同的平台(Galaxea R1 和 Hiwonder JetAuto)上,这两者具有不同的形态和相机配置,验证了其跨机器人泛化的主张。
重要意义
本文认为 Robostral Navigate 代表了一种可扩展的通用机器人方案。通过结合大规模模拟、高效训练算法(前级缓存)和强化学习,作者证明了高性能导航并不需要特权感知。这项工作表明,当与鲁棒的训练方法相结合时,一种极简传感器的方案可以超越利用复杂硬件的系统,从而降低了在多样化硬件和新环境部署通用具身智能体的门槛。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。
每周获取最佳 AI 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。