Robostral Navigate
Robostral Navigate는 240만 개의 시뮬레이션 궤적을 활용한 확장 가능한 학습 레시피, 프리픽스 캐싱(prefix-caching) 효율성, 그리고 깊이 센서나 사전 구축된 지도의 필요성을 제거하는 이미지 공간 웨이포인트 예측을 통해 다양한 로봇 구현체에 걸쳐 최첨단 단안 내비게이션을 달성하는 8B 비전-언어 모델이다.
원저자: Abdelaziz Bounhar, Abhijeet Somani, Aditi Kabra, Adrian Valente, Adrien Petralia, Adrien Sade, Alan Jeffares, Albert Jiang, Aleksandr Timashov, Alexandre Cahill, Alexandre Gavaudan, Alexandre Laval, Alexandre Sablayrolles, Amelie Heliou, Amos You, Andre Jonasson, Andrew Bai, Andrew Ehrenberg, Andrew Zhao, Angele Lenglemetz, Anmol Agarwal, Antonia Calvi, Arata Suzuki, Arjun Majumdar, Arthur Fournier, Artjom Joosen, Avinash Sooriyarachchi, Aylin Guliz Akkus, Aysenur Karaduman, Baptiste Bout, Baptiste Roziere, Baudouin De Monicault, Benjamin Holzschuh, Benjamin Lefaudeux, Benjamin Tibi, Bernhard Stadlbauer, Blazej Osinski, Camille Le Scao, Chaoran Yu, Charlotte Cronjager, Chen-Yo Sun, Chris Bamford, Christian Wallenwein, Christophe Renaudin, Clemence Lanfranchi, Corentin Barreau, Corentin Sautier, Cristiana-Diana Diaconu, Cyprien Courtot, Daniel Marczak, Darius Dabert, Diego de Las Casas, Dominik Nuss, Dylan Rubini, Dzmitry Soupel, Elizaveta Demyanenko, Elliot Chane-Sane, Emilien Fugier, Emmanuel Gottlob, Erik Aas, Etienne Goffinet, Etienne Millon, Eujeong Choi, Fabian Paischer, Fabian Schlager, Faruk Ahmed, Federico Baldassarre, Filip Szatkowski, Florian Wiesner, Gabrielle Berrada, Gaetan Ecrepont, Gaetan Lepage, Gaspard Blanchet, Gaspard Donada-Vidal, Gauthier Delerce, Gauthier Guinet, Genevieve Hayes, Georgii Novikov, Giada Pistilli, Gianluca Galletti, Guillaume Breton, Guillaume Kunsch, Guillaume Lample, Guillaume Martin, Guillaume Raille, Gunjan Dhanuka, Gunshi Gupta, Han Zhou, Harshil Shah, Hasan Furkan Vural, Hedi Hadiji, Hope McGovern, Hugo Cisneros, Hugo Thimonier, Indraneel Mukherjee, Ivan Cuevas Salazar, Jacques Sun, Jan Ludziejewski, Jason Rute, Jean Quentin, Jean-Hadrien Chabran, Jean-Malo Delignon, Jie Zhang, Joachim Studnia, Joep Barmentlo, Johannes Brandstetter, John Harvill, Jonas Amar, Jonas Schweizer, Josephine Delas, Josselin Somerville, Julien Denize, Julien Tauran, Kartik Khandelwal, Khyathi Raghavi Chandu, Kilian Tep, Kush Jain, Larissa Laich, Laura Calem, Laurence Aitchison, Laurent Callot, Laurent Fainsin, Leo Cotteleer, Leonard Blier, Lingxiao Zhao, Louis Martin, Louis Serrano, Lucile Saulnier, Ludovic Ho Fuh, Luis Montero, Maarten Buyl, Manon Chossegros, Marcin Mozejko, Margaret Jennings, Markus Hennerbichler, Martin Alexandre, Mathieu Poiree, Mathieu Schmitt, Mathilde Guillaumin, Matthieu Andre, Matthieu Dinot, Matthieu Futeral, Maurits Bleeker, Mauro Comi, Max Mynter, Maxim Berman, Maxime Darrin, Maxime Louis, Maximilian Augustin, Maximilian Muller, Melina Jingting Laimon, Mert Unsal, Mia Chiquier, Michael Pilcer, Michal Pietruszka, Michal Zajac, Mikhail Biriuchinskii, Minh-Quang Pham, Minwoo Kang, Morgane Riviere, Namit Katariya, Nathan Grinsztajn, Nathan Simpson, Neeraj Aggarwal, Neha Gupta, Ola Mysiak, Oliver Leicht, Olivier Bousquet, Olivier Duchenne, Parag Jain, Patricia Wang, Patrick Blies, Patrick von Platen, Paul Jacob, Paul Wambergue, Paula Kurylowicz, Pavan Kumar Reddy, Pavel Kuksa, Philippe Pinel, Philomene Chagniot, Pierre Stock, Pierre-Andre Savalle, Piotr Milos, Prateek Gupta, Pravesh Agrawal, Quentin Desreumaux, Quentin Torroba, Quercus Hernandez, Ram Ramrakhya, Randall Isenhour, Ranjit Parva, Raul Perez Pelaez, Reinhard Sonnleitner, Remi Delacourt, Richard Kurle, Rishi Shah, Rob Romijnders, Rohin Arora, Romain Sauvestre, Roman Soletskyi, Rosalie Millner, Rupert Menneer, Sagar Vaze, Samuel Barry, Samuel Belkadi, Samuel Humeau, Sanchit Gandhi, Sandeep Subramanian, Sarthak Mittal, Saskia Adaime, Sean Cha, Sebastian Kaltenbach, Shashwat Dalal, Shashwat Verma, Sherif Waly, Shrimai Prabhumoye, Siddhant Waghjale, Siddharth Gandhi, Simon Lepage, Simon Sorg, Soham Ghosh, Sophie Marbach, Srijan Mishra, Stanislas Lange, Steve Hong, Sumukh Aithal, Szymon Antoniak, Tarun Kumar Vangani, Teven Le Scao, Theo Cachet, Thibaut Lavril, Thomas Chabal, Thomas Coste, Thomas Defard, Thomas Foubert, Thomas Robert, Thomas Wang, Tianyu Zhang, Tim Lawson, Timothee Lacroix, Tobias Kronlachner, Tom Bewley, Tom Edwards, Tomas Hodan, Tuhin Das, Tyler Wang, Ulrick BLE, Umar Jamil, Umberto Tomasini, Valentin Mace, Van Phung, Vedant Nanda, Victor Jouault, Victor Letzelter, Victor Paltz, Victor Poucheret, Vincent Maladiere, Vincent Pfister, Virgile Richard, Vladislav Bataev, Wassim Bouaziz, Wen Ding Li, William Havard, William Marshall, Xinghui Li, Xingran Guo, Xinyu Yang, Yann Dreze, Yassine El Ouahidi, Yassir Bendou, Yihan Wang, Yimu Pan, Yves Martin des Taillades, Zaccharie Ramzi, Zhenlin Xu, Zsofia Csakany
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
로봇에게 투어 가이드가 되는 법을 가르치고 있다고 상상해 보십시오. 로보틱스 분야에서 이것은 '체화된 내비게이션(embodied navigation)'이라고 불리는데, 이는 기계가 "주방으로 가라"와 같은 음성 명령을 이해하고 벽에 부딪히지 않고 실제로 그곳까지 걸어갈 수 있는 능력을 의미합니다. 오랫동안 최고의 투어 가이드들은 고급 우주비행사 같았습니다. 그들은 업무를 수행하기 위해 비싸고 무거운 장비가 필요했습니다. 특수 3D 안경(깊이 센서)을 착용하거나, 보안팀처럼 여러 대의 카메라를 휴대하거나, 건물 전체의 미리 그려진 지도에 의존해야 했습니다. 이러한 로봇들은 성능은 좋았지만, 비싸고 취약하며 단순한 배달 드론이나 작은 창고용 바퀴 달린 로봇에 장착하기에는 어려움이 있었습니다. 과학자들이 던져온 핵심적인 질문은 이것입니다. "우리는 똑똑하면서도 가장 단순하고 흔한 도구만을 사용하는 로봇을 만들 수 있을까?" 그 답은 오늘날 거의 모든 스마트폰과 로봇에 들어있는 것과 같은 단 하나의 표준 카메라, 그리고 나머지를 스스로 파악할 수 있을 만큼 강력한 두뇌에 있습니다.
이 논문은 단 하나의 표준 카메라만을 사용하여 내비게이션 문제를 해결하도록 설계된 새로운 종류의 로봇 두뇌인 Robostral Navigate를 소개합니다. 이것을 마치 3D 지도나 레이저 스캐너가 필요 없는 로봇이라고 생각하십시오. 대신, 이 로봇은 단순히 사진을 보는 것만으로 여정의 다음 단계를 향해 "가리키는" 법을 배웁니다. 연구진은 80억 개의 파라미터를 가진 '시각-언어 모델(시각을 보고 글을 읽을 수 있는 초지능형 AI)'을 구축했으며, 비디오 게임 같은 시뮬레이션 속에서 수백만 개의 사례를 보여줌으로써 내비게이션을 학습시켰습니다. 모델은 몇 미터를 이동할지에 대한 복잡한 수학적 계산을 하는 대신, 화면상에서 다음에 가고자 하는 곳을 단순히 가리킵니다. 만약 목적지가 모퉁이 뒤에 숨겨져 있다면, 특정 거리만큼 앞으로 이동하는 백업 계획으로 전환합니다.
연구팀은 이 단순한 접근 방식이 믿기지 않을 정도로 강력하다는 것을 발견했습니다. 35만 개의 서로 다른 장면에서 240만 번의 시뮬레이션 여정을 거치며 모델을 훈련시킨 결과, 더 저렴하고 만들기 쉬울 뿐만 아니라 화려한 센서를 갖춘 로봇들보다 더 똑똑한 시스템을 만들어냈습니다. 표준 테스트에서 Robostral Navigate는 길을 찾는 데 77.4%의 성공률을 기록하며, 기존의 단일 카메라 로봇들을 큰 차이로 앞질렀으며 심지어 깊이 센서나 다중 카메라를 사용하는 일부 로봇들보다도 뛰어난 성능을 보였습니다. 비결은 단순히 가리키는 동작 그 자체가 아니라, 학습 과정을 22배 더 빠르게 만든 새로운 훈련 기법과 로봇이 길을 잃었을 때 회복하는 법을 가르친 강화 학습 단계였습니다. 그 결과, 이 로봇은 바퀴 달린 카트에서 걷는 기계나 날아다니는 드론으로 옮겨가더라도 다시 새로 배울 필요가 없으며, 진정한 범용 로봇을 만들기 위해 반드시 백만 달러짜리 센서 세트가 필요한 것은 아님을 증명했습니다.
기술 요약: Robostral Navigate
문제 정의
임바디드 내비게이션(Embodied Navigation) 시스템을 대규모로 배포하는 데는 상당한 장벽이 존재한다. 현재의 최첨단 방식들은 종종 특권적 센싱 모달리티(깊이 센서, LiDAR, 멀티 카메라 리그)나 미리 구축된 지도에 의존한다. 이러한 의존성은 하드웨어 비용을 증가시키고, 다양한 로봇 형태(바퀴형, 다리형, 비행형) 간의 호환성을 제한하며, 환경별 캘리브레이션을 필요로 한다. 또한, 이러한 시스템을 훈련하는 과정은 일반적으로 광범-하고 비용이 많이 드는 실제 데이터 수집을 요구한다. 과제는 센서에 대한 가정을 최소화하고, 서로 다른 로봇 형태에 걸쳐 일반화되며, 시뮬레이션만을 사용하여 효율적으로 학습할 수 있는 내비게이션 레시피를 개발하는 것이다.
방법론
Robostral Navigate는 단일 모노큘러 RGB 이미지 스트림만을 사용하여 임바디드 내비게이션을 해결하도록 설계된 80억 파라미터 규모의 시각-언어 모델(VLM)이다. 이 시스템은 내비게이션을 VLM을 통한 고수준 계획과 디퓨전 정책(Diffusion Policy)을 통한 저수준 제제의 두 가지 단계로 분해한다.
1. 모델 아키텍처
- 시각-언어 플래너 (8B VLM): 핵심 모델은 공간적 그라운딩(가리키기, 개수 세기, 위치 파악)을 위해 설계된 밀집형 VLM으로부터 초기화된다. 이 모델은 자연어 지시문과 모노큘러 RGB 프레임의 이력을 입력으로 받는다.
- 포인팅을 통한 내비게이션 (Navigation via Pointing): 특정 로봇 기하학에 묶인 메트릭 변위(Metric Displacement)를 예측하는 대신, VLM은 현재 카메라 뷰 내의 다음 목표 위치(이미지 좌표 u,v)와 원하는 헤딩 변화량(Δθ)을 "가리킴(Pointing)"으로써 웨이포인트를 예측한다. 이러한 이미지 공간 기반의 공식화는 카메라 내부 파라미터와 장면 스케일에 대한 강건성을 보장한다.
- 변위 폴백 (Displacement Fallback): 목적지가 시야 밖에 있는 경우(예: 회전이 필요한 경우)를 처리하기 위해, 모델은 포인팅 좌표와 함께 메트릭 변위(Δx,Δy,Δθ)를 공동으로 예측한다. 목적지가 보이지 않는 경우, 이미지 좌표를 생략하고 메트릭 변위에만 의존한다.
- 디퓨전 정책 (121M 파라미터): VLM에 의해 추론된 웨이포인트는 경량 디퓨전 트랜스포머에 의해 저수준 모터 명령으로 변환된다. 이 정책은 10Hz로 상대적 2D 변위와 1D 회전의 조밀한 궤적을 출력하며, 이는 이후 모션 트래킹 컨트롤러에 의해 고주파 액추에이터 토크로 변환된다.
2. 훈련 전략
훈련 파이프라인은 시뮬레이션에 전적으로 의존하여 최대의 효율성과 확장성을 갖도록 설계되었다.
- 데이터 생성: 시스템은 350,000개의 시뮬레이션 장면(실내 및 실외)에 걸친 약 240만 개의 전문가 궤적을 통해 훈련된다. 데이터 생성에는 다양한 시작/목표 위치와 다양한 장면 복잡성을 보장하기 위해 가장 먼 점 샘플링(Farthest-point sampling)이 포함된다.
- 프리픽스 캐싱(Prefix-Caching) 및 어텐션 마스킹: 순차적 훈련의 계산 비효전성(토큰 복잡도가 O(T2)로 스케일링됨)을 해결하기 위해, 저자들은 프리픽스 캐싱 기술을 채택했다. 전체 에피소드를 단일 훈련 시퀀스로 패킹한다. 또한, 훈련 중에 모델이 **이전의 정답 액션(Ground-truth actions)**에 조건화되는 것을 방지하기 위해 트리 기반 어텐션 마스크를 사용한다. 이는 이전의 정답 액션이 미래의 액션에 대해 매우 많은 정보를 제공할 수 있기 때문에(특히 '가장 멀리 보이는 웨이포인트' 패러다임 덕분에) 필수적이며, 그렇지 않으면 모델이 시각적으로 그라운딩된 예측을 배우는 대신 정답 액션에 의존하게 된다. 이 방식은 훈련 토큰을 22배 줄여, 훈련 시간을 몇 달에서 며칠로 단축시킨다.
- 교차 로봇 일반화 (Cross-Robot Generalization): 데이터 생성 과정에서 로봇 구성(높이, 반경, 카메라 배치, 피치)을 무작위화한다. 이를 통해 학습된 정책이 재학습 없이 서로 다른 형태의 로봇으로 전이될 수 있다.
- 온라인 강화 학습 (RL): 지도 미세 조정(SFT) 이후, 모델은 CISPO(그룹 상대적 이득 추정 방식)를 사용하는 온라인 RL을 거친다. 에이전트는 SFT 정책이 실패한 "어려운" 궤적들의 큐레이션된 서브셋에서 시뮬레이터와 상호작용한다. 보상 함수는 −max(2,dist_to_goal)로 정의되어, 에이전트가 목표에 도달하고 목표 근처에서 불필요한 기동을 피하면서
STOP액션을 방출하도록 유도한다.
주요 기여
- 최소한의 센서 의존성: 8B VLM이 깊이 센서, LiDAR 또는 멀티 카메라 설정 없이 오직 단일 RGB 카메라만을 사용하여 최첨단 내비게이션 성능을 달-성할 수 있음을 입증했다.
- 이미지 공간 포인팅: 메트릭 좌표가 아닌 이미지 공간에서 작동하는 포인팅 기반 웨이포인트 예측 메커니즘을 도입하여, 캘리브레이션 없이도 자연스러운 교차 로봇 일반화를 가능하게 했다.
- 효율적인 훈련 레시피: 프리픽스 캐싱 훈련법을 개발하여 토큰 복잡도를 22배 줄였으며, 이를 통해 시뮬레이션 데이터를 사용하여 대규모 내비게이션 정책을 몇 달이 아닌 며칠 만에 훈련할 수 있게 했다.
- 강화 학습 통합: 행동 복제(Behavioral Cloning)와 견고한 장기 내비게이션 사이의 간극을 메우기 위해 온라인 RL을 성공적으로 적용하여 탐색 및 회복 능력을 향상시켰다.
결과
시스템은 R2R-CE (Room-to-Room in Continuous Environments) 및 RxR-CE (Room-Across-Room) 벤치마크에서 평가되었다.
- R2R-CE (Validation Unseen): Robostral Navigate는 **77.4%의 성공률(SR)**과 **74.2%의 경로 길이 가중 성공률(SPL)**을 달성했다.
- 이는 최고의 단일 카메라 베이스라인(Qwen-RobotNav-4B, 66.9% SR)보다 10.5 포인트 높다.
- 또한, 보조 센서를 전혀 사용하지 않았음에도 불구하고 최고의 깊이/멀티 카메라 시스템(Qwen-RobotNav-8B, 72.1% SR)보다 5.3 포인트 앞선다.
- RxR-CE (Validation Unseen): 모델은 75.1% SR과 68.7% SPL을 기록하며 모든 단일 카메라 베이스라인을 능가했고, 깊이 보조 모델보다 우수한 경로 효율성을 보여주었다.
- 교차 로봇 배포: 동일한 모델 가중치가 서로 다른 형태와 카메라 구성을 가진 두 가지 플랫폼(Galaxea R1 및 Hiwonder JetAuto)에 성공적으로 배포되어, 교차 로봇 일반화 주장을 검증했다.
의의
본 논문은 Robostral Navigate가 범용 로봇을 위한 확장 가능한 레시피를 나타낸다고 주장한다. 대규모 시뮬레이션, 효율적인 훈련 알고리즘(프리픽스 캐싱), 그리고 강화 학습을 결합함으로써, 저자들은 고성능 내비게이션이 특권적 센싱을 필요로 하지 않는다는 것을 입증했다. 이 연구는 최소한의 센서 접근 방식이 견고한 훈련 방법론과 결합될 때, 복잡한 하드웨어를 활용하는 시스템보다 더 뛰어난 성능을 낼 수 있음을 시사하며, 이를 통해 다양한 하드웨어와 새로운 환경에 범용 임바디드 에이전트를 배포하는 데 드는 장벽을 낮춘다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.
매주 최고의 AI 논문을 받아보세요.
스탠포드, 케임브리지, 프랑스 과학 아카데미 연구자들이 신뢰합니다.
받은편지함에서 구독을 확인해주세요.
문제가 발생했습니다. 다시 시도하시겠어요?
스팸 없음, 언제든 구독 취소 가능.