← 최신 논문
🤖 AI

Robostral Navigate

Robostral Navigate는 240만 개의 시뮬레이션 궤적을 활용한 확장 가능한 학습 레시피, 프리픽스 캐싱(prefix-caching) 효율성, 그리고 깊이 센서나 사전 구축된 지도의 필요성을 제거하는 이미지 공간 웨이포인트 예측을 통해 다양한 로봇 구현체에 걸쳐 최첨단 단안 내비게이션을 달성하는 8B 비전-언어 모델이다.

원저자: Abdelaziz Bounhar, Abhijeet Somani, Aditi Kabra, Adrian Valente, Adrien Petralia, Adrien Sade, Alan Jeffares, Albert Jiang, Aleksandr Timashov, Alexandre Cahill, Alexandre Gavaudan, Alexandre Laval, A
게시일 2026-08-04
📖 2 분 읽기☕ 가벼운 읽기

원저자: Abdelaziz Bounhar, Abhijeet Somani, Aditi Kabra, Adrian Valente, Adrien Petralia, Adrien Sade, Alan Jeffares, Albert Jiang, Aleksandr Timashov, Alexandre Cahill, Alexandre Gavaudan, Alexandre Laval, Alexandre Sablayrolles, Amelie Heliou, Amos You, Andre Jonasson, Andrew Bai, Andrew Ehrenberg, Andrew Zhao, Angele Lenglemetz, Anmol Agarwal, Antonia Calvi, Arata Suzuki, Arjun Majumdar, Arthur Fournier, Artjom Joosen, Avinash Sooriyarachchi, Aylin Guliz Akkus, Aysenur Karaduman, Baptiste Bout, Baptiste Roziere, Baudouin De Monicault, Benjamin Holzschuh, Benjamin Lefaudeux, Benjamin Tibi, Bernhard Stadlbauer, Blazej Osinski, Camille Le Scao, Chaoran Yu, Charlotte Cronjager, Chen-Yo Sun, Chris Bamford, Christian Wallenwein, Christophe Renaudin, Clemence Lanfranchi, Corentin Barreau, Corentin Sautier, Cristiana-Diana Diaconu, Cyprien Courtot, Daniel Marczak, Darius Dabert, Diego de Las Casas, Dominik Nuss, Dylan Rubini, Dzmitry Soupel, Elizaveta Demyanenko, Elliot Chane-Sane, Emilien Fugier, Emmanuel Gottlob, Erik Aas, Etienne Goffinet, Etienne Millon, Eujeong Choi, Fabian Paischer, Fabian Schlager, Faruk Ahmed, Federico Baldassarre, Filip Szatkowski, Florian Wiesner, Gabrielle Berrada, Gaetan Ecrepont, Gaetan Lepage, Gaspard Blanchet, Gaspard Donada-Vidal, Gauthier Delerce, Gauthier Guinet, Genevieve Hayes, Georgii Novikov, Giada Pistilli, Gianluca Galletti, Guillaume Breton, Guillaume Kunsch, Guillaume Lample, Guillaume Martin, Guillaume Raille, Gunjan Dhanuka, Gunshi Gupta, Han Zhou, Harshil Shah, Hasan Furkan Vural, Hedi Hadiji, Hope McGovern, Hugo Cisneros, Hugo Thimonier, Indraneel Mukherjee, Ivan Cuevas Salazar, Jacques Sun, Jan Ludziejewski, Jason Rute, Jean Quentin, Jean-Hadrien Chabran, Jean-Malo Delignon, Jie Zhang, Joachim Studnia, Joep Barmentlo, Johannes Brandstetter, John Harvill, Jonas Amar, Jonas Schweizer, Josephine Delas, Josselin Somerville, Julien Denize, Julien Tauran, Kartik Khandelwal, Khyathi Raghavi Chandu, Kilian Tep, Kush Jain, Larissa Laich, Laura Calem, Laurence Aitchison, Laurent Callot, Laurent Fainsin, Leo Cotteleer, Leonard Blier, Lingxiao Zhao, Louis Martin, Louis Serrano, Lucile Saulnier, Ludovic Ho Fuh, Luis Montero, Maarten Buyl, Manon Chossegros, Marcin Mozejko, Margaret Jennings, Markus Hennerbichler, Martin Alexandre, Mathieu Poiree, Mathieu Schmitt, Mathilde Guillaumin, Matthieu Andre, Matthieu Dinot, Matthieu Futeral, Maurits Bleeker, Mauro Comi, Max Mynter, Maxim Berman, Maxime Darrin, Maxime Louis, Maximilian Augustin, Maximilian Muller, Melina Jingting Laimon, Mert Unsal, Mia Chiquier, Michael Pilcer, Michal Pietruszka, Michal Zajac, Mikhail Biriuchinskii, Minh-Quang Pham, Minwoo Kang, Morgane Riviere, Namit Katariya, Nathan Grinsztajn, Nathan Simpson, Neeraj Aggarwal, Neha Gupta, Ola Mysiak, Oliver Leicht, Olivier Bousquet, Olivier Duchenne, Parag Jain, Patricia Wang, Patrick Blies, Patrick von Platen, Paul Jacob, Paul Wambergue, Paula Kurylowicz, Pavan Kumar Reddy, Pavel Kuksa, Philippe Pinel, Philomene Chagniot, Pierre Stock, Pierre-Andre Savalle, Piotr Milos, Prateek Gupta, Pravesh Agrawal, Quentin Desreumaux, Quentin Torroba, Quercus Hernandez, Ram Ramrakhya, Randall Isenhour, Ranjit Parva, Raul Perez Pelaez, Reinhard Sonnleitner, Remi Delacourt, Richard Kurle, Rishi Shah, Rob Romijnders, Rohin Arora, Romain Sauvestre, Roman Soletskyi, Rosalie Millner, Rupert Menneer, Sagar Vaze, Samuel Barry, Samuel Belkadi, Samuel Humeau, Sanchit Gandhi, Sandeep Subramanian, Sarthak Mittal, Saskia Adaime, Sean Cha, Sebastian Kaltenbach, Shashwat Dalal, Shashwat Verma, Sherif Waly, Shrimai Prabhumoye, Siddhant Waghjale, Siddharth Gandhi, Simon Lepage, Simon Sorg, Soham Ghosh, Sophie Marbach, Srijan Mishra, Stanislas Lange, Steve Hong, Sumukh Aithal, Szymon Antoniak, Tarun Kumar Vangani, Teven Le Scao, Theo Cachet, Thibaut Lavril, Thomas Chabal, Thomas Coste, Thomas Defard, Thomas Foubert, Thomas Robert, Thomas Wang, Tianyu Zhang, Tim Lawson, Timothee Lacroix, Tobias Kronlachner, Tom Bewley, Tom Edwards, Tomas Hodan, Tuhin Das, Tyler Wang, Ulrick BLE, Umar Jamil, Umberto Tomasini, Valentin Mace, Van Phung, Vedant Nanda, Victor Jouault, Victor Letzelter, Victor Paltz, Victor Poucheret, Vincent Maladiere, Vincent Pfister, Virgile Richard, Vladislav Bataev, Wassim Bouaziz, Wen Ding Li, William Havard, William Marshall, Xinghui Li, Xingran Guo, Xinyu Yang, Yann Dreze, Yassine El Ouahidi, Yassir Bendou, Yihan Wang, Yimu Pan, Yves Martin des Taillades, Zaccharie Ramzi, Zhenlin Xu, Zsofia Csakany

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇에게 투어 가이드가 되는 법을 가르치고 있다고 상상해 보십시오. 로보틱스 분야에서 이것은 '체화된 내비게이션(embodied navigation)'이라고 불리는데, 이는 기계가 "주방으로 가라"와 같은 음성 명령을 이해하고 벽에 부딪히지 않고 실제로 그곳까지 걸어갈 수 있는 능력을 의미합니다. 오랫동안 최고의 투어 가이드들은 고급 우주비행사 같았습니다. 그들은 업무를 수행하기 위해 비싸고 무거운 장비가 필요했습니다. 특수 3D 안경(깊이 센서)을 착용하거나, 보안팀처럼 여러 대의 카메라를 휴대하거나, 건물 전체의 미리 그려진 지도에 의존해야 했습니다. 이러한 로봇들은 성능은 좋았지만, 비싸고 취약하며 단순한 배달 드론이나 작은 창고용 바퀴 달린 로봇에 장착하기에는 어려움이 있었습니다. 과학자들이 던져온 핵심적인 질문은 이것입니다. "우리는 똑똑하면서도 가장 단순하고 흔한 도구만을 사용하는 로봇을 만들 수 있을까?" 그 답은 오늘날 거의 모든 스마트폰과 로봇에 들어있는 것과 같은 단 하나의 표준 카메라, 그리고 나머지를 스스로 파악할 수 있을 만큼 강력한 두뇌에 있습니다.

이 논문은 단 하나의 표준 카메라만을 사용하여 내비게이션 문제를 해결하도록 설계된 새로운 종류의 로봇 두뇌인 Robostral Navigate를 소개합니다. 이것을 마치 3D 지도나 레이저 스캐너가 필요 없는 로봇이라고 생각하십시오. 대신, 이 로봇은 단순히 사진을 보는 것만으로 여정의 다음 단계를 향해 "가리키는" 법을 배웁니다. 연구진은 80억 개의 파라미터를 가진 '시각-언어 모델(시각을 보고 글을 읽을 수 있는 초지능형 AI)'을 구축했으며, 비디오 게임 같은 시뮬레이션 속에서 수백만 개의 사례를 보여줌으로써 내비게이션을 학습시켰습니다. 모델은 몇 미터를 이동할지에 대한 복잡한 수학적 계산을 하는 대신, 화면상에서 다음에 가고자 하는 곳을 단순히 가리킵니다. 만약 목적지가 모퉁이 뒤에 숨겨져 있다면, 특정 거리만큼 앞으로 이동하는 백업 계획으로 전환합니다.

연구팀은 이 단순한 접근 방식이 믿기지 않을 정도로 강력하다는 것을 발견했습니다. 35만 개의 서로 다른 장면에서 240만 번의 시뮬레이션 여정을 거치며 모델을 훈련시킨 결과, 더 저렴하고 만들기 쉬울 뿐만 아니라 화려한 센서를 갖춘 로봇들보다 더 똑똑한 시스템을 만들어냈습니다. 표준 테스트에서 Robostral Navigate는 길을 찾는 데 77.4%의 성공률을 기록하며, 기존의 단일 카메라 로봇들을 큰 차이로 앞질렀으며 심지어 깊이 센서나 다중 카메라를 사용하는 일부 로봇들보다도 뛰어난 성능을 보였습니다. 비결은 단순히 가리키는 동작 그 자체가 아니라, 학습 과정을 22배 더 빠르게 만든 새로운 훈련 기법과 로봇이 길을 잃었을 때 회복하는 법을 가르친 강화 학습 단계였습니다. 그 결과, 이 로봇은 바퀴 달린 카트에서 걷는 기계나 날아다니는 드론으로 옮겨가더라도 다시 새로 배울 필요가 없으며, 진정한 범용 로봇을 만들기 위해 반드시 백만 달러짜리 센서 세트가 필요한 것은 아님을 증명했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →