← Derniers articles
🤖 AI

Robostral Navigate

Robostral Navigate est un modèle vision-langage de 8B qui atteint l'état de l'art en matière de navigation monoculaire à travers divers types d'incarnations robotiques en exploitant une recette d'entraînement évolutive avec 2,4 millions de trajectoires simulées, l'efficacité du préfixe mis en cache et la prédiction de points de passage dans l'espace image pour éliminer le besoin de capteurs de profondeur ou de cartes pré-établies.

Auteurs originaux : Abdelaziz Bounhar, Abhijeet Somani, Aditi Kabra, Adrian Valente, Adrien Petralia, Adrien Sade, Alan Jeffares, Albert Jiang, Aleksandr Timashov, Alexandre Cahill, Alexandre Gavaudan, Alexandre Laval, A
Publié 2026-08-04
📖 3 min de lecture☕ Lecture pause café

Auteurs originaux : Abdelaziz Bounhar, Abhijeet Somani, Aditi Kabra, Adrian Valente, Adrien Petralia, Adrien Sade, Alan Jeffares, Albert Jiang, Aleksandr Timashov, Alexandre Cahill, Alexandre Gavaudan, Alexandre Laval, Alexandre Sablayrolles, Amelie Heliou, Amos You, Andre Jonasson, Andrew Bai, Andrew Ehrenberg, Andrew Zhao, Angele Lenglemetz, Anmol Agarwal, Antonia Calvi, Arata Suzuki, Arjun Majumdar, Arthur Fournier, Artjom Joosen, Avinash Sooriyarachchi, Aylin Guliz Akkus, Aysenur Karaduman, Baptiste Bout, Baptiste Roziere, Baudouin De Monicault, Benjamin Holzschuh, Benjamin Lefaudeux, Benjamin Tibi, Bernhard Stadlbauer, Blazej Osinski, Camille Le Scao, Chaoran Yu, Charlotte Cronjager, Chen-Yo Sun, Chris Bamford, Christian Wallenwein, Christophe Renaudin, Clemence Lanfranchi, Corentin Barreau, Corentin Sautier, Cristiana-Diana Diaconu, Cyprien Courtot, Daniel Marczak, Darius Dabert, Diego de Las Casas, Dominik Nuss, Dylan Rubini, Dzmitry Soupel, Elizaveta Demyanenko, Elliot Chane-Sane, Emilien Fugier, Emmanuel Gottlob, Erik Aas, Etienne Goffinet, Etienne Millon, Eujeong Choi, Fabian Paischer, Fabian Schlager, Faruk Ahmed, Federico Baldassarre, Filip Szatkowski, Florian Wiesner, Gabrielle Berrada, Gaetan Ecrepont, Gaetan Lepage, Gaspard Blanchet, Gaspard Donada-Vidal, Gauthier Delerce, Gauthier Guinet, Genevieve Hayes, Georgii Novikov, Giada Pistilli, Gianluca Galletti, Guillaume Breton, Guillaume Kunsch, Guillaume Lample, Guillaume Martin, Guillaume Raille, Gunjan Dhanuka, Gunshi Gupta, Han Zhou, Harshil Shah, Hasan Furkan Vural, Hedi Hadiji, Hope McGovern, Hugo Cisneros, Hugo Thimonier, Indraneel Mukherjee, Ivan Cuevas Salazar, Jacques Sun, Jan Ludziejewski, Jason Rute, Jean Quentin, Jean-Hadrien Chabran, Jean-Malo Delignon, Jie Zhang, Joachim Studnia, Joep Barmentlo, Johannes Brandstetter, John Harvill, Jonas Amar, Jonas Schweizer, Josephine Delas, Josselin Somerville, Julien Denize, Julien Tauran, Kartik Khandelwal, Khyathi Raghavi Chandu, Kilian Tep, Kush Jain, Larissa Laich, Laura Calem, Laurence Aitchison, Laurent Callot, Laurent Fainsin, Leo Cotteleer, Leonard Blier, Lingxiao Zhao, Louis Martin, Louis Serrano, Lucile Saulnier, Ludovic Ho Fuh, Luis Montero, Maarten Buyl, Manon Chossegros, Marcin Mozejko, Margaret Jennings, Markus Hennerbichler, Martin Alexandre, Mathieu Poiree, Mathieu Schmitt, Mathilde Guillaumin, Matthieu Andre, Matthieu Dinot, Matthieu Futeral, Maurits Bleeker, Mauro Comi, Max Mynter, Maxim Berman, Maxime Darrin, Maxime Louis, Maximilian Augustin, Maximilian Muller, Melina Jingting Laimon, Mert Unsal, Mia Chiquier, Michael Pilcer, Michal Pietruszka, Michal Zajac, Mikhail Biriuchinskii, Minh-Quang Pham, Minwoo Kang, Morgane Riviere, Namit Katariya, Nathan Grinsztajn, Nathan Simpson, Neeraj Aggarwal, Neha Gupta, Ola Mysiak, Oliver Leicht, Olivier Bousquet, Olivier Duchenne, Parag Jain, Patricia Wang, Patrick Blies, Patrick von Platen, Paul Jacob, Paul Wambergue, Paula Kurylowicz, Pavan Kumar Reddy, Pavel Kuksa, Philippe Pinel, Philomene Chagniot, Pierre Stock, Pierre-Andre Savalle, Piotr Milos, Prateek Gupta, Pravesh Agrawal, Quentin Desreumaux, Quentin Torroba, Quercus Hernandez, Ram Ramrakhya, Randall Isenhour, Ranjit Parva, Raul Perez Pelaez, Reinhard Sonnleitner, Remi Delacourt, Richard Kurle, Rishi Shah, Rob Romijnders, Rohin Arora, Romain Sauvestre, Roman Soletskyi, Rosalie Millner, Rupert Menneer, Sagar Vaze, Samuel Barry, Samuel Belkadi, Samuel Humeau, Sanchit Gandhi, Sandeep Subramanian, Sarthak Mittal, Saskia Adaime, Sean Cha, Sebastian Kaltenbach, Shashwat Dalal, Shashwat Verma, Sherif Waly, Shrimai Prabhumoye, Siddhant Waghjale, Siddharth Gandhi, Simon Lepage, Simon Sorg, Soham Ghosh, Sophie Marbach, Srijan Mishra, Stanislas Lange, Steve Hong, Sumukh Aithal, Szymon Antoniak, Tarun Kumar Vangani, Teven Le Scao, Theo Cachet, Thibaut Lavril, Thomas Chabal, Thomas Coste, Thomas Defard, Thomas Foubert, Thomas Robert, Thomas Wang, Tianyu Zhang, Tim Lawson, Timothee Lacroix, Tobias Kronlachner, Tom Bewley, Tom Edwards, Tomas Hodan, Tuhin Das, Tyler Wang, Ulrick BLE, Umar Jamil, Umberto Tomasini, Valentin Mace, Van Phung, Vedant Nanda, Victor Jouault, Victor Letzelter, Victor Paltz, Victor Poucheret, Vincent Maladiere, Vincent Pfister, Virgile Richard, Vladislav Bataev, Wassim Bouaziz, Wen Ding Li, William Havard, William Marshall, Xinghui Li, Xingran Guo, Xinyu Yang, Yann Dreze, Yassine El Ouahidi, Yassir Bendou, Yihan Wang, Yimu Pan, Yves Martin des Taillades, Zaccharie Ramzi, Zhenlin Xu, Zsofia Csakany

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous enseigniez à un robot comment devenir un guide touristique. Dans le monde de la robotique, on appelle cela la « navigation incarnée » — la capacité d'une machine à comprendre une commande vocale comme « va à la cuisine » et à s'y rendre réellement sans heurter les murs. Pendant longtemps, les meilleurs guides touristiques étaient comme des astronautes de haut niveau : ils avaient besoin d'un équipement lourd et coûteux pour faire leur travail. Ils portaient des lunettes 3D spéciales (capteurs de profondeur), transportaient plusieurs caméras comme une équipe de sécurité ou s'appuyaient sur des cartes pré-dessinées de tout le bâtiment. Bien que ces robots soient performants, ils étaient aussi coûteux, fragiles et difficiles à installer sur un simple drone de livraison ou une petite roue d'entrepôt. La grande question que les scientifiques se posaient est la suivante : pouvons-nous construire un robot qui soit tout aussi intelligent mais qui utilise l'outil le plus simple et le plus courant disponible ? La réponse réside dans une seule caméra standard — le genre de caméra que l'on trouve sur presque tous les téléphones et robots d'aujourd'hui — et un cerveau assez puissant pour comprendre le reste.

Ce document présente Robostral Navigate, un nouveau type de cerveau robotique conçu pour résoudre le casse-tête de la navigation en utilisant uniquement cette caméra standard unique. Considérez cela comme un robot qui n'a pas besoin d'une carte 3D ou d'un scanner laser ; au lieu de cela, il apprend à « pointer » la prochaine étape d'un voyage simplement en regardant une image. Les chercheurs ont construit un « modèle de vision-langage » de 8 milliards de paramètres (une IA super intelligente capable de lire et de voir) et lui ont appris à naviguer en lui montrant des millions d'exemples dans une simulation semblable à un jeu vidéo. Au lieu de calculer des mathématiques complexes sur la distance à parcourir en mètres, le modèle se contente de pointer l'endroit où il veut aller ensuite sur l'écran. Si la destination est cachée derrière un coin, il passe à un plan de secours consistant à avancer d'une certaine distance.

L'équipe a constaté que cette approche simple est incroyablement puissante. En entraînant le modèle sur 2,4 millions de trajets simulés à travers 350 000 scènes différentes, ils ont créé un système qui est non seulement moins cher et plus facile à construire, mais aussi plus intelligent que de nombreux robots dotés de capteurs sophistiqués. Lors de tests standards, Robostral Navigate a atteint un taux de réussite de 77,4 % pour trouver son chemin, battant de loin les meilleurs robots à caméra unique précédents et surpassant même certains robots utilisant des capteurs de profondeur ou plusieurs caméras. Le ingrédient secret n'était pas seulement le pointage ; c'était une nouvelle astuce d'entraînement qui a rendu le processus d'apprentissage 22 fois plus rapide et une phase d'apprentissage par renforcement qui a appris au robot comment se rattraper lorsqu'il s'égarait. Le résultat est un robot qui peut passer d'un chariot à roues à une machine de marche ou à un drone volant sans avoir besoin d'être réenseigné, prouant qu'il n'est pas nécessaire d'avoir une suite de capteurs à un million de dollars pour construire un robot véritablement polyvalent.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →