← Últimos artículos
🤖 AI

Robostral Navigate

Robostral Navigate es un modelo de lenguaje-visión de 8B que logra el estado del arte en navegación monocular a través de diversos encarnamientos robóticos mediante el aprovechamiento de una receta de entrenamiento escalable con 2.4 millones de trayectorias simuladas, eficiencia de caché de prefijo y predicción de puntos de ruta en el espacio de la imagen para eliminar la necesidad de sensores de profundidad o mapas preconstruidos.

Autores originales: Abdelaziz Bounhar, Abhijeet Somani, Aditi Kabra, Adrian Valente, Adrien Petralia, Adrien Sade, Alan Jeffares, Albert Jiang, Aleksandr Timashov, Alexandre Cahill, Alexandre Gavaudan, Alexandre Laval, A
Publicado 2026-08-04
📖 3 min de lectura☕ Lectura para el café

Autores originales: Abdelaziz Bounhar, Abhijeet Somani, Aditi Kabra, Adrian Valente, Adrien Petralia, Adrien Sade, Alan Jeffares, Albert Jiang, Aleksandr Timashov, Alexandre Cahill, Alexandre Gavaudan, Alexandre Laval, Alexandre Sablayrolles, Amelie Heliou, Amos You, Andre Jonasson, Andrew Bai, Andrew Ehrenberg, Andrew Zhao, Angele Lenglemetz, Anmol Agarwal, Antonia Calvi, Arata Suzuki, Arjun Majumdar, Arthur Fournier, Artjom Joosen, Avinash Sooriyarachchi, Aylin Guliz Akkus, Aysenur Karaduman, Baptiste Bout, Baptiste Roziere, Baudouin De Monicault, Benjamin Holzschuh, Benjamin Lefaudeux, Benjamin Tibi, Bernhard Stadlbauer, Blazej Osinski, Camille Le Scao, Chaoran Yu, Charlotte Cronjager, Chen-Yo Sun, Chris Bamford, Christian Wallenwein, Christophe Renaudin, Clemence Lanfranchi, Corentin Barreau, Corentin Sautier, Cristiana-Diana Diaconu, Cyprien Courtot, Daniel Marczak, Darius Dabert, Diego de Las Casas, Dominik Nuss, Dylan Rubini, Dzmitry Soupel, Elizaveta Demyanenko, Elliot Chane-Sane, Emilien Fugier, Emmanuel Gottlob, Erik Aas, Etienne Goffinet, Etienne Millon, Eujeong Choi, Fabian Paischer, Fabian Schlager, Faruk Ahmed, Federico Baldassarre, Filip Szatkowski, Florian Wiesner, Gabrielle Berrada, Gaetan Ecrepont, Gaetan Lepage, Gaspard Blanchet, Gaspard Donada-Vidal, Gauthier Delerce, Gauthier Guinet, Genevieve Hayes, Georgii Novikov, Giada Pistilli, Gianluca Galletti, Guillaume Breton, Guillaume Kunsch, Guillaume Lample, Guillaume Martin, Guillaume Raille, Gunjan Dhanuka, Gunshi Gupta, Han Zhou, Harshil Shah, Hasan Furkan Vural, Hedi Hadiji, Hope McGovern, Hugo Cisneros, Hugo Thimonier, Indraneel Mukherjee, Ivan Cuevas Salazar, Jacques Sun, Jan Ludziejewski, Jason Rute, Jean Quentin, Jean-Hadrien Chabran, Jean-Malo Delignon, Jie Zhang, Joachim Studnia, Joep Barmentlo, Johannes Brandstetter, John Harvill, Jonas Amar, Jonas Schweizer, Josephine Delas, Josselin Somerville, Julien Denize, Julien Tauran, Kartik Khandelwal, Khyathi Raghavi Chandu, Kilian Tep, Kush Jain, Larissa Laich, Laura Calem, Laurence Aitchison, Laurent Callot, Laurent Fainsin, Leo Cotteleer, Leonard Blier, Lingxiao Zhao, Louis Martin, Louis Serrano, Lucile Saulnier, Ludovic Ho Fuh, Luis Montero, Maarten Buyl, Manon Chossegros, Marcin Mozejko, Margaret Jennings, Markus Hennerbichler, Martin Alexandre, Mathieu Poiree, Mathieu Schmitt, Mathilde Guillaumin, Matthieu Andre, Matthieu Dinot, Matthieu Futeral, Maurits Bleeker, Mauro Comi, Max Mynter, Maxim Berman, Maxime Darrin, Maxime Louis, Maximilian Augustin, Maximilian Muller, Melina Jingting Laimon, Mert Unsal, Mia Chiquier, Michael Pilcer, Michal Pietruszka, Michal Zajac, Mikhail Biriuchinskii, Minh-Quang Pham, Minwoo Kang, Morgane Riviere, Namit Katariya, Nathan Grinsztajn, Nathan Simpson, Neeraj Aggarwal, Neha Gupta, Ola Mysiak, Oliver Leicht, Olivier Bousquet, Olivier Duchenne, Parag Jain, Patricia Wang, Patrick Blies, Patrick von Platen, Paul Jacob, Paul Wambergue, Paula Kurylowicz, Pavan Kumar Reddy, Pavel Kuksa, Philippe Pinel, Philomene Chagniot, Pierre Stock, Pierre-Andre Savalle, Piotr Milos, Prateek Gupta, Pravesh Agrawal, Quentin Desreumaux, Quentin Torroba, Quercus Hernandez, Ram Ramrakhya, Randall Isenhour, Ranjit Parva, Raul Perez Pelaez, Reinhard Sonnleitner, Remi Delacourt, Richard Kurle, Rishi Shah, Rob Romijnders, Rohin Arora, Romain Sauvestre, Roman Soletskyi, Rosalie Millner, Rupert Menneer, Sagar Vaze, Samuel Barry, Samuel Belkadi, Samuel Humeau, Sanchit Gandhi, Sandeep Subramanian, Sarthak Mittal, Saskia Adaime, Sean Cha, Sebastian Kaltenbach, Shashwat Dalal, Shashwat Verma, Sherif Waly, Shrimai Prabhumoye, Siddhant Waghjale, Siddharth Gandhi, Simon Lepage, Simon Sorg, Soham Ghosh, Sophie Marbach, Srijan Mishra, Stanislas Lange, Steve Hong, Sumukh Aithal, Szymon Antoniak, Tarun Kumar Vangani, Teven Le Scao, Theo Cachet, Thibaut Lavril, Thomas Chabal, Thomas Coste, Thomas Defard, Thomas Foubert, Thomas Robert, Thomas Wang, Tianyu Zhang, Tim Lawson, Timothee Lacroix, Tobias Kronlachner, Tom Bewley, Tom Edwards, Tomas Hodan, Tuhin Das, Tyler Wang, Ulrick BLE, Umar Jamil, Umberto Tomasini, Valentin Mace, Van Phung, Vedant Nanda, Victor Jouault, Victor Letzelter, Victor Paltz, Victor Poucheret, Vincent Maladiere, Vincent Pfister, Virgile Richard, Vladislav Bataev, Wassim Bouaziz, Wen Ding Li, William Havard, William Marshall, Xinghui Li, Xingran Guo, Xinyu Yang, Yann Dreze, Yassine El Ouahidi, Yassir Bendou, Yihan Wang, Yimu Pan, Yves Martin des Taillades, Zaccharie Ramzi, Zhenlin Xu, Zsofia Csakany

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás enseñando a un robot a ser un guía turístico. En el mundo de la robótica, esto se llama "navegación encarnada" (embodied navigation): la capacidad de una máquina para entender un comando hablado como "ve a la cocina" y realmente caminar hacia allí sin chocar con las paredes. Durante mucho tiempo, los mejores guías turísticos fueron como astronautas de alta gama: necesitaban equipo costoso y pesado para hacer su trabajo. Usaban gafas 3D especiales (sensores de profundidad), cargaban con múltiples cámaras como un equipo de seguridad o dependían de mapas pre-dibujados de todo el edificio. Aunque estos robots eran buenos, también eran caros, frágiles y difíciles de adaptar a un simple dron de entrega o a una rueda de almacén pequeña. La gran pregunta que los científicos se han estado haciendo es: ¿Podemos construir un robot que sea igual de inteligente pero que utilice la herramienta más simple y común disponible? La respuesta reside en una única cámara estándar —el tipo de cámara que se encuentra en casi todos los teléfonos y robots de hoy en día— y un cerebro lo suficientemente potente como para descifrar el resto.

Este artículo presenta Robostral Navigate, un nuevo tipo de cerebro robótico diseñado para resolver el rompecabezas de la navegación utilizando únicamente esa cámara estándar. Piensa en él como un robot que no necesita un mapa 3D o un escáner láser; en su lugar, aprende a "señalar" el siguiente paso en un viaje con solo mirar una imagen. Los investigadores construyeron un "modelo de visión y lenguaje" de 8 mil millones de parámetros (una IA superinteligente que puede leer y ver) y le enseñaron a navegar mostrándole millones de ejemplos en una simulación similar a un videojico. En lugar de calcular matemáticas complejas sobre cuántos metros moverse, el modelo simplemente señala hacia donde quiere ir a continuación en la pantalla. Si el destino está oculto detrás de una esquina, cambia a un plan de respaldo de avanzar una cantidad específica.

El equipo descubrió que este enfoque simple es increíblemente poderoso. Al entrenar el modelo en 2.4 millones de trayectos simulados a través de 350,000 escenas diferentes, crearon un sistema que no solo es más barato y fácil de construir, sino también más inteligente que muchos robots con sensores sofisticados. En las pruebas estándar, Robostral Navigate logró una tasa de éxito del 77.4% al encontrar su camino, superando por un amplio margen a los mejores robots de una sola cámara previos e incluso superando a algunos robots que utilizaban sensores de profundidad o múltiples cámaras. El ingrediente secreto no fue solo el señalar; fue un nuevo truco de entrenamiento que hizo que el proceso de aprendizaje fuera 22 veces más rápido y una fase de aprendizaje por refuerzo que le enseñó al robot cómo recuperarse cuando se perdía. El resultado es un robot que puede saltar de un carro con ruedas a una máquina caminante o a un dron volador sin necesidad de ser reentrenado, demostando que no se necesita un conjunto de sensores de un millón de dólares para construir un robot verdaderamente de propósito general.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →