← Últimos artigos
🤖 AI

Robostral Navigate

O Robostral Navigate é um modelo de visão-linguagem de 8B que alcança o estado da arte em navegação monocular através de diversos embodiments robóticos ao alavancar uma receita de treinamento escalável com 2,4 milhões de trajetórias simuladas, eficiência de cache de prefixo e previsão de waypoints no espaço da imagem para eliminar a necessidade de sensores de profundidade ou mapas pré-construídos.

Autores originais: Abdelaziz Bounhar, Abhijeet Somani, Aditi Kabra, Adrian Valente, Adrien Petralia, Adrien Sade, Alan Jeffares, Albert Jiang, Aleksandr Timashov, Alexandre Cahill, Alexandre Gavaudan, Alexandre Laval, A
Publicado 2026-08-04
📖 3 min de leitura☕ Leitura rápida

Autores originais: Abdelaziz Bounhar, Abhijeet Somani, Aditi Kabra, Adrian Valente, Adrien Petralia, Adrien Sade, Alan Jeffares, Albert Jiang, Aleksandr Timashov, Alexandre Cahill, Alexandre Gavaudan, Alexandre Laval, Alexandre Sablayrolles, Amelie Heliou, Amos You, Andre Jonasson, Andrew Bai, Andrew Ehrenberg, Andrew Zhao, Angele Lenglemetz, Anmol Agarwal, Antonia Calvi, Arata Suzuki, Arjun Majumdar, Arthur Fournier, Artjom Joosen, Avinash Sooriyarachchi, Aylin Guliz Akkus, Aysenur Karaduman, Baptiste Bout, Baptiste Roziere, Baudouin De Monicault, Benjamin Holzschuh, Benjamin Lefaudeux, Benjamin Tibi, Bernhard Stadlbauer, Blazej Osinski, Camille Le Scao, Chaoran Yu, Charlotte Cronjager, Chen-Yo Sun, Chris Bamford, Christian Wallenwein, Christophe Renaudin, Clemence Lanfranchi, Corentin Barreau, Corentin Sautier, Cristiana-Diana Diaconu, Cyprien Courtot, Daniel Marczak, Darius Dabert, Diego de Las Casas, Dominik Nuss, Dylan Rubini, Dzmitry Soupel, Elizaveta Demyanenko, Elliot Chane-Sane, Emilien Fugier, Emmanuel Gottlob, Erik Aas, Etienne Goffinet, Etienne Millon, Eujeong Choi, Fabian Paischer, Fabian Schlager, Faruk Ahmed, Federico Baldassarre, Filip Szatkowski, Florian Wiesner, Gabrielle Berrada, Gaetan Ecrepont, Gaetan Lepage, Gaspard Blanchet, Gaspard Donada-Vidal, Gauthier Delerce, Gauthier Guinet, Genevieve Hayes, Georgii Novikov, Giada Pistilli, Gianluca Galletti, Guillaume Breton, Guillaume Kunsch, Guillaume Lample, Guillaume Martin, Guillaume Raille, Gunjan Dhanuka, Gunshi Gupta, Han Zhou, Harshil Shah, Hasan Furkan Vural, Hedi Hadiji, Hope McGovern, Hugo Cisneros, Hugo Thimonier, Indraneel Mukherjee, Ivan Cuevas Salazar, Jacques Sun, Jan Ludziejewski, Jason Rute, Jean Quentin, Jean-Hadrien Chabran, Jean-Malo Delignon, Jie Zhang, Joachim Studnia, Joep Barmentlo, Johannes Brandstetter, John Harvill, Jonas Amar, Jonas Schweizer, Josephine Delas, Josselin Somerville, Julien Denize, Julien Tauran, Kartik Khandelwal, Khyathi Raghavi Chandu, Kilian Tep, Kush Jain, Larissa Laich, Laura Calem, Laurence Aitchison, Laurent Callot, Laurent Fainsin, Leo Cotteleer, Leonard Blier, Lingxiao Zhao, Louis Martin, Louis Serrano, Lucile Saulnier, Ludovic Ho Fuh, Luis Montero, Maarten Buyl, Manon Chossegros, Marcin Mozejko, Margaret Jennings, Markus Hennerbichler, Martin Alexandre, Mathieu Poiree, Mathieu Schmitt, Mathilde Guillaumin, Matthieu Andre, Matthieu Dinot, Matthieu Futeral, Maurits Bleeker, Mauro Comi, Max Mynter, Maxim Berman, Maxime Darrin, Maxime Louis, Maximilian Augustin, Maximilian Muller, Melina Jingting Laimon, Mert Unsal, Mia Chiquier, Michael Pilcer, Michal Pietruszka, Michal Zajac, Mikhail Biriuchinskii, Minh-Quang Pham, Minwoo Kang, Morgane Riviere, Namit Katariya, Nathan Grinsztajn, Nathan Simpson, Neeraj Aggarwal, Neha Gupta, Ola Mysiak, Oliver Leicht, Olivier Bousquet, Olivier Duchenne, Parag Jain, Patricia Wang, Patrick Blies, Patrick von Platen, Paul Jacob, Paul Wambergue, Paula Kurylowicz, Pavan Kumar Reddy, Pavel Kuksa, Philippe Pinel, Philomene Chagniot, Pierre Stock, Pierre-Andre Savalle, Piotr Milos, Prateek Gupta, Pravesh Agrawal, Quentin Desreumaux, Quentin Torroba, Quercus Hernandez, Ram Ramrakhya, Randall Isenhour, Ranjit Parva, Raul Perez Pelaez, Reinhard Sonnleitner, Remi Delacourt, Richard Kurle, Rishi Shah, Rob Romijnders, Rohin Arora, Romain Sauvestre, Roman Soletskyi, Rosalie Millner, Rupert Menneer, Sagar Vaze, Samuel Barry, Samuel Belkadi, Samuel Humeau, Sanchit Gandhi, Sandeep Subramanian, Sarthak Mittal, Saskia Adaime, Sean Cha, Sebastian Kaltenbach, Shashwat Dalal, Shashwat Verma, Sherif Waly, Shrimai Prabhumoye, Siddhant Waghjale, Siddharth Gandhi, Simon Lepage, Simon Sorg, Soham Ghosh, Sophie Marbach, Srijan Mishra, Stanislas Lange, Steve Hong, Sumukh Aithal, Szymon Antoniak, Tarun Kumar Vangani, Teven Le Scao, Theo Cachet, Thibaut Lavril, Thomas Chabal, Thomas Coste, Thomas Defard, Thomas Foubert, Thomas Robert, Thomas Wang, Tianyu Zhang, Tim Lawson, Timothee Lacroix, Tobias Kronlachner, Tom Bewley, Tom Edwards, Tomas Hodan, Tuhin Das, Tyler Wang, Ulrick BLE, Umar Jamil, Umberto Tomasini, Valentin Mace, Van Phung, Vedant Nanda, Victor Jouault, Victor Letzelter, Victor Paltz, Victor Poucheret, Vincent Maladiere, Vincent Pfister, Virgile Richard, Vladislav Bataev, Wassim Bouaziz, Wen Ding Li, William Havard, William Marshall, Xinghui Li, Xingran Guo, Xinyu Yang, Yann Dreze, Yassine El Ouahidi, Yassir Bendou, Yihan Wang, Yimu Pan, Yves Martin des Taillades, Zaccharie Ramzi, Zhenlin Xu, Zsofia Csakany

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está ensinando um robô a ser um guia turístico. No mundo da robótica, isso é chamado de "navegação incorporada" — a capacidade de uma máquina entender um comando falado como "vá para a cozinha" e realmente caminhar até lá sem bater nas paredes. Por muito tempo, os melhores guias turísticos eram como astronautas de alto nível: precisavam de equipamentos caros e pesados para fazer o seu trabalho. Eles usavam óculos 3D especiais (sensores de profundidade), carregavam múltiplas câmeras como uma equipe de segurança ou dependiam de mapas pré-desenhados de todo o edifício. Embora esses robôs fossem bons, eles também eram caros, frágeis e difíceis de adaptar em um simples drone de entrega ou em uma pequena roda de armazém. A grande questão que os cientistas têm feito é: Podemos construir um robô que seja tão inteligente quanto, mas que use a ferramenta mais simples e comum disponível? A resposta reside em uma única câmera padrão — o tipo encontrado em quase todos os celulares e robôs hoje em dia — e um cérebro poderoso o suficiente para descobrir o resto.

Este artigo apresenta o Robostral Navigate, um novo tipo de cérebro robótico projetado para resolver o quebra-cabeça da navegação usando apenas essa câmera única e padrão. Pense nisso como um robô que não precisa de um mapa 3D ou de um scanner a laser; em vez disso, ele aprende a "apontar" para o próximo passo de uma jornada apenas olhando para uma imagem. Os pesquisadores construíram um "modelo de visão-linguagem" de 8 bilhões de parâmetros (uma IA superinteligente que pode ler e ver) e o ensinaram a navegar mostrando-lhe milhões de exemplos em uma simulação semelhante a um videogame. Em vez de calcular matemática complexa sobre quão longe se mover em metros, o modelo simplesmente aponta para onde deseja ir a seguir na tela. Se o destino estiver escondido atrás de uma esquina, ele muda para um plano de contingência de mover-se para frente uma quantidade específica.

A equipe descobriu que essa abordagem simples é incrivelmente poderosa. Ao treinar o modelo em 2,4 milhões de jornadas simuladas através de 350.000 cenas diferentes, eles criaram um sistema que não é apenas mais barato e fácil de construir, mas também mais inteligente do que muitos robôs com sensores sofisticados. Em testes padrão, o Robostral Navigate alcançou uma taxa de sucesso de 77,4% em encontrar seu caminho, superando por uma margem ampla os melhores robôs de câmera única anteriores e até mesmo superando alguns robôs que usavam sensores de profundidade ou múltiplas câmeras. O ingrediente secreto não foi apenas o ato de apontar; foi um novo truque de treinamento que tornou o processo de aprendizado 22 vezes mais rápido e uma fase de aprendizado por reforço que ensinou o robô a se recuperar quando se perdia. O resultado é um robô que pode saltar de um carrinho com rodas para uma máquina de caminhar ou um drone voador sem precisar ser reensinado, provando que você não precisa de um conjunto de sensores de um milhão de dólares para construir um robô verdadeiramente de propósito geral.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →