Robostral Navigate
O Robostral Navigate é um modelo de visão-linguagem de 8B que alcança o estado da arte em navegação monocular através de diversos embodiments robóticos ao alavancar uma receita de treinamento escalável com 2,4 milhões de trajetórias simuladas, eficiência de cache de prefixo e previsão de waypoints no espaço da imagem para eliminar a necessidade de sensores de profundidade ou mapas pré-construídos.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você está ensinando um robô a ser um guia turístico. No mundo da robótica, isso é chamado de "navegação incorporada" — a capacidade de uma máquina entender um comando falado como "vá para a cozinha" e realmente caminhar até lá sem bater nas paredes. Por muito tempo, os melhores guias turísticos eram como astronautas de alto nível: precisavam de equipamentos caros e pesados para fazer o seu trabalho. Eles usavam óculos 3D especiais (sensores de profundidade), carregavam múltiplas câmeras como uma equipe de segurança ou dependiam de mapas pré-desenhados de todo o edifício. Embora esses robôs fossem bons, eles também eram caros, frágeis e difíceis de adaptar em um simples drone de entrega ou em uma pequena roda de armazém. A grande questão que os cientistas têm feito é: Podemos construir um robô que seja tão inteligente quanto, mas que use a ferramenta mais simples e comum disponível? A resposta reside em uma única câmera padrão — o tipo encontrado em quase todos os celulares e robôs hoje em dia — e um cérebro poderoso o suficiente para descobrir o resto.
Este artigo apresenta o Robostral Navigate, um novo tipo de cérebro robótico projetado para resolver o quebra-cabeça da navegação usando apenas essa câmera única e padrão. Pense nisso como um robô que não precisa de um mapa 3D ou de um scanner a laser; em vez disso, ele aprende a "apontar" para o próximo passo de uma jornada apenas olhando para uma imagem. Os pesquisadores construíram um "modelo de visão-linguagem" de 8 bilhões de parâmetros (uma IA superinteligente que pode ler e ver) e o ensinaram a navegar mostrando-lhe milhões de exemplos em uma simulação semelhante a um videogame. Em vez de calcular matemática complexa sobre quão longe se mover em metros, o modelo simplesmente aponta para onde deseja ir a seguir na tela. Se o destino estiver escondido atrás de uma esquina, ele muda para um plano de contingência de mover-se para frente uma quantidade específica.
A equipe descobriu que essa abordagem simples é incrivelmente poderosa. Ao treinar o modelo em 2,4 milhões de jornadas simuladas através de 350.000 cenas diferentes, eles criaram um sistema que não é apenas mais barato e fácil de construir, mas também mais inteligente do que muitos robôs com sensores sofisticados. Em testes padrão, o Robostral Navigate alcançou uma taxa de sucesso de 77,4% em encontrar seu caminho, superando por uma margem ampla os melhores robôs de câmera única anteriores e até mesmo superando alguns robôs que usavam sensores de profundidade ou múltiplas câmeras. O ingrediente secreto não foi apenas o ato de apontar; foi um novo truque de treinamento que tornou o processo de aprendizado 22 vezes mais rápido e uma fase de aprendizado por reforço que ensinou o robô a se recuperar quando se perdia. O resultado é um robô que pode saltar de um carrinho com rodas para uma máquina de caminhar ou um drone voador sem precisar ser reensinado, provando que você não precisa de um conjunto de sensores de um milhão de dólares para construir um robô verdadeiramente de propósito geral.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.