← Últimos artigos
💻 computer science

VEGA: Learning Navigation VLAs from In-the-Wild Egocentric Video with Geometric Trajectory Supervision

O VEGA introduz um método para treinar modelos de Visão-Linguagem-Ação de navegação a partir de vídeos egocêntricos não rotulados ao reconstruir a geometria da cena local para gerar trajetórias conscientes de obstáculos para supervisão, alcançando melhorias significativas na prevenção de colisões e nas taxas de sucesso em comparação com as linhas de base existentes.

Autores originais: Gershom Seneviratne, Yohan Abeysinghe, Jianyu An, Vaibhav Shende, Dinesh Manocha

Publicado 2026-06-19
📖 4 min de leitura☕ Leitura rápida

Autores originais: Gershom Seneviratne, Yohan Abeysinghe, Jianyu An, Vaibhav Shende, Dinesh Manocha

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você queira ensinar um robô a caminhar por uma sala cheia de gente sem esbarrar em cadeiras, pessoas ou mesas. Normalmente, para ensinar um robô a fazer isso, você precisa de uma destas duas opções:

  1. Gravar um humano caminhando por aquela sala exata enquanto o robô observa, ou
  2. Programar manualmente o robô para evitar obstáculos específicos.

Ambas as opções são lentas, caras e difíceis de escalar. Você não pode gravar um humano caminhando por cada possível sala do mundo.

Apresentamos o VEGA.

Os pesquisadores por trás deste artigo criaram uma maneira inteligente de ensinar robôs a navegar usando bilhões de vídeos "na natureza" (in-the-wild) encontrados na internet (como pessoas andando em suas casas, trilhas de caminhada ou ruas movimentadas). Esses vídeos são ótimos porque mostram ambientes reais, bagunçados e obstruídos, mas têm um grande problema: eles não dizem ao robô para onde ir ou como desviar dos móveis. São apenas vídeos "sem ação".

Aqui está como o VEGA transforma esses vídeos aleatórios em um professor de navegação, usando alguns passos criativos:

1. O Truque do "Mapa Mental"

Primeiro, o VEGA observa um único quadro de um vídeo e usa uma IA especial para construir um mapa mental 3D da sala. Ele identifica onde está o chão, onde estão as paredes e onde estão os obstáculos (como uma mesa de centro ou um cachorro) parados. Ele cria um "mapa de segurança" que sabe exatamente quanto espaço está disponível para caminhar.

2. O Jogo do "E se?"

Uma vez construído o mapa, o VEGA joga um jogo de "E se?":

  • E se o robô quisesse ir até aquela cadeira vermelha?
  • E se ele quisesse ir até a porta?
  • E se ele quisesse apenas caminhar até um ponto vazio no tapete?

Para cada destino possível, o VEGA utiliza um planejador matemático para calcular o caminho perfeito e seguro para chegar lá sem bater em nada. Ele faz isso milhões de vezes, criando uma enorme biblioteca de pares "Objetivo + Caminho Seguro".

3. O Robô "Aluno"

Agora, o VEGA treina o cérebro de um robô (chamado de VLA ou modelo de Visão-Linguagem-Ação). Este robô aluno assiste ao vídeo original e vê o "Caminho Seguro" que o VEGA calculou.

  • A Lição: "Aqui está o que você vê (o vídeo), aqui é para onde você quer ir (o objetivo) e aqui está o caminho seguro que você deve seguir."
  • O Resultado: O robô aprende a olhar para uma cena, entender um objetivo (como "ir para a cozinha" ou "ir até aquele quadro") e instantaneamente traçar um caminho seguro, apenas olhando para a transmissão da câmera. Ele não precisa mais do mapa 3D depois de treinado; ele apenas usa seus olhos e seu cérebro.

Por que isso é algo grandioso?

Pense nisso como aprender a dirigir.

  • Jeito Antigo: Você só aprende a dirigir tendo um instrutor de direção sentado ao seu lado em um carro específico em uma rua específica, dizendo exatamente quando você deve virar.
  • Jeito VEGA: Você assiste a milhões de horas de filmagens de câmeras de painel (dashcam) de todo o mundo. Você usa um computador para determinar as "linhas de condução perfeitas" para cada possível destino naqueles vídeos. Então, você treina seu céreamente para imitar essas linhas perfeitas.

Os Resultados

Os pesquisadores testaram isso em um robô real em salas bagunçadas e cheias de obstáculos, com obstáculos em movimento. Comparado a outros navegadores robóticos de alto nível:

  • Sucesso: O robô alcançou seu destino com muito mais frequência (pelo menos 150% melhor).
  • Segurança: Ele colidiu com objetos 66% menos vezes.
  • Espaço: Ele deu a si mesmo mais espaço para manobrar, evitando passagens apertadas em 60% mais casos.

Eles também criaram um teste gigante chamado VEGA-Bench (com 250.000 cenas e 5 milhões de objetivos) para provar que o método deles funciona melhor do que a concorrência no que diz respeito a evitar colisões e atingir alvos específicos.

Em resumo: O VEGA pega o caos da biblioteca de vídeos da internet, transforma-o em um "manual de segurança" estruturado usando geometria e ensina robôs a navegar no mundo real sem precisar de sessões de treinamento caras e gravadas manualmente.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →