← Últimos artigos
💻 computer science

From Seeing to Experiencing: Scaling Navigation Foundation Models with Reinforcement Learning

Este artigo apresenta o framework Seeing-to-Experiencing (S2E), que aprimora modelos de fundação de navegação ao combinar o pré-treinamento offline em vídeos de escala web com o aprendizado por reforço em simulação para melhorar o raciocínio interativo e a segurança, apoiado por um novo benchmark de avaliação chamado NavBench-GS.

Autores originais: Honglin He, Yukai Ma, Brad Squicciarini, Wayne Wu, Bolei Zhou

Publicado 2026-06-12
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Honglin He, Yukai Ma, Brad Squicciarini, Wayne Wu, Bolei Zhou

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

O Grande Problema: O "Turista" vs. O "Morador Local"

Imagine que você quer ensinar um robô a caminhar por uma cidade movimentada.

O Jeito Antigo (Apenas "Ver"):
Atualmente, a maioria dos robôs de navegação é treinada como um turista que assistiu a milhares de horas de vídeos no YouTube sobre caminhar em cidades. Eles viram todos os tipos de ruas, multidões e obstáculos na tela. Isso é chamado de Pré-treinamento Offline.

  • A Falha: Assistir a um vídeo de alguém desviando de um skatista é muito diferente de realmente desviar de um. O robô sabe como uma colisão parece, mas não entende a física de cair ou o tempo de reação de um segundo para parar. Se o robô tentar caminhar no mundo real, ele pode travar ou bater porque nunca "sentiu" as consequências de um erro de direção. Falta a ele a causalidade (causa e efeito).

O Novo Jeito (O Framework "S2E"):
Os autores propõem um novo método chamado Seeing-to-Experiencing (S2E) — Ver para Experienciar. Pense nisso como pegar esse turista e enviá-lo para um simulador de videogame altamente realista e seguro, onde ele pode realmente caminhar, tropeçar e aprender com seus erros sem se machucar.

O objetivo é combinar o conhecimento amplo do turista que assiste vídeos com a malícia de rua de quem realmente praticou no mundo real.


Como Funciona: A Receita de Dois Passos

O framework S2E usa dois "truques" principais para fazer isso funcionar de forma eficiente.

1. O Sistema de "Âncora" (Durante a Fase de Vídeo)

O Desafio: Quando um robô assiste a um vídeo, ele vê que às vezes as pessoas andam reto, às vezes viram à esquerda para desviar de um cachorro e, às vezes, param para um sinal vermelho. Todas essas ações são válidas para a mesma situação. Se o robô tentar adivinhar apenas um caminho "médio", ele falhará.

A Solução: Os autores utilizam algo chamado Anchor-Guided Distribution Matching (Correspondência de Distribuição Guiada por Âncoras).

  • A Analogia: Imagine que o robô é um chef tentando adivinhar uma receita. Em vez de adivinhar um único sabor, ele coloca várias "Âncoras" (como perfis de sabores específicos: "Picante", "Doce", "Salgado") sobre a mesa.
  • Como ajuda: O robô aprende que, para uma situação específica, a resposta pode ser "Picante" (ir reto) OU "Salgado" (virar à esquerda). Ao usar essas âncoras, o robô aprende a prever um cardápio de possíveis ações boas, em vez de apenas um palpite médio. Isso torna o robô muito mais flexível e preparado para diferentes cenários.

2. O Cérebro "Residual" (Durante a Fase de Prática)

O Desafio: Uma vez que o robô começa a praticar no simulador, queremos que ele aprenda novos truques (como desviar de um pedestre em movimento). Mas, se deixarmos o robô reaprender tudo do zero, ele pode esquecer como andar reto ou reconhecer uma calçada. Isso é chamado de "esquecimento catastrófico". Além disso, o simulador parece ligeiramente diferente do mundo real (iluminação, texturas diferentes), o que pode confundir o robô.

A Solução: Eles utilizam um Módulo de Atenção Residual.

  • A Analogia: Imagine que o robô tem um "Cérebro Base" (a parte treinada em vídeos) que é excelente em reconhecer ruas. Quando ele entra no simulador, não substituímos o Cérebro Base. Em vez disso, anexamos um pequeno e leve "Cérebro Adicional" (o Módulo Residual) sobre ele.
  • Como ajuda: O Cérebro Base permanece congelado e mantém seu conhecimento geral seguro. O Cérebro Adicional é a única parte que aprende. Ele foca apenas nas coisas novas e interativas: "Oh, aquela pessoa está se movendo, eu preciso diminuir a velocidade".
  • O Benefício: Isso é como adicionar um novo aplicativo ao seu celular sem deletar seus contatos. O robô ganha novas habilidades reativas (desviar, parar) sem perder seu conhecimento geral antigo (reconhecer uma estrada).

O Teste de Direção: NavBench-GS

Para provar que isso funciona, os autores construíram um novo campo de testes chamado NavBench-GS.

  • O que é? Em vez de testar em imagens 2D planas (como olhar para uma foto de uma rua), eles construíram um mundo 3D que se parece exatamente com o mundo real, mas possui física real. Você pode jogar uma bola no robô, e ele reagirá.
  • Os Resultados:
    • Robôs treinados apenas com vídeos (os "Turistas") bateram com frequência ao enfrentar pessoas ou obstáculos em movimento.
    • Robôs treinados com o método S2E (os "Moradores Locais") foram muito melhores. Eles chegaram ao destino com mais frequência e bateram muito menos.
    • A Surpresa de Eficiência: O robô S2E aprendeu mais rápido com menos dados. Um robô treinado com apenas 100 horas de dados + prática no simulador teve um desempenho melhor do que outros robôs treinados com mais de 2.000 horas de vídeo. Isso prova que a prática interativa é mais valiosa do que apenas assistir a mais vídeos.

Prova no Mundo Real

A equipe não parou apenas em simulações. Eles colocaram seu robô em duas máquinas reais:

  1. Um robô sobre rodas (como um robô de entrega).
  2. Um robô quadrúpede (um robô parecido com um cachorro).

Eles testaram esses robôs em ruas de cidades reais com obstáculos e pessoas reais. Os robôs S2E navegaram com sucesso nesses ambientes complexos sem treinamento específico prévio para essas ruas exatas (Generalização Zero-Shot). Eles conseguiram manter-se na calçada e evitar pedestres, provando que as habilidades aprendidas no simulador se transferiram perfeitamente para o mundo real.

Resumo

O artigo argumenta que, para tornar os robôs verdadeiros navegadores inteligentes, não podemos apenas alimentá-los com mais vídeos. Devemos deixá-los praticar. Ao combinar uma base estável "baseada em vídeo" com um módulo de aprendizado "baseado em prática" que não sobrescreve seu conhecimento original, os robôs podem aprender a navegar de forma segura e eficiente no caos do mundo real.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →