← Últimos artigos
💻 computer science

Joint On-and-Off Policy Learning for Vision-and-Language Navigation

Este artigo apresenta o JOP-VLN, um novo framework que integra sinergicamente aprendizado por imitação off-policy com exploração on-policy através de um pipeline de treinamento de três estágios para alcançar o estado da arte em benchmarks de Navegação de Visão e Linguagem.

Autores originais: Qingrong He, Lin Zhao, Kevin Zheng, Liang Lin

Publicado 2026-07-16
📖 4 min de leitura☕ Leitura rápida

Autores originais: Qingrong He, Lin Zhao, Kevin Zheng, Liang Lin

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está ensinando um robô a ser seu guia turístico pessoal. Você quer que ele ouça seus comandos de voz como, "Caminhe até a cozinha, vire à esquerda no vaso azul e pare em frente à geladeira", e então realmente faça isso sem bater nas paredes ou se perder. Este é o mundo da Navegação de Visão e Linguagem (VLN - Vision-and-Language Navigation). É um ramo da robótica onde um "agente incorporado" (um robô com corpo e olhos) tem que entender o mundo real bagunçado através de uma câmera e dar sentido à fala humana para se mover pelo ambiente.

O grande desafio aqui é que os robôs são péssimos em aprender com seus próprios erros. Se você ensinar um robô mostrando vídeos perfeitos de como caminhar, ele aprenderá a copiar esses vídeos. Mas no momento em que ele entra em uma nova sala ou vê uma cadeira em um lugar diferente, ele entra em pânico porque nunca aprendeu como se recuperar quando as coisas dão errado. Isso é como um aluno que memoriza as respostas de um teste prático, mas trava quando o professor muda os números. Para corrigir isso, os cientistas geralmente tentam duas coisas diferentes: ou mostram ao robô mais exemplos de caminhos perfeitos (Aprendizado por Imitação), ou deixam o robô vagar por aí e lhe dão um "mimo" (recompensa) quando ele chega mais perto do objetivo (Aprendizado por Reforço). Por muito tempo, esses dois métodos foram como duas escolas separadas que nunca conversavam entre si.

Apresentamos o JOP-VLN, um novo framework que decide dar uma festa conjunta para essas duas escolas. Os pesquisadores construíram um sistema que ensina o robô em três estágios distintos, misturando a segurança de copiar especialistas com a bravura de explorar por conta própria. Pense nisso como um acampamento de treinamento onde o robô primeiro aprende o básico de um mestre treinador, depois pratica em uma versão do mundo com "rodinhas" onde uma rede de segurança o ampara quando ele cai, e finalmente, vai para o mundo selvagem para explorar, mas com uma regra especial: ele só presta atenção às vezes em que ficou confuso ou cometeu um erro, usando esses momentos para ficar mais esperto.

O artigo introduz este pipeline de três estágios para resolver o problema de robôs ficarem presos quando encontram algo novo. No primeiro estágio, o robô aprende habilidades básicas de navegação e como resumir o que vê, assim como um aluno aprendendo o alfabeto e como escrever uma frase. No segundo estágio, o robô tenta navegar e, sempre que começa a se desviar do caminho, um sistema de segurança de "modo deus" (chamado de oracle) intervém para corrigir sua trajetória. O robô então aprende com esses caminhos corrigidos, praticando efetivamente como se recuperar de erros. Esta é a parte "off-policy", onde ele aprende com dados coletados por uma mistura de suas próprias tentativas e as correções da rede de segurança.

A magia acontece no terceiro estágio, onde o artigo combina tudo. Os pesquisadores perceberam que, se deixassem o robô explorar aleatoriamente, ele poderia apenas vagar em círculos ou ficar confiante demais em hábitos ruins. Então, eles adicionaram um filtro inteligente: eles só deixam o robô aprender dos momentos em que ele estava verdadeiramente incerto ou com "alta entropia" (uma forma elegante de dizer que estava adivinhando loucamente). Isso evita que o robô perca tempo com tarefas fáceis que já conhece e o força a focar nas partes difíceis. Além disso, eles ordenaram os dados de treinamento para que o robô passe a maior parte do tempo praticando os caminhos específicos onde ele falhou anteriormente, garantindo que aprenda a consertar seus próprios erros.

Os resultados desta abordagem são impressionantes. Quando testado em benchmarks de navegação padrão, o JOP-VLN alcançou uma taxa de sucesso de 69,9% no dataset R2R e 68,0% no dataset RxR. Esses números representam um novo estado da arte, o que significa que superou métodos anteriores que dependiam de apenas um tipo de aprendizado. Os pesquisadores também testaram o robô no mundo real, usando um robô quadrúppe (cachorro robótico) tanto em escritórios internos quanto em jardins externos. Mesmo com a realidade bagunçada de iluminação e texturas do mundo real, o robô conseguiu seguir instruções complexas, provando que este estilo de aprendizado "conjunto" ajuda a generalizar melhor do que antes. O artigo sugere que, ao misturar cuidadosamente a orientação de especialistas com uma exploração inteligente focada em erros, podemos construir robôs que não são apenas bons em seguir regras, mas que também são resilientes o suficiente para lidar com as reviravoltas inesperadas do mundo real.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →