← Últimos artigos
💻 computer science

LH-AVLN: A Benchmark for Long-Horizon Audio-Visual-Language Navigation

Este artigo apresenta o LH-AVLN, um novo benchmark para navegação audiovisual-linguística de longo horizonte que desafia agentes com missões de múltiplos objetivos em ambientes internos acusticamente ricos, e propõe o PAG-Nav, um agente livre de treinamento que aproveita efetivamente o áudio binaural para busca enquanto depende da verificação visual-semântica para a conclusão do objetivo.

Autores originais: Rufeng Chen, Yue Chang, Zili Shao, Zhaofan Zhang, Li Chen, Hechang Chen, Hui Xiong, Sihong Xie

Publicado 2026-07-21
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Rufeng Chen, Yue Chang, Zili Shao, Zhaofan Zhang, Li Chen, Hechang Chen, Hui Xiong, Sihong Xie

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está ensinando um robô a ser o detetive doméstico definitivo. Normalmente, quando ensinamos robôs a se moverem por uma casa, damos a eles uma missão simples: "Vá encontrar a bola vermelha". Eles olham ao redor com seus olhos de câmera, talvez lembrem onde estiveram e caminham até avistarem o objeto. Este campo da ciência é chamado de "navegação incorporada", onde o robô aprende a se mover pelo mundo real para resolver uma tarefa. Mas há um problema: a maioria desses jogos de treinamento é completamente silenciosa. O robô só consegue ver o que está diretamente à frente de sua lente. Se a bola estiver atrás de uma porta fechada ou escondida em um canto escuro, o rob o robô fica travado, cego para qualquer coisa fora de sua visão atual.

Agora, imagine dar a esse robô um superpoder: ouvidos. No mundo real, o som não viaja apenas em linha reta; ele rebate nos cantos e se infiltra pelas frestas. Um robô com bons ouvidos poderia ouvir um cachorro latindo na sala ao lado ou uma torneira pingando atrás de uma parede, dando-lhe uma pista de para onde ir mesmo quando ele ainda não consegue ver o objeto. Este artigo faz uma pergunta grande e complicada: o que acontece se combinarmos esses dois superpoderes — visão e audição — mas tornarmos a missão muito mais difícil? Em vez de encontrar apenas uma coisa, e se o robô tivesse que encontrar uma lista inteira de itens diferentes, alguns descritos por palavras, outros por imagens e outros apenas pelo nome, tudo isso enquanto os sons na casa continuam mudando conforme ele resolve o quebra-cabeça?

Os pesquisadores por trás deste estudo, liderados por Rufeng Chen e colegas da Universidade de Ciência e Tecnologia de Hong Kong e da Universidade de Jilin, construíram um novo desafio chamado LH-AVLN. Pense nisso como um videogame de alto nível e múltiplos níveis para robôs. Neste jogo, o robô é deixado em uma casa 3D e recebe uma "missão global" contendo de dois a quatro objetivos diferentes. Esses objetivos são complicados: um pode ser "encontrar o sofá" (uma categoria), outro pode ser "encontrar o sofá cinza claro ao lado das cortinas translúcidas" (uma descrição) e um terceiro pode ser "encontrar esta imagem específica de uma cama" (uma referência de imagem).

A verdadeira reviravolta, porém, é o som. Neste jogo, cada item que o robô procura faz um barulho. Mas aqui está o detalhe: os sons não são alvos fixos. À medida que o robô encontra e conclui um objetivo, o ruído desse item para. Enquanto isso, os itens que ele ainda não encontrou continuam fazendo barulho, alternando-se para serem os mais altos. Isso cria uma situação confusa. Se o robô está procurando um sofá, mas ouve uma descarga de vaso sanitário (porque ele ainda não encontrou o vaso sanitário), o som é uma distração. O robô tem que descobrir: "Esse som está me ajudando a encontrar meu alvo atual ou é uma pista falsa que me leva a uma tarefa diferente e inacabada?"

Para testar isso, os autores criaram um enorme conjunto de dados com mais de 150.000 episódios onde robôs têm que navegar por essas missões ruidosas e de múltiplos objetivos. Eles descobriram que os robôs existentes, mesmo os inteligentes que são ótimos em seguir instruções ou lembrar mapas visuais, falham terrivelmente. Quando o som se torna confuso ou a missão se prolonga, esses robôs se perdem ou desistem. Eles não conseguem distinguir entre uma pista útil e um ruído de distração.

Para mostrar o quão difícil isso é, a equipe construiu seu próprio agente robô chamado PAG-Nav. Este robô não usa um treinamento complexo para aprender; em vez disso, utiliza uma estratégia inteligente. Ele mantém um mapa mental de toda a casa, rastreando por onde passou, o que viu e de onde vêm os sons. Ele usa o som para guiar sua busca quando não consegue enxergar nada, mas se recusa a dizer "eu encontrei!" até conseguir uma visão clara e nítida do objeto para garantir que é o correto. Mesmo com essa estratégia inteligente, o robô tem sucesso em apenas cerca de 2% a 3% das missões ordenadas e de 3% a 5% das não ordenadas.

O principal achado deste artigo é que adicionar o som a missões longas e complexas torna as coisas significativamente mais difíceis, não mais fáceis, para a tecnologia atual. Os autores sugerem que, embora o som seja uma ferramenta poderosa para encontrar coisas escondidas da visão, ele se torna um pesadelo se o robô não conseguir discernir qual som pertence a qual tarefa. Eles argumentam que o futuro da navegação robótica não é apenas sobre ver melhor ou ouvir melhor, mas sobre aprender a ignorar o ruído e focar na pista certa no momento certo. O artigo conclui que ainda estamos longe de resolver esse quebra-cabeça, deixando muito espaço para futuros inventores construírem robôs que possam realmente navegar em um mundo ruidoso e de múltiplas tarefas.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →