← Últimos artigos
💻 computer science

GLAM: Training a latent world model over global spatiotemporal memory for active exploration and navigation

O artigo apresenta o GLAM, um modelo de mundo latente condicionado a objetivos treinado em memória espaço-temporal global que prevê representações de mapas futuros e pontos de passagem de navegação para permitir uma exploração ativa e navegação semântica aprimoradas, demonstrado pelo sistema GLAM NAV superando o baseline BSC-Nav em tarefas HM3D-ObjectNav.

Autores originais: I-Tak Ieong, Ruizhi Feng, Zhaoyang Lu, Yifei Cao, Jiayao Zhao, Leon Li, Senhua Zhu, Wenbo Ding

Publicado 2026-09-16
📖 7 min de leitura🧠 Leitura aprofundada

Autores originais: I-Tak Ieong, Ruizhi Feng, Zhaoyang Lu, Yifei Cao, Jiayao Zhao, Leon Li, Senhua Zhu, Wenbo Ding

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine um robô entrando em uma sala que nunca viu antes, encarregado de encontrar um objeto específico, como uma cadeira vermelha, que ele não consegue ver de onde está parado. Para ter sucesso, o robô não pode simplesmente reagir ao que está imediatamente à frente de sua câmera. Ele deve construir uma imagem mental do espaço conforme se move, lembrar-se de onde esteve e supor o que há ao contornar a próxima esquina. Esta habilidade de manter um mapa na memória, antecipar como esse mapa mudará conforme o robô avança e usar essa antecipação para planejar o próximo passo é o cerne do desafio da exploração ativa. Durante anos, pesquisadores tentaram ensinar essa habilidade às máquinas fazendo com que elas reconstruíssem o mundo em detalhes de alta definição, pixel por pixel, ou dependendo de mapas pré-fabricados. No entanto, uma nova abordagem sugere que um robô não precisa ver cada tijolo e sombra para navegar; ele só precisa entender a estrutura do espaço e o caminho provável para o seu objetivo.

Uma equipe de pesquisadores desenvolveu um sistema chamado GLAM, que significa goal-conditioned latent world model trained over global spatiotemporal memory (modelo de mundo latente condicionado ao objetivo treinado sobre memória espaço-temporal global). Em termos mais simples, este é um sistema de navegação que aprende a prever o layout futuro de uma sala e o melhor caminho para um destino sem precisar recriar o mundo visual em detalhes perfeitos. Em vez de tentar gerar um novo quadro de vídeo do que a sala parecerá no próximo segundo, o sistema prevê uma representação comprimida e abstrata do mapa e um plano oculto de para onde ir a seguir. Esta abordagem é inspirada pela forma como os cérebros biológicos, particularmente o hipocampo, organizam memórias espaciais e as utilizam para simular cenários futuros. Os pesquisadores construíram um sistema de navegação completo em torno deste modelo, chamado GLAM NAV, que combina mapeamento online, recuperação de memória e planejamento preditivo em um único ciclo.

O sistema funciona atualizando constantemente uma memória digital esparsa do ambiente conforme o robô se move. Esta memória não é uma fotografia 3D completa, mas uma coleção de marcos principais e relações espaciais. Quando o robô precisa encontrar um alvo, ele usa sua posição atual e a memória do que já viu para fazer uma pergunta simples: "Se eu me mover nesta direção, como o mapa parecerá e estarei mais perto do meu objetivo?". O modelo GLAM responde a isso prevendo duas coisas simultaneamente. Primeiro, ele prevê como os tokens do mapa — os blocos de construção abstratos de sua memória — evoluirão conforme o robô explora. Segundo, ele prevê um waypoint latente, que é uma representação oculta do próximo passo que o robô deve dar. Essas previsões acontecem em um espaço compartilhado, o que significa que o modelo aprende a vincular o mapa em mudança diretamente ao movimento necessário, tudo isso sem nunca tentar reconstruir as imagens visuais brutas do futuro.

Para treinar este sistema, os pesquisadores não enviaram robôs ao mundo real para cometer erros. Em vez disso, utilizaram um simulador de alta fidelidade chamado Habitat, que contém centenas de varreduras 3D detalhadas de ambientes internos reais, como apartamentos e escritórios. Eles reproduziram trajetórias de especialistas — caminhos percorridos por um agente controlado por computador que conhecia exatamente onde os objetos estavam — e dividiram esses caminhos em milhares de amostras de treinamento. O modelo aprendeu a observar um histórico de tokens de mapa e um objetivo, e então prever o mapa futuro e o próximo waypoint. Crucialmente, o sistema foi ensinado a ignorar a tarefa de recriar o mundo visual. Ele focou inteiramente em prever a estrutura do espaço e o plano para navegar nele. Antes de treinar o modelo principal, os pesquisadores também pré-treinaram um componente separado para entender como traduzir esses planos de waypoints ocultos em movimentos físicos reais, garantindo que as previsões pudessem ser transformadas em comandos reais.

Ao serem testados no simulador, os resultados mostraram que esta abordagem preditiva funcionou melhor do que métodos anteriores que dependiam de diferentes tipos de estruturas de memória. Em um conjunto específico de cinquenta por cento das cenas de teste, o novo sistema, GLAM NAV, encontrou o objeto alvo com sucesso em 86,89 por cento das tentativas, uma melhoria significativa em relação à taxa de sucesso de 78,50 por cento do sistema de base com o qual foi comparado. Ele também conseguiu atingir o alvo de forma mais eficiente, com uma métrica chamada Sucesso ponderado pelo Comprimento do Caminho (Success weighted by Path Length) subindo de 47,70 por cento para 48,35 por cento. Esses números sugerem que, ao prever a estrutura do mapa e o caminho juntos, o robô tornou-se mais confiável para encontrar seu caminho, mesmo quando o alvo estava inicialmente fora de vista. O sistema não apenas memorizou uma rota; ele aprendeu a antecipar o layout do ambiente e ajustar seu plano com base nessa antecipação.

Para provar que isso não era meramente um resultado do simulador, os pesquisadores implantaram o sistema em um robô físico, um humanoide com rodas e braços duplos, em um ambiente de escritório real. No primeiro teste no mundo real, o robô foi encarregado de encontrar uma planta decorativa em uma sala que nunca tinha visto, sem nenhum mapa pré-construído fornecido. Conforme se movia, ele construía sua própria memória do espaço, conectando novas observações visuais ao seu mapa crescente. Ele navegou com sucesso até a planta, demonstrando que o sistema pode construir uma memória espacial útil do zero em um cenário físico real. Em um segundo teste, o robô foi solicitado a recordar onde havia visto a planta após o objeto ter saído de vista. O sistema recuperou a localização armazenada em sua memória e navegou com sucesso de volta àquele ponto. Essas demonstrações confirmaram que as previsões abstratas feitas pelo modelo podem guiar um robô real através de um ambiente real, usando a memória para preencher a lacuna entre o que é visto e o que é necessário.

Apesar desses sucessos, os pesquisadores fazem questão de notar os limites de seu trabalho. O sistema aprende com os caminhos percorridos por agentes especialistas no simulador, portanto, é mais eficaz quando o comportamento do robô permanece dentro dos padrões vistos durante o treinamento. Não é um simulador geral que pode prever o resultado de qualquer ação aleatória; em vez disso, é uma ferramenta direcionada a objetivos que estima o mapa e o caminho mais prováveis para um objetivo específico. O modelo também produz uma previsão única e definitiva em vez de uma gama de possibilidades, o que significa que não calcula explicitamente a incerteza de seus palpites. Se o robô encontrar um layout muito diferente do que aprendeu, ou se seus sensores derivarem e perderem o rastro de sua posição, o sistema poderá enfrentar dificuldades. Os pesquisadores enfatizam que o robô ainda depende de observações em tempo real para verificar sua localização e evitar colisões, usando as previsões apenas para guiar sua busca.

O trabalho representa uma mudança na forma como pensamos sobre a navegação de robôs. Em vez de tentar construir uma réplica perfeita e de alta resolução do mundo dentro de um computador, o sistema aprende a trabalhar com uma versão funcional e abstrata do mapa que é suficiente para o planejamento. Ao tratar a previsão do mapa futuro e o planejamento do próximo movimento como uma única tarefa conectada, os pesquisadores criaram um sistema que é tanto mais confiável na busca de alvos quanto capaz de operar em ambientes do mundo real. As descobertas sugerem que, para um robô explorar de forma eficaz, ele não precisa ver tudo; ele precisa entender a estrutura do espaço bem o suficiente para imaginar o que vem a seguir.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →