← Últimos artigos
💬 NLP

Why Do LLM Agents Fail in Exploring New Environments? A World-Modeling Perspective

Este artigo identifica o "colapso da exploração" como um modo de falha fundamental onde agentes de LLM perdem a capacidade de descobrir novas soluções em ambientes desconhecidos durante o aprendizado por reforço, e propõe o SPA, um método que melhora o desempenho ao fundamentar primeiro o agente na previsão de estado e transição por meio de ajuste fino supervisionado de autoexperiência antes de otimizar para recompensa.

Autores originais: Shiqi Chen, Tongyao Zhu, Zian Wang, Jinghan Zhang, Kangrui Wang, Ruochen Zhou, Siyang Gao, Teng Xiao, Yee Whye Teh, Junxian He, Manling Li

Publicado 2026-09-10
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Shiqi Chen, Tongyao Zhu, Zian Wang, Jinghan Zhang, Kangrui Wang, Ruochen Zhou, Siyang Gao, Teng Xiao, Yee Whye Teh, Junxian He, Manling Li

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine um programa de computador projetado para pensar e agir como um humano, capaz de resolver quebra-cabeças, navegar em mundos virtuais ou até mesmo usar um navegador da web para encontrar informações. Esses programas, conhecidos como modelos de linguagem de grande escala, são treinados em vastas quantidades de texto da internet, aprendendo a prever qual palavra vem a seguir em uma frase. Quando pesquisadores pedem que esses modelos atuem como agentes — tomando medidas para atingir um objetivo — eles frequentemente utilizam um método chamado aprendizagem por reforço. Este é um processo onde o modelo tenta diferentes ações, recebe feedback sobre se teve sucesso ou falhou e, gradualmente, aprende a repetir as ações que levam ao sucesso. É uma maneira poderosa de ensinar uma máquina a fazer coisas para as quais não foi explicitamente programada. No entanto, um problema crítico surge quando esses agentes são colocados em situações novas e desconhecidas. Embora possam aprender a resolver um quebra-cabeça específico que já viram antes, eles frequentemente têm dificuldade em descobrir como explorar um ambiente completamente novo, ficando presos em uma forma de pensar estreita que os impede de encontrar a melhor solução.

Uma equipe de pesquisadores partiu para entender por que esses agentes inteligentes falham quando encontram o desconhecido. Eles descobriram um fenômeno específico que chamam de "colapso de exploração". Em termos simples, quando um agente é treinado em uma nova tarefa, ele frequentemente aprende a encontrar apenas um caminho específico para o sucesso e então ignora todas as outras possibilidades. Ele se torna tão focado nessa única rota que perde a capacidade de tentar diferentes abordagens. Os pesquisadores mediram isso observando duas pontuações diferentes: uma que rastreia se o seu melhor palpite funciona, e outra que rastreia se qualquer um de seus muitos palpites diferentes funciona. Em tarefas familiares, ambas as pontuações melhoram à medida que o agente aprende. Mas em ambientes novos e difíceis, como um quebra-cabeça baseado em grade onde caixas devem ser empurradas para alvos específicos, a pontuação para o único melhor palpite sobe ligeiramente, enquanto a pontuação para tentar muitos caminhos diferentes na verdade cai. O agente está aprendendo a ter mais confiança em um mau hábito em vez de aprender a ser mais flexível. Isso acontece porque o agente não entende verdadeiramente as regras do novo mundo em que está; ele está adivinhando sem uma base sólida.

Para corrigir isso, os pesquisadores desenvolveram um novo método de treinamento chamado SPA, que significa Agente de Experiência Própria (Self-Experience Agent). Em vez de imediatamente tentar ensinar o agente como obter recompensas, eles primeiro o ensinaram a entender o mundo ao seu redor. Eles deram ao agente a chance de explorar o ambiente por conta própria, sem a pressão de marcar pontos. Durante esta fase, o agente era solicitado a descrever o que via e a prever o que aconteceria a seguir se realizasse uma certa ação. Por exemplo, se o agente visse uma caixa em um lugar específico e decidisse empurrá-la, ele teria que primeiro declarar onde a caixa estava e depois prever onde ela terminaria. Os pesquisadores então usaram os resultados reais e corretos do ambiente para corrigir as previsões do agente, efetivamente ensinando as leis da física para aquele jogo específico. Esse processo criou uma espécie de mapa interno ou "modelo de mundo" dentro da mente do agente, fundamentando sua compreensão na realidade, em vez de em palpites vagos.

Uma vez que o agente construiu esse entendimento interno de como o mundo funciona, os pesquisadores iniciaram o processo de treinamento padrão para ensinar como vencer. Os resultados foram impressionantes. Em testes em um jogo de quebra-cabeça chamado Sokoban, onde o agente tinha que empurrar caixas para alvos, o método de treinamento padrão permitiu que o agente tivesse sucesso apenas cerca de 25 por cento das vezes. Com o novo método, a taxa de sucesso saltou para quase 60 por cento. Em outro quebra-cabeça envolvendo um lago congelado, a taxa de sucesso melhorou de cerca de 22 por cento para mais de 70 por cento. Talvez o mais surpreendente seja que um modelo de computador muito pequeno, treinado com este método, foi capaz de superar um modelo muito maior e mais poderoso que havia sido treinado usando os métodos antigos e padrão. O modelo pequeno, tendo aprendido as regras do jogo primeiro, foi capaz de navegar pelos quebra-cabeças complexos de forma mais eficaz do que o modelo gigante que apenas tentava adivinhar o caminho para uma recompensa.

Os pesquisadores também testaram se essa abordagem funcionava em outros tipos de tarefas, como um quebra-cabeça de lógica chamado Sudoku e um ambiente simulado para tarefas domésticas. Em todos os casos, o método que ensinou o agente a entender o estado do mundo antes de tentar vencer levou a melhores resultados. Eles descobriram que a chave para o sucesso não era apenas ter mais dados ou um computador maior, mas sim a ordem em que o aprendizado acontecia. Ao forçar o agente a aprender a estrutura do ambiente primeiro, eles evitaram a armadilha de colapsar em uma estratégia única e frágil. O agente aprendeu a manter suas opções abertas, explorando múltiplos caminhos porque entendia as consequências de suas ações. Essa abordagem sugere que, para a inteligência artificial realmente se adaptar a situações novas e complexas, ela precisa construir um entendimento confiável da realidade antes de tentar otimizar o sucesso. O estudo mostra que, quando um agente está fundamentado nas mecânicas reais de seu ambiente, ele pode aprender a explorar de forma mais eficaz e resolver problemas que estavam anteriormente fora de alcance.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →