← Últimos artigos
🤖 machine learning

GROW: Aligning GRPO with State-Action Modeling for Open-World VLM Agents

O artigo apresenta o GROW, um framework de aprendizado por reforço que adapta a Otimização de Política Relativa de Grupo (GRPO) para agentes de Modelo Visão-Linguagem em mundos abertos, decompondo trajetórias completas em amostras de estado-ação para superar limitações de comprimento de contexto, alcançando desempenho de última geração em mais de 800 tarefas do Minecraft.

Autores originais: Xiongbin Wu, Zhihao Luo, Shanzhe Lei, Lechao Zhang, Xuhong Wang, Jie Yang, Zhonglong Zheng, Yuanjie Zheng, Xin Tan, Wei Liu

Publicado 2026-05-21
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Xiongbin Wu, Zhihao Luo, Shanzhe Lei, Lechao Zhang, Xuhong Wang, Jie Yang, Zhonglong Zheng, Yuanjie Zheng, Xin Tan, Wei Liu

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está ensinando um robô a jogar um videogame complexo como Minecraft. O robô possui uma câmera (seus olhos) e pode digitar em um teclado e mover um mouse (suas mãos). Seu objetivo é completar tarefas como "construir uma casa", "minerar ouro" ou "derrotar um monstro".

Por muito tempo, a melhor maneira de ensinar esses robôs foi o Ajuste Fino Supervisionado (SFT). Pense nisso como mostrar ao robô um vídeo de um especialista humano jogando o jogo perfeitamente e dizendo: "Copie exatamente o que eles fizeram". O problema? Encontrar horas de jogabilidade humana perfeita é caro, e se o robô apenas memorizar o vídeo, ele fica confuso quando o jogo muda ligeiramente.

Então, pesquisadores tentaram Aprendizado por Reforço (RL), especificamente um algoritmo chamado GRPO. Isso é como deixar o robô jogar o jogo, falhar, ter sucesso e aprender com os resultados. No entanto, o GRPO padrão tinha uma falha grave quando aplicado a jogos de mundo aberto: ele tratava a sessão inteira do jogo como uma única lição.

O Problema: A Lição "Demasiado Longa"

Imagine que você está tentando aprender a assar um bolo.

  • O GRPO Padrão é como entregar a você um livro de 500 páginas que inclui a história da sua infância, a previsão do tempo de três dias atrás, a receita e a história do cachorro do seu vizinho, tudo misturado. Ele diz: "Você assou um bolo bom no final, então tudo neste livro de 500 páginas foi bom."
  • No artigo, isso é chamado de "trajetória completa". À medida que o robô joga Minecraft, o histórico do que ele viu e fez fica cada vez mais longo. Eventualmente, o "livro" torna-se tão enorme e cheio de ruído irrelevante (como andar por 10 minutos antes de encontrar um bloco) que o robô fica sobrecarregado e não consegue descobrir qual movimento específico realmente levou ao sucesso.

A Solução: GROW (A Abordagem do "Cartão de Receita")

Os autores propõem um novo framework chamado GROW (Alinhando GRPO com Modelagem Estado-Ação).

Em vez de dar ao robô todo o livro de 500 páginas, o GROW divide a sessão do jogo em pequenos cartões de receita fáceis de digerir.

  • Decomposição Estado-Ação: O GROW divide a longa sessão do jogo em momentos individuais: "Olhe para o bloco" + "Clique no mouse" + "Picareta acerta".
  • Feedback Inteligente: Se o robô tiver sucesso no final, o GROW não diz "Tudo no jogo inteiro foi ótimo". Em vez disso, ele olha para os cartões específicos que levaram à vitória. Ele diz: "O movimento que você fez 5 segundos antes de encontrar o ouro foi muito bom. O movimento que você fez 20 minutos atrás, quando apenas estava andando? Isso foi apenas aceitável."

Como Funciona (A Analogia)

Pense em um treinador treinando um jogador de futebol.

  • Método Antigo (GRPO Padrão): O treinador assiste a toda a partida de 90 minutos, vê o jogador marcar um gol e então grita: "Ótimo trabalho! Você fez tudo certo desde o primeiro minuto até o último!" O jogador fica confuso porque na verdade fez uma passada terrível no 10º minuto que quase fez perder o jogo.
  • Método GROW: O treinador divide o jogo. "Aquela passada no 10º minuto foi desleixada. Mas a corrida que você fez no 80º minuto? Perfeita. E o chute no 89º minuto? Brilhante." O jogador aprende exatamente quais ações específicas repetir.

A Matemática "Mágica"

O artigo inclui uma prova matemática (Análise de Substituto) para nos assegurar que essa abordagem de "cortar a lição" ainda é válida.

  • A Preocupação: A matemática padrão para esse tipo de aprendizado geralmente exige comparar diferentes tentativas no mesmo ponto de partida exato. O GROW compara diferentes momentos no tempo, que são todos diferentes.
  • O Resultado: Os autores provaram que, mesmo que os pontos de partida sejam diferentes, a "pontuação" que o robô recebe ainda reflete com precisão quão boa é sua estratégia. É como avaliar um aluno em uma prova de matemática: mesmo que as perguntas sejam diferentes, a pontuação final ainda diz se ele está ficando melhor em matemática.

Os Resultados: Vencendo o Jogo

A equipe testou o GROW em mais de 800 tarefas diferentes de Minecraft, variando de navegar por cavernas a criar itens e lutar contra monstros.

  • Taxa de Sucesso: O GROW superou significativamente os métodos anteriores. Por exemplo, em "tarefas de GUI" (usando os menus do jogo para criar itens), o sucesso saltou de cerca de 39% para 68%.
  • Eficiência: O robô não apenas venceu mais vezes; venceu mais rápido. Levou menos passos para completar tarefas porque aprendeu a ignorar o "ruído" e focar nos movimentos que realmente importavam.
  • Generalização: O robô não apenas memorizou os jogos específicos nos quais praticou. Ele aprendeu habilidades gerais (como como procurar um alvo ou como usar um menu) que permitiram que ele tivesse sucesso em novas tarefas não vistas que ele nunca tinha visto antes.

Em Resumo

O GROW é uma maneira mais inteligente de ensinar agentes de IA a jogar jogos de mundo aberto. Em vez de sobrecarregá-los com longas e bagunçadas histórias de suas sessões de jogo inteiras, ele divide o jogo em pequenos passos claros. Isso ajuda a IA a entender exatamente quais ações levam ao sucesso, permitindo que ela aprenda mais rápido, jogue melhor e lide com novos desafios sem ficar confusa.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →