← Últimos artigos
🤖 machine learning

Open-ended Multi-agent Autocurricula via Visual Inspection of Policies with Multi-modal LLMs

Este artigo apresenta o Visual Inspection of Policies (VIP), um novo framework de aprendizado por reforço multiagente de código aberto que utiliza um Modelo de Linguagem de Vídeo para analisar vídeos de políticas e gerar currículos eficazes, superando tanto os métodos baseados em texto quanto os baseados em pontuação escalar no StarCraft Multi-Agent Challenge.

Autores originais: Lorenzo Pantè, Andrea Fanti, Roberto Capobianco

Publicado 2026-07-10
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Lorenzo Pantè, Andrea Fanti, Roberto Capobianco

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando ensinar um esquadrão de personagens de videogame a vencer uma batalha caótica em StarCraft. No passado, os treinadores (os algoritmos) tinham que adivinhar o que ensinar a seguir baseando-se em um boletim simples: "Eles venceram? Sim ou Não". Se eles perdesam, o treinador assumia que a tarefa era difícil demais. Se eles vencessem, o treinador assumia que eles estavam prontos para o próximo nível.

Mas aqui está o problema: às vezes, uma equipe perde uma batalha mesmo tendo jogado quase perfeitamente. Talvez eles tivessem uma vantagem enorme em números, mas uma de suas unidades entrou em pânico e fugiu, causando uma reação em cadeia que perdeu o jogo. Um treinador olhando apenas para o boletim de "Vitória/Derrota" pensaria: "Oh, eles são terríveis neste mapa", e poderia mudá-los para um mapa mais fácil e entediante. Ele perderia o fato de que a equipe estava tão perto de uma estratégia de avanço.

É aqui que entra o novo método, chamado Visual Inspection of Policies (VIP) [Inspeção Visual de Políticas]. Em vez de apenas ler um boletim de notas, o VIP contrata um treinador de IA superinteligente que pode realmente assistir ao vídeo do jogo.

A Analogia do "Treinador de Esportes"

Pense na forma antiga como um treinador que lê apenas uma manchete de jornal: "Equipe Perdeu". O treinador não tem ideia do porquê eles perderam. Eles jogaram mal? O árbitro cometeu um erro? O clima estava ruim?

O VIP é como um treinador que se senta com a equipe e assiste à gravação do jogo. O treinador vê o vídeo e diz: "Ei, olhe isso! Embora tenham perdido, a equipe estava usando uma estratégia brilhante na primeira metade. Eles apenas ficaram nervosos no final. Vamos continuar praticando este mapa específico para que possam aprender a manter a calma".

Ao assistir ao vídeo, o treinador do VIP detecta os momentos "promissores" que um simples boletim de notas ignora. Ele vê que os agentes estão aprendendo, mesmo que o placar diga que eles perderam.

Como Funciona (A Receita Mágica)

Os pesquisadores testaram essa ideia no StarCraft Multi-Agent Challenge (SMAC), um jogo complexo onde equipes de tropas digitais lutam entre si. Aqui está a receita que eles usaram:

  1. O Jogo: Os agentes de IA jogam uma rodada de StarCraft.
  2. A Gravação: O sistema grava um vídeo da batalha (cerca de 1 a 10 segundos de duração).
  3. O Treinador: Este vídeo, junto com uma pequena nota de texto dizendo "Taxa de Vitória: 10%", é enviado para um Modelo de Linguagem de Vídeo (VLM). Pense neste VLM como um robô que pode ver o vídeo e entender a história da batalha.
  4. A Recomendação: O robô assiste ao vídeo e diz: "Vejo que eles estão melhorando no 'kiting' (fugir enquanto atiram), mas entram em pânico quando estão em menor número. Vamos mantê-los neste mapa, mas torná-lo ligeiramente mais difícil", ou "Vamos mudar para um novo mapa que desafie essa fraqueza específica".
  5. A Verificação: Como robôs às vezes inventam nomes de mapas falsos (alucinações), um módulo de "verificador ortográfico" (um módulo de similaridade de frases) dupla-checa a sugestão do robô para garantir que seja um mapa real que existe no jogo.

O Que Eles Descobriram (Os Resultados)

A equipe executou simulações para ver se este treinador de "assistir ao vídeo" era melhor do que os antigos treinadores de "apenas boletim de notas".

  • Os Treinadores de Boletim de Notas Falharam: Quando usaram métodos que olhavam apenas para números (como "Positive Value Loss" ou "Max Monte Carlo"), os agentes frequentemente ficavam travados. Nos mapas mais difíceis, esses agentes mal venciam partidas (taxas de vitória próximas de 0%). Eles eram constantemente enviados para as tarefas erradas porque os números não contavam a história toda.
  • O Treinador de Apenas Texto Foi Ok: Eles tentaram uma versão onde o robô lia apenas um resumo de texto do jogo (sem vídeo). Foi melhor que o boletim de notas, mas ainda assim teve dificuldades.
  • O Treinador VIP Venceu: Quando o robô podia assistir ao vídeo, os agentes aprendiam muito mais rápido.
    • Em um mapa difícil chamado 3s vs 4z, os agentes VIP alcançaram uma taxa de vitória de ~84% após o ajuste fino (fine-tuning).
    • Em 3s5z, eles atingiram ~76%.
    • Em contraste, a versão de texto (sem vídeo) ficou travada em 0% no mapa 3s vs 4z.

O artigo sugere que o vídeo foi o "ingrediente secreto". Ele permitiu que o sistema visse que os agentes estavam perto de uma estratégia vencedora, mesmo quando estavam perdendo a partida.

O Que Eles Descartaram

O artigo é muito claro sobre o que não funciona tão bem quanto o VIP:

  • Apenas olhar para números: Métodos que dependem apenas de pontuações escalares (como "quantos pontos eles fizeram?") são muito brutos. Eles perdem a nuance de como os agentes estão jogando.
  • Apenas ler texto: Resumir o jogo em palavras (sem mostrar o vídeo) não é suficiente. As pistas visuais de pânico, coordenação ou táticas inteligentes são perdidas em um resumo de texto.
  • Adivinhar o futuro: O artigo argumenta contra métodos que tentam prever o "potencial de aprendizado" de uma tarefa sem realmente ver o comportamento do agente.

O Quão Certos Eles Estão?

Os autores estão confiantes nesses resultados, mas são cuidadosos ao dizer que estas são simulações.

  • Eles executaram 5 testes independentes (seeds) para cada método para garantir que os resultados não fossem apenas sorte.
  • Eles usaram um cérebro robótico leve e de código aberto (VideoLLaMa2-7B) que ocupou apenas ~1% do tempo total do computador. Os outros 99% foram apenas o treinamento do jogo. Isso prova que a parte de assistir ao vídeo não atrasou o processo.
  • Eles compararam o VIP contra um método "supervisionado" que usou uma busca em grade massiva (tentando 1.700 configurações diferentes) para encontrar o professor perfeito. Embora o método de busca em grade (MAPPO*) tenha sido ligeiramente melhor em dois mapas, o VIP foi 100 vezes mais eficiente em termos de passos necessários para aprender. O VIP alcançou resultados semelhantes em um mapa (3s5z) com muito menos tentativas.

A Conclusão

O artigo sugere que, se você quer ensinar agentes de IA a ficarem realmente bons em jogos multiagentes complexos, você não deve olhar apenas para o placar. Você precisa assistir ao jogo. Ao permitir que um "treinador" de IA inspecione o vídeo do comportamento dos agentes, você pode criar um currículo (um caminho de aprendizado) que é perfeitamente adaptado ao que os agentes são realmente capazes de fazer, ajudando-os a descobrir estratégias vencedoras que de outra forma permaneceriam ocultas.

É a diferença entre um treinador que só conhece o resultado final e um treinador que assiste ao filme, vê o potencial e sabe exatamente qual exercício aplicar a seguir.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →