← Últimos artigos
🤖 machine learning

Superhuman AI for Generals.io Using Self-Play Reinforcement Learning

Este artigo apresenta um agente de IA sobre-humano para o jogo de estratégia em tempo real Generals.io que alcança o 1º lugar no ranking público ao alavancar um simulador nativo em JAX com uma aceleração de 10.000x para permitir o treinamento end-to-end eficiente de uma política de vision transformer via aprendizado por reforço por auto-jogo.

Autores originais: Matej Straka, Viliam Lisý, Martin Schmid

Publicado 2026-06-23
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Matej Straka, Viliam Lisý, Martin Schmid

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine um campo de batalha digital chamado Generals.io. É um jogo de estratégia em tempo real onde dois comandantes (ou equipes) comandam exércitos em uma grade. Eles não conseguem ver todo o mapa de uma vez; eles só veem a terra que possuem e a área imediata ao redor de suas tropas. O resto está escondido em uma "névoa de guerra". O objetivo é simples: capturar o quartel-general inimigo (o General) enquanto protege o seu próprio.

Este artigo descreve como uma equipe de pesquisadores construiu uma IA que é tão boa neste jogo que venceu os melhores jogadores humanos do mundo. Aqui está a história de como eles fizeram isso, dividida em conceitos simples.

1. O Simulador de "Supervelocidade"

Antes de poderem treinar a IA, eles precisavam de uma maneira de praticar. No passado, treinar uma IA neste jogo era como tentar aprender a dirigir assistindo a um carro se mover um centímetro por hora. Era muito lento.

Os pesquisadores construíram um novo "simulador" (uma versão digital do jogo) usando uma ferramenta especial chamada JAX. Pense nisso como atualizar de uma bicicleta para um jato supersônico.

  • O Jeito Antigo: A versão anterior conseguia executar cerca de 3.500 passos de jogo por segundo em um computador padrão.
  • O Jeito Novo: A nova versão executa 50 milhões de passos por segundo em uma única placa de vídeo.
  • O Resultado: Este é um aumento de velocidade de 10.000x. Isso significa que a IA pode jogar milhões de partidas no tempo que um humano leva para jogar uma. Essa velocidade removeu o maior gargalo: a IA finalmente podia aprender rápido o suficiente para ficar realmente boa.

2. O Campo de Treinamento de "Auto-Jogo" (Self-Play)

Em vez de ensinar a IA mostrando vídeos de especialistas humanos (o que é como ensinar um jogador de xadrez apenas mostrando jogos de grandes mestres), eles deixaram a IA jogar contra si mesma.

  • O Método: A IA joga milhões de partidas contra cópias de si mesma.
  • A Recompensa: O jogo é muito simples: ou você vence (+1 ponto) ou você perde (-1 ponto). Não existem "troféus de participação" ou pontos por matar alguns soldados inimigos. Você só recebe uma recompensa se capturar o General inimigo.
  • O Desafio: Como a recompensa é muito rara (você só a recebe no final de um longo jogo), é difícil para a IA entender o que ela fez corretamente. É como tentar aprender a fazer um bolo provando apenas o produto final, sem nenhum feedback sobre se você adicionou açúcar demais ou farinha de menos.

3. O Ingrediente Secreto: O Que Realmente Funcionou

Os pesquisadores testaram muitas "receitas" diferentes para ver o que tornava a IA sobre-humana. Eles descobriram que algumas coisas que as pessoas pensavam serem necessárias eram na verdade inúteis, enquanto alguns truques simples fizeram toda a diferença.

  • Não são Necessários "Guias de Trapaça": Eles não precisaram dar à IA regras complexas ou recompensas ajustadas manualmente por fazer coisas "boas" (como capturar um castelo). Apenas o sinal simples de "Vencer ou Perder" foi o suficiente, graças ao simulador super-rápido.
  • O Estudante "Médio" (EMA): Em muitos sistemas de IA, você usa a versão mais recente da IA que terminou o treinamento. Os pesquisadores descobriram que usar uma Média Móvel Exponencial (EMA) do céreio da IA ao longo do tempo funcionava melhor.
    • Analogia: Imagine um estudante fazendo uma prova todos os dias. A "última iteração" é apenas a nota dele no último dia. O "EMA" é como tirar a média do desempenho dele ao longo de todo o mês. Os pesquisadores descobriram que o "estudante médio" era, na verdade, mais consistente e inteligente do que o estudante no seu melhor (ou pior) dia isolado.
  • Filtragem dos Jogos "Bons" (Top-Advantage Filtering): A IA jogou milhões de partidas, mas a maioria era entediante ou aleatória. Os pesquisadores perceberam que não precisavam aprender com todas as partidas. Eles mantiveram apenas os 25% superiores de partidas onde a IA tinha uma vantagem clara e aprenderam com essas.
    • Analogia: Se você está tentando aprender a nadar, não precisa assistir a todas as vezes que você se debate na água. Você só precisa estudar as vezes em que nadou de forma suave e eficiente. Isso tornou o treinamento muito mais rápido e eficiente.
  • Começando Pequeno: Eles não começaram a IA em um mapa enorme. Eles começaram com os Generais muito próximos uns dos outros para que a IA pudesse aprender a vencer rapidamente. Depois, eles afastaram lentamente os Generais, deixando a IA aprender a estratégia de longo prazo passo a passo.

4. Os Resultados: Vencendo os Humanos

Após treinar por quatro dias em computadores poderosos, a IA (apelidada de "Average Joe") foi para o ranking público.

  • Classificação: Ela alcançou o #1 entre mais de 5.000 jogadores humanos.
  • A Diferença: Ela venceu o segundo colocado humano por uma margem enorme. Na verdade, a diferença entre a IA e o segundo colocado humano era do mesmo tamanho que a diferença entre o segundo colocado humano e o 25º lugar humano.
  • Confronto Direto: Quando jogaram diretamente contra os dois melhores jogadores humanos, a IA venceu 199 partidas e perdeu apenas 70.
  • Contra os Bots Antigos: Ela também esmagou a melhor IA anterior e o melhor bot "baseado em regras" (que usa fórmulas matemáticas em vez de aprendizado) com uma taxa de vitória perfeita de 100%.

5. O Que a IA "Viu"

Os pesquisadores olharam dentro do cérebro da IA para ver se ela estava pensando como um humano.

  • O Detector de "Névoa": Eles encontraram uma parte específica do cérebro da IA que parecia rastrear onde o General inimigo estava escondido.
  • A Analogia: Imagine que você está jogando esconde-esconde no escuro. No começo, você acha que a pessoa pode estar em qualquer lugar. Conforme você ouve um ruído ou vê uma sombra, você estreita as possibilidades para alguns pontos. Finalmente, você a localiza. O cérebro da IA fez exatamente isso: começou com um palpite, estreitou as opções conforme reunia pistas e, finalmente, "travou" na localização do General inimigo, mesmo sem conseguir vê-lo diretamente.

Resumo

O artigo prova que você não precisa de regras complexas criadas à mão ou de quantidades massivas de dados humanos para criar uma IA sobre-humana para jogos de estratégia. Se você tiver um simulador rápido o suficiente e uma recompensa simples de "Vencer ou Perder", um algoritmo de aprendizado padrão pode descobrir o resto por conta própria. Os ingredientes principais foram velocidade, paciência (média dos resultados) e foco apenas nos jogos mais informativos.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →