← Últimos artigos
🤖 AI

Impartial Games: A Challenge for Reinforcement Learning

Este artigo demonstra que algoritmos de aprendizado por reforço no estilo AlphaZero falham em alcançar o domínio de nível especialista em jogos imparciais como Nim devido a um gargalo representacional fundamental no aprendizado de princípios matemáticos abstratos, revelando que o simples ajuste de hiperparâmetros não pode superar sua incapacidade de generalizar além de estados memorizados.

Autores originais: Bei Zhou, Søren Riis

Publicado 2026-09-09
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Bei Zhou, Søren Riis

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

No mundo da inteligência artificial, um tipo específico de programa de computador tornou-se recentemente famoso por sua habilidade de dominar jogos de estratégia complexos. Ao jogar milhões de partidas contra si mesmo, esses programas aprendem a fazer jogadas que frequentemente surpreendem até os maiores especialistas humanos. Eles se tornaram campeões em jogos como xadrez e Go, onde o sucesso depende de reconhecer padrões, avaliar posições e planejar muitos passos à frente. A ideia subjacente é que, se uma máquina pode aprender a vencer ao compreender o fluxo de um jogo, ela poderá eventualmente aprender a resolver qualquer problema complexo. No entanto, esse sucesso criou uma falsa sensação de segurança. Acontece que a maneira como essas máquinas aprendem não é universal. Existe uma classe específica de jogos onde as regras são simples, as peças são compartilhadas por ambos os jogadores e a estratégia vencedora depende de uma lógica matemática oculta, em vez de reconhecimento de padrões. Nesses jogos, os sistemas de inteligência artificial mais avançados encontram um muro, falhando em aprender os próprios princípios que tornam o jogo solucionável para os humanos.

Pesquisadores do Imperial College London e da Queen Mary University of London decidiram investigar esse ponto cego usando um jogo chamado Nim. Nim é um jogo jogado com várias pilhas de objetos, onde dois jogadores alternam turnos removendo qualquer número de objetos de uma única pilha. O objetivo é ser aquele que retira o último objeto. Embora o jogo pareça simples, o segredo para vencer é um cálculo matemático específico envolvendo os números binários dos tamanhos das pilhas. Para um humano, aprender essa regra é uma questão de entender um único conceito abstrato. Para a inteligência artificial, o desafio é diferente. Os pesquisadores queriam ver se os mesmos algoritmos de aprendizado que conquistaram o xadrez poderiam aprender a vencer no Nim e, se não, o porquê. Eles construíram uma versão personalizada do famoso sistema de aprendizado AlphaZero e o treinaram para jogar Nim em tabuleiros de tamanhos crescentes, observando de perto como a compreensão do computador evoluía.

Os resultados foram nítidos e reveladores. Quando os pesquisadores testaram o sistema em um pequeno tabuleiro de Nim com cinco pilhas, o computador aprendeu a jogar bem. Ele conseguia vencer consistentemente, agindo como um campeão que sabe como iniciar um jogo e conduzi-lo em direção à vitória. No entanto, assim que o tamanho do tabuleiro aumentava para seis ou sete pilhas, o desempenho do sistema colapsava. O computador parava de aprender a vencer. Em vez de encontrar as jogadas corretas, ele começou a adivinhar, performando não melhor do que se tivesse escolhido jogadas aleatórias. Os pesquisadores descobriram que o problema não era a complexidade do jogo ou a necessidade de mais tempo de treinamento para o computador. A questão era fundamental à forma como o cérebro do computador, um tipo de rede neural, processa informações. Essas redes são excelentes em detectar conexões entre coisas, como reconhecer que um certo arranjo de peças de xadrez geralmente leva à vitória. Mas elas têm imensa dificuldade com um tipo específico de lógica chamada paridade, que é essencialmente uma forma de contar se um número é par ou ímpar em um grupo de itens. No Nim, a jogada vencedora depende inteiramente desse tipo de lógica de contagem.

Para entender por que isso importa, os pesquisadores introduziram uma nova maneira de medir a habilidade de uma inteligência artificial. Eles distinguiram entre um "campeão" e um "especialista". Um campeão é um jogador que pode vencer a partir da posição inicial, guiando o jogo para um território familiar onde ele sabe o que fazer. Um especialista, no entanto, consegue fazer a jogada perfeita de qualquer posição no tabuleiro, mesmo aquelas que nunca viu antes. O estudo mostrou que a inteligência artificial podia se tornar uma campeã em tabuleiros pequenos, memorizando as jogadas de abertura corretas. Mas ela falhou em se tornar uma especialista. Quando o jogo avançava para as fases intermediárias ou finais, ou quando o tabuleiro era maior, o computador não conseguia determinar a jogada correta. Seu guia interno, que deveria dizer quais jogadas são boas, ficava confuso. Ele atribuía uma alta probabilidade a uma jogada perdedora e ignorava a vencedora. Mesmo quando o computador realizava milhões de simulações para verificar suas escolhas, não conseguia corrigir seu erro inicial porque seu palpite inicial estava muito longe do correto.

Os pesquisadores testaram se essa falha era devida ao método de aprendizado em si ou à dificuldade da lógica do jogo. Eles criaram uma versão do jogo onde os dois jogadores controlavam pilhas diferentes e não precisavam usar a lógica de paridade para vencer. Nesse jogo modificado, a mesma inteligência artificial aprendeu rápida e facilmente, provando que o sistema de aprendizado era capaz. Isso confirmou que o problema não era o processo de treinamento, mas o tipo específico de matemática exigido pelo jogo original. O computador simplesmente não conseguia aprender a regra abstrata da paridade a partir dos dados que gerava ao jogar contra si mesmo. O ruído nos dados, causado pelos erros cometidos pelo computador durante sua fase inicial de aprendizado, tornava impossível para a rede decifrar o padrão subjacente.

Essa descoberta desafia a ideia de que a inteligência artificial atual pode resolver qualquer problema, desde que receba dados e poder computacional suficientes. Ela sugere que existem certos tipos de raciocínio lógico que esses sistemas não conseguem aprender sozinhos. Os pesquisadores propõem que, para realmente dominar jogos como o Nim, e talvez outros problemas complexos que dependem de matemática abstrata, a inteligência artificial futura precisará ser construída de forma diferente. Eles sugerem combinar o poder de reconhecimento de padrões dos sistemas atuais com um módulo separado de raciocínio simbólico que possa lidar com essas regras lógicas específicas. Até que tal mudança seja feita, esses poderosos sistemas de aprendizado continuarão sendo campeões em algumas áreas, mas permanecerão cegos para a lógica fundamental de outras, incapazes de atingir o nível de verdadeira expertise que um humano pode alcançar com um único insight.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →