← Últimos artigos
💻 computer science

Mahjax: A GPU-Accelerated Mahjong Simulator for Reinforcement Learning in JAX

Este artigo apresenta o Mahjax, um ambiente de Mahjong Riichi totalmente vetorizado e acelerado por GPU, construído em JAX, que permite aprendizado por reforço em grande escala com taxas de processamento de até 2 milhões de passos por segundo, facilitando o treinamento de agentes a partir do zero sem dependência de registros de jogos humanos.

Autores originais: Soichiro Nishimori, Shinri Okano, Keigo Habara, Sotetsu Koyamada, Eason Yu, Masashi Sugiyama

Publicado 2026-05-21
📖 4 min de leitura☕ Leitura rápida

Autores originais: Soichiro Nishimori, Shinri Okano, Keigo Habara, Sotetsu Koyamada, Eason Yu, Masashi Sugiyama

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você quer ensinar um computador a jogar Mahjong, um jogo complexo de fichas onde a sorte desempenha um papel enorme e você não pode ver as cartas de todos. Para ficar realmente bom nisso, o computador precisa praticar milhões de vezes, tentando diferentes jogadas e aprendendo com seus erros. Isso é chamado de "Aprendizado por Reforço".

O problema é que o Mahjong é como um cruzamento de trânsito massivo e caótico. Se você tentar simulá-lo em um processador de computador padrão (o "cérebro" de um computador normal), ele se move muito devagar. É como tentar limpar esse cruzamento de trânsito um carro de cada vez. Até o computador aprender algo, levaria anos.

Aí entra o Mahjax.

Os autores deste artigo construíram um novo simulador super-rápido chamado Mahjax. Pense nele como uma atualização de uma estrada de uma única faixa para uma superestrada massiva de 100 faixas que roda em uma Unidade de Processamento Gráfico (GPU)—o mesmo tipo de chip poderoso encontrado em computadores de videogames de alta performance.

Aqui está a explicação do que eles fizeram e por que isso importa, usando analogias simples:

1. A Analogia da "Fábrica" (Vetorização)

Os simuladores antigos eram como um único trabalhador montando um brinquedo de cada vez. Se você quisesse treinar uma IA, tinha que esperar aquele único trabalhador terminar antes de começar o próximo.

O Mahjax é como uma fábrica massiva com milhares de braços robóticos trabalhando em perfeita sincronia. Como foi construído usando uma ferramenta chamada JAX, ele pode executar milhares de jogos de Mahjong simultaneamente em uma única GPU. Em vez de jogar um jogo, ele joga 1.000 jogos exatamente ao mesmo tempo, depois 10.000, depois 100.000. Isso é chamado de "vetorização".

2. O Recorde de Velocidade

O artigo testou essa nova "fábrica" em oito poderosas GPUs NVIDIA A100 (que são como ter oito supercomputadores trabalhando juntos).

  • O Resultado: O Mahjax pode simular 2 milhões de etapas de jogo por segundo (para uma versão mais simples das regras) e 1 milhão de etapas por segundo (para a versão padrão com fichas "vermelhas").
  • A Comparação: Isso é mais de 10 vezes mais rápido do que os melhores simuladores anteriores que rodavam em CPUs padrão. É a diferença entre um caracol rastejando e um trem-bala zumbindo.

3. Aprendendo do Zero (Tabula Rasa)

Muitas IAs atuais de Mahjong são como alunos que só aprendem memorizando livros didáticos escritos por especialistas humanos (usando "Aprendizado Supervisionado"). Elas olham para registros de como os humanos jogaram e tentam copiá-los.

Os autores querem ver se uma IA pode aprender do zero (como um bebê aprendendo a andar), sem olhar para registros humanos primeiro. Este é o estilo de aprendizado "AlphaZero". Para fazer isso, a IA precisa jogar bilhões de jogos muito rapidamente para descobrir as melhores jogadas por conta própria. O Mahjax fornece a velocidade necessária para tornar esse "aprendizado do zero" possível.

4. O "Depurador" (Visualização)

Aprender um novo jogo é difícil, e depurar um programa de computador que joga é ainda mais difícil. Os autores incluíram uma ferramenta especial que permite assistir ao jogo se desenrolar na tela, como uma transmissão de TV.

  • Ela traduz os complexos símbolos de fichas japoneses em palavras em inglês.
  • Ela ajuda os pesquisadores a ver exatamente o que a IA está fazendo, para que possam corrigir bugs ou entender por que a IA fez uma jogada estranha.

5. Funcionou?

A equipe testou o sistema treinando um agente de IA usando um algoritmo de aprendizado padrão (PPO).

  • Eles começaram a IA com uma estratégia básica de "imitador" (Clonagem Comportamental) para colocá-la em movimento.
  • Depois, deixaram-na jogar contra si mesma usando o novo simulador Mahjax.
  • O Resultado: A IA ficou significativamente melhor no jogo, melhorando seu ranking contra oponentes de referência. Isso prova que o Mahjax é estável e rápido o suficiente para realmente treinar agentes de IA de alto nível.

Resumo

Em resumo, o artigo apresenta o Mahjax, uma ferramenta que transforma o processo lento e de thread única de simular Mahjong em um processo de alta velocidade e paralelo. Ele atua como um motor massivo que permite aos pesquisadores treinar agentes de IA para dominar o Mahjong do zero, em vez de apenas copiar humanos, processando milhões de cenários de jogo no tempo que antes levava para processar alguns milhares.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →