ZAYA1-8B Technical Report
O artigo apresenta o ZAYA1-8B, um modelo de raciocínio MoE altamente eficiente com 8 bilhões de parâmetros, totalmente treinado em infraestrutura AMD, que alcança desempenho de ponta em benchmarks de matemática e programação por meio de uma cascata especializada de quatro estágios de RL e do novo método de computação em tempo de teste Markoviano RSA, reduzindo efetivamente a lacuna em relação a modelos muito maiores.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
A Visão Geral: Um Cérebro Pequeno com Superpoder
Imagine que você tem um estudante minúsculo, mas incrivelmente inteligente, chamado ZAYA1-8B. Este estudante tem um cérebro com apenas 700 milhões de neurônios ativos (um tamanho muito pequeno para uma IA), mas faz parte de uma "escola" maior com 8 bilhões de neurônios no total.
Geralmente, para resolver problemas matemáticos difíceis ou escrever códigos complexos, você precisa de um cérebro gigante (como uma IA massiva com bilhões de parâmetros). O ZAYA1-8B é especial porque, apesar de ser pequeno, consegue resolver esses problemas difíceis tão bem quanto, ou até melhor do que, estudantes "gênios" muito maiores.
Como? Usando três armas secretas: uma nova forma de pensar, um campo de treinamento especial e um método único para verificar seu próprio trabalho.
1. A Arquitetura: Uma Equipe Especializada
A maioria dos modelos de IA é como uma única pessoa tentando fazer tudo sozinha. O ZAYA1-8B é construído como uma equipe especializada usando uma "Mistura de Especialistas" (MoE).
- A Equipe: Imagine uma sala de aula com 16 professores diferentes (especialistas). Quando uma pergunta chega, um "roteador" (o monitor da classe) decide qual professor é o mais adequado para respondê-la.
- O Novo Monitor (Roteador ZAYA1): Em modelos mais antigos, o monitor era um seguidor simples de regras. O ZAYA1-8B usa um monitor mais inteligente e multicamadas que toma melhores decisões sobre quem deve ensinar, garantindo que o especialista certo realize o trabalho a cada vez.
- A Biblioteca Comprimida (CCA): Para ler livros longos ou lembrar de histórias longas, o modelo usa um sistema de "biblioteca comprimida". Em vez de carregar cada página do livro em sua cabeça, ele armazena uma versão resumida e comprimida que economiza espaço e energia, mas mantém todos os detalhes importantes. Isso permite que ele lide com conversas muito longas sem se cansar.
2. O Treinamento: Aprendendo a Pensar Antes de Falar
O artigo descreve um processo de treinamento único projetado para transformar este estudante em uma máquina de raciocínio.
- O "Corte Preservador de Resposta": Professores frequentemente têm explicações longas e detalhadas (rastros de raciocínio) que são muito longas para caber em uma única página de um livro didático. Em vez de cortar o meio da história (o que arruinaria a lógica), o ZAYA1-8B usa um truque especial: ele corta o final da explicação, mas mantém a resposta final. Isso ensina ao modelo como planejar e pensar, mesmo que o processo de pensamento completo seja longo demais para caber de uma só vez.
- O Campo de Treinamento de Quatro Estágios: Após aprender o básico, o modelo passou por um rigoroso campo de treinamento de "Aprendizado por Reforço" (RL):
- Aquecimento: Resolver quebra-cabeças e problemas matemáticos fáceis para se acostumar a pensar com dificuldade.
- A Academia: Um ambiente personalizado com 400 geradores de quebra-cabeças diferentes que ficam mais difíceis conforme o modelo melhora.
- O Evento Principal: Enfrentar desafios reais de matemática e codificação, incluindo uma fase especial de "Cálculo no Tempo de Teste" (TTC), onde ele aprende a gerar múltiplas respostas possíveis e escolher a melhor.
- Polimento: Um estágio final para aprender a conversar educadamente e seguir instruções, como um bom assistente.
3. O Segredo: "RSA Markoviana" (O Pensamento de Grupo)
Esta é a parte mais inovadora do artigo. Geralmente, quando uma IA resolve um problema difícil, ela tenta pensar na resposta em um único fluxo longo e contínuo. Se o fluxo ficar muito longo, a IA fica confusa.
O ZAYA1-8B usa um método chamado RSA Markoviana. Pense nisso como uma corrida de revezamento com um toque:
- A Corrida: Em vez de um corredor tentar correr a maratona inteira, o modelo envia 16 corredores (candidatos) ao mesmo tempo.
- A Troca: Cada corredor corre uma distância curta e segura (uma "cauda" de 4.000 palavras). Eles não carregam toda a história da corrida; apenas passam seus últimos poucos passos (a cauda) para a próxima rodada.
- A Agregação: Um "treinador" olha para os últimos passos de todos os 16 corredores, combina as melhores ideias e as envia para outra rodada.
- O Resultado: Ao dividir o processo de pensamento em pequenos pedaços gerenciáveis e fazer a equipe votar no melhor caminho, o ZAYA1-8B consegue resolver problemas matemáticos incrivelmente difíceis (como as competições AIME e HMMT) que geralmente exigem cérebros muito maiores.
A Analogia: Imagine tentar resolver um quebra-cabeça gigante.
- Jeito Antigo: Uma pessoa tenta segurar todo o quebra-cabeça em sua cabeça de uma vez. Ela fica sobrecarregada.
- Jeito ZAYA1-8B: Você envia 16 pessoas para trabalhar em pequenas seções. Elas passam apenas algumas peças de sua seção para o próximo grupo. O grupo combina essas pequenas peças para construir a imagem completa. É mais rápido, usa menos memória e obtém um resultado melhor.
4. O Hardware: Construído na AMD
Todo o modelo foi treinado usando chips de computador AMD (especificamente as GPUs MI300X). Isso é um grande feito porque prova que você não precisa dos chips mais caros e proprietários para treinar modelos de raciocínio de nível superior. A equipe mostrou que, com a configuração correta de software e hardware, os chips AMD podem lidar com o trabalho pesado de treinar uma IA complexa.
5. Os Resultados: Pequeno, mas Poderoso
O artigo afirma que, com essa configuração:
- O ZAYA1-8B (com apenas 0,7 bilhão de parâmetros ativos) supera ou iguala o DeepSeek-R1 (que tem 37 bilhões de parâmetros ativos) em testes de matemática e codificação.
- Ao usar o método de pensamento de grupo "RSA Markoviana", ele obtém pontuações em competições matemáticas difíceis muito próximas de modelos massivos e caros como o Gemini-2.5 Pro e o GPT-5-High.
Resumo
O ZAYA1-8B é uma IA pequena e eficiente que prova que você não precisa de um cérebro gigante para ser um gênio. Ao usar uma estrutura de equipe inteligente, um método de treinamento especial que mantém as respostas seguras e uma estratégia de "corrida de revezamento em grupo" para pensar, ele consegue resolver os problemas mais difíceis de matemática e codificação enquanto usa uma fração da potência de computação de seus concorrentes maiores.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.