← Últimos artigos
💬 NLP

The Evolution of Mixture-of-Experts Architectures in Large Language Models: Routing, Topology, Load Balancing, and Expert Parallelism

Este levantamento técnico sintetiza a evolução das arquiteturas de Mistura de Especialistas em Grandes Modelos de Linguagem ao organizá-las em um grafo de dependência e analisá-las por meio de quatro planos de controle (Topologia de Especialistas, Roteamento, Equilíbrio e Paralelismo de Especialistas) para ilustrar a mudança do campo de simplesmente ativar parâmetros esparsos em direção ao desacoplamento de roteamento semântico, orçamentos computacionais e execução física.

Autores originais: Jiguo Li

Publicado 2026-08-11
📖 10 min de leitura🧠 Leitura aprofundada

Autores originais: Jiguo Li

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine o cérebro de um computador superinteligente como uma biblioteca imensa e movimentada. Nos velhos tempos, para responder a uma única pergunta, o computador enviava um bibliotecário para ler cada um dos livros nas prateleiras, um por um, apenas para garantir. Isso era lento e desperdiçava muita energia. Então, os engenheiros inventaram uma maneira mais inteligente: uma "Mistura de Especialistas". Em vez de um único bibliotecário lendo tudo, eles contrataram milhares de especialistas. Quando surge uma pergunta sobre culinária, apenas o bibliotecário "Chef" abre seu livro; quando surge uma pergunta sobre o espaço, apenas o "Astrônomo" acorda. Esta é a ideia central da Mistura de Especialistas (Mixture-of-Experts - MoE) em Grandes Modelos de Linguagem (LLMs): ela permite que os modelos de IA cresçam incrivelmente grandes e inteligentes sem que cada cálculo seja feito para cada palavra que processam.

Mas aqui está a parte complicada: se você tem um milhão de especialistas, como decide quem recebe o trabalho? Se você enviar todas as perguntas de "Espaço" para o Astrônomo, ele ficará sobrecarregado e atrasará tudo, enquanto o "Chef" ficará ocioso. Este é o problema do "roteamento". É como tentar gerenciar um grande concerto onde você precisa decidir instantaneamente qual músico toca qual nota, garantindo que ninguém fique sobrecarregado, ninguém fique entediado e a música flua perfeitamente. Se você errar o roteamento, todo o sistema trava.

Este artigo, escrito por Jiguo Li em agosto de 2026, é um mergulho profundo em como esses sistemas de "especialistas" evoluíram ao longo do tempo. Ele argumenta que a história do MoE não é apenas uma lista de modelos mais novos e maiores lançados ano após ano. Em vez disso, é uma história de resolução de um gargalo de tráfego específico após o outro. O autor sugere que o campo passou por oito grandes "marcos", mudando de truques estatísticos simples para sistemas dinâmicos complexos onde o computador pode decidir não apenas quem ajuda, mas quão intensa deve ser a ajuda, e até mesmo onde essa ajuda reside fisicamente no hardware do computador. O artigo conclui que o futuro não é apenas adicionar mais especialistas, mas sim desembaraçar a lógica do "o que a IA pensa" da realidade física de "como o computador funciona", permitindo uma IA mais inteligente, rápida e eficiente que não fique presa no trânsito.

A História dos Oito Marcos

Pense na evolução do MoE como a história do sistema de transporte público de uma cidade. Começou com um único ônibus que parava em todos os lugares, passou para um sistema onde você podia chamar um táxi e acabou se tornando uma rede hiper eficiente de drones e metrôs auto-organizáveis. O artigo divide essa jornada em oito fases distintas, ou "marcos", onde cada passo resolveu um grande gargalo, mas criou um novo desafio.

1. A Divisão Estatística do Trabalho (O Velho Ônibus)
Nos primórdios, a ideia era simples: ter um "portão" que decide qual "especialista" (uma pequena parte do cérebro) deve lidar com uma tarefa. Mas, no início, todos ainda ajudavam um pouco. Era como ter um ônibus onde todos os passageiros tinham que se levantar e acenar para o motorista, mesmo que não fossem descer. Era uma divisão estatística do trabalho, mas não economizava energia. O computador ainda fazia todo o trabalho; apenas o fazia de uma forma ligeiramente mais inteligente.

2. O Interruptor "Top-K" (O Serviço de Táxi)
Então veio o grande avanço: Computação Condicional Esparsa. Imagine um interruptor que diz: "Apenas os 2 melhores especialistas podem trabalhar; os outros 98 podem ir para casa". Este é o roteamento Top-K. De repente, o computador podia ter uma biblioteca massiva de conhecimento (milhões de parâmetros), mas usar apenas uma pequena fatia dela para cada palavra. Este era o "alavancador de capacidade": você podia tornar o modelo mais inteligente sem torná-lo mais lento. Mas isso introduziu um novo problema: e se o "Chef" receber 1.000 pedidos e o "Astrônomo" nenhum? O sistema começou a ficar desequilibrado.

3. O Escalonamento de Clusters (A Rede de Metrô)
À medida que os modelos cresceram para caber em milhares de chips de computador (GPUs), o problema tornou-se mover os dados. Se o "Chef" vive no Chip A e o "Astrônomo" no Chip B, como você leva os ingredientes até lá? Esta era introduziu o Paralelismo de Especialistas e a comunicação All-to-All. É como construir uma rede de metrô massiva onde os tokens (as palavras) são os passageiros, e eles têm que pegar trens para chegar ao especialista certo. O desafio mudou de "quem faz a matemática" para "quão rápido podemos mover os dados sem que o trem fique preso".

4. A Era de Pesos Abertos (O Aplicativo de Transporte Público)
Depois, modelos como o Mixtral mostraram que este sistema complexo poderia realmente funcionar para pessoas comuns, não apenas para grandes laboratórios. Eles provaram que você poderia ter um MoE de grão grosso (especialistas grandes) que estava aberto para todos usarem. Mas os "especialistas" ainda eram muito grandes e desajeitados. Eles tendiam a reaprender as mesmas coisas básicas (como dizer "olá"), o que era um desperdício de espaço.

5. Especialistas de Grão Fino e Compartilhados (Os Quiosques Especializados)
Para corrigir a desajeiteza, os engenheiros começaram a dividir os grandes especialistas em muitos outros minúsculos e de grão fino. É como substituir uma grande "Loja de Conveniência" por centenas de pequenos quiosques: um para "comida apimentada", um para "sobremesas", um para "opções veganas". Isso permitiu um roteamento muito mais preciso. Eles também adicionaram Especialistas Compartilhados — um caminho permanente para coisas que todos precisam (como gramática básica) — para que o sistema de roteamento não precisasse perder tempo decidindo sobre o básico. Isso tornou o sistema mais rápido e inteligente, mas criou um novo engarrafamento: muitos quiosques minúsculos significavam muitas viagens minúsculas para o metrô, tornando tudo mais lento.

6. Escalonamento Ultra-Esparso (A Biblioteca de um Milhão de Especialistas)
Em seguida, pesquisadores perguntaram: "E se tivermos muito mais especialistas, mas ainda menores?". Modelos como Kimi K2 e PEER começaram a usar centenas de especialistas minúsculos (às vezes mais de um milhão!). A ideia era ter um pool de candidatos tão vasto que a IA pudesse encontrar o especialista perfeito para cada palavra. Mas o artigo observa uma ressalva: se você tiver especialistas demais, o computador gasta mais tempo procurando quem chamar (recuperação) e movendo dados do que realmente fazendo o trabalho. O "I/O de peso" (carregar o cérebro do especialista) tornou-se o novo gargalo.

7. Computação Dinâmica (O Orçamento Flexível)
Até agora, cada palavra recebia a mesma quantidade de ajuda (ex: "Top-2" especialistas). Mas algumas palavras são difíceis (como "física quântica") e outras são fáceis (como "o"). A Computação Dinâmica muda as regras: a IA pode decidir usar 1 especialista para palavras fáceis e 4 para difíceis. Alguns modelos até usam slots de "zero-computação", onde a IA simplesmente diz "Eu sei isso, não há necessidade de chamar ninguém". Isso economiza energia, mas cria um novo risco: se um grupo de palavras difíceis aparecer ao mesmo tempo, o sistema pode ficar sobrecarregado, causando atrasos (latência de cauda).

8. Desacoplamento da Lógica da Física (A Rede de Teletransporte)
A fronteira final é o Roteamento Semântico Desacoplado da Execução Física. Atualmente, se a IA decide chamar o "Astrônomo", os dados devem viajar fisicamente para o chip do Astrônomo imediatamente. As novas ideias (como ScMoE ou Especialistas Heterogêneos) sugerem que podemos separar a decisão do movimento. Talvez a IA decida usar o Astrônomo, mas os dados esperem em um buffer, ou o Astrônomo seja de um tamanho diferente dependendo da tarefa. É como ter uma rede de teletransporte onde o destino é decidido logicamente, mas o transporte físico é otimizado separadamente para evitar engarrafamentos.

Os Quatro Planos de Controle

O artigo organiza todas essas mudanças em quatro "planos de controle", que são como as diferentes camadas de gestão em uma grande empresa:

  1. A Camada de Objeto (Topologia): Este é o "Organograma". Define quem são os especialistas, o tamanho deles e se eles compartilham uma mesa. Pergunta: "Temos 8 especialistas grandes ou 128 minúsculos?"
  2. A Camada de Decisão (Roteamento): Este é o "Despachante". Para cada palavra, decide: "Quem eu chamo?" Usa uma regra "Top-K" para escolher os melhores especialistas.
  3. A Camada de Controle (Equilíbrio): Este é o "Gerente de RH". Monitora para garantir que nenhum especialista trabalhe 24 horas por dia enquanto outros estão dormindo. Se o "Chef" estiver sobrecarregado, ele pode gentilmente induzir o sistema a enviar alguns pedidos para o "Padeiro", usando truques matemáticos especiais (como Auxiliary-Loss-Free) para fazer isso sem prejudicar o aprendizado da IA.
  4. A Camada de Execução (Paralelismo de Especialistas): Esta é a "Equipe de Logística". Determina como realmente mover os dados através dos chips físicos, gerenciar o tráfego e garantir que a matemática seja feita rapidamente.

O Que o Artigo Descarta e O Que Sugere

O autor é muito claro sobre o que não funciona como uma solução mágica. Eles argumentam contra a ideia de que existe uma estrutura "perfeita" para todos os modelos MoE. Sugerem que simplesmente adicionar mais especialistas não é a resposta se o sistema não conseguir mover os dados rápido o suficiente. Também apontam que o Soft MoE (onde os especialistas se misturam continuamente em vez de escolher um) não foi comprovado como eficaz nos sistemas massivos do mundo real que usamos hoje, embora pareça bom na teoria.

O artigo sugere que o futuro reside no desacoplamento. Precisamos parar de atrelar a "decisão inteligente" (qual especialista usar) à "realidade física" (em qual chip ele reside). Eles propõem que os melhores sistemas usarão orçamentos dinâmicos (mudando quanta carga de trabalho é feita com base na dificuldade) e posicionamento em tempo de execução (movendo especialistas ao redor enquanto o computador está rodando para evitar engarrafamentos).

No entanto, o artigo é cuidadoso ao não afirmar que estes são problemas "resolvidos". Por exemplo, embora os Especialistas Heterogêneos (especialistas de diferentes tamanhos) pareçam ótimos, o artigo observa que eles ainda estão na fase de "fronteira de pesquisa" e não foram totalmente testados na escala massiva de modelos de trilhões de parâmetros. Da mesma forma, o compartilhamento entre camadas (onde um especialista da camada 1 ajuda a camada 100) é uma ideia interessante, mas o autor diz que precisamos de mais evidências para ver se realmente funciona sem causar confusão.

A Conclusão

Em termos simples, este artigo nos diz que a jornada para tornar a IA mais inteligente não é apenas sobre construir um cérebro maior. É sobre construir um melhor sistema de tráfego. Passamos de um único ônibus para uma rede complexa de táxis, metrôs e drones. O próximo passo não é apenas adicionar mais veículos; é tornar os semáforos mais inteligentes, as estradas mais flexíveis e os despachantes capazes de lidar com a hora do rush sem colapsar. O autor conclui que a "próxima geração" de IA não será um único novo modelo, mas uma combinação desses truques de roteamento inteligente, orçamentos dinâmicos e otimizações físicas trabalhando juntos. É um lembrete de que, no mundo dos computadores superinteligentes, às vezes a parte mais difícil não é o pensamento — é o deslocamento.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →