← Últimos artigos
💬 NLP

dMoE: dLLMs with Learnable Block Experts

O artigo propõe o dMoE, uma estrutura de Mixture-of-Experts em nível de bloco para Diffusion Large Language Models que agrega distribuições de especialistas em nível de token para reduzir significativamente o uso de memória e a latência de inferência ao minimizar especialistas ativados de forma única, mantendo simultaneamente um desempenho competitivo.

Autores originais: Sicheng Feng, Zigeng Chen, Gongfan Fang, Xinyin Ma, Xinchao Wang

Publicado 2026-06-01
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Sicheng Feng, Zigeng Chen, Gongfan Fang, Xinyin Ma, Xinchao Wang

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem uma biblioteca enorme e superinteligente (o Modelo de Linguagem de Grande Escala de Difusão, ou dLLM) que pode escrever histórias, resolver problemas matemáticos e responder perguntas. Para tornar essa biblioteca ainda mais inteligente sem torná-la muito pesada para carregar, os arquitetos adicionaram um recurso especial chamado Mistura de Especialistas (Mixture-of-Experts - MoE).

Pense nos "Especialistas" como uma equipe de 100 bibliotecários especializados. Quando você faz uma pergunta, a biblioteca não pede ajuda a todos os 100 especialistas. Em vez disso, ela possui um "Roteador" (um gerente de bibliotecários) que escolhe os 8 especialistas mais adequados para a sua pergunta específica. Isso mantém o trabalho rápido e eficiente.

O Problema: A "Trilha em Grupo" vs. A "Trilha Solo"

Aqui é onde o problema começou.

  • O Jeito Antigo (Modelos Autorregressivos): Imagine um trilheiro caminhando sozinho subindo uma montanha, um passo de cada vez. A cada passo, o trilheiro pergunta ao gerente: "Quem devo chamar para ajudar agora?". O gerente escolhe 8 especialistas, eles ajudam, e então o trilheiro dá o próximo passo.
  • O Jeito Novo (dLLMs): Os novos dLLMs são como uma trilha em grupo caminhando em um aglomerado apertado. Eles não caminham um por um; eles se moveem em grandes blocos de 32 pessoas de uma só vez. Eles podem olhar para todo o caminho à frente e corrigir vários passos simultaneamente. Isso é muito mais rápido!

O Desajuste:
O problema é que o "Gerente" (o Roteador) ainda estava agindo como se estivesse lidando com um trilheiro solo. Mesmo que o grupo se movesse em um bloco de 32, o gerente tratava cada pessoa nesse bloco como um trilheiro separado e individual.

  • A Pessoa 1 no bloco pede ajuda: O gerente escolhe 8 especialistas.
  • A Pessoa 2 pede: O gerente escolhe outros 8 especialistas diferentes.
  • ...
  • A Pessoa 32 pede: O gerente escolhe outros 8 especialistas diferentes.

Como o grupo está se movendo junto, o gerente acaba chamando dezenas de especialistas diferentes apenas para lidar com um único bloco de movimento. Isso é como um motorista de ônibus parando em 32 postos de gasolina diferentes para abastecer 32 carros diferentes, embora todos estejam no mesmo ônibus. O ônibus fica travado, a memória (combustível) acaba e todo o processo fica lento porque o sistema está tentando carregar muitos especialistas diferentes de uma só vez.

A Solução: dMoE (O "Gerente de Bloco")

Os autores deste artigo propõem um novo sistema chamado dMoE. Eles perceberam que, como o grupo se move junto, eles devem ser tratados como uma unidade única ao escolher os especialistas.

Veja como o dMoE funciona, usando uma analogia simples:

  1. A Votação do Grupo: Em vez de perguntar individualmente para cada uma das 32 pessoas no bloco quem elas precisam, o dMoE pede ao grupo inteiro que vote junto. "Ei, bloco, que tipo de ajuda vocês precisam coletivamente?"
  2. A Lista Unificada: O gerente pega todos os votos individuais e os combina em uma única "Pontuação de Bloco". Se 20 pessoas no bloco precisam do "Especialista de Matemática E1" e 10 precisam do "Especialista de Matemática E2", o gerente vê que o bloco inteiro realmente precisa de E1 e E2.
  3. A Lista Curta Inteligente: O gerente então olha para essa lista combinada e diz: "Ok, para este bloco inteiro, nós realmente só precisamos dos principais especialistas que cubram 90% das necessidades do grupo". Eles criam uma lista pequena e fixa de especialistas (um "coreset") para todo o bloco.
  4. O Resultado: Agora, em vez de carregar mais de 60 especialistas diferentes para um único bloco, o sistema carrega apenas cerca de 14. É como o motorista do ônibus percebendo: "Ah, todo mundo neste ônibus precisa abastecer nas mesmas 3 estações", então ele só para nelas.

Por Que Isso Importa (Os Resultados)

O artigo testou este novo "Gerente de Bloco" em um modelo de última geração chamado LLaDA2.0-mini em testes difíceis de matemática e lógica (como MATH500 e GSM8K).

  • Menos Memória: Como não estão carregando uma lista enorme e caótica de especialistas, o uso de memória do computador caiu cerca de 77% a 80%. É como trocar um caminhão que carrega 100 ferramentas diferentes por uma mochila que carrega apenas as 14 essenciais.
  • Maior Velocidade: O modelo rodou de 1.14x a 1.66x mais rápido. O ônibus não teve que parar em tantos postos de gasolina.
  • Sem Perda de Inteligência: A parte mais impressionante? O modelo não ficou mais burro. Ele manteve 99,11% de sua inteligência original. Ele resolveu o mesmo número de problemas matemáticos corretamente, apenas de forma muito mais eficiente.

Em Resumo

O artigo diz: "Descobrimos que, quando esses novos modelos de IA rápidos trabalham em grupos, tratá-los como indivíduos causa um congestionamento. Ao permitir que o grupo vote junto sobre quem eles precisam, podemos reduzir o número de trabalhadores que chamamos em quase 5 vezes, economizar muita memória e fazer a IA rodar mais rápido — tudo isso sem perder qualquer poder cerebral."

Esta é uma estratégia "aprendível", o que significa que a IA aprende como agrupar esses votos durante seu treinamento, tornando isso uma correção inteligente e automática.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →