← Últimos artigos
💬 NLP

Efficient-DLM: From Autoregressive to Diffusion Language Models, and Beyond in Speed

Este artigo apresenta o Efficient-DLM, um framework que converte modelos autoregressivos pré-treinados em modelos de linguagem de difusão altamente eficientes ao empregar um padrão de atenção por blocos e mascaramento de tokens dependente da posição, alcançando assim precisão e rendimento superiores em comparação com os modelos mais avançados.

Autores originais: Yonggan Fu, Lexington Whalen, Zhifan Ye, Xin Dong, Shizhe Diao, Jingyu Liu, Chengyue Wu, Hao Zhang, Enze Xie, Song Han, Maksim Khadkevich, Jan Kautz, Yingyan Celine Lin, Pavlo Molchanov

Publicado 2026-05-01
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Yonggan Fu, Lexington Whalen, Zhifan Ye, Xin Dong, Shizhe Diao, Jingyu Liu, Chengyue Wu, Hao Zhang, Enze Xie, Song Han, Maksim Khadkevich, Jan Kautz, Yingyan Celine Lin, Pavlo Molchanov

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

A Visão Geral: O Engarrafamento vs. A Rodovia

Imagine duas maneiras de escrever uma história:

  1. O Jeito Antigo (Autoregressivo/AR): Isso é como uma estrada de pista única. Você escreve uma palavra, depois a próxima, e então a seguinte. Você não pode escrever a segunda palavra até que a primeira esteja terminada. É muito preciso, mas é lento porque você tem que esperar na fila para cada palavra individual.
  2. O Jeito Novo (Difusão/DLM): Isso é como uma rodovia de múltiplas pistas. Você pode escrever muitas palavras ao mesmo tempo (em paralelo). Deveria ser muito mais rápido. No entanto, no passado, essas "rodovias" eram irregulares, confusas e frequentemente produziam histórias de qualidade inferior à da estrada de pista única. Elas também eram muito caras para construir (treinar).

O Problema: Os cientistas queriam a velocidade da rodovia com a qualidade da estrada de pista única, mas não conseguiam descobrir como construí-la sem começar do zero (o que custaria uma fortuna).

A Solução: Os autores deste artigo descobriram como pegar um modelo existente de "pista única" de alta qualidade e transformá-lo em um modelo de "rodovia" que é ao mesmo tempo rápido e preciso. Eles chamam essa nova família de modelos de Efficient-DLM.


Como Eles Fizeram Isso: Três Truques Chave

O artigo identifica três "regras" principais que eles tiveram que seguir para fazer essa transformação funcionar.

1. A Regra do "Contexto Limpo" (O Jeito dos Blocos)

  • O Erro Antigo: Tentativas anteriores tentavam deixar o modelo olhar para a frase inteira de uma vez, até mesmo as partes que ainda estavam bagunçadas ou faltando. Imagine tentar resolver um quebra-cabeça onde metade das peças está faltando, e você é permitido olhar para os espaços vazios como se estivessem preenchidos. Isso confundia o modelo e fazia com que ele esquecesse o que havia aprendido antes.
  • A Correção: Os autores decidiram quebrar a frase em pequenos blocos (como capítulos em um livro).
    • O modelo olha para os capítulos anteriores, que já estão terminados e limpos.
    • Ele apenas tenta corrigir o capítulo atual, que está bagunçado.
    • Analogia: Pense nisso como uma equipe de construção. Eles não tentam consertar o prédio inteiro de uma vez. Eles terminam a fundação e o primeiro andar (contexto limpo) antes de subir para consertar o segundo andar (o bloco bagunçado). Isso mantém a estrutura estável e permite que eles usem um "atalho" (chamado de cache KV) para lembrar o que já construíram, tornando o processo muito mais rápido.

2. A Regra do "Sem Deslocamento de Token" (Pare de Adivinhar o Próximo Passo)

  • O Erro Antigo: Ao converter o modelo antigo, os pesquisadores costumavam fazer o modelo adivinhar a próxima palavra, assim como o antigo modelo de pista única fazia.
  • A Correção: Os autores descobriram que o modelo não precisa adivinhar a palavra "seguinte". Ele apenas precisa corrigir as palavras faltantes bem na sua frente.
  • Analogia: Imagine que você está editando um documento.
    • Jeito Antigo: Você lê uma frase, depois tenta prever a próxima frase antes mesmo de terminar de editar a atual.
    • Jeito Novo: Você apenas se concentra em preencher os espaços em branco no parágrafo atual. Acontece que corrigir os espaços em branco é mais fácil e preciso do que tentar prever o futuro.

3. A Regra do "Mascaramento Dependente de Posição" (O Viés da Esquerda para a Direita)

  • O Problema: Quando o modelo estava sendo treinado, ele costumava esconder palavras aleatoriamente (como escolher números da loteria). Mas quando o modelo é realmente usado (inferência), ele naturalmente tende a terminar palavras da esquerda para a direita, assim como os humanos leem. Isso criou uma incompatibilidade: o treinamento não se parecia com o teste real.
  • A Correção: Os autores mudaram o treinamento para que o modelo seja mais propenso a esconder palavras no final de um bloco, em vez do início.
  • Analogia: Imagine um professor corrigindo uma prova.
    • Treinamento Antigo: O professor cobre perguntas aleatórias na página.
    • Treinamento Novo: O professor percebe que os alunos geralmente ficam presos nas últimas poucas perguntas de uma seção. Então, o professor pratica especificamente cobrir o final da seção. Isso prepara o modelo para o mundo real, onde ele tem que terminar a frase da esquerda para a direita.

Os Resultados: Velocidade e Inteligência

Seguindo essas regras, os autores criaram a família Efficient-DLM (tamanhos 1,5B, 4B e 8B).

  • Velocidade: Eles são significativamente mais rápidos do que os melhores modelos existentes. Por exemplo, o modelo 8B deles é 4,5 vezes mais rápido do que um concorrente chamado "Dream" e 2,7 vezes mais rápido do que "Qwen3 4B".
  • Precisão: Apesar de serem mais rápidos, eles são na verdade mais precisos em tarefas de matemática, codificação e raciocínio do que os modelos que venceram.
  • Flexibilidade: Como eles podem gerar várias palavras de uma vez, você pode ajustá-los. Se você precisa de velocidade, gera muitas palavras de uma vez. Se precisa de precisão extrema, gera menos palavras de uma vez. É como ter um carro que pode mudar instantaneamente entre o "Modo Corrida" e o "Modo Cruzeiro".

Resumo

O artigo diz: "Pegamos um modelo lento e preciso e ensinamos ele a rodar em uma rodovia. Fizemos isso organizando o trabalho em blocos limpos, impedindo-o de adivinhar o futuro e treinando-o para focar no final das frases. O resultado é uma família de modelos que é ao mesmo tempo mais rápida e mais inteligente do que o estado atual da arte."

Eles também notaram que, como esses modelos podem olhar para o texto em ambas as direções (bidirecionais), eles são surpreendentemente bons em entender o "significado" do texto para tarefas de busca e incorporação (embedding), superando os modelos antigos de direção única.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →