← Últimos artigos
💬 NLP

Esoteric Language Models: A Family of Any-Order Diffusion LLMs

Este artigo introduz os Eso-LMs, uma nova família de modelos de linguagem de difusão que fundem os paradigmas autorregressivo e de difusão mascarada usando atenção causal para permitir o cache de KV e a geração paralela, estabelecendo assim um novo estado da arte na fronteira de Pareto entre velocidade e qualidade para geração incondicional.

Autores originais: Subham Sekhar Sahoo, Zhihan Yang, Yash Akhauri, Johnna Liu, Deepansha Singh, Zhoujun Cheng, Zhengzhong Liu, Eric Xing, John Thickstun, Arash Vahdat

Publicado 2026-06-01
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Subham Sekhar Sahoo, Zhihan Yang, Yash Akhauri, Johnna Liu, Deepansha Singh, Zhoujun Cheng, Zhengzhong Liu, Eric Xing, John Thickstun, Arash Vahdat

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você esteja tentando escrever uma história, mas tem duas maneiras muito diferentes de fazer isso.

O Jeito Antigo (Modelos Autoregressivos):
Pense nisso como escrever uma frase uma palavra por vez, da esquerda para a direita. Você escreve "O", depois pensa no que vem a seguir, escreve "gato", depois "sentou", e assim por diante. Isso é muito preciso e de alta qualidade, mas é lento porque você não pode escrever a próxima palavra até ter terminado a anterior. É como uma única pessoa digitando em um teclado; ela não consegue digitar duas teclas ao mesmo tempo.

O Jeito "Difusão" (Modelos de Difusão Mascarados):
Agora, imagine que você tem uma página em branco onde cada palavra está escondida atrás de uma máscara (como um "____"). Em vez de escrever uma palavra de cada vez, você adivinha muitas das palavras escondidas ao mesmo tempo. Você pode adivinhar a primeira, a terceira e a quinta palavras simultaneamente. Então, você verifica seus palpites, corrige os errados e adivinha novamente. Isso é muito mais rápido porque você está trabalhando na página inteira de uma só vez. No entanto, como você está adivinhando muitas coisas ao mesmo tempo sem verificar seu trabalho anterior, às vezes você comete erros, e a história final pode não ser tão perfeita quanto a do "Jeito Antigo". Além disso, até agora, este método era ineficiente porque toda vez que você fazia um palpite, tinha que reler a página inteira do zero, mesmo as partes que você já tinha resolvido.

A Nova Solução: "Esoteric Language Models" (Eso-LMs)

Os pesquisadores neste artigo criaram um novo método chamado Eso-LMs (Esoteric Language Models). Eles o chamam de "Esotérico" porque é um pouco incomum e explora os limites estranhos entre essas duas formas de escrever.

Pense nos Eso-LMs como uma equipe híbrida que obtém o melhor dos dois mundos:

  1. A Fase de "Palpites em Grupo": Primeiro, o modelo age como o método de Difusão. Ele olha para a página inteira e adivinha um monte de palavras ao mesmo tempo. Isso é rápido e cobre muito terreno rapidamente.
  2. A Fase de "Polimento": Assim que o grupo faz um bom começo, o modelo muda para o "Jeito Antigo" (palavra por palavra) para preencher os espaços restantes.

Por que isso é um grande feito?

O artigo afirma três grandes avanços:

1. O "Banco de Memória" (KV Caching)
No antigo método de Difusão, toda vez que o modelo adivinhava uma palavra, ele tinha que reler a história inteira desde o início, mesmo as partes que já havia resolvido. Era como um estudante lendo um livro inteiro toda vez que queria verificar um fato.
O Eso-LMs introduz um "Banco de Memória" (chamado de KV Caching). Uma vez que uma palavra é decifrada, o modelo a salva em sua memória. Quando ele precisa adivinhar a próxima palavra, ele apenas consulta seu banco de memória em vez de reler o livro inteiro.

  • O Resultado: O modelo agora é de 14 a 65 vezes mais rápido do que o antigo método de Difusão para histórias longas, e de 3 a 4 vezes mais rápido do que o método de "bloco" anterior.

2. O Equilíbrio Perfeito (A "Fronteira de Pareto")
Geralmente, você tem que escolher entre velocidade e qualidade. Se você quer rapidez, fica bagunçado. Se você quer perfeição, é lento.
O Eso-LMs cria uma escala deslizante suave. Você pode dizer ao modelo: "Eu quero 80% de velocidade e 20% de perfeição", ou "Eu quero 20% de velocidade e 80% de perfeição".

  • O Resultado: Ele atinge um novo "Estado da Arte". Ele não fica apenas no meio; ele supera os métodos anteriores em todas as configurações de velocidade. Mesmo quando roda muito rápido, não produz textos sem sentido (um problema que o método de "bloco" anterior tinha).

3. Calculando a "Pontuação Real"
Em aprendizado de máquina, é difícil saber exatamente o quão "bom" um modelo de Difusão é, porque a matemática costuma ser complexa demais para ser resolvida exatamente.
Como o Eso-LMs usa um tipo específico de atenção (uma forma de o modelo olhar para as palavras), os pesquisadores descobriram uma maneira de calcular a pontuação exata (verossimilhança) do modelo pela primeira vez.

  • O Resultado: Isso permite um melhor treinamento e teste, e abre as portas para o uso de técnicas avançadas (como Aprendizado por Reforço) para tornar esses modelos ainda mais inteligentes.

Em Resumo

O artigo apresenta uma nova maneira de gerar texto que combina a velocidade de adivinhar muitas palavras ao mesmo tempo com a precisão de escrevê-las uma por uma. Ao adicionar um "banco de memória" ao método rápido, eles o tornaram incrivelmente eficiente, resolvendo o problema de velocidade que travava os modelos de Difusão há muito tempo. Eles o chamam de "Esotérico" porque é uma mistura inteligente e ligeiramente não convencional de duas filosofias diferentes que funciona melhor do que qualquer uma delas isoladamente.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →