← Últimos artigos
💬 NLP

Rethinking the Generation Order of Block Diffusion Language Models

Este artigo introduz o Parallel Autoregressive Decoding (PARD), um método de amostragem livre de treinamento que aproveita o alinhamento inerente da esquerda para a direita de modelos de linguagem de difusão em blocos para alcançar velocidades de geração mais rápidas com perda mínima de qualidade em comparação com a decodificação autorregressiva pura.

Autores originais: Kai Syun Hou, James Kwok

Publicado 2026-07-28
📖 8 min de leitura🧠 Leitura aprofundada

Autores originais: Kai Syun Hou, James Kwok

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando ensinar um robô a escrever uma história. Por muito tempo, a melhor maneira de fazer isso era fazer o robô escrever uma palavra de cada vez, da esquerda para a direita, exatamente como um humano lendo um livro. Este método, chamado geração "autorregressiva", é muito confiável, mas pode ser lento, como uma única pessoa digitando um romance em uma máquina de escrever. Recentemente, cientistas descobriram uma nova maneira chamada "difusão", que é mais parecida com um pintor começando com uma tela em branco coberta de ruído estático e gradualmente limpando-a até que uma imagem clara apareça. Este novo método permite que o robô adivinhe muitas palavras de uma só vez, potencialmente escrevendo muito mais rápido. No entanto, há um problema: embora este método de "limpeza de ruído" seja ótimo para ser flexível, às vezes ele se confunde sobre a ordem das palavras, levando ao gerador de palavras sem sentido (gibberish). A grande questão para os pesquisadores é: como obtemos a velocidade do pintor sem perder o fluxo lógico da máquina de escrever?

Este artigo aborda exatamente esse quebra-cabeça ao olhar para uma versão mais nova desses modelos de "limpeza de ruído" chamada Modelos de Linguagem de Difusão em Bloco (BDLMs). Os autores, Kai Syun Hou e James Kwok, descobriram algo surpreendente: embora esses modelos sejam construídos para serem flexíveis e adivinhem palavras em qualquer ordem, eles na verdade "pensam" muito mais como a antiga máquina de escrever da esquerda para a direita do que qualquer um esperava. Eles descobriram que forçar esses modelos a aderir a uma ordem estrita da esquerda para a direita, enquanto ainda permite que adivinhem algumas palavras de cada vez, cria um ponto ideal perfeito. Eles chamam este novo método de PARD (Decodificação Autorregressiva Paralela). Pense nisso como uma equipe de escritores que concorda em escrever em ordem, mas, em vez de esperar que uma pessoa termine uma frase inteira antes que a próxima come-ce, todos entram para terminar as próximas palavras simultaneamente se estiverem confiantes o suficiente. O resultado? O robô escreve significativamente mais rápido do que o antigo método lento, mas a história permanece tão lógica e de alta qualidade.

A História do Robô de "Limpeza de Ruído"

Para entender por que isso importa, vamos imaginar duas maneiras diferentes pelas quais um robô pode tentar escrever uma frase.

O Jeito Antigo (Autorregressivo): Imagine um robô que escreve uma história uma letra de cada vez. Ele escreve "T", depois "h", depois "e", depois " ". Ele não pode escrever a próxima palavra até ter terminado a atual. É muito cuidadoso e raramente comete erros, mas é lento. É como uma única pessoa digitando um romance; ela não pode digitar a última página até ter terminado a primeira.

O Novo Jeito (Difusão): Agora imagine um robô que começa com uma frase onde cada palavra é substituída por um ponto de interrogação (ou uma "máscara"). O trabalho dele é olhar para a frase inteira e adivinhar quais devem ser as palavras que faltam. Ele não precisa adivinhá-las em ordem. Ele poderia adivinhar a última palavra primeiro, depois a primeira palavra, depois a do meio. Isso é como um pintor olhando para uma tela bagunçada e borrada e tentando descobrir qual é a imagem final. A vantagem é a velocidade: o robô pode corrigir muitas partes da frase ao mesmo tempo. A desvantagem é que, se ele adivinhar o fim da frase antes do começo, pode errar o contexto e produzir algo sem sentido.

Por um tempo, os cientistas tentaram fazer o robô de "limpeza de ruído" funcionar permitindo que ele adivinhasse palavras na ordem que quisesse, esperando que ele descobrisse o melhor caminho. Mas os autores deste artigo notaram algo estranho. Eles testaram um novo tipo de robô chamado Modelo de Linguagem de Difusão em Bloco (BDLM). Esses robôs são especiais porque são treinados para trabalhar em blocos (chunks) de texto, usando o texto limpo de blocos anteriores para ajudar a adivinhar o próximo bloco.

A Grande Descoberta: O Robô Prefere a Ordem

Os autores realizaram uma série de experimentos para ver como esses robôs realmente se comportam. Eles compararam um robô padrão de "limpeza de ruído" (LLaDA) com o novo robô de "bloco" (SDAR).

Eles descobriram que o robô padrão realmente gosta de adivinhar palavras em ordens aleatórias. Mas o novo robô de bloco se comporta de forma muito diferente. Embora ele possa adivinhar palavras em qualquer ordem, ele naturalmente prefere adivinhá-las da esquerda para a direita, assim como o antigo robô da máquina de escrever.

Para provar isso, eles observaram a "confiança" do robô. Se você pedir a um robô para adivinhar a próxima palavra, ele geralmente tem uma "pontuação de confiança" para cada possibilidade. Os autores descobriram que, para o robô de bloco, os palpites mais confiantes eram quase sempre as palavras no início da frase restante. É como se o robô tivesse um hábito secreto: "Eu sei que posso saltar de um lado para o outro, mas eu realmente me sinto mais confortável começando pela esquerda".

Eles até fizeram matemática para explicar por que isso acontece. Eles perceberam que, durante o treinamento, o robô de bloco recebe muitos exemplos onde o lado esquerdo da frase já está escrito, e ele só precisa adivinhar o lado direito. É exatamente assim que o antigo robô "máquina de escrever" aprende. O robô padrão de "limpeza de ruído", por outro lado, é treinado em frases onde as palavras estão faltando em todos os lugares, então ele nunca aprendeu realmente a depender do lado esquerdo primeiro. Como o robô de bloco é treinado dessa forma, ele "quer" ser da esquerda para a direita.

A Solução: PARD (A Equipe de Escritores)

Então, se o robô de bloco naturalmente quer ir da esquerda para a direita, por que não apenas fazê-lo ir da esquerda para a direita? O problema é que, se ele for estritamente da esquerda para a direita, ele perde a vantagem de velocidade de adivinhar várias palavras de uma vez. Ele se torna lento novamente.

Os autores criaram uma solução inteligente chamada PARD (Decodificação Autorregressiva Paralela).

Imagine um grupo de escritores trabalhando em uma história juntos.

  1. A Regra: Eles devem escrever em ordem, da esquerda para a direita.
  2. A Reviravolta: Em vez de esperar que uma pessoa termine uma palavra antes que a próxima comece, todos olham para as próximas poucas palavras. Se eles estiverem muito confiantes sobre a próxima palavra, eles a escrevem. Se eles também estiverem muito confiantes sobre a palavra seguinte, eles escrevem essa também.
  3. A Rede de Segurança: Se eles não tiverem certeza sobre a segunda palavra, eles param. Eles não adivinham a segunda palavra apenas para serem rápidos; eles esperam até terem certeza.

É isso que o PARD faz. Ele olha para as pontuações de confiança do robô. Se o robô estiver confiante sobre a primeira palavra mascarada, ele a escreve. Então, ele verifica imediatamente se o robô também está confiante sobre a próxima palavra. Se sim, ele a escreve também. Ele continua seguindo a linha, escrevendo um "prefixo" de palavras confiáveis, até encontrar uma palavra onde o robô esteja incerto.

Os Resultados: Rápido e Preciso

Os autores testaram este novo método em três diferentes robôs de bloco e seis tarefas diferentes, incluindo escrita de código e resolução de problemas matemáticos.

  • Velocidade: O PARD foi muito mais rápido que o antigo método da "máquina de escrever". Em alguns casos, foi 3,64 vezes mais rápido em um dos modelos. Ele escreveu tokens (pedaços de texto) a uma taxa de até 152 tokens por segundo, comparado a apenas 70 para o método lento.
  • Qualidade: Apesar de ser mais rápido, as histórias e códigos que escreveu eram tão bons, ou frequentemente melhores, do que outros métodos rápidos que tentavam adivinhar palavras em ordens aleatórias. De fato, no modelo SDAR, o PARD foi na verdade melhor que os métodos de ordem aleatória, pontuando 81,1% em um teste de codificação comparado aos 75,0% do método aleatório.
  • A Comparação: Eles compararam o PARD com outros métodos sofisticados de "velocidade" que usam regras complexas para decidir quais palavras adivinhar. O PARD consistentemente venceu todos eles. Os métodos complexos eram como tentar resolver um quebra-cabeça pulando aleatoriamente; o PARD era como resolver o quebra-cabeça seguindo as peças das bordas primeiro, o que se revelou o caminho mais eficiente para esses robôs específicos.

Por Que Isso Importa

O artigo sugere que, para esses novos robôs de "bloco", a velha ideia de "adivinhar em qualquer ordem" não é, na verdade, a melhor forma de ir. Os robôs têm um viés natural para o pensamento da esquerda para a direita devido à forma como foram treinados. Ao respeitar esse viés e adicionar velocidade paralela apenas quando o robô tem certeza, obtemos o melhor dos dois mundos: a velocidade de uma equipe de escritores e a precisão de um digitador cuidadoso.

Os autores observam cuidadosamente que este é um método "sem necessidade de treinamento" (training-free). Eles não tiveram que retreinar os robôs ou mudar seus cérebros; eles apenas mudaram a forma como pediam aos robôs para escrever. Isso torna o método uma ferramenta muito prática que pode ser usada agora com modelos existentes.

Em resumo, o artigo mostra que, às vezes, a maneira mais rápida de seguir em frente é lembrar de se mover em linha reta, mas dar passos maiores quando você tem certeza de para onde está indo.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →