← Últimos artigos
💬 NLP

Improving Diffusion Language Model Decoding through Joint Search in Generation Order and Token Space

Este artigo introduz o Order-Token Search, um novo método de decodificação para Modelos de Linguagem de Difusão que explora conjuntamente a ordem de geração e o espaço de tokens para superar as linhas de base existentes em benchmarks de raciocínio matemático e codificação.

Autores originais: Yangyi Shen, Tianjian Feng, Jiaqi Han, Wen Wang, Tianlang Chen, Chunhua Shen, Jure Leskovec, Stefano Ermon

Publicado 2026-02-06
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Yangyi Shen, Tianjian Feng, Jiaqi Han, Wen Wang, Tianlang Chen, Chunhua Shen, Jure Leskovec, Stefano Ermon

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando resolver um quebra-cabeça complexo, como um problema de matemática ou um desafio de programação, mas você tem um assistente mágico (o Modelo de Linguagem de Difusão) que não apenas escreve a resposta da esquerda para a direita como um humano digitando uma letra. Em vez disso, esse assistente começa com uma página em branco cheia de espaços reservados "MASK" e tenta preenchê-los todos de uma vez, adivinhando quais palavras pertencem a cada lugar.

O problema é que o assistente é um pouco caótico. Ele pode preencher os espaços em qualquer ordem que desejar. Às vezes, ele acerta a palavra certa para o primeiro espaço, mas depois fica travado porque adivinhou a palavra errada para o segundo espaço. Outras vezes, ele adivinha as palavras certas, mas na ordem errada, levando a um beco sem saída.

O Jeito Antigo: Adivinhação e Poda

Anteriormente, as pessoas tentavam corrigir isso de duas maneiras principais, ambas com falhas:

  1. A Abordagem "Confiante": O assistente observa os espaços sobre os quais ele se sente mais seguro e os preenche primeiro. É como um trilheiro que só caminha pelo caminho que parece mais sólido.
    • O Bom: Geralmente obtém uma boa resposta rapidamente.
    • O Ruim: Se o "caminho sólido" levar a um precipício (uma resposta errada), o trilheiro fica preso ali. Ele nunca explora outros caminhos que poderiam ter sido melhores.
  2. A Abordagem "Aleatória": O assistente escolhe os espaços para preencher de forma completamente aleatória.
    • O Bom: Ele explora uma enorme variedade de caminhos, então é muito provável que acabe encontrando a solução correta eventualmente.
    • O Ruim: Ele é tão disperso que raramente escolhe o melhor caminho na primeira tentativa. É como um trilheiro vagando em círculos; eles podem encontrar o tesouro, mas também cavarão muitos buracos vazios antes.

A Nova Solução: Busca de Ordem-Token (Order-Token Search)

Os autores deste artigo introduziram um novo método chamado Order-Token Search. Pense nisso como uma Equipe de Exploradores trabalhando juntos.

Em vez de enviar um único trilheiro ou uma multidão caótica, o método envia uma pequena equipe (um "feixe" ou beam) de exploradores. Veja como eles trabalham:

  1. Caminhos Divergentes (A Busca): Em intervalos regulares, a equipe se divide. Cada explorador tenta uma estratégia diferente:

    • O Explorador A decide preencher a primeira palavra que falta.
    • O Explorador B decide preencher a última palavra que falta.
    • O Explorador C tenta uma palavra diferente para o meio.
    • Analogia: Eles estão explorando tanto onde escrever a seguir (a ordem) quanto o que escrever (o token).
  2. A Planilha de Pontuação (O Estimador de Verossimilhança): Esta é a parte mágica. A equipe tem um juiz especial (o estimador de verossimilhança) que não olha apenas para a resposta final. Em vez disso, o juiz observa cada passo que os exploradores deram.

    • O explorador fez um movimento lógico?
    • Esta frase parcial faz sentido dado o que foi escrito antes?
    • Analogia: Imagine um treinador observando uma corrida de revezamento. Se um corredor tropeça cedo, o treinador não espera que ele termine a corrida para cortá-lo; ele o interrompe imediatamente porque o passo que ele deu estava errado.
  3. Cortando os Becos sem Saída (Poda): O juiz pontua o progresso de cada explorador. Se um explorador está seguendo um caminho que parece improvável de ter sucesso (mesmo que ainda não tenha terminado), a equipe corta esse caminho e foca os recursos nos exploradores que estão nos melhores trajetos.

Por Que Isso Importa

O artigo testou isso em problemas matemáticos difíceis (como os conjuntos de dados GSM8K e MATH500) e tarefas de programação (HumanEval).

  • O Resultado: A "Equipe de Exploradores" (Order-Token Search) encontrou consistentemente as respostas corretas com mais frequência do que os antigos métodos "Confiante" ou "Aleatório".
  • A Comparação: Teve um desempenho tão bom que igualou ou até superou métodos que exigem o retreinamento caro e de meses de duração (como o diffu-GRPO). Isso significa que você pode tornar uma IA muito mais inteligente apenas mudando como ela pensa durante o teste, sem precisar retreinar o cérebro em si.

Uma Nota Especial sobre Sudoku

O artigo também testou isso em quebra-cabeças de Sudoku. Curiosamente, não funcionou bem aí. Os autores explicam que o Sudoku exige regras globais estritas (como "não repetir números em uma linha") que a "planilha de pontuação" interna da IA simplesmente não consegue entender. É como dar a uma equipe de trilheiros um mapa que não mostra os precipícios; não importa o quão bem eles explorem, eles não conseguem evitar cair da borda se o mapa estiver errado. Isso sugere que, para algumas tarefas, a própria IA precisa ser treinada de forma diferente, não apenas o método de busca.

Em Resumo

O artigo mostra que, ao permitir que uma IA explore múltiplas formas diferentes de escrever (ordem) e múltiplas palavras diferentes (tokens) simultaneamente, e depois usar um sistema de pontuação inteligente para cortar as ideias ruins precocemente, podemos obter resultados muito melhores de Modelos de Linguagem de Difusão sem a necessidade de retreinar o modelo. Transforma um jogo de adivinhação caótico em uma busca estruturada e eficiente pela verdade.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →