← Últimos artigos
🤖 AI

PRESTO: Prefix-Aligned Tree Drafting for Diffusion Speculative Decoding

O artigo introduz o PRESTO, um framework fundamentado que aprimora a decodificação especulativa baseada em difusão ao implementar pontuação alinhada ao prefixo e busca em árvore baseada em prioridade para resolver o descompasso entre as marginais de difusão e a verificação autorregressiva, aumentando significamente o throughput de ponta a ponta.

Autores originais: Zheng Wang, Zhifan Ye, Qi Cheng, Yonggan Fu, Ziyan Wang, Feng Zhu, Haozhe Zhao, Jan Kautz, Pavlo Molchanov, Humphrey Shi, Minjia Zhang

Publicado 2026-07-28
📖 10 min de leitura🧠 Leitura aprofundada

Autores originais: Zheng Wang, Zhifan Ye, Qi Cheng, Yonggan Fu, Ziyan Wang, Feng Zhu, Haozhe Zhao, Jan Kautz, Pavlo Molchanov, Humphrey Shi, Minjia Zhang

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando prever a próxima palavra em uma história. Por muito tempo, os computadores mais inteligentes (chamados de Grandes Modelos de Linguagem) faziam isso uma palavra por vez, como uma pessoa lendo um livro em voz alta, parando após cada única palavra para pensar no que vem a seguir. Isso é preciso, mas é lento. Recentemente, cientistas descobriram uma nova maneira de escrever essas histórias usando modelos de "difusão". Pense nestes como um escultor que começa com um bloco de mármore e esculpe toda a estátua de uma só vez, em vez de lascar uma pequena peça de cada vez. Isso permite que o computador adivinhe muitas palavras simultaneamente, o que é incrivelmente rápido.

No entanto, há um porém. Quando você adivinha muitas palavras de uma vez, pode errar algumas. Para corrigir isso, existe um truque inteligente chamado "decodificação especulativa". É como ter um assistente júnior rápido que adivinha as próximas poucas palavras, e então um chefe superinteligente e lento verifica se esses palpites estão certos. Se o chefe concordar, ele aceita todo o lote de palavras instantaneamente, economizando muito tempo. O problema é que o assistente júnior (o modelo de difusão) é ótimo em adivinhar palavras individuais, mas nem sempre sabe como essas palavras se encaixam em uma ordem específica. É como se o assistente fosse ótimo em escolher ingredientes individuais para um bolo, mas nem sempre soubesse quais combinações de ingredientes realmente terão um sabor bom juntos.

É aqui que entra um novo artigo. Os pesquisadores, liderados por Zheng Wang e colegas, perceberam que a maneira atual de usar esses assistentes rápidos está deixando velocidade na mesa. Eles descobriram que, enquanto o assistente pode gerar uma enorme variedade de combinações de palavras, o método atual verifica apenas um único caminho, como caminhar por um único corredor e torcer para que a porta no fim dele esteja aberta. Os autores propõem um novo sistema chamado PRESTO (Prefix-Aligned Tree Drafting). Em vez de caminhar por um único corredor, o PRESTO constrói uma árvore de possibilidades, explorando muitos caminhos diferentes ao mesmo tempo. Mas aqui está a magia: ele corrige uma falha fundamental na forma como a confiança do assistente é medida. A confiança original do assistente é "cega ao prefixo", o que significa que ela não se importa com quais palavras vieram antes. O PRESTO adiciona uma pontuação "alinhada ao prefixo", que atua como uma bússola, garantindo que os caminhos escolhidos para exploração sejam aqueles que têm maior probabilidade de serem aceitos pelo chefe.

O resultado é um sistema significativamente mais rápido. Em seus testes, o PRESTO ajudou o computador a aceitar mais palavras em cada rodada de adivinhação. Em algumas das melhores configurações existentes, ele tornou todo o processo 1,5 vez mais rápido. Em outras configurações, proporcionou um aumento de velocidade de 1,12 vezes. O artigo sugere que, ao tratar o processo de adivinhação como uma aventura de ramificação de árvore, em vez de uma linha reta, e ao garantir que os ramos sejam escolhidos com base em como bem eles se encaixam na história até agora, podemos obter o melhor dos dois mundos: a velocidade da difusão e a precisão da verificação cuidadosa.

O Problema: A Armadilha do "Caminho Único"

Para entender por que o PRESTO é necessário, imagine que você está jogando um jogo de "Mad Libs" com um amigo que está tentando adivinhar as palavras que faltam. Seu amigo é um modelo de difusão. Eles são incríveis em olhar para um espaço em branco e dizer: "Eu aposto que a palavra aqui é 'gato'!" ou "Talvez seja 'cachorro'?" ou "Ou talvez 'foguete'?". Eles podem gritar todas essas opções ao mesmo tempo.

No entanto, a maneira atual de usar esse amigo é muito rígida. Ela pega o palpite principal do seu amigo, escreve-o e então pergunta ao "chefe" (o modelo alvo) se o palpite está certo. Se o chefe disser "Não", tudo é descartado e você tem que começar de novo. Se o chefe disser "Sim", você passa para a próxima palavra e repete o processo. Isso é chamado de drafting linear. É como caminhar por uma floresta e olhar apenas para o caminho diretamente à sua frente.

Os autores observaram que essa abordagem é ineficiente. Como o modelo de difusão gera muitas opções simultaneamente, existe um enorme "espaço combinatório" de possibilidades. É como ter um mapa com mil trilhas diferentes, mas você só tem permissão para caminhar em uma. O artigo mostra que, ao insistir em apenas um caminho, o sistema perde muitas rotas válidas. Na verdade, em problemas matemáticos como o GSM8K, o método atual aceitou cerca de 6,5 palavras em média, mas os pesquisadores calcularam que, se pudessem verificar todos os melhores caminhos, poderiam ter aceitado quase 10 palavras. Esse é um enorme abismo!

O Descompasso: A Bússola "Cega"

Os pesquisadores investigaram mais a fundo e descobriram uma razão específica pela qual simplesmente verificar mais caminhos (construir uma árvore) não funcionava perfeitamente com os métodos antigos. Eles identificaram um "descompasso fundamental".

No mundo da IA padrão (modelos autorregressivos), a pontuação de confiança para uma palavra depende fortemente das palavras que vieram antes dela. Se a frase é "O gato sentou no...", o modelo sabe que "tapete" é uma palavra muito provável para a próxima, mas "pizza" não é. Isso é alinhado ao prefixo.

Mas os modelos de difusão funcionam de forma diferente. Eles geram uma probabilidade "marginal" para cada posição de forma independente. É como se o modelo dissesse: "Na posição 5, 'gato' tem 80% de probabilidade", sem se importar se a posição 4 foi "O" ou "O rápido marrom". Isso é cego ao prefixo.

Quando você tenta construir uma árvore de palpites usando essas pontuações cegas, você tem um problema de classificação. Você pode escolher um caminho que parece ótimo para a primeira palavra, mas terrível para a segunda, porque o modelo não percebeu que a primeira palavra mudou o contexto. É como um GPS que dá direções baseadas apenas na rua atual, ignorando o fato de que você acabou de virar à esquerda e agora está em uma rua de mão única. O artigo argumenta que usar essas pontuações cegas para construir uma árvore leva a uma "classificação de caminho não confiável", o que significa que o sistema explora os ramos errados e perde tempo.

A Solução: PRESTO

O PRESTO (Prefix-Aligned Scoring and priority-based Tree search for diffusion Speculative decOding) resolve isso adicionando uma "correção" às pontuações do modelo de difusão.

  1. Pontuação Alinhada ao Prefixo: Os autores perceberam que precisavam combinar o forte sinal "marginal" do modelo de difusão (o quão provável é uma palavra por si só) com um sinal "condicionado ao prefixo" (o quão provável ela é dados os termos anteriores). Eles criaram uma nova fórmula de pontuação que multiplica a probabilidade de difusão por um fator de correção derivado de um modelo n-grama simples (uma ferramenta leve que observa combinações de palavras). Isso cria uma pontuação que respeita o fluxo da história.
  2. Busca em Árvore Baseada em Prioridade: Em vez de apenas escolher o caminho principal, o PRESTO constrói uma árvore. Ele usa as novas pontuações corrigidas para decidir quais ramos cultivar. Ele prioriza caminhos que têm o maior potencial de serem aceitos pelo chefe. É como um caminhante que, em vez de apenas andar em linha reta, olha para um mapa e escolhe a trilha que tem mais probabilidade de levá-lo ao cume, mesmo que essa trilha não seja a mais óbvia no início.

O artigo testou duas maneiras de cultivar essa árvore: Busca em Feixe (Beam Search) (mantendo um número fixo de caminhos principais em cada etapa) e Busca de Melhor Primeiro (Best-First Search) (sempre expandindo o único melhor caminho encontrado até o momento). Eles descobriram que, para sua configuração específica, o Beam Search funcionava tão bem quanto o mais complexo Best-First Search, então mantiveram a opção mais simples e eficiente.

Os Resultados: Mais Rápidos e Inteligentes

Os autores colocaram o PRESTO à prova em várias tarefas, incluindo problemas matemáticos (GSM8K, Math500), desafios de codificação (HumanEval, LiveCodeBench) e conversas de chat. Eles usaram dois tipos diferentes de sistemas:

  • Drafts de Difusão Dedicados: Um modelo de difusão pequeno e rápido adivinhando para um modelo autorregressivo maior (como o dFlash).
  • LLMs de Difusão Auto-especulativos: Um único modelo de difusão que adivinha e verifica a si mesmo (como o Nemotron-Labs-Diffusion).

Os resultados foram consistentes em todos os campos. O PRESTO aumentou consistentemente o Comprimento Médio de Aceitação, que é o número de palavras que o chefe aceita de uma só vez.

  • No sistema dFlash (usando Qwen3-8B), o comprimento médio de aceitação saltou de cerca de 6,6 palavras para 9,6 palavras. Isso se traduziu em um aumento de velocidade de ponta a ponta de 1,5 vez.
  • No sistema Nemotron-Labs-Diffusion, o comprimento de aceitação aumentou de 8,8 para 9,9 palavras, resultando em um aumento de velocidade de 1,12 vez.

Talvez o mais impressionante seja que o artigo mostrou que o PRESTO funciona mesmo quando o sistema está sendo "estocástico" (aleatório), o que geralmente é mais difícil de prever. Nesses casos, o aumento de velocidade foi ainda mais pronunciado, com alguns benchmarks vendo quase o dobro do rendimento (throughput).

Os autores também verificaram o "custo" deste novo método. Eles descobriram que o trabalho adicional necessário para construir a árvore e calcular as novas pontuações era minúsculo — menos de 4% do tempo total. A grande maioria do tempo (mais de 90%) ainda era gasto na verificação real pelo modelo chefe. Isso significa que o PRESTO é uma atualização altamente eficiente que não atrasa o sistema com excesso de carga (overhead).

O que o PRESTO NÃO É

É importante notar o que o artigo não afirma. Os autores declaram explicitamente que aplicar uma estrutura de árvore ingênua (sem sua pontuação alinhada ao prefixo) é subótimo. Se você apenas pegar as pontuações brutas do modelo de difusão e construir uma árvore, você não obterá o benefício total devido à natureza "cega" das pontuações. O PRESTO é especificamente sobre corrigir esse descompasso de pontuação.

Além disso, o artigo não afirma ter resolvido o problema dos modelos de difusão inteiramente. Eles reconhecem que seu método depende de um "sinal de alinhamento de prefixo tratável" (como o modelo n-grama que usaram) para fazer o trabalho pesado da correção. Eles sugerem que trabalhos futuros poderiam explorar sinais ainda mais ricos, mas, por enquanto, sua correção simples é suficiente para observar ganhos massivos.

Por Que Isso Importa

Na corrida para tornar a IA mais rápida e eficiente, cada fração de velocidade conta. A decodificação especulativa tem sido um tema quente porque nos permite usar os melhores modelos, mais precisos, sem pagar a penalidade total de tempo. No entanto, os métodos atuais eram limitados pelo fato de tratarem os modelos de difusão como máquinas lineares, ignorando sua capacidade única de gerar muitas opções simultaneamente.

O PRESTO muda o jogo ao tratar os modelos de difusão como os exploradores de múltiplos caminhos que eles são. Ao alinhar a pontuação com a maneira como o chefe verifica o trabalho, ele desbloqueia o potencial total da geração paralela do modelo de difusão. O resultado é um sistema que não é apenas ligeiramente mais rápido, mas significativamente mais eficiente, permitindo gerar texto, resolver problemas matemáticos e escrever código em velocidades que anteriormente eram consideradas impossíveis para esses tipos de modelos. Como os autores colocaram, eles transformaram uma caminhada de "caminho único" em uma expedição baseada em "árvore", garantindo que cada passo dado seja um passo em direção à resposta correta.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →