← Últimos artigos
🤖 machine learning

TreeFlash: Parallel AR-Approximation for Faster Speculative Decoding

O TreeFlash é um novo método de decodificação especulativa paralela que aprimora drafters de bloco de tiro único ao incorporar uma camada MLP para aproximar distribuições autorregressivas, melhorando significativamente a eficiência de bloco e a aceleração enquanto mantém a complexidade de tempo de decodificação constante.

Autores originais: Peer Rheinboldt, Frédéric Berdoz, Roger Wattenhofer

Publicado 2026-06-03
📖 4 min de leitura☕ Leitura rápida

Autores originais: Peer Rheinboldt, Frédéric Berdoz, Roger Wattenhofer

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando prever a próxima palavra em uma frase, como se estivesse terminando a história de um amigo.

O Jeito Antigo (Autorregressivo)
Normalmente, grandes modelos de IA (como os que escrevem este artigo) são muito cuidadosos, mas lentos. Eles escrevem uma palavra, verificam, depois escrevem a próxima palavra baseada naquela, e assim por diante. É como uma única pessoa digitando uma frase letra por letra. Eles não conseguem acelerar porque precisam esperar pela letra anterior antes de digitar a próxima.

O Atalho "Especulativo"
Para acelerar as coisas, pesquisadores inventaram um sistema de "rascunho". Uma IA pequena e rápida (o Rascunhador) adivinha um bloco inteiro de palavras de uma só vez. Então, a IA grande e lenta (o Verificador) verifica todas elas de uma só vez. Se os palpites estiverem corretos, a IA grande aceita todos instantaneamente, economizando muito tempo.

O Problema do Rascunho de "Um Passo Só" (One-Shot)
Recentemente, um método chamado DFlash foi introduzido. Em vez de adivinhar as palavras uma por uma, o Rascunhador tenta cuspir o bloco inteiro de palavras em um único instante (um "one-shot").

  • A Analogia: Imagine um chef tentando adivinhar os próximos 10 ingredientes para uma sopa de uma só vez, sem provar os 9 primeiros.
  • A Falha: Como o chef não provou os ingredientes anteriores, seu palpite para o 10º ingrediente é baseado apenas na receita original, não no fato de que ele acabou de adicionar "sal" ou "pimenta". Conforme a lista de palpites fica mais longa, os palpites do chef começam a se afastar do que a receita real (o Verificador) realmente quer.
  • O Problema da Árvore: Métodos mais novos tentam adivinhar vários caminhos diferentes ao mesmo tempo (como uma árvore com muitos galhos). Mas, se os galhos compartilham um início comum, eles são forçados a usar o mesmo palpite para o próximo passo, mesmo que um galho tenha tido "sal" e o outro tenha tido "açúcar". Isso torna a árvore bagunçada e menos precisa.

A Solução: TreeFlash
Os autores deste artigo criaram o TreeFlash. Eles perceberam que o chef precisa de uma ajuda minúscula para lembrar o que acabou de "provar".

  • O Truque de Mágica: Eles adicionaram uma camada de ajuda muito pequena e leve (um AR-Aproximador) ao Rascunhador.
  • Como funciona: Mesmo que o Rascunhador ainda esteja adivinhando o bloco inteiro de uma vez (mantendo-o super rápido), este ajudante olha para a palavra imediatamente anterior no rascunho e sussurra: "Ei, já que acabamos de dizer 'sal', a próxima palavra provavelmente deve ser 'pimenta', e não 'açúcar'".
  • O Resultado: O Rascunhador pode agora fazer palpites que dependem das palavras logo antes delas, exatamente como um humano normal faria, mas ainda faz tudo em um único instante.

Por que isso é importante
O artigo afirma que, ao adicionar este pequeno ajudante:

  1. Mantém-se rápido: Não desacelera o processo porque o ajudante é muito pequeno e o cálculo é feito em paralelo.
  2. É mais preciso: Os palpites permanecem muito mais próximos do que a IA grande realmente quer, especialmente para as palavras posteriores no bloco.
  3. Constrói árvores melhores: Ao adivinhar múltiplos caminhos ao mesmo tempo, o TreeFlash pode lidar com os diferentes galhos corretamente (ex: um galho recebe "sal", o outro recebe "açúcar", e as próximas palavras se ajustam de acordo).

Os Resultados
Quando testaram o TreeFlash em várias tarefas (como problemas matemáticos, programação e conversas gerais) usando diferentes tamanhos de modelos de IA, ele superou consistentemente os melhores métodos anteriores.

  • Ele aceitou mais palavras corretas por palpite (maior eficiência).
  • Tornou todo o processo mais rápido (maior aceleração/speedup).
  • A melhoria tornou-se ainda maior quando pediram à IA para adivinhar listas de palavras mais longas.

Em Resumo
TreeFlash é como dar um pen drive de memória para um robô de leitura rápida. Ele permite que o robô adivinhe um parágrafo inteiro em um segundo, mas em vez de adivinhar cegamente, ele lembra a última palavra que adivinhou para tornar o próximo palpite mais inteligente. Isso faz com que a IA escreva muito mais rápido sem perder a qualidade.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →