← Últimos artigos
💬 NLP

Unlocking Parallelism in Autoregressive Language Models via Speculative Decoding with Progressive Tree Drafting

Este artigo apresenta o Progressive Tree Drafting (PTD), um método de decodificação especulativa livre de treinamento e agnóstico ao modelo que aproveita uma estratégia paralela estruturada e guiada dentro do LLM alvo para alcançar até 2x de aceleração na decodificação sem módulos auxiliares.

Autores originais: Zipeng Gao, Zhi Zheng, Qingrong Xia, Junda Lin, Ziwei Zhao, Tong Xu, Zhefeng Wang, Enhong Chen

Publicado 2026-07-14
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Zipeng Gao, Zhi Zheng, Qingrong Xia, Junda Lin, Ziwei Zhao, Tong Xu, Zhefeng Wang, Enhong Chen

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você esteja tentando escrever uma história com um amigo robô superinteligente. Normalmente, esse robô é muito cuidadoso, mas também muito lento: ele escreve uma palavra de cada vez, para para pensar, verifica seu trabalho e então escreve a próxima palavra. Esse processo "um por um" é como uma estrada de pista única onde engarrafamentos ocorrem facilmente porque o robô tem que esperar por cada única palavra antes de seguir em frente.

Por um tempo, as pessoas tentaram acelerar isso contratando um "assistente de rascunho" — um robô menor e mais rápido para adivinhar as próximas palavras. Mas isso criou um novo problema: você tinha que pagar o assistente, treiná-lo para falar como o robô grande e constantemente passar notas entre eles. Era como contratar um mensageiro que tinha que correr de um lado para o outro, atrasando todo mundo.

Então, alguns pesquisadores engenhosos tentaram um truque diferente: pediram ao robô grande para adivinhar suas próprias palavras futuras sem nenhum ajudante. Eles tentaram fazer o robô pensar em vários caminhos de história diferentes ao mesmo tempo. Mas o artigo argumenta que esses métodos anteriores de "autoadivinhação" eram um pouco bagunçados. O robô frequentemente escrevia duas ou três frases que eram quase exatamente iguais, desperdiçando sua capacidade cerebral com ideias duplicadas. Era como pedir a um chef para cozinhar três refeições diferentes, apenas para perceber que todas acabaram sendo exatamente a mesma sopa.

A Grande Ideia do Artigo: O Truque da "Árvore"

Os autores deste artigo, aceito no COLM 2026, propõem uma nova maneira de organizar o pensamento do robô chamada Progressão de Rascunho em Árvore (Progressive Tree Drafting - PTD). Em vez de deixar o robô vagar por caminhos aleatórios e separados, eles o guiam para cultivar uma "árvore" de ideias.

Veja como funciona de uma forma lúdica:

  1. O Ramificar: Imagine que o robô começa com uma frase. Em vez de apenas adivinhar a próxima palavra, ele se ramifica como uma árvore, tentando alguns finais diferentes ao mesmo tempo (como "O Havaí é um lugar alegre" vs. "O Havaí é um lugar famoso").
  2. A Poda: Esta é a parte mágica. Se dois ramos da árvore começarem a parecer muito semelhantes (como dois ramos crescendo exatamente na mesma direção), o robô "poda" os excedentes. Ele corta as duplicatas para economizar energia.
  3. O Crescimento: O robô continua cultivando esta árvore, passo a passo, mas verifica constantemente para garantir que os ramos sejam realmente diferentes e façam sentido. É como um jardineiro que deixa a planta crescer livremente, mas poda os galhos mortos ou idênticos para que a planta permaneça saudável e diversa.

O Que Eles Descobriram

Os pesquisadores testaram essa ideia em vários cérebros robóticos famosos (como LLaMA e Qwen) e encontraram resultados empolgantes:

  • Velocidade: Ao usar este método de árvore, o robô conseguiu escrever até 2,30 vezes mais rápido em problemas matemáticos e 2,08 vezes mais rápido em tarefas de programação comparado ao antigo método lento. Em tarefas de chat geral, foi cerca de 1,67 vezes mais rápido.
  • Sem Ajuda Extra Necessária: A melhor parte é que este método não precisa de nenhum robô "assistente" extra ou treinamento especial. Ele funciona diretamente com o robô existente.
  • Melhor Qualidade: Como o robô é forçado a explorar diferentes caminhos (os ramos da árvore) em vez de apenas repetir o mesmo palpite, as palavras que ele aceita são mais longas e fazem mais sentido juntas.

O Que Eles Descartaram

O artigo é muito claro sobre o que não funciona tão bem quanto o novo método deles. Eles argumentam contra a ideia de que simplesmente deixar o robô adivinhar múltiplos caminhos lineares (como uma linha reta de palpites) é suficiente. Sua análise mostrou que, sem a estrutura de "árvore" e a "poda" de duplicatas, o robô desperdiça mais da metade do seu tempo pensando em ideias que são 80% idênticas. Eles também mostraram que adicionar "módulos de rascunho" externos (os robôs assistentes) cria muito ruído de comunicação e exige muito treinamento, tornando-os menos eficientes do que o método de autogestão em árvore do próprio robô.

O Quão Certos Eles Estão?

Os autores estão bastante confiantes nesses números porque realizaram experimentos reais em hardware de verdade (GPUs NVIDIA L20). Eles não apenas simularam a ideia; eles mediram a velocidade em "tokens por segundo" e descobriram que seu método supera consistentemente outros métodos populares de "sem treinamento", como o Lookahead Decoding e o Self-Draft. Por exemplo, no benchmark de matemática GSM-8k, o método deles alcançou um aumento de velocidade de 2,30×, enquanto o próximo melhor método alcançou apenas 1,90×.

Em resumo, o artigo sugere que, se você quiser fazer a IA falar mais rápido sem contratar ajuda extra, deve parar de deixá-la vagar em linhas retas e começar a guiá-la para cultivar uma árvore inteligente e podada de ideias. É uma forma de tirar o máximo proveito do cérebro do robô, garantindo que ele não perca tempo pensando na mesma coisa duas vezes.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →