← Últimos artigos
💬 NLP

FlexDraft: Flexible Speculative Decoding via Attention Tuning and Bonus-Guided Calibration

FlexDraft é um framework de decodificação especulativa sem perdas que acelera a inferência de LLMs em diferentes tamanhos de lote, combinando ajuste de atenção para difusão de blocos de alta qualidade, calibração guiada por bônus para resolver incompatibilidades na verificação de rascunhos e um mecanismo de comutação dinâmica que otimiza entre modos de execução paralela e sequencial.

Autores originais: Yaojie Zhang, Jianuo Huang, Junlong Ke, Yuhang Han, Yongji Long, Tianchen Zhao, Biqing Qi, Linfeng Zhang

Publicado 2026-05-20
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Yaojie Zhang, Jianuo Huang, Junlong Ke, Yuhang Han, Yongji Long, Tianchen Zhao, Biqing Qi, Linfeng Zhang

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando escrever uma história longa, mas tem um editor muito rigoroso (o Modelo Alvo) que é incrivelmente inteligente, mas se move muito lentamente porque precisa verificar cada palavra individualmente antes de escrever a próxima. Isso faz com que a escrita da história leve uma eternidade.

Para acelerar as coisas, você contrata um assistente rápido e energético (o Rascunhador) para adivinhar as próximas palavras para você. O assistente escreve um parágrafo inteiro com antecedência, e então o editor lento verifica rapidamente se essas adivinhações estavam corretas. Se estiverem corretas, você pode pular o tempo de pensamento lento do editor para essas palavras. Isso é chamado de Decodificação Espetacular.

No entanto, a maneira antiga de fazer isso tinha dois grandes problemas:

  1. O Jogo de Espera: O assistente escrevia uma adivinhação, depois esperava o editor terminar de verificá-la antes de escrever a próxima adivinhação. Eles estavam se revezando, o que desperdiçava tempo.
  2. A Confusão "E Se": Em métodos mais novos e rápidos, o assistente tenta escrever múltiplos parágrafos futuros diferentes ao mesmo tempo, esperando cobrir todas as possibilidades. Mas o assistente não sabe qual parágrafo o editor realmente aprovará. Isso leva o assistente a desperdiçar energia escrevendo parágrafos que são descartados, e o editor a ter que verificar muitas opções, o que desacelera tudo novamente quando você tem muitas histórias para escrever ao mesmo tempo (tamanhos de lote grandes).

Apresentando o FlexDraft: O Assistente Inteligente e Flexível

O artigo apresenta o FlexDraft, um novo sistema que corrige esses problemas para que você possa escrever mais rápido sem perder qualidade. Veja como funciona, usando analogias simples:

1. Os "Óculos Especializados" (Ajuste de Atenção)

Normalmente, para tornar o assistente melhor em adivinhar, você precisa reeducar todo o seu cérebro, o que é caro e arriscado (pode fazer com que ele esqueça como falar corretamente).

O FlexDraft é diferente. Ele coloca um par de "óculos especializados" apenas nos olhos do assistente para os últimos poucos passos do pensamento.

  • Como funciona: O assistente mantém todo o seu conhecimento original (o cérebro congelado), mas aprende a usar esses novos óculos para olhar para "espaços em branco" (tokens mascarados) e preenchê-los todos de uma vez.
  • O Benefício: O assistente torna-se um adivinhador rápido e paralelo sem precisar de um transplante completo de cérebro. Ele permanece fiel ao estilo do editor, para que as adivinhações sejam de alta qualidade e seguras.

2. O "Anotação Mágica" (Calibração Guiada por Bônus)

Aqui está a parte complicada: Quando o editor verifica as adivinhações do assistente, às vezes o editor diz: "Não, essa palavra está errada, mas aqui está a palavra correta para começar em vez disso." Essa palavra correta é chamada de Token de Bônus.

Nos antigos métodos "rápidos", o assistente tinha que adivinhar o próximo parágrafo antes de ver essa Nota Mágica. Então, o assistente poderia adivinhar uma história sobre um pirata, enquanto o editor queria uma história sobre um chef. A adivinhação do assistente estava errada porque ele não tinha a nota.

O FlexDraft adiciona um sistema de Nota Mágica:

  • Como funciona: Assim que o editor revela o Token de Bônus, o FlexDraft usa uma calculadora minúscula e rápida para ajustar instantaneamente as adivinhações anteriores do assistente para corresponder a essa nova direção.
  • O Benefício: Mesmo que o assistente tenha adivinhado cegamente no início, o sistema rapidamente "direciona" a adivinhação para alinhar com a correção do editor. Isso significa que menos adivinhações são rejeitadas.

3. O "Policial de Trânsito" (Decodificação Flexível)

O maior problema dos antigos métodos "rápidos" era que eles tentavam escrever todas as histórias futuras possíveis de uma vez. Se você tiver apenas uma história para escrever (lote pequeno), isso é bom. Mas se você tiver 16 histórias para escrever ao mesmo tempo (lote grande), o assistente fica sobrecarregado tentando escrever 16 futuros diferentes para cada história individual, e o editor fica atolado verificando todas elas.

O FlexDraft age como um Policial de Trânsito inteligente:

  • Trânsito Leve (Lote Pequeno): Quando há poucas histórias, o policial diz: "Vá! Escreva todos os futuros possíveis ao mesmo tempo!" Isso sobrepõe a escrita e a verificação para economizar tempo.
  • Trânsito Pesado (Lote Grande): Quando há muitas histórias, o policial diz: "Pare! Não escreva todas as possibilidades. Escreva apenas a que tem maior probabilidade de ser aprovada."
  • O Benefício: Ele alterna estratégias automaticamente. Evita o "desperdício de energia" de escrever muitas opções quando o sistema está ocupado, impedindo que a velocidade colapse.

O Resultado

Ao combinar esses três truques, o FlexDraft permite que o editor lento processe texto muito mais rápido.

  • Sem Perda de Qualidade: A história final é exatamente a mesma que se o editor lento a tivesse escrito palavra por palavra.
  • Aceleração Enorme: Em testes com um modelo de IA popular (Qwen3-8B), o FlexDraft tornou o sistema 4,59 vezes mais rápido do que o método lento padrão.
  • Escalabilidade: Funciona bem seja você escrevendo uma história ou gerenciando uma multidão enorme de histórias, ao contrário de métodos anteriores que ficavam lentos e desajeitados quando a multidão crescia.

Em resumo, o FlexDraft é uma maneira flexível e sem perdas de permitir que um assistente rápido ajude um editor lento, garantindo que trabalhem juntos suavemente sem desperdiçar tempo ou cometer erros.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →