← Últimos artigos
💬 NLP

DFlare: Scaling Up Draft Capacity for Block Diffusion Speculative Decoding

O DFlare acelera a inferência de LLMs ao superar as limitações de expressividade de métodos anteriores de difusão por blocos por meio de um mecanismo de fusão leve camada a camada que permite modelos de rascunho mais profundos e capazes, alcançando acelerações significativas em diversos benchmarks.

Autores originais: Jiebin Zhang, Zhenghan Yu, Song Liu, Eugene J. Yu, Zheng Li, Dawei Zhu, Jiangshan Duo, Weimin Xiong, Yifan Song, Guanghua Yu, Jianchen Zhu, Sujian Li

Publicado 2026-06-02
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Jiebin Zhang, Zhenghan Yu, Song Liu, Eugene J. Yu, Zheng Li, Dawei Zhu, Jiangshan Duo, Weimin Xiong, Yifan Song, Guanghua Yu, Jianchen Zhu, Sujian Li

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você esteja tentando escrever uma história longa, mas você é um escritor muito lento e perfeccionista (o Modelo Alvo). Cada vez que você quer escrever a próxima palavra, tem que pensar muito bem, verificar sua gramática e garantir que ela se encaixe perfeitamente. Isso leva muito tempo.

Para acelerar isso, você contrata um assistente rápido e energético (o Modelo de Rascunho). O assistente tenta adivinhar as próximas palavras para você. Se o assistente estiver certo, você apenas diz "Sim, continue!", e avança rapidamente. Se o assistente estiver errado, você tem que parar, corrigi-lo e recomeçar. Isso é chamado de Decodificação Especulativa.

O Problema: O Assistente "Tamanho Único"

Recentemente, um novo método chamado DFlash tentou tornar o assistente ainda melhor. Em vez de adivinhar uma palavra por vez, o assistente do DFlash tenta adivinhar um bloco inteiro de palavras de uma só vez (como tentar adivinhar a próxima frase de uma só vez).

No entanto, o DFlash tinha uma falha importante. Ele deu ao assistente uma "folha de cola" única e genérica derivada do céreza do escritor principal.

  • A Falha: Imagine que o assistente tem 7 camadas de pensamento (como 7 andares em um edifício). O DFlash deu a mesma folha de cola genérica para o 1º andar, para o 4º andar e para o 7º andar.
  • O Resultado: O assistente ficou confuso. Os andares inferiores precisavam de regras gramaticais simples, enquanto os andares superiores precisavam de ideias complexas de enredo. Como todos receberam a mesma informação genérica, o assistente não conseguia ficar mais inteligente ao adicionar mais andares. Ele atingiu um "teto" onde adicionar mais camadas não ajudava.

A Solução: DFLARE

Os autores deste artigo criaram o DFLARE. Pense no DFLARE como uma atualização no sistema de treinamento do assistente, para que cada andar do edifício receba uma folha de cola personalizada.

Aqui está como o DFLARE funciona, usando analogias simples:

1. As Folhas de Cola Personalizadas (Fusão por Camada)

No DFLARE, em vez de dar a cada andar a mesma folha de cola genérica, o sistema cria uma mistura única de informações para cada andar.

  • A Analogia: Imagine que o escritor principal (Modelo Alvo) tem uma biblioteca de livros.
    • O DFlash pegou uma página da biblioteca, tirou sete fotocópias dela e deu uma cópia para cada andar.
    • O DFLARE olha para a biblioteca e diz: "O Andar 1 precisa de uma página sobre gramática, o Andar 4 precisa de uma página sobre reviravoltas no enredo e o Andar 7 precisa de uma página sobre emoções de personagens". Ele mistura diferentes páginas da biblioteca para criar um guia único e perfeito para cada andar específico.
  • O Benefício: Como cada andar tem um guia especializado, o assistente pode realmente se tornar mais inteligente ao adicionar mais andares. O "teto" é quebrado.

2. Cadernos Separados (Projeções KV Heterogêneas)

O assistente precisa armazenar dois tipos de notas: seus próprios palpites e as informações do escritor principal.

  • A Analogia: No sistema antigo, o assistente tentava escrever seus próprios palpites e as notas do escritor principal no mesmo caderno. A tinta se misturava e era difícil de ler.
  • A Correção do DFLARE: Ele dá ao assistente dois cadernos separados. Um é para seus próprios palpites ousados, e o outro é estritamente para as notas do escritor principal. Isso mantém a informação limpa e fácil de usar.

3. Aprendizado em Estágios (Perda Progressiva)

Quando o assistente está aprendendo, ele não deve tentar dominar as partes mais difíceis da história imediatamente.

  • A Analogia: Imagine um professor avaliando um aluno.
    • O Jeito Antigo: O professor avaliava a primeira frase fácil e a última frase difícil com a mesma importância desde o primeiro dia. O aluno ficava sobrecarregado.
    • O Jeito do DFLARE: O professor começa focando apenas nas primeiras frases fáceis para construir confiança. À medida que o aluno melhora, o professor começa a avaliar lentamente as frases mais difíceis no final do bloco. Essa abordagem de "aquecimento" ajuda o assistente a aprender de forma mais rápida e eficaz.

Os Resultados: O Quão Rápido?

O artigo testou este novo sistema em três "escritores principais" (modelos de IA) e descobriu que o DFLARE é significativamente mais rápido que o método anterior (DFlash).

  • Em um escritor de tamanho médio (Qwen3-4B): É 5,52 vezes mais rápido.
  • Em um escritor grande (Qwen3-8B): É 5,46 vezes mais rápido.
  • Em um escritor muito grande (GPT-OSS-20B): É 3,91 vezes mais rápido.

Em termos simples, se o método antigo levava 10 segundos para escrever um parágrafo, o DFLARE pode fazê-lo em cerca de 2 segundos, mantendo a mesma história de alta qualidade.

Resumo

DFLARE é como atualizar um assistente rápido, dando a cada parte de seu cérebro um guia especializado e personalizado em vez de um genérico. Isso permite que o assistente cresça e se torne mais inteligente, levando a aumentos massivos de velocidade na rapidez com que a IA pode escrever textos, códigos ou resolver problemas matemáticos.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →