← Últimos artigos
💬 NLP

DIVERSED: Relaxed Speculative Decoding via Dynamic Ensemble Verification

O artigo apresenta o DIVERSED, um método de decodificação especulativa que utiliza um verificador de ensemble dinâmico para relaxar a verificação rígida de tokens, aumentando significativamente a eficiência de inferência sem comprometer a qualidade da geração.

Autores originais: Ziyi Wang, Siva Rajesh Kasa, Ankith M S, Santhosh Kumar Kasa, Jiaru Zou, Sumit Negi, Ruqi Zhang, Nan Jiang, Qifan Song

Publicado 2026-04-10
📖 4 min de leitura☕ Leitura rápida

Autores originais: Ziyi Wang, Siva Rajesh Kasa, Ankith M S, Santhosh Kumar Kasa, Jiaru Zou, Sumit Negi, Ruqi Zhang, Nan Jiang, Qifan Song

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está escrevendo um livro muito longo e complexo, e tem dois escritores ajudando você:

  1. O "Rascunho Rápido" (Draft Model): Um escritor jovem, veloz e ágil, que joga ideias no papel instantaneamente. Ele é rápido, mas às vezes erra a gramática ou a lógica.
  2. O "Editor Sênior" (Target Model): Um editor experiente, extremamente inteligente e preciso, mas que é lento para pensar e revisar cada palavra.

O método tradicional de Decodificação Especulativa funciona assim:
O escritor rápido joga 5 palavras na mesa. O editor sênior olha para cada uma delas, uma por uma. Se o editor disser "Sim, está perfeito", você aceita as 5 palavras de uma vez. Se o editor disser "Não, essa está errada", você joga fora todas as 5 palavras, mesmo que as primeiras 4 estivessem corretas, e o editor precisa começar a escrever a próxima palavra do zero.

O Problema:
Muitas vezes, o editor sênior é muito exigente. Ele rejeita palavras que, na verdade, não estragariam a história, apenas porque não eram exatamente o que ele teria escrito. Isso faz com que o processo fique lento, porque você está desperdiçando tempo rejeitando coisas que poderiam ser aceitas.


A Solução: DIVERSED (O "Mediador Inteligente")

O artigo apresenta o DIVERSED, que é como se você contratasse um mediador inteligente para ficar entre o escritor rápido e o editor sênior.

1. A Ideia do "Peso Dinâmico" (O Contexto é Tudo)

No método antigo (chamado de "Ensemble Estático"), o mediador usava uma regra fixa: "Sempre confie 50% no rápido e 50% no sênior". O problema é que nem todas as palavras são iguais.

  • Se o escritor rápido errar um número em uma conta de matemática, é um desastre. O mediador deve confiar 100% no editor sênior aqui.
  • Se o escritor rápido usar uma palavra bonita para descrever uma paisagem, mas o editor sênior teria usado outra palavra também bonita, não faz sentido rejeitar. O mediador pode confiar mais no rápido aqui.

O DIVERSED é especial porque ele aprende a ajustar essa confiança em tempo real. Ele olha para o contexto da frase e decide:

  • "Neste momento, a precisão é vital. Vamos ser rigorosos."
  • "Neste momento, a criatividade é mais importante. Vamos aceitar a sugestão do rápido."

2. A Analogia do Trânsito

Pense no processo de gerar texto como um carro dirigindo em uma estrada cheia de semáforos.

  • Método Antigo: O carro para em todo semáforo, mesmo que o farol esteja verde para ele passar, só porque o "sistema central" diz para verificar. Isso causa engarrafamento.
  • DIVERSED: O carro tem um navegador inteligente (o mediador) que sabe: "Neste cruzamento, o trânsito está livre, podemos acelerar e aceitar o caminho sugerido pelo GPS rápido. Naquele outro, onde há uma obra, vamos parar e verificar com o engenheiro sênior."

Isso significa que o carro (o modelo de IA) passa por mais semáforos sem parar, chegando ao destino muito mais rápido, sem sair da rota correta.

3. O Resultado na Prática

Os autores testaram isso em várias tarefas:

  • Matemática: Onde um erro de cálculo é fatal, o DIVERSED fica rigoroso.
  • Resumo de Notícias: Onde a essência importa mais que a palavra exata, o DIVERSED é mais flexível e aceita mais sugestões do modelo rápido.

O Ganho:
Com o DIVERSED, o sistema consegue aceitar muito mais palavras sugeridas pelo modelo rápido sem precisar reescrevê-las. Isso reduz o tempo de espera (latência) de forma significativa, tornando a IA muito mais ágil, sem perder a qualidade da resposta final.

Resumo em uma frase:

O DIVERSED é um sistema que ensina a IA a saber quando ser rigorosa e quando ser flexível, aceitando mais "dicas" do modelo rápido para escrever mais depressa, mas sem cometer erros bobos. É como ter um editor que sabe exatamente quando confiar no instinto do escritor rápido e quando chamar o especialista para checar.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →