Approximate Speculative Decoding
Este artigo introduz o Approximate Speculative Decoding (ASD), um método livre de treinamento que acelera a geração autorregressiva ao aceitar seletivamente incompatibilidades de tokens de rascunho com base em um orçamento de arrependimento para reutilizar sufixos válidos, aumentando assim o rendimento sem exigir novos modelos de rascunho ou ajuste fino.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você esteja tentando escrever uma história com um amigo muito inteligente, mas incrivelmente lento. Cada vez que você quer adicionar uma nova palavra à sua história, você tem que esperar seu amigo pensar profundamente, consultar toda a sua biblioteca de conhecimento e dizer exatamente qual palavra vem a seguir. É assim que os modelos de linguagem de IA modernos funcionam: eles geram texto palavra por palavra, e a parte do "pensar" consome a maior parte do tempo, fazendo o processo parecer uma pintura secando ao sol. Para acelerar isso, cientistas inventaram um truque chamado "decodificação especulativa". Pense nisso como ter um assistente júnior rápido que adivinha as próximas palavras para você. Você então pede ao seu amigo especialista e lento para verificar rapidamente se esses palpites estão certos. Se o especialista concordar, você consegue escrever várias palavras de uma vez em vez de apenas uma, economizando uma quantidade enorme de tempo.
No entanto, há um porém: o amigo especialista é um rigoroso seguidor de regras. Se o assistente adivinhar até mesmo uma palavra que não seja a escolha absolutamente perfeita que o especialista escolheria, o especialista interrompe todo o processo imediatamente. Eles jogam fora todas as outras palavras que o assistente adivinhou para aquele turno, mesmo que a maioria delas fosse perfeita. É como um professor corrigindo uma prova que para de ler no momento em que vê uma única resposta errada, jogando o resto do papel no lixo. Essa regra de "tudo ou nada" mantém a história perfeita, mas desperdiça muito do trabalho duro do assistente e torna tudo mais lento.
Este artigo apresenta um novo método chamado Decodificação Especulativa Aproximada (ASD - Approximate Speculative Decoding), que atua como um professor mais inteligente e flexível. Em vez de jogar fora a prova inteira só porque houve um pequeno erro, o ASD pergunta: "Este erro é minúsculo? E o assistente acertou as próximas palavras de qualquer maneira?". Se a resposta for sim, o ASD aceita o pequeno erro, mantém as boas palavras que se seguiram e segue em frente. É como um professor que diz: "Você errou a grafia de 'porque', mas escreveu as dez palavras seguintes perfeitamente, então vamos apenas corrigir essa palavra e continuar". Os pesquisadores descobriram que, ao ser ligeiramente mais tolerante com erros pequenos, eles conseguiram fazer a IA escrever significativamente mais rápido sem estragar a qualidade da história.
A História do Assistente "Orçamentado"
A ideia central por trás do ASD é parar de tratar cada erro como um desastre. No método antigo, se o seu assistente adivinhasse uma palavra que não era a principal escolha, o sistema pararia imediatamente. Mas os autores perceberam que, às vezes, o palpite "errado" do assistente é, na verdade, muito próximo do correto, e as palavras que o seguem ainda são perfeitas.
Para resolver isso, a equipe criou um sistema com um orçamento. Imagine que você tem um pote de "tokens de erro". Você tem permissão para cometer alguns erros pequenos, mas precisa pagá-los usando o seu pote.
- O Portão Local (Local Gate): Antes de aceitar um erro, o sistema verifica o quão "ruim" ele é. Se o palpite do assistente for apenas ligeiramente menos provável do que a palavra perfeita, é um erro barato. Se for um erro enorme, custa muitos tokens, e o sistema diz "não".
- O Limite de Bloco (Block Cap): Você não pode cometer muitos erros em um único lote de palpites. Isso evita que o assistente se torne impreciso de uma só vez.
- O Orçamento de Requisição (Request Budget): Este é o pote total de tokens para toda a conversa. Quando os tokens acabam, você tem que voltar a ser perfeito (seguindo estritamente as regras antigas) pelo resto da história.
A mágica acontece quando o sistema aceita um pequeno erro. Como os próximos palpites do assistente foram, na verdade, perfeitos (coincidindo com o que o especialista teria escolhido), o sistema pode "reutilizá-los". Ele não precisa pedir ao especialista lento para verificá-los novamente. O sistema apenas os aceita e segue em frente. Isso transforma um momento de "parar e jogar fora" em um momento de "corrigir e continuar".
O Que Eles Descobriram
Os pesquisadores testaram essa ideia usando modelos de IA muito populares (como Qwen3 e DeepSeek) em uma variedade de tarefas, desde a resolução de problemas matemáticos até a escrita de código. Eles não precisaram retreinar os modelos ou ensinar nada novo ao assistente; eles apenas mudaram a forma como o "professor" (o verificador) corrigia o trabalho.
Os resultados foram bastante promissores. Ao usar essa abordagem orçamentada, o sistema tornou-se mais rápido sem a necessidade de treinamento adicional.
- Em um conjunto de sete tarefas diferentes, o sistema ficou, em média, 7,78% mais rápido do que o método antigo e rigoroso.
- Nos melhores casos, como no conjunto de dados MATH-500, a aceleração foi de 11,73%.
- Ao testarem em um modelo massivo chamado DeepSeek-V4-Flash, viram as taxas de aceitação (quantos palpites o sistema manteve) subirem cerca de 10% a 16%.
O artigo é cuidadoso ao notar que isso não é uma varinha mágica que torna tudo perfeito. Os autores afirmam explicitamente que este método altera o caminho que a IA percorre para chegar à resposta. Às vezes, a história pode ser ligeiramente diferente, ou o "hash" (uma impressão digital digital do texto) pode mudar, mesmo que a resposta final esteja correta. Por exemplo, em alguns testes de codificação, a precisão caiu ligeiramente (menos de 1,5 pontos percentuais), mas em muitas outras tarefas, a precisão permaneceu exatamente a mesma ou até melhorou ligeiramente.
Por Que Isso Importa
A beleza deste artigo é que ele não exige a construção de uma nova IA mais rápida ou o treinamento de um novo assistente. Ele apenas muda as regras do jogo para o que você já tem. É como perceber que um guarda de trânsito rigoroso está atrasando toda a cidade porque para os carros por cada infração menor, quando uma abordagem mais flexível manteria o tráfego fluindo suavemente com apenas riscos pequenos e gerenciáveis.
Os autores sugerem que este método é uma ótima maneira de extrair mais velocidade dos sistemas de IA atuais. Eles enfatizam que, embora os ganhos de velocidade sejam reais e mensuráveis (até 15,26% em alguns casos), os usuários precisam estar cientes de que estão trocando uma pequena parcela de perfeição estrita por muita velocidade. É uma troca calculada: você faz sua história ser escrita muito mais rápido e, para a maioria das pessoas, as pequenas diferenças na redação não importarão de forma alguma. O artigo conclui que esta abordagem "orçamentada" é uma maneira prática e livre de treinamento de tornar a geração de IA mais rápida, desde que você verifique os resultados para garantir que a qualidade ainda é boa o suficiente para suas necessidades.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.