← Últimos artigos
💬 NLP

EntMTP: Accelerating LLM Inference with Entropy Guided Multi Token Prediction

O EntMTP é um escalonador livre de treinamento que ajusta dinamicamente a profundidade de predição de múltiplos tokens com base na entropia de geração local para maximizar o throughput de inferência enquanto mantém a qualidade da saída, alcançando até 1,36x de aceleração em relação às linhas de base existentes.

Autores originais: Carrie Chen

Publicado 2026-06-29
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Carrie Chen

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você esteja tentando escrever uma história, mas tem uma regra muito rígida: você só pode escrever uma palavra de cada vez e, após cada única palavra, você tem que parar, conferir todo o seu trabalho para garantir que aquela palavra está perfeita, e então seguir em frente. É assim que os modelos de linguagem de grande escala (LLMs) atuais geralmente funcionam. É incrivelmente preciso, mas é dolorosamente lento porque você está constantemente parando para conferir seu trabalho.

Para acelerar isso, pesquisadores inventaram um truque chamado Previsão de Múltiplos Tokens (MTP). Em vez de escrever uma palavra e conferir, o modelo tenta adivinhar as próximas três ou quatro palavras de uma só vez, como um rascunho. Então, ele faz uma "checagem" única para ver quantos desses palpites estavam certos. Se ele acertou três palavras corretamente, ele economiza muito tempo.

No entanto, o artigo EntMTP aponta uma falha em como esse truque é usado atualmente.

O Problema: O Erro do "Tamanho Único"

Atualmente, os modelos usam uma estratégia estática. Imagine que você está dirigindo um carro. O método atual diz: "Não importa se você está dirigindo em uma rodovia suave ou em uma estrada de terra esburacada, você deve sempre manter o pé no acelerador exatamente na mesma velocidade e olhar exatamente 100 pés à frente."

  • Rodovia suave (baixa entropia): A estrada é previsível. Você poderia olhar 100 pés à frente com segurança e adivinhar as próximas curvas perfeitamente.
  • Estrada de terra esburacada (alta entropia): A estrada é caótica. Olhar 100 pés à frente é uma perda de tempo porque você pode atingir um buraco ou um animal. Você deve olhar apenas alguns pés à frente e dirigir com cautela.

Os modelos existentes (como Hydra e Medusa) escolhem um "distância de olhar à frente" (uma estrutura de árvore específica) antes de começarem e mantêm isso para sempre. Isso é ineficiente. Às vezes eles tentam adivinhar muito longe e desperdiçam energia; outras vezes eles tentam adivinhar pouco e perdem a chance de acelerar.

A Solução: EntMTP (O Copiloto Inteligente)

Os autores propõem o EntMTP (Previsão de Múltiplos Tokens guiada por Entropia). Pense nisso como um copiloto inteligente que verifica constantemente as condições da estrada e diz ao motorista até onde ele deve olhar.

  1. Lendo a "Entropia" (As Condições da Estrada):
    O modelo mede constantemente o quão "surpreendentes" são as próximas palavras.

    • Baixa Entropia (Previsível): O texto está fluindo suavemente (ex: "O sol nasce no..."). O copiloto diz: "Fácil! Vamos adivinhar as próximas 4 palavras!"
    • Alta Entropia (Caótico): O texto é difícil ou complexo (ex: um problema matemático difícil ou uma reviravolta repentina na trama). O copiloto diz: "Opa, isso é arriscado. Vamos prever apenas a próxima 1 palavra para garantir."
  2. O "Banco de Árvores" (O Kit de Ferramentas):
    Antes mesmo de o modelo começar a escrever, os pesquisadores preparam um pequeno "banco" de diferentes estratégias de previsão (árvores). Algumas são grandes e agressivas (adivinhando muitas palavras), e outras são pequenas e conservadoras (adivinhando poucas palavras).

    • Crucialmente, eles não escolhem apenas uma. Eles criam um menu das melhores opções para diferentes situações.
  3. A Troca (A Mudança de Marcha):
    Durante o processo de escrita, o EntMTP atua como um trocador de marchas.

    • Se o texto for fácil, ele muda para a Marcha Alta (a árvore grande) para avançar rapidamente.
    • Se o texto ficar difícil, ele muda instantaneamente para a Marcha Baixa (a árvore pequena) para evitar bater.
    • A Magia: Trocar de marcha leva quase zero tempo. É apenas uma rápida troca de ponteiro na memória do computador, não uma reconstrução pesada.

Os Resultados: Mais Rápido Sem Perder a Qualidade

O artigo testou este novo "Copiloto Inteligente" em três tipos de tarefas muito diferentes:

  • Programação (HumanEval): Escrever programas de computador.
  • Matemática (GSM8K): Resolver problemas matemáticos do ensino fundamental.
  • Conversação (ShareGPT): Ter uma conversa.

O Resultado:

  • Velocidade: O EntMTP foi consistentemente de 9% a 15% mais rápido que os métodos anteriores mais avançados (Hydra). Em alguns casos, foi 36% mais rápido que os métodos antigos.
  • Qualidade: Como o modelo ainda confere seu trabalho perfeitamente, a qualidade da escrita não caiu nada. É como dirigir mais rápido, mas chegar exatamente ao mesmo destino com a mesma segurança.
  • Eficiência: Ele alcançou essa aceleração não tornando o computador mais forte, mas tornando o computador mais inteligente sobre quando adivinhar longe e quando ser cuidadoso.

A Conclusão

Pense no método antigo como um corredor que corre em velocidade máxima por 100 metros, para para amarrar o sapato, corre outros 100 metros, para novamente, independentemente de a pista ser plana ou cheia de obstáculos.

O EntMTP é o corredor que observa a pista. Se ela estiver plana, ele corre com força total. Se ele vir um obstáculo chegando, ele diminui a velocidade apenas o suficiente para passar com segurança, e então volta a correr imediatamente. Isso permite que ele termine a corrida muito mais rápido sem tropeçar.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →