← Últimos artigos
💬 NLP

MARS: Enabling Autoregressive Models Multi-Token Generation

O artigo apresenta o MARS, um método de ajuste fino leve que permite a modelos de linguagem autoregressivos gerar múltiplos tokens por vez sem alterações arquiteturais ou perda de desempenho, oferecendo ganhos de throughput e flexibilidade em tempo real para implantação.

Autores originais: Ziqi Jin, Lei Wang, Ziwei Luo, Aixin Sun

Publicado 2026-04-09
📖 4 min de leitura☕ Leitura rápida

Autores originais: Ziqi Jin, Lei Wang, Ziwei Luo, Aixin Sun

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está pedindo para um assistente de IA escrever uma história para você. O modelo atual (chamado de "Autoregressivo" ou AR) funciona como um escritor extremamente meticuloso, mas um pouco lento.

Ele escreve uma palavra de cada vez.

  • Ele pensa: "A próxima palavra é 'o'". Escreve.
  • Pensa: "A próxima é 'gato'". Escreve.
  • Pensa: "A próxima é 'pula'". Escreve.

Mesmo quando a frase é óbvia, como "O céu é azul", ele gasta a mesma energia e tempo para escrever "azul" quanto gastaria para escrever uma palavra difícil e complexa. É como se ele parasse para respirar e pensasse profundamente antes de cada sílaba, mesmo quando a resposta é automática.

A Solução: MARS (O Escritor que "Acelera" na Autoestrada)

Os pesquisadores criaram um novo método chamado MARS (Mask AutoRegreSsion). Pense no MARS como dar a esse escritor um superpoder de "previsão em bloco", sem mudar quem ele é.

Aqui está como funciona, usando analogias simples:

1. O Problema das Técnicas Antigas

Outras tentativas de acelerar a IA eram como tentar colocar um motor de Ferrari em um carro popular:

  • Método A (Speculative Decoding): Colocar um "assistente" (um modelo pequeno) ao lado do escritor principal para chutar as palavras. O problema? Você precisa de dois carros na garagem (duas memórias), o que é caro e complicado.
  • Método B (Medusa/EAGLE): Colocar "antenas" extras no carro para tentar adivinhar. Isso muda o design do carro e exige peças novas (parâmetros extras).

O MARS é diferente. Ele não adiciona peças novas. Ele apenas treina o mesmo escritor para, quando estiver muito confiante, escrever várias palavras de uma vez.

2. Como o MARS Aprende? (A Técnica do "Rascunho")

Imagine que você está ensinando um aluno a escrever.

  • O jeito antigo: Você dá a frase e ele escreve a próxima palavra.
  • O jeito MARS: Você dá a frase, mas esconde as próximas 4 palavras com uma fita adesiva (chamada de [MASK]).
    • Você pergunta: "O que vem aqui?"
    • O aluno tenta adivinhar as 4 palavras escondidas de uma vez só.
    • O Segredo: O MARS faz isso ao mesmo tempo em que continua praticando o jeito normal (escrevendo uma palavra por vez) para não esquecer como fazer. É como treinar para uma maratona (uma palavra) e um sprint (várias palavras) ao mesmo tempo.

3. A Regra de Ouro: "Confiança é Tudo"

A mágica acontece durante a escrita. O modelo olha para as palavras que ele "adivinhou" e pergunta a si mesmo: "Estou 100% confiante?"

  • Se a frase for óbvia (ex: "O céu é..."): O modelo diz: "Sim! É 'azul'!" e escreve "azul" imediatamente.
  • Se a frase for difícil (ex: um raciocínio lógico complexo): O modelo diz: "Hmm, não tenho certeza". Ele escreve apenas uma palavra, pausa, pensa mais um pouco e continua.

Isso cria um fluxo inteligente:

  • Em partes fáceis, ele corre como um coelho (várias palavras por vez).
  • Em partes difíceis, ele anda como uma tartaruga (uma palavra por vez), garantindo que a qualidade não caia.

4. O Resultado na Vida Real

  • Velocidade: Em testes, o MARS foi 1,5 a 1,7 vezes mais rápido que os modelos normais.
  • Qualidade: Adivinhe? A qualidade do texto não piorou. Se você pedir para ele escrever apenas uma palavra por vez (modo seguro), ele é tão bom quanto o original. Se você deixar ele "acelerar" nas partes fáceis, ele ganha velocidade sem cometer erros bobos.
  • Flexibilidade: Imagine um botão de volume. Se o servidor estiver cheio de pessoas pedindo respostas, você pode girar o botão para "Máxima Velocidade" (aceitando mais palavras de uma vez). Se o servidor estiver vazio e você quiser perfeição, gira para "Qualidade Máxima". Tudo isso sem trocar o modelo ou reiniciar o sistema.

Resumo em uma Frase

O MARS ensina a IA a ser um ciclista experiente: ele pedala devagar e com cuidado nas subidas difíceis (raciocínio complexo), mas solta os freios e acelera nas retas planas (frases óbvias), tudo isso usando o mesmo corpo e as mesmas pernas, sem precisar de um novo motor.

Isso torna a IA mais rápida, mais barata de rodar e ainda mais inteligente, sem precisar de mudanças complicadas na tecnologia.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →