← Últimos artigos
💬 NLP

Pair-In, Pair-Out: Latent Multi-Token Prediction for Efficient LLMs

O artigo propõe Pair-In, Pair-Out (PIPO), um quadro unificado que combina compressão de entrada latente com previsão de saída de múltiplos tokens e um mecanismo de aceitação leve baseado em confiança para alcançar acelerações significativas na latência e desempenho aprimorado de raciocínio em modelos de linguagem grandes, sem a sobrecarga de uma passagem separada de verificador.

Autores originais: Wenhui Tan, Minghao Li, Xiaoqian Ma, Siqi Fan, Xiusheng Huang, Liujie Zhang, Ruihua Song, Weihang Chen

Publicado 2026-05-27
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Wenhui Tan, Minghao Li, Xiaoqian Ma, Siqi Fan, Xiusheng Huang, Liujie Zhang, Ruihua Song, Weihang Chen

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine um modelo de linguagem de grande escala (LLM) como um escriba muito inteligente, mas muito lento, que escreve histórias uma palavra de cada vez. Para resolver um problema matemático difícil ou escrever código complexo, esse escriba precisa pensar em voz alta, gerando uma longa "cadeia de pensamento" antes de escrever a resposta final. O problema é que escrever uma palavra, parar, pensar e escrever a próxima palavra é incrivelmente lento e caro.

O artigo apresenta um novo método chamado PIPO (Entrada em Par, Saída em Par) para tornar esse escriba muito mais rápido sem fazê-lo cometer mais erros. Eis como funciona, usando analogias simples:

1. O Problema: O Gargalo "Um Passo de Cada Vez"

Atualmente, o escriba trabalha como uma pessoa digitando em uma máquina de escrever: ela digita uma letra, aperta "Enter", espera a máquina processar, digita a próxima letra e assim por diante. Mesmo que o escriba seja inteligente, a máquina é lenta porque só consegue lidar com uma letra por ciclo.

2. A Solução: O Ônibus "Duplo-Deck" (PIPO)

O PIPO muda as regras da estrada. Em vez de o escriba processar uma palavra de cada vez, o PIPO permite que ele processe duas palavras de uma só vez.

  • Entrada em Par (A Compressão): Imagine que o escriba recebe uma pilha de duas letras (por exemplo, "T" e "h"). Em vez de alimentá-las na máquina separadamente, um "compressor" especial as dobra juntas em um único pacote compacto (uma representação latente). É como dobrar um grande mapa em um lenço de bolso pequeno para que ele caia por uma porta estreita.
  • A Jornada: A máquina processa esse único pacote "dobrado".
  • Saída em Par (O Desdobramento): Uma vez que a máquina termina, ela não apenas cospe uma letra. Ela possui uma cabeça especial de "desdobramento" que pega o resultado e produz instantaneamente duas letras: a próxima palavra esperada e uma palavra de rascunho prevista (por exemplo, "e" e " ").

O Resultado: O escriba agora escreve duas letras para cada único ciclo da máquina. Isso efetivamente duplica a velocidade de escrita.

3. O Risco: O "Jogo de Adivinhação"

Há uma pegadinha. Prever a segunda palavra é um palpite. Se o palpite estiver errado, toda a frase pode se tornar sem sentido.

  • Jeito Antigo (Decodificação Especulativa): Anteriormente, para verificar se um palpite estava certo, o escriba tinha que parar, executar um teste massivo de "verificação" (como um editor sênior lendo todo o rascunho novamente) e, em seguida, decidir se o palpite era bom. Essa etapa de verificação era tão lenta que anulava os ganhos de velocidade.
  • Jeito do PIPO (A Cabeça de Confiança): O PIPO instala um "medidor de confiança" minúsculo e super-rápido logo ao lado do escriba. Esse medidor é treinado para olhar as duas palavras e dizer instantaneamente: "Tenho 95% de certeza de que essa segunda palavra está correta" ou "Não tenho certeza, vamos pular isso".
    • Se o medidor disser "Vá", o escriba mantém ambas as palavras.
    • Se o medidor disser "Não", o escriba mantém a primeira palavra e substitui a segunda por um "espaço em branco" (padding) para manter o ritmo.

4. O Segredo: Aprendendo com Erros (Distorção On-Policy)

Como o "medidor de confiança" aprende a ser tão preciso sem um editor lento?

O artigo usa um truque de treinamento engenhoso chamado Distorção On-Policy.

  • Imagine que o escriba (o aluno) tenta escrever uma história.
  • Um professor superinteligente (um modelo maior, pré-treinado) também escreve a história.
  • O sistema compara o palpite do aluno com a resposta do professor.
  • A Magia: O sistema percebe que o "professor" está fazendo exatamente o mesmo trabalho que o "editor" no método antigo. Então, em vez de executar uma verificação de editor lenta toda vez, o sistema usa as respostas do professor para treinar o minúsculo "medidor de confiança" durante a fase de aprendizado.
  • Uma vez treinado, o medidor de confiança sabe exatamente quando confiar no palpite e quando ter cuidado, tudo isso sem precisar do editor lento durante o processo real de escrita.

5. Os Resultados: Mais Rápido e Mais Inteligente

O artigo testou isso em tarefas difíceis de matemática e codificação (como a competição matemática AIME e benchmarks de codificação).

  • Velocidade: Como processa duas palavras de uma vez e pula a verificação lenta do editor, o PIPO é 2 a 2,6 vezes mais rápido que o método padrão. Ele entrega a primeira palavra muito mais rápido e mantém o fluxo em movimento.
  • Precisão: Surpreendentemente, não ficou apenas mais rápido; ficou melhor. Ao encaixar mais "pensamento" no mesmo espaço (porque comprime a entrada), o modelo pôde gerar cadeias de raciocínio mais longas e completas. Em alguns testes, a taxa de sucesso saltou mais de 7 pontos em comparação com métodos normais.

Resumo

O PIPO é como atualizar um caminhão de entregas de uma estrada de pista única para uma rodovia de duas pistas.

  1. Comprima a carga (entrada) para caber dois pacotes em um único slot.
  2. Entregue dois pacotes de uma vez (saída).
  3. Use um sensor inteligente (cabeça de confiança) para decidir se o segundo pacote é seguro de manter, treinado por um professor que já conhece a resposta.

Isso permite que a IA pense mais e responda mais rápido, resolvendo problemas complexos sem o usual atraso.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →