← Últimos artigos
💬 NLP

Compressing Sequences in the Latent Embedding Space: KK-Token Merging for Large Language Models

O artigo propõe o K-Token Merging, um framework de compressão no espaço de embeddings latentes que funde blocos de K tokens em uma única representação, permitindo reduzir o comprimento de entrada em até 75% com degradação mínima de desempenho em tarefas de raciocínio, classificação e edição de código.

Autores originais: Zihao Xu, John Harvill, Ziwei Fan, Yizhou Sun, Hao Ding, Hao Wang

Publicado 2026-04-17
📖 3 min de leitura☕ Leitura rápida

Autores originais: Zihao Xu, John Harvill, Ziwei Fan, Yizhou Sun, Hao Ding, Hao Wang

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem um livro gigante e precisa enviar um resumo dele para um amigo que está em outra cidade. O problema é que enviar o livro inteiro (ou até mesmo um resumo muito detalhado) demora muito e custa caro em termos de "correio" (computação e memória).

Até agora, as Inteligências Artificiais (LLMs) faziam isso de duas formas principais:

  1. Jogando fora partes do texto: Como se você rasgasse páginas que achava "menos importantes". O risco? Você pode rasgar uma página que continha a resposta para a pergunta do seu amigo.
  2. Reescrevendo o texto de forma mais curta: Como um editor que tenta encurtar frases. Isso funciona bem, mas ainda usa muitas "palavras" (tokens) para dizer a mesma coisa.

Os autores deste artigo, "K-Token Merging", propuseram uma terceira ideia, muito mais inteligente. Eles não jogam nada fora e nem apenas reescrevem. Eles compactam o significado.

A Analogia do "Mala de Viagem Mágica"

Pense nas palavras que uma IA lê como se fossem peças de roupa em uma mala.

  • Se você tem 4 camisetas (4 palavras) que são todas muito parecidas ou que formam um conjunto, em vez de levar 4 peças separadas ocupando espaço, você as dobra e as coloca dentro de uma única caixa compacta.
  • Essa "caixa" (o novo embedding comprimido) carrega a informação de todas as 4 camisetas, mas ocupa o espaço de apenas 1.

A grande sacada do papel é que eles fazem isso no espaço oculto (o "cérebro" da IA), onde as palavras são transformadas em números e conceitos, e não apenas no texto visível.

Como Funciona na Prática?

  1. O Agrupamento (K-Token): A IA pega um bloco de palavras seguidas (por exemplo, 4 palavras de uma vez).
  2. O Encarregado (Encoder): Um pequeno "funcionário" (um encoder leve) olha para essas 4 palavras e as transforma em uma única "super-palavra" que resume tudo o que aquelas 4 diziam.
  3. A Viagem: A IA viaja com essa lista muito mais curta de "super-palavras". Isso faz com que o processo de leitura seja 75% mais rápido e use 75% menos memória.
  4. O Desembarque (Geração): Quando a IA precisa responder, ela "desempacota" essa informação e gera as palavras normais, como se nada tivesse acontecido. A resposta final é escrita no idioma comum, sem atalhos estranhos.

Por que isso é tão bom?

O artigo mostra que essa técnica é como ter um superpoder de eficiência:

  • Não perde informações: Diferente de jogar palavras fora, a "caixa compacta" guarda tudo o que é importante. Em testes de raciocínio lógico e código, a IA quase não errou nada, mesmo com o texto original reduzido em 75%.
  • Funciona em tudo: Funciona bem para entender sentimentos em reviews de produtos, para resolver problemas de lógica em árvores de texto e até para editar códigos de programação complexos.
  • O Equilíbrio Perfeito: Eles criaram um gráfico onde o método deles fica no "ponto ideal" (fronteira de Pareto): máxima economia de tempo/espaço com a mínima perda de qualidade.

O Resultado Final

Imagine que você tem um motor de carro que, ao invés de queimar 10 litros de gasolina para ir a uma cidade, queima apenas 2,5 litros, mas chega lá com a mesma velocidade e conforto.

O K-Token Merging faz exatamente isso com as IAs: ele permite que elas leiam livros inteiros, documentos longos ou códigos complexos em uma fração do tempo e custo, sem ficar "tonta" ou esquecer os detalhes importantes. É uma forma de dizer à IA: "Não precisa ler cada letra individualmente, leia o significado do bloco todo de uma vez!".

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →