← Últimos artigos
🤖 machine learning

Kronecker Embeddings: Byte-Level Structured Token Representations for Parameter-Efficient Language Models

Este artigo apresenta as Embeddings de Kronecker, um método determinístico de fatoração em nível de byte que substitui as tradicionais tabelas de embedding grandes por um codificador fixo e uma projeção aprendida, eliminando assim mais de 90% dos parâmetros treináveis do lado de entrada e melhorando a eficiência de treinamento, a robustez ortográfica e o uso de memória em tempo de execução em modelos de linguagem grandes.

Autores originais: Rohan Shravan

Publicado 2026-05-29
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Rohan Shravan

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine uma biblioteca gigante onde cada livro tem um cartão de identificação único. Em um Modelo de Linguagem Grande (IA) padrão, a primeira coisa que o computador faz ao ver uma palavra é consultar o cartão de identificação dessa palavra em um imenso livro de telefones pré-escrito. Esse livro de telefones é chamado de tabela de embeddings.

Para modelos pequenos, esse livro de telefones é gerenciável. Mas para os massivos modelos de "fronteira" que alimentam as IAs mais avançadas de hoje, esse livro de telefones tornou-se um monstro inchado. Ele ocupa centenas de milhões de dólares em memória de computador e exige que a IA gaste uma enorme quantidade de sua capacidade cerebral apenas memorizando qual cartão de identificação corresponde a qual palavra, antes mesmo de começar a pensar no significado da frase.

Kronecker Embeddings é uma nova maneira de construir essa biblioteca que elimina completamente o livro de telefones gigante.

Veja como funciona, usando analogias simples:

1. O Jeito Antigo: O Livro de Telefones Gigante

Pense na IA padrão como um estudante que precisa memorizar um dicionário onde cada palavra, de "maçã" a "zéfiro", tem um número aleatório específico atribuído a ela.

  • O Problema: Se o dicionário tem 130.000 palavras, o estudante precisa memorizar 130.000 números aleatórios. Isso ocupa uma enorme quantidade de espaço em seu cérebro (memória) e o deixa mais lento.
  • A Peculiaridade: O artigo descobriu que esse "livro de telefones" é realmente muito ruim em entender famílias de palavras. Se você perguntar à IA sobre "correr", seu livro de telefones diz que as palavras mais próximas são "Correr", "correr" e ".correr" (apenas a mesma palavra com diferentes maiúsculas ou pontuação). Ele trata "correr" e "correndo" como estranhos, mesmo que sejam relacionados.

2. O Jeito Novo: O Plano de Montagem de Lego

Kronecker Embeddings joga fora o livro de telefones. Em vez disso, dá à IA um plano de montagem de Lego.

  • Como funciona: Cada palavra é apenas uma sequência de pequenos blocos de construção (bytes). O plano diz: "Se você vir um 'b' no primeiro lugar, use esta peça de Lego específica. Se você vir um 'a' no segundo lugar, use aquela peça."
  • A Magia: A IA não memoriza a palavra "correr". Ela constrói a palavra "correr" sob demanda, encaixando as peças para 'c', 'o', 'r', 'r', 'e' e 'r' em suas posições específicas.
  • O Resultado: A IA não precisa mais de um livro de telefones gigante. Ela precisa apenas de um pequeno manual de instruções (uma matriz de projeção) para saber como encaixar essas peças de Lego em uma forma significativa. Isso economiza 91–94% da memória normalmente necessária para o lado de entrada do modelo.

3. O Que o Artigo Realmente Descobriu

Os pesquisadores testaram esse novo método contra o antigo e encontraram algumas coisas surpreendentes:

  • É Mais Esperto com Erros de Digitação: Porque o novo método constrói palavras a partir de suas letras individuais (bytes), ele entende que "netwrok" é muito semelhante a "network". Se você cometer um erro de digitação, a IA ainda reconhece a forma da palavra. O método antigo, que depende do livro de telefones gigante, frequentemente fragmenta a palavra em pedaços confusos quando ocorre um erro de digitação.
    • Analogia: Se você escrever "gato" como "gst", a IA antiga pode pensar que você está falando de um objeto completamente diferente e desconhecido. A nova IA vê que o "g" e o "t" estão nos lugares certos e sabe que você provavelmente quis dizer "gato".
  • Aprende Mais Rápido: Em seus testes, a IA usando o plano de montagem de Lego (Kronecker) aprendeu a prever a próxima palavra em uma frase 2,5% melhor do que a IA usando o livro de telefones. Ela também atingiu esse nível de habilidade usando 43% menos etapas de treinamento.
  • Não "Esquece" Palavras Novas: Se você pedir à IA para falar sobre uma palavra inventada como "kronekticus", a IA antiga fica confusa e inventa uma definição falsa. A nova IA, porque constrói palavras a partir de letras, pode repetir a palavra inventada para você perfeitamente, preservando a grafia exata que você forneceu.

4. As Compensações (O Problema)

O artigo é honesto sobre as desvantagens.

  • Gêmeos Confusos: Porque o novo método olha para as letras, às vezes ele acha que palavras que se parecem são relacionadas, mesmo que signifiquem coisas diferentes. Por exemplo, "computar" e "comutar" parecem muito semelhantes letra por letra. A nova IA pode pensar que são primos próximos, mesmo que uma seja sobre matemática e a outra sobre viagens. A IA precisa usar seu "cérebro" (o restante do modelo) para descobrir a diferença com base no contexto.
  • Sem "Amarrar" os Nós: No sistema antigo, a IA podia usar o mesmo livro de telefones para leitura e escrita para economizar espaço. O novo sistema é estruturalmente muito diferente para fazer isso, então precisa de um pequeno manual separado para escrita. No entanto, o artigo observa que os maiores modelos de IA já estão se afastando dessa prática de "amarrar" de qualquer maneira.

5. Por Que Isso Importa para o Futuro

O artigo sugere que, ao remover o livro de telefones gigante e pesado, podemos liberar essa enorme quantidade de memória de computador.

  • A Re-alocação: Em vez de desperdiçar memória em uma lista estática de palavras, esse espaço economizado pode ser usado para tornar o "cérebro" da IA (o corpo do transformador) maior, mais inteligente ou capaz de ler documentos mais longos.
  • Dispositivos de Borda: Para executar IA em telefones ou dispositivos pequenos, isso é uma mudança de jogo. O novo método permite que a IA seja distribuída sem uma lista de palavras de vários gigabytes. Ela pode reconstruir palavras a partir de um arquivo minúsculo de 4,5 MB em vez de um arquivo de 2 GB, tornando muito mais fácil executar IA poderosa em hardware pequeno.

Em Resumo:
Kronecker Embeddings substitui um dicionário massivo e rígido por um kit de construção flexível, letra por letra. Ele economiza enormes quantidades de memória, lida melhor com erros de digitação, aprende mais rápido e permite que a IA lide com palavras que nunca viu antes, mantendo toda a arquitetura restante da IA exatamente a mesma.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →