← Últimos artigos
🤖 machine learning

Looped Latent Attention: Cross-Loop KV Compression for Looped Transformers

Este artigo introduz o Looped Latent Attention (LLA), um codec de pós-treinamento que explora a estrutura de baixo posto dos caches KV indexados por loop em Transformers com pesos compartilhados para alcançar compressão extrema (até 32x) e aumentar significativamente a capacidade de lote, mantendo um desempenho quase sem perdas através de inicialização por SVD e destilação.

Autores originais: James O' Neill, Fergal Reid

Publicado 2026-07-20
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: James O' Neill, Fergal Reid

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

O Problema da Memória nos Cérebros de IA

Imagine que você está tentando ensinar um robô a escrever uma história. O robô tem um cérebro feito de milhões de pequenos interruptores (parâmetros) que sabem como as palavras se encaixam. Mas aqui está o detalhe: para escrever uma história longa, o robô não pode apenas olhar para o seu cérebro; ele precisa de um bloco de notas. Cada vez que ele escreve uma nova palavra, ele tem que se lembrar de tudo o que acabou de escrever para não se repetir ou perder o fio da meada. No mundo da Inteligência Artificial, esse bloco de notas é chamado de KV cache (cache de Chave-Valor). É um caderno privado para cada conversa individual, e ele cresce a cada palavra que o robô fala.

Agora, imagine um tipo especial de robô projetado para ser super eficiente. Em vez de ter um cérebro enorme com muitas salas diferentes (camadas) para diferentes tarefas, este robô tem uma sala pequena e inteligente que ele visita repetidamente. Ele reutiliza o mesmo conjunto de instruções, fazendo loops através delas para pensar mais profundamente. Isso é chamado de Looped Transformer (Transformer em Loop). Isso economiza espaço no próprio cérebro, o que é ótimo. Mas há um problema sorrateiro: embora o robô reutilize a mesma sala, ele ainda escreve uma nova página em seu bloco de notas toda vez que faz o loop. Se o robô fizer quatro loops para resolver um problema de matemática, ele acaba com quatro páginas separadas de notas para o mesmo momento da história. Isso significa que o robô "em loop" ainda precisa de uma quantidade massiva de memória para funcionar, derrotando o propósito de ser eficiente. A grande questão para os cientistas é: podemos encolher esse bloco de notas sem fazer o robô esquecer como pensar?

A Descoberta do Artigo: Um Atalho Secreto nas Notas

Este artigo apresenta um truque inteligente chamado Looped Latent Attention (LLA) para resolver esse problema de memória. Os pesquisadores descobriram que as notas do robô não são tão bagunçadas quanto parecem. Quando o robô percorre seu processo de pensamento em loop, as notas que ele escreve para a mesma palavra não mudam drasticamente; elas seguem um caminho suave e previsível, como uma bola de gude rolando por uma colina suave. Em vez de salvar cada página individual do bloco de notas do robô, o novo método salva apenas um pequeno "resumo" desse caminho e um conjunto de instruções sobre como reconstruir as páginas específicas apenas quando o robô realmente precisar lê-las.

Pense assim: Imagine que você está assistindo a um filme onde o personagem principal caminha por um corredor. Em um computador normal, você salvaria uma foto completa, de alta definição, do personagem em cada passo que ele dá. Isso ocupa um enorme espaço de armazenamento. Mas com o LLA, você percebe que o personagem está apenas caminhando em linha reta. Então, em vez de salvar milhares de fotos, você salva uma foto do personagem e uma nota simples dizendo: "Mova 1 polegada para frente no passo 2, 2 polegadas no passo 3". Quando o computador precisa ver o personagem no passo 3, ele desenha rapidamente aquela imagem usando a nota. É exatamente isso que o artigo faz pela IA: ele comprime a parte do "loop" da memória, transformando uma pilha de quatro páginas em um único resumo minúsculo que pode ser expandido de volta para as páginas completas instantaneamente.

Os pesquisadores testaram isso em vários modelos de IA, incluindo um chamado Ouro-1.4B. Eles descobriram que este método funciona incrivelmente bem. Na verdade, em um chip de computador poderoso chamado H200, eles conseguiram encaixar 768 conversas diferentes na memória de uma só vez, enquanto antes conseguiam encaixar apenas 32. Esse é um salto massivo na capacidade de quantas pessoas podem usar a IA ao mesmo tempo. Eles também mostraram que esse truque funciona mesmo quando a IA está resolvendo problemas matemáticos muito longos e difíceis, embora precise de um pouco de treinamento extra para garantir que não se confunda ao escrever sua própria história em vez de apenas copiar um professor.

O Que Este Artigo Diz "Não"

É importante saber o que este método não é. Os pesquisadores testaram uma ideia muito simples primeiro: "E se jogarmos fora as três primeiras páginas de notas e mantivermos apenas a última?". Eles pensaram que talvez o robô se estabilize em uma resposta final após alguns loops, então as notas anteriores não importariam. Eles tentaram isso, e foi um desastre. A IA esqueceu completamente como fazer matemática, pontuando zero nos testes. Isso prova que o "caminho" que as notas percorrem é importante; você não pode simplesmente pegar o ponto final. Você precisa capturar a jornada.

Eles também compararam seu método com outras formas de reduzir a memória, como esmagar as notas juntas (quantização) ou compartilhar notas entre diferentes partes do cérebro (compressão de eixo de cabeça). Embora esses métodos ajudem um pouco, o artigo mostra que comprimir o eixo do "loop" é o ingrediente secreto. Se você tentar comprimir as outras partes em vez dos loops, a IA perde sua capacidade de raciocínio. O artigo é muito claro: o loop é a parte mais redundante da memória, e é o único lugar onde você deve apertar.

O Quão Certo Eles Estão?

Os autores estão bastante confiantes nesses resultados porque os mediram diretamente. Eles não apenas adivinharam; eles rodaram a IA em tarefas reais, como resolver problemas de matemática (GSM8K) e escrever código (HumanEval). Eles mostraram que, com uma compressão de 4x (tornando a memória 4 vezes menor), a IA ainda performa quase tão bem quanto a versão original, não comprimida. Quando levaram ao extremo da compressão (21.3x), a IA ainda conseguia lidar com muitas tarefas, embora começasse a ter dificuldades com os passos de raciocínio mais longos e complexos.

Eles também testaram isso em um tipo diferente de modelo de IA chamado Huginn-3.5B, que possui uma estrutura de cérebro diferente e faz loops de até 32 vezes. Mesmo lá, o método funcionou, provando que isso não é apenas uma coincidência para um robô específico. O artigo sugere que essa "trajetória de baixo posto" (o caminho suave das notas) é uma propriedade fundamental de como esses robôs em loop pensam. Embora tenham provado que funciona para economizar memória e aumentar a capacidade, eles observam que, para o melhor desempenho em tarefas muito longas, a IA precisa de uma segunda rodada de treinamento, onde ela pratica com suas próprias notas comprimidas, em vez de apenas copiar um professor. Este treinamento "on-policy" corrige os pequenos erros que acontecem quando o robô começa a escrever sua própria história.

Em resumo, este artigo mostra que podemos tornar os modelos de IA em loop muito mais eficientes ao perceber que sua memória é repetitiva de uma forma específica. Ao armazenar um pequeno resumo dessa repetição em vez das notas completas, podemos encaixar centenas de vezes mais conversas em um único chip de computador, tornando a IA poderosa disponível para mais pessoas sem a necessidade de hardware super caro.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →