← Últimos artigos
🤖 machine learning

Kaczmarz Linear Attention

O artigo apresenta a Atenção Linear Kaczmarz (KLA), uma Gated DeltaNet modificada que substitui seu coeficiente de atualização aprendido empiricamente por um tamanho de passo Kaczmarz derivado teoricamente e normalizado pela norma da chave, resultando em perplexidade superior, estabilidade em contextos longos e eficiência de decodificação sem alterar a arquitetura do modelo ou a forma do estado.

Autores originais: Jiaxuan Zou, Ruifeng Ren, Yong Liu

Publicado 2026-05-12
📖 4 min de leitura☕ Leitura rápida

Autores originais: Jiaxuan Zou, Ruifeng Ren, Yong Liu

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando ensinar um robô a ler um livro muito longo. O robô precisa lembrar do que leu anteriormente para entender a frase atual.

O Problema: O Gargalo "Quadrático"
Os modelos de IA tradicionais (Transformers) funcionam como um estudante que, para cada nova palavra que lê, precisa folhear todo o livro para verificar cada palavra anterior e ver como elas se conectam. Se o livro for curto, isso é aceitável. Mas se o livro tiver 100.000 páginas, o estudante precisa realizar uma quantidade massiva de trabalho para cada palavra única. Isso fica tão lento e caro que se torna praticamente impossível escalar.

A Solução: O "Estado Recorrente"
Modelos mais recentes tentam corrigir isso agindo como um estudante com um caderno pequeno e de tamanho fixo. Em vez de folhear todo o livro, eles apenas atualizam seu caderno à medida que leem. Eles anotam as partes mais importantes, esquecem o resto e continuam avançando. Isso é rápido (tempo linear), mas difícil de acertar: O que eles devem anotar? Quanto devem apagar? E como devem atualizar a nota se virem o mesmo tópico novamente?

A Tentativa Anterior: Gated DeltaNet (GDN)
Um modelo popular, chamado Gated DeltaNet (GDN), usa uma abordagem de "caderno". Quando vê uma nova peça de informação, calcula a diferença entre o que acha que sabe e o que realmente vê, e então escreve essa diferença no caderno.

No entanto, o GDN tem uma falha: usa um "palpite aprendido" (um número que ele calcula durante o treinamento) para decidir quão grande deve ser a mudança. É como um estudante adivinhando: "Hmm, acho que devo anotar isso com um marcador de tamanho 5". Às vezes, eles usam um marcador muito grande (borrando a página), e às vezes muito pequeno (a escrita fica fraca e se perde). Esse palpite é apenas um hábito que o modelo aprendeu, não uma regra matemática.

A Nova Ideia: Atenção Linear Kaczmarz (KLA)
Os autores deste artigo, Jiaxuan Zou e colegas, perguntaram: "Podemos parar de adivinhar e usar matemática para decidir exatamente quão grande deve ser a mudança?"

Eles olharam para um antigo método matemático chamado projeção Kaczmarz.

  • A Analogia: Imagine que você está tentando desenhar uma linha em um papel que passa por um ponto específico. Você tem uma régua (seu estado atual). Se sua régua não atingir o ponto, você precisa ajustá-la.
  • A Intuição: O método Kaczmarz diz que a melhor maneira de ajustar a régua é medir quão "forte" ou "alto" o ponto é. Se o ponto for muito alto (um sinal forte), você precisa apenas de um pequeno ajuste para atingi-lo. Se o ponto for quieto (um sinal fraco), você precisa de um grande ajuste.

Na linguagem do artigo, eles olham para a "Chave" (o sinal) e medem sua força (sua "norma"). Eles então calculam um tamanho de passo preciso:

Tamanho do Passo = (Taxa de Aprendizado) / (Força do Sinal)

Isso é o Coeficiente Kaczmarz.

O Que Mudou?
Os autores não construíram um novo robô ou um novo caderno. Eles não mudaram o hardware. Eles simplesmente substituíram o número de "palpite" no modelo GDN por esse número preciso, derivado matematicamente.

  • Antigo Método: "Vou anotar isso com um marcador de tamanho 0,5 porque meus dados de treinamento me disseram para fazer isso."
  • Novo Método (KLA): "Vou anotar isso com um marcador de tamanho 0,5 dividido por quão alto é este sinal."

Os Resultados
Como essa nova regra é matematicamente perfeita para a tarefa específica de atualizar a memória, o modelo performa melhor:

  1. Mais Inteligente: Prevê a próxima palavra em uma frase com mais precisão (menor "perplexidade") do que os melhores modelos anteriores.
  2. Memória Mais Longa: Pode lidar com contextos muito mais longos (até 65.000 palavras) sem ficar confuso ou esquecer coisas, enquanto o modelo antigo começava a ter dificuldades.
  3. Melhor em Tarefas: Em testes onde o modelo precisava encontrar uma "agulha" específica em um enorme "palheiro" de texto, o KLA acertou 100%, enquanto outros falharam.
  4. Igualmente Rápido: Como eles apenas alteraram a fórmula matemática para a atualização e não a estrutura do caderno, o modelo roda tão rápido quanto o antigo. Na verdade, decodifica (gera texto) 2,1 vezes mais rápido em comprimentos longos.

Em Resumo
O artigo introduz o KLA, um modelo que mantém a mesma estrutura rápida e eficiente de seu predecessor, mas substitui uma regra de atualização de "palpite" por uma precisa, derivada matematicamente. É como pegar um carro que já dirige bem e trocar a adivinhação do motorista por um sistema de navegação GPS perfeito. O carro é o mesmo, mas chega ao destino com mais precisão e eficiência.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →