← Últimos artigos
🤖 machine learning

A Unifying View of Attention Sinks: Two Algorithms, Two Solutions

Este artigo revela que os sumidouros de atenção visualmente semelhantes em transformers representam, na verdade, dois mecanismos distintos — supressão adaptativa "nop" e agregação de "broadcast" global — necessitando de uma estratégia de intervenção dupla combinando gating e registers para abordar efetivamente ambos.

Autores originais: Lukas Fesser, Mozes Jacobs, Thomas Fel, Andy Keller, Sham Kakade

Publicado 2026-06-09
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Lukas Fesser, Mozes Jacobs, Thomas Fel, Andy Keller, Sham Kakade

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está olhando para uma sala cheia de pessoas (os "tokens" em um modelo de IA) tentando conversar umas com as outras. Em um tipo específico de IA chamado Vision Transformer, pesquisadores notaram um padrão estranho: não importa quem esteja falando, todos parecem continuar virando a cabeça para olhar para apenas uma ou duas pessoas específicas na sala. No "mapa de atenção" da IA, isso se parece com uma faixa vertical escura.

Por muito tempo, os cientistas pensaram que isso era um erro — um bug onde a IA ficava presa encarando um único ponto. Mas este artigo argumenta que esse "encarar" não é um erro. Em vez disso, é, na verdade, a IA usando duas estratégias completamente diferentes que apenas parecem iguais por fora.

Aqui está o detalhamento das duas estratégias, usando analogias simples:

1. O Botão "Não Faça Nada" (Adaptive NOP)

A Analogia: Imagine um professor em uma sala de aula. Às vezes, o professor não tem nada útil para adicionar à conversa. Em vez de dizer "hum" ou "talvez", o professor aponta para um aluno específico (o "sink" ou sumidouro) e diz: "Apenas olhe para o Alex; ele não está dizendo nada, então ficaremos exatamente como estamos".

O que está acontecendo:

  • O Objetivo: A IA quer parar de mudar seu pensamento atual. Ela precisa dizer: "Eu não tenho nenhuma informação nova para adicionar agora".
  • O Truque: Como a IA é forçada a apontar para alguém, ela aponta para um token "nulo" (um token com quase zero de informação). Ao apontar para este token vazio, a IA efetivamente aperta um botão de "Não Faça Nada".
  • A Pista: Se você verificar a "energia" (valor) deste token especial, ela é quase zero. É um token fantasma usado apenas para cancelar atualizações.

2. O "Café" (Broadcast/Transmissão)

A Analogia: Agora imagine um cenário diferente. O professor tem uma notícia muito importante (como "Está chovendo lá fora") que todos precisam saber. Em vez de sussurrar para cada aluno um por um, o professor fica no centro da sala (o "sink") e grita a notícia. Todos viram para olhar para o professor para ouvir a atualização.

O que está acontecendo:

  • O Objetivo: A IA quer compartilhar uma informação global com todos na sala.
  • O Truque: O token "sink" atua como um hub. Ele reúne informações e então as "transmite" (broadcast) para todos os outros tokens. Todos atualizam seu estado ao adicionar essa peça compartilhada de informação.
  • A Pista: Se você verificar a "energia" deste token especial, ela é alta e cheia de conteúdo. Ele está escrevendo ativamente uma mensagem para o grupo.

Por Que Isso Importa

A principal descoberta do artigo é que você não consegue distinguir a diferença apenas olhando para o mapa de atenção. Ambos os estratégias parecem uma faixa vertical onde todos encaram um ponto.

  • Se você vê uma faixa, você não sabe se a IA está apertando o botão "Não Faça Nada" ou gritando "Notícia Importante!".
  • O Problema: Tentativas anteriores de "corrigir" essas faixas (como adicionar tokens especiais de "registro" ou mecanismos de "gating") estavam apenas adivinhando.
    • Alguns ajustes assumiam que a IA estava fazendo "Não Faça Nada" e tentavam impedir isso.
    • Outros assumiam que a IA estava "Transmitindo" e tentavam ajudar nisso.
    • Como os pesquisadores não sabiam qual dos dois estava acontecendo, seus ajustes eram frequentemente incompletos.

A Solução: Uma Abordagem de Duas Frentes

Os autores criaram uma maneira de diagnosticar qual estratégia a IA está usando:

  1. Verifique a "Energia": Se o token estiver vazio (baixa energia), é um botão de "Não Faça Nada".
  2. Verifique a "Estrutura": Se o token estiver cheio de dados e criar um padrão simples e compartilhado, é uma "Transmissão" (Broadcast).

O Resultado: Quando aplicaram isso a modelos de IA reais (como aqueles que reconhecem imagens), descobriram que ambas as estratégias estão acontecendo ao mesmo tempo, mas em partes diferentes do cérebro:

  • Camadas iniciais costumam usar a estratégia "Não Faça Nada".
  • Camadas mais profundas costumam usar a estratégia de "Transmissão".
  • Mesmo os tokens de "Registro" (tokens especiais adicionados para ajudar a IA) estavam sendo usados para ambos os propósitos.

O Ajuste: O artigo mostra que, para realmente corrigir os problemas causados por esses padrões, você precisa usar ambas as ferramentas juntas:

  • Use Gating para lidar com os tokens de "Não Faça Nada" (permitindo que eles suprimam atualizações de forma limpa).
  • Use Registers para lidar com os tokens de "Transmissão" (dando a eles um espaço dedicado para compartilhar informações).

Quando combinaram esses dois métodos, a IA tornou-se mais estável e melhor em compreender o layout espacial detalhado de imagens (como reconhecer onde objetos estão em uma foto), embora sua capacidade de apenas "nomear" a imagem não tenha mudado muito.

Resumo

O artigo nos ensina que só porque uma IA parece estar encarando um ponto, não significa que ela esteja quebrada. Ela pode estar fazendo uma pausa (Não Faça Nada) ou compartilhando um segredo (Transmissão). Para consertar o comportamento da IA, primeiro precisamos entender por que ela está encarando, e então usar a ferramenta certa para o trabalho.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →