← Últimos artigos
💬 NLP

Mechanistic evaluation of Transformers and state space models

Este artigo utiliza intervenções causais para revelar que, embora os Transformers e os SSMs possam alcançar acurácia semelhante em tarefas de recall associativo, eles dependem de mecanismos fundamentalmente diferentes — especificamente, os modelos baseados em Transformers utilizam indução em contexto, enquanto a maioria dos SSMs depende de computações de estado de camada única, com o Mamba alcançando indução de forma única através de convoluções curtas, em vez de seu componente central de SSM.

Autores originais: Aryaman Arora, Neil Rathi, Nikil Roashan Selvam, Róbert Csordás, Dan Jurafsky, Christopher Potts

Publicado 2026-02-02
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Aryaman Arora, Neil Rathi, Nikil Roashan Selvam, Róbert Csordás, Dan Jurafsky, Christopher Potts

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando ensinar um robô a jogar um jogo de memória. O jogo é simples: você mostra ao robô uma lista de pares, como "Maçã = Vermelha", "Banana = Amarela" e "Uva = Roxa". Depois, você pergunta: "Qual é a cor da Banana?". O robô precisa olhar de volta para a lista, encontrar "Banana" e lembrar que ela está ligada a "Amarela".

No mundo da IA, isso é chamado de Recall Associativo. O artigo que você compartilhou é um mergulho profundo em como diferentes tipos de cérebros de IA (arquiteturas) resolvem este jogo. Os pesquisadores não apenas olharam para quem obteve a pontuação mais alta; eles colocaram os robôs sob um microscópio para ver exatamente o que estava acontecendo dentro de suas "cabeças" enquanto jogavam.

Aqui está a história das descobertas deles, dividida em conceitos simples.

Os Dois Principais Contendentes

O artigo compara dois tipos principais de arquiteturas de IA:

  1. Transformers: Os campeões atuais da IA (como os que alimentam a maioria dos chatbots). Eles usam um mecanismo chamado "Atenção", que é como ter um holofote que pode escanear instantaneamente toda a lista de pares para encontrar a resposta.
  2. Modelos de Espaço de Estados (SSMs): Os novos desafiantes, mais rápidos e eficientes (como o Mamba e o DeltaNet). Eles são projetados para serem mais leves e rápidos que os Transformers, mas há suspeitas de que sejam piores em tarefas de memória.

A Grande Descoberta: Não é Apenas Sobre a Pontuação

Normalmente, se uma IA tira 99% em um teste, assumimos que ela aprendeu a lição. Mas este artigo argumenta que obter a resposta certa não significa que você aprendeu do jeito certo.

Os pesquisadores usaram uma técnica especial de "cirurgia" chamada Intervenção Causal. Imagine que você tem um robô que resolve o jogo de memória perfeitamente. Então, você secretamente troca a palavra "Banana" por "Carro" na memória do robô depois que ele leu a lista, mas antes de dar a resposta.

  • Se o robô disser de repente "Amarelo é a cor de um Carro", isso significa que ele estava realmente lembrando a ligação (Indução).
  • Se o robô apenas adivinhar ou falhar, significa que ele não estava armazenando a ligação de uma forma flexível; ele estava apenas olhando para os arredores imediatos.

O Que Eles Descobriram

1. A Diferença entre "Indução" e "Recuperação Direta"

  • Transformers e modelos "Based": Esses modelos aprenderam a jogar do jeito "inteligente". Eles criaram um mapa mental onde armazenaram a conexão entre o item e seu valor (ex: "Banana" está colada em "Amarela") conforme liam a lista. Quando questionados, eles procuravam nesse mapa armazenado. Os pesquisadores chamam isso de Indução.
  • A maioria dos SSMs (como H3 e Hyena): Esses modelos falharam no jogo. Eles não conseguiram entender como armazenar as ligações.
  • Mamba e DeltaNet: Esses modelos obtiveram pontuações altas, mas trapacearam! Eles não construíram um mapa mental. Em vez disso, usaram um "atalho". Quando a pergunta "Banana?" surgiu, eles olharam imediatamente para o token logo antes dela ou usaram um truque muito específico e rígido para pegar a resposta. Eles não aprenderam a regra geral de "associar" coisas; eles apenas aprenderam a pegar a resposta de um lugar específico.

2. A Arma Secreta: A "Convolução Curta"

Os pesquisadores descobriram que os modelos que tiveram sucesso (Mamba e Based) tinham uma arma secreta: uma ferramenta de memória minúscula e de curto prazo chamada convolução curta.

  • Analogia: Imagine ler um livro. Uma "convolução longa" é como ler o capítulo inteiro para entender uma frase. Uma "convolção curta" é como dar uma olhada rápida na palavra que você acabou de ler e na anterior.
  • A Descoberta: O Mamba usa esse "olhar rápido" (convolução curta) para ligar "Banana" a "Amarela" enquanto lê. Sem essa ferramenta específica (convolução curta), o Mamba esquece completamente como jogar o jogo. Acontece que o Mamba não está usando seu "cérebro" principal (a parte do SSM) para fazer o trabalho de memória; ele está usando essa ferramenta de "olhar rápido" para fazer o trabalho pesado.

3. A Reviravolta: O Jogo da "Árvore" (ATR)

Para ver se essas descobertas eram apenas uma coincidência do jogo simples, os pesquisadores inventaram uma versão mais difícil chamada Associative Treecall (ATR).

  • A Mudança: No jogo simples, "Banana" e "Amarela" estavam sempre próximas uma da outra. No jogo da "Árvore", elas poderiam estar longe, separadas por outras palavras, como uma árvore genealógica. "João tinha um cachorro. O cachorro perseguiu um gato. O gato viu um pássaro. O que o João tinha?"
  • O Resultado:
    • Transformers e Based: Continuaram usando seu mapa de "Indução". Eles lidaram com a distância facilmente.
    • Mamba (com o atalho): Ainda usou sua ferramenta de "olhar rápido" e se saiu bem.
    • Mamba (sem o atalho): Aqui está a surpresa! Quando os pesquisadores removeram a ferramenta de "convolução curta" do Mamba, o Mamba falhou no jogo simples, mas teve sucesso no jogo difícil da "Árvore".
    • Por quê? Sem o atalho, o Mamba foi forçado a aprender o mapa de "Indução" (da mesma forma que os Transformers fazem) para resolver o problema mais difícil. Isso provou que o Mamba é capaz de aprender o jeito inteligente, mas ele só o faz quando é absolutamente necessário.

A Conclusão

O artigo conclui que a precisão é uma mentirosa.

Dois modelos de IA podem obter a mesma pontuação em um teste, mas um pode ser um gênio que entende as regras (Indução), enquanto o outro pode ser um trapaceiro que apenas memorizou o gabarito para aquele teste específico (Recuperação Direta).

  • Transformers são como bibliotecários que organizam livros em prateleiras para que possam encontrar qualquer conexão mais tarde.
  • Mamba (em sua forma padrão) é como uma pessoa que só lembra da última coisa que viu, a menos que use um "post-it" (convolução curta) para ajudá-la.
  • A Lição: Para entender verdadeiramente a IA, não podemos apenas olhar para as pontuações dos testes. Temos que olhar sob o capô para ver como a máquina está pensando. Esta "avaliação mecanística" é a nova ferramenta que os autores propõem para nos impedir de sermos enganados por pontuações altas que escondem uma compreensão fraca.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →