← Últimos artigos
💬 NLP

Many Circuits, One Mechanism: Input Variation and Evaluation Granularity in Circuit Discovery

Este artigo contesta a suposição de que diferenças estruturais em circuitos descobertos indicam mecanismos distintos, demonstrando através da "especialização fantasma" que estatísticas de entrada variáveis produzem subgrafos estruturalmente diversos, mas funcionalmente equivalentes, revelando assim que as práticas de avaliação padrão frequentemente obscurecem o mapeamento muitos-para-um entre a estrutura do circuito e a função do modelo.

Autores originais: Alireza Bayat Makou, Jingcheng Niu, Subhabrata Dutta, Iryna Gurevych

Publicado 2026-06-05
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Alireza Bayat Makou, Jingcheng Niu, Subhabrata Dutta, Iryna Gurevych

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem uma máquina gigante e complexa (um grande modelo de IA) que realiza um truque específico: ela observa um padrão de letras e copia uma delas para o final da linha. Cientistas querem saber como a máquina faz esse truque. Eles tentam encontrar a "fiação" específica dentro da máquina responsável pelo truque. Eles chamam essa fiação de circuito.

Por muito tempo, pesquisadores acreditaram que, se encontrassem um diagrama de fiação diferente para o mesmo truque sob condições ligeiramente diferentes, isso significaria que a máquina havia desenvolvido uma nova forma especializada de realizar o truque.

Este artigo diz: Calma lá.

Os autores descobriram que o que parece ser uma máquina nova e especializada é, na verdade, a mesma máquina fazendo o mesmo truque, mas com alguns fios extras e desnecessários anexados. Eles chamam isso de "Especialização Fantasma" (Phantom Specialization).

Aqui está a divisão usando analogias simples:

1. O Experimento: O Jogo do "Copia e Cola"

Os pesquisadores usaram um jogo chamado "Cópia de Sequência Literal".

  • A Tarefa: A IA vê uma sequência como A B C D ... A B C e precisa adivinar a próxima letra (D).
  • A Reviravolta: Eles jogaram este jogo usando palavras que aparecem com muita frequência no treinamento da IA (como "o/a/os/as") e palavras que aparecem muito raramente (como nomes próprios obscuros).
  • A Expectação: Eles pensaram: "Talvez a IA use um conjunto diferente de fios internos para palavras raras do que para palavras comuns".

2. A Descoberta: O Problema dos "Muitos Caminhos para Roma"

Quando eles olharam para os diagramas de fiação para palavras comuns vs. palavras raras, os diagramas pareciam diferentes.

  • O circuito da "palavra rara" tinha mais fios.
  • O circuito da "palavra comum" tinha menos fios.
  • Eles pareciam dois projetos (blueprints) diferentes.

No entanto, quando testaram a função:

  • Eles pegaram os fios da "palavra rara" e os usaram para copiar "palavras comuns". Funcionou perfeitamente.
  • Eles pegaram os fios da "palavra comum" e os usaram para "palavras raras". Também funcionou perfeitamente.
  • A Conclusão: Os fios extras no circuito da "palavra rara" não estavam fazendo nada de especial. Eles eram apenas decoração. A máquina estava usando exatamente a mesma lógica central para ambos.

3. A Analogia: O "Espandrél" ou o "Mochila Extra"

Imagine que você está fazendo uma trilha.

  • Cenário A: Você prepara uma mochila pequena e eficiente para uma caminhada curta.
  • Cenário B: Você prepara uma mochila enorme e pesada para uma caminhada longa.

Se você olhar para as duas mochilas, elas parecem totalmente diferentes (Estrutura). Você pode pensar: "A mochila grande é uma ferramenta especializada para trilhas longas!"

Mas e se você descobrisse que ambas as mochilas contêm exatamente a mesma garrafa de água e o mesmo mapa? O espaço extra na mochila grande é apenas vazio ou preenchido com itens aleatórios que por acaso estão lá. Se você pegasse a mochila pequena e a usasse para a trilha longa, você ainda sobreviveria. Se pegasse a mochila grande e a usasse para a trilha curta, você também sobreviveria.

A "Especialização Fantasma" é a ilusão de que a mochila grande é um tipo diferente de ferramenta, quando na verdade é apenas a mesma ferramenta com algum peso extra e inútil anexado.

4. Por que Isso Aconteceu? (O Mecânico "Ganancioso")

Os pesquisadores descobriram que o método usado para encontrar esses circuitos é um pouco como um mecânico ganancioso tentando consertar um carro.

  • O mecânico quer encontrar o menor conjunto de fios que faça o carro funcionar.
  • Às vezes, existem múltiplos fios que fazem exatamente o mesmo trabalho (redundância).
  • Quando o mecânico olha para uma entrada de "palavra rara", o estado interno do carro é ligeiramente diferente. O mecânico ganancioso escolhe um conjunto de fios para manter e corta o restante.
  • Ao olhar para uma "palavra comum", o estado interno é ligeiramente diferente de novo, então o mecânico escolhe um conjunto diferente de fios para manter.

O resultado? Dois diagramas de fiação diferentes que fazem o carro funcionar perfeitamente. As diferenças não são porque o carro precisa de motores diferentes; é apenas porque o mecânico fez escolhas aleatórias entre opções igualmente boas.

5. O Problema da "Lente de Zoom" (Granularidade de Avaliação)

O artigo também descobriu que os cientistas estavam frequentemente olhando para os circuitos através da "lente" errada.

  • A Lente de "Nível de Fonte" (Zoom Out/Visão Panorâmica): Esta olha para o componente inteiro (como um chip inteiro). Se qualquer fio no chip estiver ativo, o chip inteiro é contado como "funcionando". Isso faz com que os circuitos pareçam muito fiéis e diferentes.
  • A Lente de "Nível de Aresta" (Zoom In/Visão Detalhada): Esta olha para os fios específicos. Quando você dá zoom, vê que muitos dos fios selecionados eram, na verdade, desnecessários.

O artigo argumenta que, se você olhar apenas de longe (Nível de Fonte), você verá a "Especialização Fantasma". Se você der zoom (Nível de Aresta), verá que os circuitos estão, na verdade, fazendo exatamente a mesma coisa.

Resumo das Principais Conclusões

  1. Fios Diferentes \neq Lógica Diferente: Só porque dois circuitos parecem diferentes no papel, não significa que eles façam coisas diferentes.
  2. O "Fantasma": A aparente especialização é uma ilusão causada pela maneira como extraímos e medimos esses circuitos.
  3. A Redundância é Real: Modelos de IA possuem muitos caminhos de reserva. Se um caminho é cortado, outro assume o controle. Isso torna difícil encontrar o "único circuito verdadeiro".
  4. Como Corrigir: Para entender como a IA funciona, não devemos apenas olhar para um circuito. Precisamos:
    • Testar se um circuito funciona em diferentes tipos de entradas (Testes de Transferência).
    • Olhar para os fios específicos, não apenas para os grandes componentes (Avaliação de Nível de Aresta).
    • Executar a extração várias vezes e ver o que permanece constante (Múltiplas Extrações).

Em resumo: A IA não está construindo um motor novo para palavras raras; ela está apenas usando um chapéu diferente. O chapéu parece diferente, mas o motor por baixo é o mesmo.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →