← Últimos artigos
🤖 AI

Data-driven Circuit Discovery for Interpretability of Language Models

Este artigo critica os métodos existentes de descoberta de circuitos baseados em hipóteses por produzirem circuitos específicos de conjuntos de dados que falham em capturar a verdadeira diversidade mecânica dos modelos de linguagem, e propõe a Descoberta de Circuitos Orientada por Dados (DCD), um novo framework que agrupa exemplos por similaridade de processamento para revelar múltiplos circuitos distintos e de alta fidelidade para uma única tarefa.

Autores originais: Daking Rai, Mor Geva, Ziyu Yao

Publicado 2026-05-12
📖 4 min de leitura☕ Leitura rápida

Autores originais: Daking Rai, Mor Geva, Ziyu Yao

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem um robô gigante e superinteligente (um Modelo de Linguagem) que pode escrever histórias, fazer cálculos e resolver quebra-cabeças. Os cientistas querem entender como esse robô pensa. Eles chamam isso de "Interpretabilidade Mecanística".

A maneira tradicional pela qual os cientistas tentaram fazer isso é como tentar encontrar o "motor" de um carro observando uma única viagem específica. Eles dizem: "Certo, o robô acabou de ir do Ponto A ao Ponto B. Vamos mapear exatamente quais engrenagens giraram para fazer isso acontecer." Eles chamam esse caminho mapeado de Circuito.

O Problema: A Armadilha do "Tamanho Único"
O artigo argumenta que a maneira antiga de fazer isso é falha porque faz duas suposições ruins:

  1. A Suposição do Conjunto de Dados: Assume que os exemplos específicos que os cientistas usaram (como uma estrutura de frase específica) representam todas as maneiras pelas quais o robô pode realizar a tarefa.
  2. A Suposição do Motor Único: Assume que o robô usa apenas um conjunto específico de engrenagens (circuito) para resolver a tarefa, não importa como a pergunta seja feita.

A Descoberta: O Robô Tem Muitos Motores
Os pesquisadores testaram isso dando ao robô a mesma tarefa, mas com pequenas variações (como mudar os nomes em uma história, ou escrever o problema matemático em palavras em vez de números).

Eles descobriram que:

  • Quando mapearam o "motor" do robô para uma história com nomes como "João e Maria", parecia completamente diferente do motor usado para uma história com nomes como "Pessoa X e Pessoa Y".
  • Pior ainda, se misturavam duas tarefas totalmente diferentes (como "encontrar o objeto" e "fazer matemática") em um grande monte de dados, o método antigo ainda tentava forçar um único mapa sobre isso. Criava um circuito bagunçado e confuso, uma mistura "Frankenstein" de ambas as tarefas, em vez de perceber que o robô estava, na verdade, alternando entre dois motores diferentes dependendo da entrada.

A Solução: Descoberta de Circuitos Orientada por Dados (DCD)
Para corrigir isso, os autores propõem um novo método chamado Descoberta de Circuitos Orientada por Dados (DCD).

Pense nisso assim:

  • Método Antigo: Você pede a um grupo de pessoas para resolver um quebra-cabeça. Você olha para a solução de todos e tenta desenhar um único plano mestre que explique como todos o resolveram. Se algumas pessoas usaram um martelo e outras usaram uma chave de fenda, seu plano torna-se uma confusão de ambas as ferramentas.
  • Novo Método (DCD): Você primeiro olha para as pessoas e as agrupa por como estão resolvendo o problema. Você coloca todos os "usuários de martelo" em um quarto e todos os "usuários de chave de fenda" em outro. Então, você desenha um plano separado e limpo para o grupo do martelo e um plano diferente e limpo para o grupo da chave de fenda.

Como a DCD Funciona (A Metáfora)

  1. Organizar os Dados: Em vez de forçar o robô a usar um único caminho, a DCD examina cada exemplo individual que o robô processa. Ela pergunta: "Este exemplo faz as engrenagens internas do robô girarem de maneira semelhante àquele outro exemplo?"
  2. Criar Grupos: Ela organiza os exemplos em "clusters" com base em como o robô os processa.
  3. Encontrar Circuitos Específicos: Em seguida, encontra um "mapa de motor" específico e limpo para cada grupo.

Os Resultados
Quando usaram esse novo método:

  • Descobriram que o robô na verdade usa múltiplos mecanismos distintos (motores) para o que os humanos acham que é apenas "uma tarefa".
  • Os novos mapas (circuitos) foram muito mais precisos (fiéis) e mais simples (esparços) do que os antigos mapas bagunçados.
  • Crucialmente, a organização interna do robô não se importava com rótulos humanos como "Matemática" ou "História". Ela se organizava pela estrutura da entrada. A DCD respeita a lógica interna do robô em vez de forçar categorias humanas sobre ele.

Em Resumo
O artigo diz: "Pare de tentar encontrar um único motor universal para uma tarefa. O robô é mais inteligente e mais flexível do que isso. Ele tem motores diferentes para situações diferentes. Nosso novo método, a DCD, permite que os dados nos digam onde estão os limites, para que possamos encontrar o motor certo para o trabalho certo, em vez de forçar um único mapa de motor confuso sobre tudo."

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →