Polymorphism Is Rotation: Operational Mechanistic Interpretability from a Two-Layer Transformer to Pythia-70m
Este artigo demonstra que transformadores treinados independentemente computam funções idênticas usando coordenadas internas mutuamente incompreensíveis relacionadas por uma rotação aleatória uniforme, um fenômeno denominado "polimorfismo" que pode ser resolvido por meio de um único ajuste de Procrustes ortogonal para permitir a transferência direta de dicionários de características e vetores de direção sem retreinamento.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você e um amigo estão construindo castelos de Lego idênticos e complexos, seguindo o mesmo manual de instruções. Ambos acabam com castelos que parecem exatamente iguais por fora e desempenham as mesmas funções exatas (possuem as mesmas portas, janelas e torres).
No entanto, dentro dos seus castelos, os "projetos" de como os blocos estão dispostos são completamente diferentes. Na verdade, são tão diferentes que, se você tentasse usar o projeto interno do seu amigo para entender o seu próprio castelo, ficaria confuso. Não é que seus castelos sejam diferentes; é que vocês estão falando duas "línguas internas" diferentes para descrever a mesma coisa.
Este artigo chama esse fenômeno de "Polimorfismo". Significa "mesma função, coordenadas internas diferentes".
Aqui está a explicação do que os pesquisadores descobriram, usando analogias simples:
1. O "Decodificador" vs. O "Codificador" (O Problema do Dicionário)
Na pesquisa de IA, os cientistas frequentemente tentam entender o que um modelo está pensando observando seus "recursos" (como um dicionário de conceitos). Eles descobriram que, se olhassem para o final do processo (o "decodificador"), os dicionários pareciam quase idênticos entre dois modelos diferentes. Era como duas pessoas usando exatamente o mesmo dicionário para escrever uma história.
A Reviravolta: Os pesquisadores perceberam que, embora o dicionário (o decodificador) fosse o mesmo, a forma como eles liam o dicionário (o codificador) estava completamente embaralhada.
- A Analogia: Imagine duas pessoas lendo um livro. A Pessoa A lê normalmente. A Pessoa B tem o livro girado 90 graus e está lendo de cabeça para baixo. Se você apenas olhar para as palavras que elas apontam (o decodificador), elas combinam perfeitamente. Mas, se tentar ler as anotações da Pessoa B usando a perspectiva da Pessoa A, as anotações não fazem sentido. As "anotações" (ativações) estão em um referencial girado.
2. O Falha Catastrófica
Quando os pesquisadores tentaram pegar o "dicionário de recursos" do Modelo A e aplicá-lo diretamente ao Modelo B, falhou completamente. A reconstrução dos pensamentos internos do modelo foi pior do que apenas adivinhar a resposta média.
- A Analogia: É como tentar usar um mapa de Nova York para navegar em Londres. Os pontos de referência (colunas do decodificador) podem parecer semelhantes em uma lista, mas as ruas (coordenadas internas) estão orientadas de forma diferente. Se você seguir o mapa de Nova York em Londres, ficará perdido imediatamente.
3. O Arranjo Mágico: Uma Multiplicação de Matriz
A maior descoberta do artigo é como corrigir isso. Você não precisa retreinar os modelos ou mudar seus cérebros. Você só precisa aplicar uma única "rotação" matemática (um tipo específico de operação matemática chamada ajuste de Procrustes) para alinhar os dois modelos.
- A Analogia: Imagine que você e seu amigo estão olhando para uma escultura, mas estão de lados opostos de uma plataforma giratória. Vocês veem o mesmo objeto, mas de ângulos diferentes. Se você apenas girar sua plataforma para combinar com a do seu amigo, de repente suas visões se alinham perfeitamente.
- O Resultado: Assim que aplicaram essa única "rotação" aos dados internos do Modelo B, o dicionário do Modelo A funcionou perfeitamente no Modelo B. A "língua interna" foi traduzida instantaneamente.
4. É uma Rotação Específica ou Aleatória?
Os pesquisadores queriam saber: essa rotação é uma mudança específica e significativa, ou é apenas caos aleatório?
- A Descoberta: É essencialmente aleatória. A rotação entre dois modelos treinados independentemente é como um giro aleatório em uma roda. Não é um ângulo "especial"; é apenas uma rotação uniforme aleatória.
- A Analogia: Se você girar um globo aleatoriamente e pará-lo, a orientação é aleatória. O artigo mostra que, sempre que dois modelos de IA são treinados do zero, eles acabam com um "globo" que foi parado em um ângulo aleatório em relação um ao outro.
5. O Que Isso Significa para "Direcionamento" (Mudança de Comportamento)
O artigo também testou "vetores de direcionamento" — ferramentas usadas para empurrar um modelo para se comportar de maneira diferente (por exemplo, tornando-o mais educado ou mais criativo).
- A Descoberta: Se você tentar usar um "empurrão de direcionamento" do Modelo A no Modelo B sem corrigir a rotação primeiro, isso frequentemente falha ou até faz o oposto do que você deseja.
- A Analogia: Imagine que você tem um controle remoto para um carro de brinquedo (Modelo A). Se tentar usar esse controle em um carro de brinquedo diferente (Modelo B) que está virado para uma direção diferente, pressionar "Frente" pode fazer o segundo carro ir para a "Esquerda" ou "Trás". Você precisa primeiro descobrir para onde o segundo carro está virado (a rotação) e ajustar os sinais do seu controle remotamente.
Resumo das "Regras"
O artigo estabelece três regras principais sobre como esses modelos se relacionam:
- Mesma Função, Coordenadas Diferentes: Dois modelos treinados separadamente fazem o mesmo trabalho, mas usam "mapas" internos diferentes.
- O Decodificador Mente: Apenas porque os recursos do "final da linha" parecem semelhantes não significa que os modelos entendem as coisas da mesma maneira.
- A Correção é Barata: Você pode alinhar dois modelos totalmente diferentes com um único e simples cálculo matemático (uma multiplicação de matriz) sem precisar re treiná-los.
A Escala da Descoberta
Os pesquisadores provaram isso em dois níveis:
- O Modelo "Brinquedo": Um modelo minúsculo e simples (104.000 parâmetros), onde puderam verificar cada bloco individualmente para garantir que a teoria fosse verdadeira.
- O Modelo "Real": Um modelo de linguagem muito maior e do mundo real (Pythia-70m) com 70 milhões de parâmetros. A mesma regra de "rotação aleatória" também se manteve aqui.
A Conclusão: Modelos de IA são como gêmeos que falam a mesma língua, mas com sotaques e orientações diferentes. Eles fazem as mesmas coisas, mas para se entenderem, você só precisa girar sua perspectiva. Uma vez que você faz isso, seus segredos internos tornam-se legíveis.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.