← Últimos artigos
💬 NLP

A Unifying Perspective on Language Model Representations: From Filler-Role Structure to Mechanistic Interpretability

Este artigo propõe as Representações de Produto Tensorial (TPRs) como um arcabouço unificador que demonstra matemática e empiricamente como diversos métodos de interpretabilidade de modelos de linguagem, tais como sondagem linear e autoencoders esparsos, podem ser derivados de uma única estrutura subjacente de vínculos entre preenchimento e função.

Autores originais: Zhang Enyan, R. Thomas McCoy

Publicado 2026-09-01
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Zhang Enyan, R. Thomas McCoy

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

No mundo silencioso e vibrante da inteligência artificial, pesquisadores tentam compreender como programas de computador massivos, conhecidos como modelos de linguagem, realmente pensam. Esses sistemas conseguem escrever poesia, resolver problemas matemáticos e manter conversas, mas, dentro de seus cérebos digitais, a informação é armazenada como longas listas de números. Por anos, cientistas usaram várias ferramentas para espiar dentro dessas caixas pretas, descobrindo que os modelos parecem organizar a informação de maneiras surpreendentemente ordenadas. Algumas ferramentas mostram que os modelos podem resolver quebra-cabeças somando e subtraindo essas listas de números, enquanto outras revelam que partes específicas do modelo se iluminam quando encontram uma palavra ou ideia particular. No entanto, essas descobertas permaneceram isoladas, como pistas separadas encontradas em diferentes cômodos de uma casa escura. A grande questão tem sido se existe uma estrutura única e subjacente que explique todos esses comportamentos diferentes, ou se os modelos são apenas um emaranhado caótico de truques não relacionados.

Uma equipe de pesquisadores da Universidade de Yale propôs uma resposta unificadora para este enigma. Eles sugerem que esses complexos modelos de linguagem são construídos sobre um princípio arquitetônico específico chamado Representações de Produto Tensorial. Em termos simples, isso significa que os modelos armazenam informação ao vincular fortemente duas coisas: o conteúdo de uma ideia (como uma palavra específica) e seu papel em uma frase (como se é o sujeito ou o objeto). Imagine um sistema de arquivamento onde cada informação é armazenada não apenas pelo que ela é, mas por exatamente onde ela pertence em uma estrutura. Os pesquisadores descobriram que essa forma simples e estruturada de organizar dados pode explicar uma ampla gama de descobertas anteriormente não relacionadas. Ela explica por que os modelos podem realizar analogias matemáticas, por que testes simples podem revelar conceitos ocultos e por que alterar uma única parte do estado interno de um modelo pode alterar seu comportamento de maneiras previsíveis.

Para testar essa ideia, a equipe não se baseou apenas na teoria; eles construíram um novo tipo de ferramenta para atuar como um tradutor. Eles criaram um sistema que pega a estrutura conhecida de uma frase — identificando o sujeito, o verbo e o objeto — e a converte nos padrões numéricos específicos que os modelos utilizam. Eles então compararam essa versão traduzida com o funcionamento interno real de vários modelos de computador diferentes, variando de redes pequenas e simples a sistemas de linguagem massivos e de última geração. Os resultados foram surpreendentemente consistentes. Em testes envolvendo sequências de números e frases estruturadas em inglês, a tradução estrutural dos pesquisadores correspondeu aos estados internos dos modelos com extrema precisão. Para os modelos mais simples, a correspondência foi quase perfeita, capturando quase toda a variação de como os modelos processavam a informação. Mesmo para os maiores e mais complexos modelos de linguagem, a tradução capturou a vasta maioria da informação, sugerindo que esses sistemas gigantes, apesar de seu tamanho, dependem deste mesmo método fundamental de vincular conteúdo à posição.

O poder desta descoberta reside em como ela conecta diferentes métodos de investigação. Os pesquisadores mostraram que a lógica matemática por trás de sua tradução estrutural poderia ser usada para recriar os resultados de quatro importantes técnicas de interpretabilidade que os cientistas usam hoje. Primeiro, eles explicaram por que os modelos de linguagem podem realizar "analogias aditivas", um fenômeno onde subtrair um conceito de outro e adicionar um terceiro resulta em um quarto conceito relacionado. O trabalho deles demonstrou que isso acontece porque os modelos estão, essencialmente, calculando a diferença entre pares específicos de conteúdo e função. Segundo, eles mostraram como as "sondas lineares", que são testes simples usados para detectar se um modelo conhece um certo fato, são na verdade apenas uma forma de desvincular a função do conteúdo para recuperar a ideia original. Terceiro, eles explicaram como os "autoencoders esparsos", que decompõem sinais complexos em partes mais simples, estão efetivamente identificando esses mesmos vínculos de conteúdo e função. Finalmente, eles demonstraram que o "patching de ativação", uma técnica onde pesquisadores trocam partes do cérebro de um modelo para ver como isso altera o comportamento, funciona porque eles estão trocando diretamente esses vínculos estruturais específicos.

Em uma série de experimentos, a equipe provou que poderia usar sua tradução estrutural para construir essas quatro ferramentas de teste do zero, sem precisar treiná-las nos modelos primeiro. Quando usaram essas ferramentas construídas para analisar os modelos, elas tiveram um desempenho tão bom quanto as ferramentas padrão, fortemente treinadas, utilizadas na área. Por exemplo, quando usaram seu método para prever qual palavra apareceria a seguir em uma frase, ou para identificar o sujeito de uma frase, a precisão foi quase idêntica à dos melhores métodos existentes. Em um teste específico envolvendo um grande modelo de linguagem, a diferença entre a previsão estrutural deles e o método padrão foi tão pequena que era quase invisível, com um escore de correlação próximo de um. Isso sugere que os comportamentos complexos e aprendidos desses modelos não são misteriosos ou acidentais, mas são consequências diretas desta regra estrutural subjacente.

Os pesquisadores também exploraram quão bem essa estrutura se mantém quando os modelos enfrentam novas situações. Eles treinaram seu tradutor estrutural em um conjunto de frases e depois o testaram em frases contendo palavras e funções que nunca haviam visto antes. O tradutor generalizou com sucesso, reconstruindo com precisão o estado interno do modelo para essas novas combinações. Isso indica que os modelos não estão simplesmente memorizando exemplos específicos, mas estão usando um sistema flexível para combinar novos conteúdos com funções conhecidas. O estudo não afirmou resolver todos os mistérios da inteligência artificial, nem sugeriu que todos os modelos sejam idênticos. No entanto, forneceu evidências fortes de que um framework único e coerente pode explicar como esses sistemas representam o mundo. Ao mostrar que diversos métodos de interpretabilidade apontam para a mesma realidade estrutural, o trabalho aproxima o campo de uma compreensão unificada de como as redes neurais funcionam, transformando uma coleção de observações isoladas em uma imagem única e coerente da mente da máquina.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →