← Últimos artigos
💬 NLP

What Makes Two Language Models Think Alike?

Este artigo introduz um novo método para mapear a atividade neural em características linguísticas interpretáveis para revelar que as semelhanças entre 43 modelos de linguagem diversos são impulsionadas principalmente por sua data de lançamento e família de modelos, em vez de escala ou classe arquitetônica.

Autores originais: Louis Jalouzot, Christophe Pallier, Emmanuel Chemla, Yair Lakretz

Publicado 2026-06-05
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Louis Jalouzot, Christophe Pallier, Emmanuel Chemla, Yair Lakretz

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem uma sala cheia de diferentes chefs. Alguns são treinados em culinária francesa, outros em japonesa, e alguns são autodidatas. Todos eles têm o mesmo trabalho: prever o próximo ingrediente em uma receita.

A grande questão que os pesquisadores fizeram é: Esses chefs realmente pensam sobre ingredientes da mesma forma?

Por exemplo, quando um chef vê uma frase como "O gato perseguiu o rato", eles focam no fato de ser uma história sobre animais (sintaxe), ou apenas focam nas palavras específicas "gato" e "rato" (vocabulário)?

O Jeito Antigo: Medindo a "Forma"

Anteriormente, os cientistas tentavam comparar esses chefs (modelos de IA) observando a "forma" de seus pensamentos internos. Imagine tirar uma foto de como cada chef organiza seus ingredientes em um balcão. Se as fotos parecem geometricamente semelhantes, os cientistas assumiam que os chefs pensavam de forma parecida.

Mas isso tinha um problema: era como uma caixa preta. Podia dizer que dois chefs organizavam os ingredientes de forma semelhante, mas não podia explicar o porquê. Talvez ambos agrupassem as coisas por cor, ou talvez ambos agrupassem as coisas por peso. O método antigo não conseguia explicar o "porquê".

O Novo Jeito: A "Assinatura Linguística"

Este artigo introduz uma maneira nova e mais simples de olhar para dentro da mente dos chefs. Em vez de apenas olhar para a forma da organização, eles perguntam: "O quanto cada regra específica importa para este chef?"

Eles criaram uma ferramenta chamada Modelo de Codificação de Aprendizado de Métricas (MLEM). Pense nisso como um tradutor que converte os pensamentos internos bagunçados e complexos do chef em um boletim simples de Características Linguísticas.

Este boletim lista coisas como:

  • Tempo Verbal: A frase é sobre o passado ou o futuro?
  • Sujeito: A frase é sobre uma pessoa ou sobre muitas?
  • Estrutura da Frase: É uma frase simples ou uma complexa com uma "oração relativa" (como "O homem que está usando um chapéu...")?

A ferramenta mede o quanto os pensamentos internos do chef mudam quando essas regras mudam. Se o pensamento do chef salta drasticamente quando você muda do tempo passado para o futuro, essa característica tem uma pontuação alta em seu boletim. Este boletim é chamado de "Assinatura Linguística."

O Experimento: 43 Chefs, 10 Famílias

Os pesquisadores testaram 43 modelos de IA diferentes (os "chefs"). Esses modelos vinham de diferentes "famílias" (como a família Llama, a família GPT ou a família Mamba) e tinham tamanhos diferentes (de minúsculos a gigantescos) e arquiteturas diferentes (formas diferentes de construir o cérebro).

Eles compararam as Assinaturas Linguísticas de cada modelo contra todos os outros.

A Grande Descoberta: É Sobre "Família" e "Era", Não de Tamanho

Os resultados foram surpreendentes. Os pesquisadores descobriram que o que faz dois modelos pensarem de forma semelhante não é o quão grandes eles são, mas sim quem são seus pais e quando eles nasceram.

  1. A Família Importa Mais: Modelos da mesma família (por exemplo, todos os modelos "Llama") tinham assinaturas muito semelhantes, mesmo que um fosse minúsculo e o outro fosse enorme. Eles foram criados com as mesmas "receitas de treinamento" e projetos arquitetônicos, então aprenderam a priorizar as mesmas regras linguísticas.
  2. A Data de Lançamento Importa: A data em que um modelo foi lançado foi o preditor mais forte de similaridade. Isso é como dizer: "Chefs treinados em 2024 pensam mais parecidos do que chefs treinados em 2020". Isso ocorre porque toda a indústria muda suas técnicas juntas ao longo do tempo (novas funções de ativação, melhores dados de treinamento, etc.).
  3. O Tamanho Não dita o Estilo: Simplesmente tornar um modelo maior (adicionando mais parâmetros) não o fazia subitamente começar a pensar como um tipo completamente diferente de modelo. Um modelo pequeno e um gigante da mesma família ainda compartilhavam as mesmas "prioridades linguísticas".

O "Loop" do Pensamento

Os pesquisadores também observaram como essas assinaturas mudavam conforme a informação passava pelas camadas do modelo (como uma mensagem passando por uma corrida de revezamento).

Eles descobriram que modelos da mesma família seguiam o mesmo caminho. Eles começavam com um certo foco, moviam-se para um pico de complexidade nas camadas intermediárias e depois voltavam para um foco mais simples no final. É como um loop. Isso sugere que, embora os modelos sejam de tamanhos diferentes, todos resolvem o problema da linguagem com os mesmos "passos de dança".

A Conclusão

Em resumo, este artigo argumenta que não devemos apenas olhar para o quão "grande" ou "complexo" um IA é para entender como ele pensa. Em vez disso, devemos olhar para sua Assinatura Linguística — um perfil do que as regras que ele mais valoriza.

O estudo mostra que arquitetura e escala são menos importantes do que a "família" e a "geração" do modelo. Dois modelos podem ser construídos de forma diferente e ter tamanhos diferentes, mas se vierem da mesma família e era, provavelmente priorizarão as mesmas características linguísticas, fazendo com que "pensem de forma semelhante".

O estudo mostra que arquitetura e escala são menos importantes do que a "família" e a "geração" do modelo. Dois modelos podem ser construídos de forma diferente e ter tamanhos diferentes, mas se vierem da mesma família e era, provavelmente priorizarão as mesmas características linguísticas, fazendo com que "pensem de forma semelhante".

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →