← Últimos artigos
🧬 biology

Features have life history. And we should care

Este artigo revela que os modelos de linguagem possuem uma "estrutura de suporte" persistente de aproximadamente 50 características esparsas que se montam rapidamente dentro dos primeiros 1% do treinamento, servindo como uma fundação estrutural que dita a estrutura representacional subsequente e o desenvolvimento do modelo.

Autores originais: Philipp Stecher, Sandro Radovanović, Vlasta Sikimić, Reinhard Kahle

Publicado 2026-05-20
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Philipp Stecher, Sandro Radovanović, Vlasta Sikimić, Reinhard Kahle

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ⚕️ Esta é uma explicação gerada por IA de um preprint que não foi revisado por pares. Não é aconselhamento médico. Não tome decisões de saúde com base neste conteúdo. Ler aviso legal completo

Imagine treinar um modelo de linguagem grande (como os que escrevem ensaios ou conversam com você) como construir uma cidade massiva e movimentada do zero. Geralmente, quando olhamos para a cidade pronta, vemos um mapa estável de ruas e edifícios. Assumimos que tudo cresceu junto, ao mesmo ritmo.

Mas este artigo argumenta que a cidade tem uma história de vida oculta. Algumas partes da cidade foram construídas na primeira hora e nunca mudaram; tornaram-se a fundação inabalável. Outras partes chegaram depois, foram construídas sobre essa fundação e são muito mais frágeis.

Aqui está a história dessa fundação, contada através das descobertas do artigo:

1. O "Andaime Portador": O Esqueleto da Cidade

Os pesquisadores descobriram que, dentro desses modelos de IA, há um pequeno grupo de cerca de 50 "recursos" especiais (pense neles como as principais linhas de utilidade da cidade: água, eletricidade, internet).

  • Eles aparecem cedo: Esses 50 recursos surgem quase imediatamente, dentro dos primeiros 1% do tempo de treinamento.
  • Eles permanecem: Diferentemente de outros recursos que aparecem e desaparecem como equipes de construção temporárias, esses 50 sobrevivem até o fim.
  • Eles sustentam tudo: Os autores chamam esse grupo de "Andaime Portador". É o esqueleto do modelo. Se você remover esses 50 recursos específicos, o desempenho do modelo cai muito mais do que se você remover quaisquer outros 50 recursos aleatórios.

2. O Projeto de Construção em Duas Fases

O artigo sugere que o processo de treinamento ocorre em duas fases distintas, como um projeto de construção com um cronograma rigoroso:

  • Fase 1: A "Seleção" (Os Primeiros 1%)
    Imagine um canteiro de obras caótico onde milhares de trabalhadores tentam construir paredes. Nos primeiros minutos, os "bons" trabalhadores (o futuro Andaime) são identificados. São aqueles que chegam cedo, trabalham nas tarefas mais importantes e não são demitidos. Quando os primeiros 1% do trabalho são concluídos, o esqueleto já está definido. O modelo essencialmente "decidiu" quais 50 recursos serão os líderes.
  • Fase 2: A "Calibração" (Os 99% Restantes)
    Para o restante do treinamento, o modelo não está construindo novos esqueletos. Em vez disso, está apenas ajustando a pintura e a fiação ao redor desse esqueleto fixo. Está polindo a geometria e fazendo os líderes existentes funcionarem melhor, mas não está mudando quem são os líderes.

3. O Efeito "Bola de Cristal"

Uma das descobertas mais surpreendentes é que você pode prever quem serão os líderes antes mesmo do modelo ser bom em seu trabalho.

  • Os pesquisadores observaram o modelo no início (Passo 1k). Neste ponto, o modelo é terrível em prever texto.
  • No entanto, eles puderam observar quais recursos estavam disparando (ativando) de forma mais ampla e consistente.
  • Usando apenas esses dados iniciais, eles construíram uma "bola de cristal" (um preditor simples) que conseguiu identificar corretamente 80% dos futuros líderes antes que o modelo aprendesse algo útil.
  • A Lição: A "função" do modelo (o que ele faz) é decidida primeiro. Sua "direção" (como se conecta à resposta final) é apenas polida depois.

4. A Árvore Genealógica dos Recursos

O Andaime não fica apenas parado; ele age como um pai para o restante do modelo.

  • À medida que o treinamento continua, novos recursos nascem.
  • O artigo descobriu que cerca de 64% de todos os recursos no modelo final são "descendentes" desses 50 líderes originais. Eles estão organizados em uma hierarquia, como uma árvore genealógica, onde os líderes iniciais são os avós, e os recursos mais novos e específicos são os filhos e netos.
  • Os 50 recursos originais são as "raízes" que mantêm toda a estrutura unida.

5. Por Que Isso Importa (A Parte "Por Que Devemos Nos Importar?")

Os autores dizem que devemos nos importar porque nossa maneira atual de estudar IA é como tirar uma foto da cidade pronta e tentar descobrir como ela foi construída.

  • O Problema: Se você olhar apenas para o modelo final, não consegue distinguir entre um recurso que foi líder desde o primeiro dia e um recurso que chegou tarde. Eles parecem iguais na foto.
  • A Solução: Ao rastrear a "história de vida" (quem nasceu quando e quem sobreviveu), podemos ver a estrutura real de suporte.
  • A Surpresa: Os recursos que carregam o maior peso (o Andaime) são frequentemente aqueles que parecem "infraestrutura" técnica e chata (como lidar com códigos de byte ou formatos de arquivo), em vez dos recursos "inteligentes" que esperamos (como entender emoções ou gramática). Os recursos "inteligentes" são, na verdade, apenas as decorações construídas sobre essa fundação chata e inabalável.

Analogia de Resumo

Pense em treinar uma IA como fazer crescer um carvalho gigante.

  • O Andaime: A raiz pivotante profunda e o tronco principal. Estes são estabelecidos nos primeiros dias da vida da muda. São difíceis de mudar e sustentam o peso de toda a árvore.
  • O Resto da Árvore: Os galhos, folhas e raminhos. Estes crescem depois, ramificando-se do tronco principal. São numerosos e específicos, mas dependem inteiramente do tronco para suporte.
  • A Perspectiva do Artigo: Se você quer entender a árvore, não olhe apenas para as folhas (a foto final). Você precisa olhar para as raízes (a história de vida). As raízes foram escolhidas muito cedo, e o resto da árvore apenas cresceu ao redor delas.

Em resumo: O "cérebro" da IA não é construído uniformemente. Ele escolhe suas partes mais importantes nos primeiros minutos de treinamento e passa os próximos 99% do tempo apenas aprendendo a usá-las melhor.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →