← Últimos artigos
🤖 machine learning

How to Tame Grokking: Representation Geometry as a Control Signal

Este artigo identifica que o colapso de dimensionalidade na geometria da representação precede consistentemente o fenômeno do grokking e introduz a Regularização de Dimensionalidade Geométrica (GeomDR) para controlar ativamente essa geometria, acelerando assim a generalização em até 52 vezes através de várias tarefas e arquiteturas.

Autores originais: Maksim A Kazanskii

Publicado 2026-07-14
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Maksim A Kazanskii

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine um estudante estudando intensamente para uma prova de matemática. No início, ele apenas memoriza as respostas das questões de prática de forma mecânica. Ele consegue 100% na folha de exercícios, mas se você fizer uma pergunta ligeiramente diferente, ele falha. É isso que acontece com muitos modelos de IA em um fenômeno chamado "grokking". A IA memoriza os dados de treinamento perfeitamente, mas leva um tempo muito longo — às vezes centenas de milhares de passos — para subitamente "clicar" e realmente entender as regras para que possa resolver novos problemas. É como o estudante encarando o livro didático por dias, e então, de repente, tem um momento de "Aha!" logo antes da prova real.

Por um tempo, os cientistas se perguntaram por que esse atraso acontecia e o que estava acontecendo dentro do "cérebro" da IA durante essa longa espera.

A Grande Descoberta: O Cérebro Encolhe Antes de Entender

Os pesquisadores neste artigo decidiram olhar dentro do "cérebro" da IA (especificamente, em suas camadas ocultas) para ver o que estava acontecendo geometricamente. Eles trataram os pensamentos internos da IA como uma nuvem de pontos em um espaço multidimensional.

Eles descobriram algo fascinante: Antes de a IA começar subitamente a entender as regras, sua "nuvem" interna de pensamentos colapsa em uma forma muito menor e mais compacta.

Pense nisso como uma festa bagunçada e espalhada em um armazém gigante. Todos estão correndo para todos os lados (alta dimensionalidade). De repente, a festa encolhe. Todos param de vagar e se agrupam firmemente em uma linha única e organizada em um corredor pequeno (baixa dimensionalidade). O artigo mostra que esse "encolhimento" ou colapso de dimensionalidade acontece todas as vezes logo antes de a IA começar a generalizar. Não é apenas um efeito colateral; os autores mostram que forçar essa mudança geométrica influencia diretamente o tempo do "clique", sugerindo que este é um fator determinante no processo.

O Novo Truque: GeomDR (O "Mudador de Forma")

Já que notaram que encolher a forma interna da IA leva à compreensão, os autores perguntaram: E se forçarmos a IA a encolher de propósito?

Eles inventaram uma nova ferramenta chamada Regularização Geométrica de Dimensionalidade (GeomDR). Imagine que você está treinando um cachorro para sentar. Normalmente, você apenas espera que ele entenda. Mas com o GeomDR, você guia gentilmente as patas do cachorro para a posição de "sentar" antes mesmo de ele conhecer o comando.

Em termos técnicos, o GeomDR é uma regra adicionada ao processo de treinamento que diz à IA: "Ei, pare de espalhar seus pensamentos em todas as direções. Mantenha suas representações internas compactas e focadas em um número específico e menor de direções."

Os Resultados: De Centenas de Milhares de Passos para Apenas Milhares

Os resultados foram dramáticos. Em seus experimentos com quebra-cabeças matemáticos simples (como adição modular, que é basicamente fazer matemática com o mostrador de um relógio):

  • Sem ajuda: A IA levou cerca de 362.100 passos de otimização para finalmente "grokkar" e entender o padrão.
  • Com GeomDR: A IA entendeu em apenas 6.900 passos de otimização.

Isso é uma aceleração de 52,5 vezes em termos de passos de treinamento. Em alguns casos, essa redução de passos significa que a IA alcança a solução significativamente mais rápido em tempo real, embora o artigo meça especificamente o número de passos de treinamento em vez de horas de tempo real. Eles testaram isso em diferentes tipos de quebra-cabeças (divisão, embaralhamento de listas) e diferentes arquiteturas de IA (redes simples e modelos "Transformer" mais complexos), e funcionou em todos os lugares, embora a aceleração tenha sido mais massiva nas redes mais simples.

O Que Eles Descartaram (e o Que Não Descartaram)

O artigo é muito cuidadoso sobre o que afirma.

  • NÃO é apenas sobre a IA ficar "mais simples" de uma forma vaga. Os autores mostram explicitamente que é sobre a geometria dos dados. Eles argumentam contra a ideia de que isso é apenas um efeito colateral do treinamento padrão; eles demonstraram que forçar a geometria a mudar altera diretamente a velocidade do aprendizado.
  • NÃO é uma "solução mágica" para todos os problemas. O artigo observa que, embora funcione muito bem nesses quebra-cabeças algorítmicos específicos, eles ainda não testaram em modelos de linguagem massivos ou reconhecimento de imagem. Eles sugerem que pode funcionar lá, mas não têm certeza.
  • NÃO é uma teoria "resolvida" de como a IA pensa. Os autores são cuidadosos ao dizer que eles sugerem que o encolhimento da geometria é a chave. Eles não provaram matematicamente por que uma forma menor equivale à compreensão, apenas que isso acontece consistentemente e que forçá-la faz a IA aprender mais rápido.

O "Momento Ideal" (Sweet Spot)

Uma das partes mais interessantes do estudo é que você não pode simplesmente ligar essa regra de "encolhimento" imediatamente.

  • Se você forçar a IA a encolher cedo demais (antes mesmo de ela ter memorizado as questões de prática), ela fica confusa e aprende lentamente.
  • Se você esperar demais (até que ela já tenha memorizado tudo), a regra não ajuda muito.
  • A mágica acontece se você deixar a IA memorizar os dados primeiro e, depois, guiá-la gentilmente para encolher sua forma interna. É como deixar um aluno memorizar os fatos e, depois, dizer a ele: "Ok, agora organize esses fatos em uma lista organizada", que é quando a verdadeira compreensão acontece.

A Conclusão

Este artigo sugere que o segredo para fazer a IA entender regras mais rápido não é apenas dar a ela mais dados ou treiná-la por mais tempo. Em vez disso, trata-se de gerenciar a forma de seus pensamentos. Ao guiar suavemente a geometria interna da IA para colapsar em uma estrutura compacta e organizada no momento certo, podemos fazer o momento do "grokking" acontecer quase instantaneamente.

É um pouco como perceber que a razão pela qual você não conseguia resolver um quebra-cabeça não era porque você não conhecia as peças, mas porque estava segurando-as em uma pilha bagunçada. Uma vez que você as organizou em uma pilha arrumada, a imagem tornou-se clara imediatamente. Os autores encontraram uma maneira de ajudar a IA a organizar sua pilha muito mais rápido do que ela conseguiria sozinha.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →