← Últimos artículos
📊 statistics

A Stochastic--Geometric Theory of Scaling Laws in Grokking

Este artículo propone una teoría estocástico-geométrica que explica el grokking como una transición inducida por la optimización desde una cáscara de memorización hacia un núcleo de generalización dentro del espacio de parámetros de Adam, derivando y validando así leyes de escala para el tiempo de retraso basadas en la tasa de aprendizaje, el tamaño del lote y la regularización.

Autores originales: Róisín Luo, Christian Gagné, Jonas Ngnawé, Ihsan Ullah, Karyn Morrissey

Publicado 2026-07-10
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Róisín Luo, Christian Gagné, Jonas Ngnawé, Ihsan Ullah, Karyn Morrissey

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás viendo a un personaje de un videojuego intentar resolver un rompecabezas difícil. Al principio, el personaje corre frenéticamente, memorizando cada uno de los pasos del camino que acaba de recorrer. Consigue la puntuación de cero instantáneamente, pero no ha aprendido realmente las reglas; solo ha memorizado el mapa específico. Esto se llama memorización.

Entonces, sucede algo mágico. Después de un largo y aburrido periodo en el que nada parece cambiar, el personaje de repente se detiene, mira el tablero y lo entiende. Empieza a resolver nuevos rompecabezas no vistos perfectamente. Este repentino momento de "¡eureka!" es lo que los investigadores llaman grokking.

Durante mucho tiempo, nadie sabía por qué ocurría este retraso. ¿Era magia? ¿Un error? En este artículo, los autores sugieren una nueva forma de visualizar lo que está ocurriendo dentro del cerebro de la computadora (la red neuronal) utilizando un mapa de formas y distancias.

La Cebolla de las Soluciones

Los autores proponen que el espacio donde puede existir el "cerebro" de la computadora se parece a un conjunto de esferas anidadas, algo así como una cebolla o una diana.

  1. La Capa Exterior (Inicialización): Cuando la computadora comienza, sus configuraciones están dispersas en una capa exterior delgada. Es como lanzar dardos que todos aterrizan en el borde de un globo gigante.
  2. La Capa Media (Memorización): A medida que la computadora aprende, se desliza rápidamente hacia una capa intermedia. Aquí, ha memorizado perfectamente los datos de entrenamiento. Es como el personaje de nuestro juego que ha memorizado el mapa pero no entiende las reglas. La computadora se queda atrapada aquí durante mucho tiempo.
  3. El Núcleo (Generalización): En lo profundo del centro de la cebolla se encuentra el núcleo de "generalización". Este es el punto ideal donde la computadora realmente entiende las reglas y puede resolver nuevos problemas.

El fenómeno del "grokking" es simplemente el viaje desde la capa media, a través del espacio vacío, hacia el núcleo. El misterio era: ¿Por qué tarda tanto en llegar allí?

La Caminata del Borracho y la Atracción Magnética

Los autores explican que el proceso de aprendizaje de la computadora (usando un optimizador llamado Adam) es una mezcla de dos fuerzas:

  • La Caminata del Borracho (Difusión): Debido a que la computadora aprende de pequeños lotes de datos, su camino es un poco tambaleante, como una persona borracha caminando en línea recta. Este tambaleo es aleatorio.
  • La Atracción Magnética (Deriva): También hay una fuerza constante que empuja a la computadora hacia el centro, especialmente debido a una regla llamada regularización 2\ell_2 (que actúa como un imán suave que intenta mantener las configuraciones pequeñas).

El artículo sugiere que la computadora se queda atrapada en la capa media porque la "caminata del borracho" es demasiado débil para empujarla fuera de esa capa, y la "atracción magnética" no es lo suficientemente fuerte como para arrastrarla directamente al centro de inmediato. Tiene que deambular por la capa media durante un tiempo hasta que, por azar, los tambaleos aleatorios la empujan lo suficiente como para caer en el núcleo.

Las Reglas del Juego (Leyes de Escalamiento)

Los autores no solo lo adivinaron; utilizaron matemáticas (específicamente la teoría del tiempo de parada y las ecuaciones diferenciales estocásticas) para predecir exactamente cuánto debería durar este retraso. Encontraron tres "perillas" principales que controlan la velocidad de este viaje:

  1. Tasa de Aprendizaje (η\eta): Esto es qué tan grande es el paso que da la computadora. El artículo muestra que si haces los pasos demasiado pequeños, tarda una eternidad en escapar de la capa media. Si los haces demasiado grandes, la computadora podría pasarse de largo. Existe una zona "Goldilocks" (ni muy fría, ni muy caliente, sino justa).
  2. Tamaño del Lote (bb): Esto es cuántos ejemplos mira la computadora antes de dar un paso. El artículo sugiere que los lotes más grandes hacen que la "caminata del borracho" sea menos tambaleante, lo que en realidad ralentiza el escape de la capa media.
  3. Regularización (λ\lambda): Esta es la fuerza de la "atracción magnética". El artículo encuentra que una atracción más fuerte ayuda a la computadora a escapar de la capa media más rápido, pero solo hasta cierto punto.

Derivaron fórmulas específicas (leyes de escalamiento) sobre cómo estas perillas cambian el tiempo que tarda en hacer el grok. Por ejemplo, el tiempo que tarda en saltar de la memorización a la generalización es aproximadamente proporcional a 1/(ηλ)1/(\eta \lambda). Esto significa que si duplicas la tasa de aprendizaje o la regularización, el tiempo de retraso se reduce a la mitad.

Lo que Descartaron

El artículo es muy cuidadoso al decir lo que no están afirmando. No dicen que el grokking ocurra porque la red de repente "encuentre un circuito" o debido a algún despertar misterioso de tipo biológico. En su lugar, argumentan que es puramente un resultado de la geometría del espacio de soluciones y de la aleatoriedad del proceso de optimización. También descartan la idea de que esto sea solo un golpe de suerte; su matemática sugiere que es una característica estructural y predecible de cómo Adam optimiza estos tipos específicos de problemas.

¿Qué tan seguros están?

Los autores están bastante seguros de su teoría, pero son cuidadosos al distinguir entre lo que demostraron y lo que midieron.

  • Las Matemáticas: Derivaron estas leyes de escalamiento utilizando pruebas matemáticas rigurosas basadas en modelos de tiempo continuo del proceso de aprendizaje. Utilizaron un sistema de álgebra simbólica (un programa informático que hace matemáticas) para verificar sus fórmulas, lo que les otorza una alta confianza en las ecuaciones.
  • La Prueba: Probaron sus ideas en dos tipos específicos de rompecabezas: aprendizaje de teoría de grupos (específicamente en el grupo simétrico S5S_5) y aritmética modular (específicamente en enteros módulo 127, escrito como Z127Z_{127}).
  • Los Resultados: En estos experimentos, el comportamiento de la computadora coincidió con sus predicciones. Por ejemplo, cuando cambiaron la tasa de aprendizaje o el tamaño del lote, el tiempo que tardó en hacer el grok cambió exactamente como sus fórmulas lo predijeron. También observaron la curva en forma de "U" para el radio de memorización, lo cual su teoría decía que sucedería.

Sin embargo, señalan que su matemática depende de ciertas condiciones, como tener una tasa de aprendizaje pequeña y un tamaño de lote grande. No pretenden que esto explique cada instancia de grokking en cualquier red neuronal posible, sino que explica el fenómeno en estos tipos de tareas estructuradas donde existe la geometría de "capa-núcleo".

La Conclusión

El grokking no es magia; es un viaje geométrico. La computadora comienza en el exterior, se queda atrapada en una "capa de memorización" y tiene que deambular hasta que el ruido aleatorio de su aprendizaje la empuja hacia el "núcleo de generalización". El tiempo que tarda en realizar este salto depende de qué tan rápido da los pasos (tasa de aprendizaje), qué tan constantes son sus pasos (tamaño del lote) y qué tan fuerte es atraída hacia el centro (regularización). Los autores han mapeado estas reglas con matemáticas y las han confirmado con experimentos, dándonos una imagen más clara de por qué estas redes neuronales a veces parecen dormir durante mucho tiempo antes de despertar repentinamente.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →