← Últimos artículos
💻 computer science

Is Grokking Worthwhile? Functional Analysis and Transferability of Generalization Circuits in Transformers

Este artículo desafía la noción de que el "grokking" representa un cambio fundamental en las capacidades de razonamiento, demostrando en cambio que los modelos que han alcanzado el grokking simplemente integran hechos memorizados en rutas de inferencia existentes sin lograr una transferencia superior o una verdadera maestría de la lógica composicional en comparación con sus contrapartes no grokked.

Autores originales: Kaiyu He, Zhang Mian, Peilin Wu, Xinya Du, Zhiyu Chen

Publicado 2026-01-15
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Kaiyu He, Zhang Mian, Peilin Wu, Xinya Du, Zhiyu Chen

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

La gran pregunta: ¿Vale la pena la espera del "Grokking"?

Imagina que estás enseñando a un robot a resolver un rompecabezas de dos pasos.

  • Paso 1: "¿Quién es la esposa de Barack?" (Respuesta: Michelle)
  • Paso 2: "¿Cuándo nació Michelle?" (Respuesta: 1964)
  • El objetivo: "¿Cuándo nació la esposa de Barack?"

Normalmente, los robots (modelos de IA) son muy buenos en el Paso 1 y el Paso 2 por separado, pero fallan en el objetivo final. No pueden conectar los puntos. Esto se llama la "maldición del razonamiento de dos saltos" (two-hop reasoning).

Recientemente, los investigadores descubrieron un fenómeno extraño llamado "Grokking". Si sigues entrenando a un robot durante un tiempo muy largo (mucho después de que parezca haber aprendido todo), de repente ocurre un "clic". Deja de adivinar y comienza a resolver estos rompecabezas perfectamente. Se siente como si el robot hubiera adquirido repentinamente un superpoder.

Este artículo plantea una pregunta sencilla: ¿Vale realmente la pena el tiempo y el dinero de esperar este "clic"?

Los hallazgos principales (Los momentos "¡Ajá!")

Los autores excavaron dentro del cerebro del robot para ver cómo estaba resolviendo los rompecabezas. Esto es lo que encontraron:

1. El "Puente" estuvo ahí todo el tiempo

La analogía: Imagina a un equipo de construcción construyendo un puente sobre un río.

  • La visión antigua: Pensábamos que el equipo construía el puente repentinamente después de años de trabajo (el momento del "Grokking").
  • La nueva visión: El equipo en realidad construyó la estructura del puente muy pronto. Sin embargo, solo tenían unos pocos ladrillos (datos) para probarlo. La fase de "Grokking" no se trató de construir un puente nuevo; fue simplemente que el equipo fue llenando lentamente los huecos con más ladrillos hasta que el puente fue lo suficientemente fuerte como para soportar el tráfico.

Lo que dice el artículo: El "camino de razonamiento" (el puente) existe en el cerebro del robot casi de inmediato. El largo período de entrenamiento solo ayuda al robot a memorizar suficientes hechos específicos para usar ese camino de manera confiable. Si le das al robot suficientes datos de práctica desde el principio, construirá el puente rápidamente y tendrá un rendimiento igual de bueno que aquel que esperó años para hacer "Grok".

2. Existe el "Grokking falso"

La analogía: Imagina a un estudiante tomando un examen.

  • Grokking real: El estudiante entiende la fórmula matemática y puede resolver cualquier problema nuevo.
  • Grokking falso: El estudiante memorizó las respuestas específicas del examen de práctica. Cuando el profesor cambia los números ligeramente, el estudiante se confunde, a pesar de haber obtenido una puntuación perfecta en el examen de práctica.

Lo que dice el artículo: A veces, un robot parece haber hecho "Grokking" porque sus puntuaciones en las pruebas subieron repentinamente. Pero si miras en su interior, no construyó el "puente" (el circuito de razonamiento). Solo memorizó patrones. Estos robots con "Grokking falso" fallan cuando les das hechos nuevos y ligeramente diferentes. Parecen inteligentes, pero no pueden razonar realmente.

3. El superpoder no se transfiere bien

La analogía: Imagina a un chef que ha dominado la elaboración de un pastel de chocolate perfecto. Le pides que haga un pastel de fresa usando la misma lógica.

  • Expectativa: Debería ser capaz de cambiar los ingredientes y hacer un excelente pastel de fresa de inmediato.
  • Realidad: El chef es excelente con el pastel de chocolate, pero cuando le das una nueva fruta que nunca ha usado, tiene dificultades. Tiene que empezar de nuevo para aprender cómo manejar esa fruta específica.

Lo que dice el artículo: Incluso cuando un robot ha hecho "Grocking" y ha construido un puente de razonamiento perfecto, no se convierte automáticamente en un maestro de toda la lógica. Si introduces hechos completamente nuevos (nuevos ingredientes), el robot a menudo olvida cómo usar su puente. Tiene que pasar por el largo proceso de entrenamiento nuevamente para aprender a conectar los nuevos hechos. No ha aprendido "cómo pensar"; simplemente ha aprendido "cómo resolver este conjunto específico de rompecabezas".

Conclusión

¿Vale la pena esperar por el "Grokking"?

  • Si tienes muy pocos datos: Sí, es posible que tengas que esperar. El robot necesita ese tiempo extra para descubrir cómo usar el puente con tan pocos ejemplos.
  • Si tienes abundantes datos: No, es una pérdida de tiempo. Si le das al robot suficientes ejemplos de práctica desde el principio, construirá el puente de razonamiento rápidamente y tendrá un rendimiento igual de bueno que aquel que esperó el "clic".

La idea clave: El "momento mágico" del Grokking no es un descubrimiento repentino de una nueva forma de pensar. Es simplemente el robot memorizando lentamente suficientes hechos para usar un camino de razonamiento que ya estaba allí. Y aun después de ese momento mágico, el robot todavía tiene dificultades para aplicar su lógica a situaciones completamente nuevas.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →