← Últimos artículos
📊 statistics

Grokking or Glitching? How Low-Precision Drives Slingshot Loss Spikes

Este artículo demuestra que el "Mecanazo de Catapulta", caracterizado por picos periódicos en la pérdida y un crecimiento rápido de los parámetros durante el entrenamiento a largo plazo, no es una dinámica de optimización intrínseca, sino un artefacto numérico causado por la aritmética de punto flotante de baja precisión, donde los errores de redondeo en los gradientes rompen la restricción de suma cero y desencadenan un bucle de retroalimentación positiva conocido como Inflación Numérica de Características (NFI).

Autores originales: Liu Hanqing, Jianjun Cao, Yuanze Li, Zijian Zhou

Publicado 2026-05-08
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Liu Hanqing, Jianjun Cao, Yuanze Li, Zijian Zhou

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás entrenando a un robot para reconocer diferentes animales. Sigues mostrándole imágenes de gatos y perros hasta que alcanza un 100% de perfección. En este punto, el robot está tan seguro que, cuando ve un gato, grita "¡GATO!" con una voz tan fuerte que ahoga cualquier otra posibilidad.

Según este artículo, esta confianza extrema es realmente peligrosa debido a un defecto oculto en cómo las computadoras realizan los cálculos matemáticos. Aquí está la historia de lo que sucede, explicada de forma sencilla.

El Problema: El "Glitch del Susurro vs. Grito"

Las computadoras no piensan con precisión infinita; utilizan un sistema numérico limitado (como una regla con solo tantos trazos diminutos).

  1. El Grito: Cuando el robot está 99.999% seguro de que una imagen es un gato, la puntuación de "Gato" es enorme. La puntuación de "Perro" es diminuta.
  2. El Glitch (Colapso de Softmax): Debido a que la puntuación de "Gato" es tan enorme en comparación con la de "Perro", las matemáticas de la computadora se confunden. Intenta sumar el diminuto número de "Perro" al enorme número de "Gato", pero el número de "Perro" es tan pequeño en relación con el de "Gato" que es tragado por la precisión limitada de la computadora. La computadora piensa que la puntuación de "Perro" es exactamente cero.
  3. El Silencio: En un mundo perfecto, si el robot se equivoca, debería recibir un pequeño empujón para corregirse. Pero como las matemáticas tragaron la puntuación de "Perro", la computadora piensa que el robot está perfectamente en lo correcto. Deja de enviar cualquier señal de corrección (gradientes) para la clase "Gato". El robot se queda en silencio.

La Trampa: La "Cuerda de Tiro" que Nunca Termina

Aquí es donde las cosas se vuelven extrañas. Aunque el robot piensa que es perfecto, las matemáticas en realidad están rotas.

  • El Desequilibrio Roto: Normalmente, si el robot empuja la puntuación de "Gato" hacia arriba, debe empujar la puntuación de "Perro" hacia abajo para mantener el equilibrio total. Pero como la señal de "Perro" fue tragada, el equilibrio se rompe. La computadora empuja accidentalmente la puntuación de "Gato" hacia arriba sin tirar de la puntuación de "Perro" hacia abajo.
  • El Bucle de Retroalimentación (Inflación Numérica de Características): Esto crea un efecto desbocado. El "promedio" interno del robot para los gatos y su "promedio" interno para el mundo entero comienzan a alejarse. Empiezan a tironear el uno del otro como un equipo de tiro a la cuerda que sigue corriendo más y más rápido en direcciones opuestas.
  • La Explosión: Los números dentro del cerebro del robot (los pesos) comienzan a crecer exponencialmente, como un globo siendo inflado por una manguera contra incendios. Se vuelven tan enormes que las matemáticas internas del robot se vuelven inestables.

El "Honda": El Choque y el Rebote

Eventualmente, los números se vuelven tan grandes y las matemáticas internas se distorsionan tanto que el robot de repente se da cuenta: "¡Espera, no soy perfecto!".

  • El Pico: Debido a que el robot estaba en un estado de "silencio" (sin correcciones), el algoritmo de aprendizaje (Adam) había estado acumulando una cantidad masiva de "momento". Cuando el robot finalmente recibe una señal de corrección nuevamente, dispara una actualización masiva y explosiva.
  • El Resultado: El rendimiento del robot se desploma. La pérdida (error) se dispara hacia el cielo. Parece que el robot olvidó todo.
  • La Recuperación: Después de este choque, el robot es sacudido de vuelta a un estado normal. Vuelve a aprender, y a menudo, en realidad se vuelve mejor generalizando (entendiendo nuevos gatos y perros que no ha visto antes). Este ciclo de choque y recuperación se llama el "Mecanismo de Honda".

¿Por Qué Sucede Esto?

Los autores demuestran que esto no es una propiedad profunda y misteriosa de cómo aprenden los cerebros. Es un error matemático causado por el uso de números de baja precisión (como los flotantes estándar de 32 bits).

  • La Prueba: Cuando ejecutaron el mismo entrenamiento utilizando matemáticas de mayor precisión (flotantes de 64 bits), el "grito" fue lo suficientemente fuerte para que el "susurro" no fuera tragado. El glitch desapareció, el bucle de retroalimentación desbocado se detuvo y los picos de pérdida desaparecieron.

La Conclusión

  • Es un Error, No una Característica: La "Honda" no es un truco mágico de optimización; es un efecto secundario de que la computadora se quede sin lugares decimales para contar.
  • La Solución: Puedes detener esto utilizando matemáticas de mayor precisión para el cálculo final, o mediante trucos específicos (como la "Normalización por Lotes") que reinician los promedios internos del robot para que no se alejen entre sí.
  • Mundo Real: Esto explica por qué algunos modelos de IA se comportan de manera extraña después de entrenar durante mucho tiempo, especialmente cuando las personas intentan hacerlos funcionar más rápido utilizando matemáticas de menor precisión. No es que el modelo esté "aprendiendo" de una manera extraña; es que las matemáticas del modelo se están rompiendo.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →