← Últimos artículos
🤖 machine learning

When to use what Schatten-pp norm in deep learning?

Este artículo resuelve las observaciones conflictivas sobre los optimizadores de norma Schatten-pp al demostrar que, mientras que los métodos Schatten-\infty como Muon sobresalen en entornos de alta dimensionalidad, las geometrías Schatten-pp más pequeñas son en realidad óptimas en regímenes de baja dimensionalidad como el escalado Chinchilla, un hallazgo respaldado por nuevos resultados de aceleración robustos al ruido para p>2p>2 que también explican la falta de requerimiento de calentamiento de Muon y su preferencia por lotes grandes.

Autores originales: Thomas Pethick

Publicado 2026-06-16
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Thomas Pethick

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

La gran pregunta: ¿Qué "regla" deberíamos usar?

Imagina que estás intentando encontrar el punto más bajo en un vasto valle cubierto de niebla (esto es el modelo de IA intentando aprender). Para hacer esto, necesitas una "regla" para medir qué tan empinado es el terreno y decidir en qué dirección dar un paso.

En el mundo del aprendizaje profundo (deep learning), existen diferentes tipos de reglas, llamadas normas Schatten-p.

  • Schatten-2 (Euclidiana): Esta es la regla estándar y recta que solemos usar (como el optimizador llamado Adam).
  • Schatten-∞ (La regla "Muon"): Esta es una regla especial y rígida que solo se preocupa por el único precipicio más empinado del paisaje. Recientemente, un método llamado Muon (que usa esta regla) se volvió muy popular porque parecía funcionar increíblemente rápido en algunas pruebas.
  • Schatten-p (Las reglas "Punto Medio"): Estas son reglas intermedias, que miden la pendiente de una forma que no es ni demasiado suave ni demasiado rígida.

La confusión:
La gente discutía sobre qué regla era la mejor.

  • Algunos decían: "¡Muon (Schatten-∞) es increíble! ¡Es la más rápida!"
  • Otros decían: "No, Muon está sobrevalorado. Los métodos estándar funcionan mejor cuando entrenamos con cantidades enormes de datos".

La respuesta del artículo:
El autor, Thomas Pethick, dice: "Ambos tienen razón, pero están mirando tamaños de valle diferentes".

La mejor regla depende enteramente del tamaño del problema en relación con la cantidad de datos que tienes.


Los dos regímenes: Piscinas pequeñas frente a Océanos grandes

El artículo divide el mundo en dos escenarios principales:

1. El régimen de "Baja Dimensionalidad" (La piscina pequeña)

  • Qué es: Esto ocurre cuando tienes un modelo relativamente pequeño o una ejecución de entrenamiento corta (como los "speedruns" en juegos pequeños mencionados en el artículo). El número de pasos que das (datos) es mucho mayor que la complejidad del modelo.
  • La analogía: Imagina que estás caminando por un jardín pequeño y bien iluminado. Puedes ver todo el camino.
  • La mejor regla: En este escenario, la regla Schatten-∞ (Muon) en realidad no es la mejor. Sorprendentemente, una regcción de un p menor (más cercana a la regla euclidiana estándar) es más rápida.
  • ¿Por qué? Porque en un jardín pequeño, no necesitas estar hiperenfocado en un solo precipicio empinado. Necesitas un enfoque más suave y equilibrado para acelerar rápidamente. El artículo demuestra que usar una regla más "suave" aquí te otorga un impulso de velocidad.

2. El régimen de "Alta Dimensionalidad" (El océano grande)

  • Qué es: Estas son las ejecuciones de entrenamiento masivas utilizadas para modelos de IA gigantes (como los LLM), donde el modelo es increíblemente complejo y los datos son vastos.
  • La analogía: Imagina que estás navegando en un océano enorme y oscuro con miles de islas. No puedes ver todo el mapa.
  • La mejor regla: Aquí, la regla Schatten-∞ (Muon) brilla. Está diseñada para manejar la "rugosidad" específica de estos paisajes masivos y complejos.
  • El truco: Para que Muon funcione en este gran océano, necesitas un tamaño de lote (batch size) enorme (mirando una rebanada muy amplia del océano a la vez). Si intentas usar Muon con un tamaño de lote pequeño en este régimen, fallará.

El secreto del "Tamaño de Lote" (Batch Size)

Uno de los hallazgos clave del artículo trata sobre el Tamaño de Lote (cuántos ejemplos observa la IA antes de dar un paso).

  • La regla: El artículo deriva una regla matemática que muestra que a medida que cambias tu regla (de p=2p=2 a p=p=\infty), el tamaño de lote ideal también debe cambiar.
  • La metáfora: Piensa en la regla como un bote.
    • Un bote pequeño (Regla Estándar) puede navegar con una tripulación pequeña (tamaño de lote pequeño).
    • Un crucero masivo (Muon/Schatten-∞) necesita una tripulación enorme (tamaño de lote masivo) para mantenerse estable y moverse rápido. Si intentas navegar un crucero con solo dos personas, simplemente dará vueltas en círculos.
  • La idea clave: Esto explica por qué Muon funciona de maravilla para los "speedruns" (donde la gente usa lotes masivos en modelos pequeños) pero tiene dificultades en algunos benchmarks de gran escala (donde el tamaño de lote podría no haberse escalado lo suficiente para la geometría específica).

¿Por qué necesitamos "Warmups"?

Es posible que hayas oído que algunos entrenadores de IA necesitan un "warmup" (empezar lento y luego acelerar).

  • El hallazgo del artículo: La regla Schatten-∞ (Muon) es tan robusta que no necesita un warmup. Puede empezar a máxima velocidad inmediatamente.
  • El contraste: Si usas una regla pp más pequeña en el régimen de baja dimensionalidad, te beneficiarás de una fase de warmup para poner en marcha la aceleración.

La conexión con "Chinchilla"

El artículo conecta esto con una regla famosa en IA llamada escalado Chinchilla, que dice: "A medida que obtienes más datos, deberías hacer tu modelo más grande".

  • El giro: El artículo argumenta que, incluso con el escalado Chinchilla, a menudo todavía estamos en el "Régimen de Baja Dimensionalidad" (el jardín pequeño).
  • El resultado: Debido a que a menudo estamos en este régimen de "jardín pequeño", usar el Muon estándar (Schatten-∞) podría ser en realidad menos eficiente que usar un optimizador de norma pp finita (como HTMuon o Soft-Muon). Esto explica por qué los métodos más nuevos que usan reglas más "suaves" están empezando a superar a Muon en algunas pruebas a gran escala.

Resumen: Cómo elegir tu regla

El artículo concluye con una guía sencilla:

  1. Si estás en un régimen de "Baja Dimensionalidad" (modelos pequeños, o cuando la cantidad de datos es enorme en comparación con el tamaño del modelo):

    • No uses automáticamente el extremo Schatten-∞ (Muon).
    • Considera usar una norma Schatten-pp finita (una regla más "suave"). Acelera más rápido y maneja mejor el ruido.
    • Nota: ¡Incluso podrías querer cambiar de regla mientras entrenas! Empieza con una regla "dura" y cambia a una más "suave" después.
  2. Si estás en un régimen de "Alta Dimensionalidad" (complejidad masiva):

    • La Schatten-∞ (Muon) es probablemente la elección correcta, PERO debes usar un tamaño de lote muy grande para que funcione.

La conclusión final: No existe un optimizador único que sea "el mejor". La mejor herramienta depende del tamaño del problema y de cuántos datos tengas. La confusión en la comunidad existió porque la gente estaba probando las herramientas en diferentes "regímenes" sin darse cuenta.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →