← Últimos artículos
🤖 machine learning

Muown: Row-Norm Control for Muon Optimization

El artículo presenta Muown, un optimizador de reemplazo directo que controla explícitamente los vectores de magnitud de fila para evitar la deriva de la norma espectral en Muon, mejorando así la estabilidad del entrenamiento, reduciendo la sensibilidad a la decadencia de los pesos y logrando una perplejidad superior en diversas escalas de modelos.

Autores originales: Kai Lion, Florian Hübler, Bingcong Li, Antonio Orvieto, Niao He

Publicado 2026-05-12
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Kai Lion, Florian Hübler, Bingcong Li, Antonio Orvieto, Niao He

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás entrenando un cerebro digital gigante (un Modelo de Lenguaje Grande) para escribir historias, resolver problemas matemáticos o charlar contigo. Para lograrlo, el cerebro debe aprender ajustando millones de perillas diminutas (pesos) dentro de sus circuitos.

Durante mucho tiempo, la mejor manera de girar estas perillas fue un método llamado AdamW. Recientemente, llegó un método nuevo y más rápido llamado Muon. Fue como cambiar de una bicicleta a un coche deportivo; aprendía más rápido y mejor. Pero había una trampa: el coche deportivo tenía tendencia a acelerar fuera de control.

El Problema: El Motor "Derivando"

El artículo identifica un problema específico con Muon. A medida que el modelo se entrena, el "tamaño" de sus conexiones internas (específicamente, la fuerza de las filas en sus matrices de pesos) comienza a crecer descontroladamente.

Piensa en ello como un globo que se está inflando.

  • Muon es excelente para determinar hacia dónde soplar el globo (la dirección).
  • Sin embargo, sigue bombeando más aire del necesario, haciendo que el globo se haga cada vez más grande hasta que podría reventar (errores numéricos) o volverse inestable.
  • La solución estándar era atar una cuerda alrededor del globo y tensarla cada vez que se hiciera demasiado grande (Decaimiento de Pesos). Pero los autores descubrieron que esto era como usar un mazo para matar un mosquito: ralentizaba el proceso de aprendizaje porque apretaba todo el globo, incluso las partes que estaban bien.

El Diagnóstico: Dos Partes del Problema

Los autores, liderados por Kai Lion, decidieron mirar dentro del globo para ver qué era lo que realmente crecía. Se dieron cuenta de que el "tamaño" de la conexión está compuesto por dos partes distintas:

  1. La Magnitud (El Volumen): Qué tan grande es la fila de números en general.
  2. La Coherencia (La Forma): Cómo están dispuestos los números dentro de esa fila en relación entre sí.

Descubrieron que solo la Magnitud estaba derivando fuera de control. La Forma (Coherencia) en realidad se comportaba perfectamente bien y permanecía estable. El globo no estaba cambiando su forma; solo se estaba haciendo más grande.

La Solución: Muown (La Bomba Inteligente)

Los autores crearon un nuevo optimizador llamado Muown.

En lugar de tratar toda la conexión como un solo bloque grande, Muown divide el trabajo en dos tareas separadas:

  1. El Equipo de Dirección (Muon): Este equipo sigue haciendo lo que Muon hace mejor: determinar la dirección perfecta para actualizar los pesos. Dejan esta parte sin cambios.
  2. El Equipo de Volumen (Nuevo): Esta es la parte nueva. Toman la "Magnitud" (el volumen) y la tratan como una variable separada y explícita. Le dan a este volumen un conjunto especial de reglas (una geometría matemática específica llamada \ell_\infty) para evitar que crezca demasiado rápido.

La Analogía:
Imagina que conduces un coche donde el volante y el pedal del acelerador están pegados. Si giras el volante, el pedal del acelerador también se empuja, haciendo que el coche acelere descontroladamente.

  • Muon era como ese coche atascado.
  • Muown es como desacoplar el volante del pedal del acelerador. Aún puedes dirigir perfectamente (usando la lógica de Muon), pero ahora tienes un control de crucero separado e inteligente para el pedal del acelerador (la magnitud) que mantiene la velocidad exactamente donde debe estar sin ralentizarte.

Los Resultados

El artículo probó esto en modelos que van desde pequeños (124 millones de parámetros) hasta muy grandes (2.7 mil millones de parámetros). Esto es lo que encontraron:

  • Mejor Rendimiento: Muown produjo consistentemente mejores resultados (menor "perplejidad", que es una medida de cuán confundido está el modelo) que Muon, AdamW y otros competidores.
  • Más Perdonador: Con Muon, tenías que ser muy cuidadoso con tus configuraciones (tasa de aprendizaje). Si elegías una incorrecta, el modelo fallaría. Muown es mucho más robusto; funciona bien en una amplia gama de configuraciones, como un coche con un "punto dulce" de conducción más amplio.
  • Sin Costo Extra: Por lo general, añadir un nuevo sistema de control ralentiza un coche. Pero como los autores integraron este nuevo "control de volumen" directamente en el flujo de trabajo existente del motor, añadió casi ningún tiempo extra al proceso de entrenamiento.
  • Estabilidad: El "globo" dejó de derivar. La norma espectral (el tamaño de las conexiones) se mantuvo estable, previniendo los errores numéricos que plagaban al Muon original.

Resumen

El artículo argumenta que la inestabilidad en el popular optimizador Muon no era un defecto en su capacidad de encontrar la dirección, sino más bien una falta de control sobre el "volumen" de sus actualizaciones. Al separar el "volumen" de la "dirección" y controlarlos con herramientas diferentes y especializadas, Muown mantiene el entrenamiento rápido y estable sin necesidad de soluciones pesadas como el decaimiento de pesos. Es un reemplazo directo que hace que el proceso de entrenamiento sea más suave, rápido y fiable.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →