← Últimos artículos
🤖 machine learning

Reassessing Muon for Matrix Factorization

Este artículo reevalúa el optimizador Muon en la factorización de matrices de bajo rango para aislar su regla de actualización de factores de confusión, revelando que no supera consistentemente a AdamW y que sus ventajas reportadas son a menudo sensibles a las elecciones de hiperparámetros.

Autores originales: Ali Parviz, Gal Mishne, Alex Cloninger

Publicado 2026-07-16
📖 4 min de lectura☕ Lectura para el café

Autores originales: Ali Parviz, Gal Mishne, Alex Cloninger

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando enseñarle a un robot superinteligente cómo aprender. Para hacer esto, necesitas un "entrenador" que le diga al robot hacia qué dirección dar el siguiente paso para mejorar. En el mundo de la inteligencia artificial, este entrenador se llama optimizador. Durante años, el entrenador más popular ha sido un método llamado AdamW, que es excelente ajustando sus pasos según lo resbaladizo o accidentado sea el camino. Pero recientemente, llegó un nuevo y llamativo entrenador llamado Muon. Muon afirma ser especial porque no solo observa el camino; intenta "enderezar" los pasos del robot usando un sofisticado truco matemático llamado ortogonalización. Piensa en ello como un instructor de danza que obliga al bailarín a moverse en direcciones perfectas y no superpuestas, con la esperanza de que esto haga que la danza sea más eficiente.

La gran pregunta que todos se hacen es: ¿Es Muon realmente un mejor entrenador que AdamW para las tareas masivas y complejas que realiza la IA moderna, como escribir historias o generar imágenes? ¿O es que Muon solo se ve bien porque la pista de baile es enorme y caótica? Los científicos han estado realizando enormes pruebas en modelos de IA gigantes, y Muon parece ganar. Pero cuando tratas con miles de millones de variables, es difícil saber si el entrenador está haciendo el trabajo o si el tamaño descomunal del problema simplemente está ocultando los errores del entrenador. Aquí es donde la historia se pone interesante: para encontrar la verdad, no puedes limitarte a observar el gran espectáculo; tienes que probar a los entrenadores en una sala silenciosa y controlada.

Este artículo, titulado "Reassessing Muon for Matrix Factorization", toma a Muon y a AdamW fuera de la caótica pista de baile de mil millones de parámetros y los deja caer en una sala de práctica sencilla y bien iluminada. Los investigadores decidieron probarlos en una tarea específica y fundamental llamada factorización de matrices. Si imaginas una hoja de cálculo gigante de números que quieres descomponer en dos hojas de cálculo más pequeñas y simples que se multipliquen entre sí para volver a obtener la original, eso es la factorización de matrices. Es un rompecabezas matemático limpio donde sabemos exactamente cómo es la solución y podemos medir cada pequeño paso que dan los entrenadores.

Los investigadores realizaron un experimento masivo, ajustando la "tasa de aprendizaje" (qué tan grande es el paso que da el robot) para ambos entrenadores a través de muchas versiones diferentes del rompecabezas. Probaron de todo, desde rompecabezas fáciles y suaves hasta otros extremadamente difíciles e "mal condicionados", donde los números son complicados y decaen rápidamente. También analizaron diferentes tipos de rompecabezas, incluyendo algunos donde los números debían permanecer positivos (Factorización de Matrices No Negativas).

Aquí está lo que encontraron, y podría sorprenderte: Muon no es una solución mágica. Cuando los investigadores les dieron a ambos entrenadores una oportunidad justa de encontrar su tamaño de paso perfecto, Muon no superó consistentemente a AdamW. De hecho, para tareas de factorización de bajo rango estándar, AdamW e incluso el viejo y simple Descenso de Gradiente a menudo igualaron o incluso superaron a Muon. La "superioridad" de Muon que la gente vio en los modelos de IA gigantes parece desvanecerse cuando se controlan las variables. El artículo sugiere que el éxito de Muon en el mundo real podría ser un artefacto de la escala y arquitectura específicas de esos modelos gigantes, más que el hecho de que el optimizador sea fundamentalmente mejor en las matemáticas.

Sin embargo, Muon no es inútible. El artículo encontró que Muon tiene una clara ventaja en un escenario específico: la Factorización de Matrices No Negativas (NMF). En estos rompecabezas, donde los números deben permanecer positivos, la forma única de Muon de enderezar los pasos le ayudó a evitar soluciones redundantes y a encontrar respuestas más diversas. Parece que Muon es un especialista, no un generalista. Brilla cuando el problema tiene peculiaridades geométricas específicas (como las restricciones de NMF), pero lucha por dominar cuando el problema es simplemente un rompecabezas matemático estándar y bien comportado.

El estudio también reveló que el "condicionamiento" del problema (qué tan complicados son los números) cambia al ganador. En escenarios muy difíciles y mal condicionados, el ranking de los entrenadores puede cambiar por completo dependiendo de la forma de los datos. Los autores concluyen que no podemos simplemente mirar una prueba o un ajuste predeterminado para decidir qué optimizador es el mejor. Necesitamos probarlos a través de una amplia gama de condiciones y tamaños de paso. La conclusión es que, si bien Muon es una herramienta poderosa, no destrona automáticamente a los viejos campeones como AdamW en todas las situaciones. Su éxito depende en gran medida de la forma específica del problema que intenta resolver.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →