← Últimos artículos
🤖 machine learning

How Much Orthogonalization Does Muon Need?

Este artículo demuestra que un esquema de ortogonalización de Newton-Schulz cúbico de cinco pasos y bajo costo logra una calidad de entrenamiento comparable a las variantes de Muon más costosas, revelando que una alta precisión en la descomposición polar no es estrictamente necesaria para un entrenamiento eficaz de redes neuronales.

Autores originales: Hua Huang

Publicado 2026-06-02
📖 4 min de lectura☕ Lectura para el café

Autores originales: Hua Huang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando enseñarle a un robot masivo y complejo (una red neuronal) a realizar una nueva tarea. Para ayudarlo a aprender, le das una actualización de "momento" (momentum)—un empujón en la dirección que cree que es correcta basándose en su experiencia pasada. Sin embargo, a veces ese empujón se vuelve desordenado o "sesgado", como un coche que intenta girar en una carretera resbaladiza donde las ruedas giran en diferentes direcciones.

El optimizador Muon es una herramienta diseñada para arreglar estos empujones desordenados. Toma esa actualización sesgada y la "endereza" para que el robot se mueva de manera eficiente. Matemáticamente, este proceso de enderezamiento se llama ortogonalización. Piensa en esto como tomar un trozo de papel arrugado y plancharlo hasta que quede completamente plano, de modo que las líneas sean perfectamente rectas y perpendiculares.

El Problema: ¿Qué tan "perfecto" debe ser el planchado?

El artículo plantea una pregunta muy práctica: ¿Qué tan perfectamente necesitamos planchar estas actualizaciones?

En el mundo de las matemáticas, existen formas "perfectas" de planchar una matriz (como usar una plancha de alta gama, cara y que tarda mucho tiempo). El método estándar de Muon utiliza un proceso complejo de 5 pasos (llamado método "quíntico") para dejar la actualización muy cerca de la perfección. Es como usar una plancha de vapor profesional: requiere 15 pasadas para que el papel quede perfectamente liso.

Los autores se preguntaron: ¿Realmente necesitamos que sea así de perfecto? ¿O podemos lograr que el robot aprenda igual de bien con un método un poco más rápido y económico?

La Solución: El Atajo "Cúbico"

Los autores desarrollaron un nuevo método más simple llamado Cubic5.

  • La forma antigua (Muon-Jordan): Utiliza una fórmula compleja de 5 pasos que requiere 15 cálculos pesados (multiplicaciones de matrices) para enderezar la actualización.
  • La nueva forma (Cubic5): Utiliza una fórmula de 5 pasos más sencilla que solo requiere 10 cálculos pesados.

Piénsalo de esta manera:

  • La forma antigua es como contratar a un equipo de 15 personas para doblar un mapa con sumo cuidado.
  • La nueva forma es como contratar a 10 personas que doblan el mapa igual de bien, pero en menos tiempo.

Derivaron este nuevo método al darse cuenta de que, para el entrenamiento de la IA, el "empujón" no necesita ser matemáticamente perfecto hasta el último decimal de punto. Solo necesita ser "suficientemente bueno" para que el robot siga aprendiendo. Establecieron un "objetivo relajado": mientras la actualización sea aproximadamente recta, el robot aprenderá bien.

Lo que descubrieron: "Suficientemente bueno" es en realidad genial

Los investigadores probaron su nuevo método "Cubic5" contra los métodos antiguos "perfectos" e incluso contra un método "perfecto" teórico (usando una herramienta matemática súper precisa llamada SVD) en diferentes modelos de IA, desde los pequeños (como GPT-2) hasta los muy grandes (con miles de millones de parámetros).

Esto es lo que descubrieron:

  1. La calidad del entrenamiento es la misma: Ya fuera que usaran el método caro de 15 pasos, el nuevo método de 10 pasos o incluso la herramienta matemática súper precisa (SVD), los modelos de IA terminaron aprendiendo casi exactamente lo mismo. La "puntuación" final (pérdida de validación) fue casi idéntica.
  2. Más pasos no siempre significan algo mejor: Sorprendentemente, añadir más pasos al método "perfecto" no siempre hacía que la IA aprendiera mejor. A veces, el método más simple funcionaba igual de bien.
  3. El "planchado" no necesita ser perfecto: El hallazgo más importante es que a la IA no le importa si la actualización es matemáticamente "perfecta". Le importa que la actualización sea útil. El nuevo método más barato redefine la actualización lo suficiente como para que la IA aprenda, sin perder tiempo en una precisión innecesaria.

La Conclusión

El artículo concluye que Muon no necesita estar perfectamente ortogonalizado para funcionar bien.

El nuevo método Cubic5 es una alternativa de "bajo costo". Ahorra aproximadamente un tercio del trabajo computacional (el esfuerzo pesado) requerido para enderezar las actualizaciones, produciendo resultados que son prácticamente indistinguibles de los métodos más costosos.

En términos cotidianos: Si estás horneando un pastel, el método antiguo era como medir la harina con una báscula láser hasta el microgramo. El nuevo método es como usar una taza medidora estándar. El artículo demuestra que, para esta receta específica (entrenar IA), la taza estándar funciona tan bien como la báscula láser, pero es mucho más rápida y fácil de usar. Esto permite que la IA se entrene más rápido sin sacrificar la calidad del resultado final.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →