← Últimos artículos
🤖 machine learning

MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training

El artículo presenta MONA, un optimizador novedoso que integra una aceleración al estilo de Nesterov en el marco Muon para escapar de mínimos locales agudos y lograr una convergencia y un rendimiento aguas abajo de vanguardia en modelos de lenguaje que van desde 1B hasta 68B de parámetros.

Autores originales: Jiacheng Li, Jianchao Tan, Hongtao Xu, Jiaqi Zhang, Yifan Lu, Yerui Sun, Yuchen Xie, Xunliang Cai

Publicado 2026-05-27
📖 4 min de lectura☕ Lectura para el café

Autores originales: Jiacheng Li, Jianchao Tan, Hongtao Xu, Jiaqi Zhang, Yifan Lu, Yerui Sun, Yuchen Xie, Xunliang Cai

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando enseñar a un robot gigante y superinteligente a hablar el lenguaje humano. Para lograrlo, debes ajustar millones de pequeños perillas dentro de su cerebro. El proceso de encontrar la configuración perfecta para estas perillas se llama "entrenamiento", y la herramienta que utilizas para girar esas perillas se llama optimizador.

Durante mucho tiempo, la herramienta estándar para este trabajo se llamó AdamW. Es confiable, como un excursionista constante y cauteloso que da pasos pequeños y revisa el mapa constantemente. Recientemente, llegó una nueva herramienta llamada Muon. Muon es como un excursionista que observa toda la cordillera de una vez, tratando grupos de perillas como una sola unidad. Esto hace que Muon sea más rápido y eficiente, pero aún tiene un defecto: puede quedar atrapado en un "valle agudo".

El Problema: La Trampa del Valle Agudo

Imagina que el paisaje del proceso de aprendizaje del robot es un terreno montañoso.

  • Los valles planos son buenos lugares para asentarse; significan que el robot ha encontrado una solución estable y general que funciona bien en muchas situaciones.
  • Los valles agudos son fosas estrechas y profundas. Si el robot cae en uno, podría parecer que ha encontrado el punto más bajo, pero en realidad está atrapado en un lugar muy específico y frágil. Si lo empujas ligeramente, sale de su lugar "perfecto" y funciona mal.

Tanto AdamW como Muon pueden caer accidentalmente en estos valles agudos y quedarse atrapados allí. Carecen de una forma de "sentir" la forma del terreno con anticipación para saber si un punto es demasiado agudo.

La Solución: MONA (Muon con Aceleración Nesterov)

Los autores de este artículo crearon una nueva herramienta llamada MONA. Piensa en MONA como Muon con un par de gafas de sonar.

Así es como funciona usando una analogía simple:

  1. La Vieja Forma (Muon): Muon mira la pendiente justo donde está de pie y se mueve hacia abajo. Es excelente para moverse eficientemente, pero no sabe si el terreno adelante es una pendiente suave o un borde de acantilado.
  2. La Nueva Forma (MONA): Antes de que Muon dé un paso, MONA observa cómo cambió la pendiente desde el último paso hasta el actual.
    • Si la pendiente cambió muy de repente (como chocar contra un acantilado agudo), MONA sabe: "¡Vaya, este es un valle agudo! Empujemos más fuerte para rebotar y salir de aquí".
    • Si la pendiente cambió muy lentamente (un valle suave y plano), MONA dice: "Esto parece seguro. Asentémonos aquí".

MONA añade un "término de aceleración" especial a las matemáticas. Calcula la diferencia entre la dirección actual y la dirección anterior. Esta diferencia actúa como un sensor que detecta la "agudeza" del terreno. Si el terreno es agudo, empuja al robot fuera del hoyo. Si es plano, permite que el robot descanse.

¿Qué Descubrieron?

Los investigadores probaron esta nueva herramienta en tres tamaños diferentes de modelos de lenguaje (pequeño, mediano y enorme), que van desde 1 mil millones hasta 68 mil millones de parámetros. Los entrenaron con cantidades masivas de texto (hasta 1 billón de palabras).

  • Mejor Entrenamiento: En cada prueba, MONA ayudó a los modelos a aprender más rápido y alcanzar un estado final mejor que tanto el antiguo estándar (AdamW) como el más nuevo Muon.
  • Robots Más Inteligentes: Los modelos entrenados con MONA fueron mejores en tareas generales, problemas de matemáticas y escritura de código. Por ejemplo, en un modelo de 68 mil millones de parámetros, MONA logró las mejores puntuaciones en los puntos de referencia para matemáticas y programación.
  • Ajuste Fino: Incluso después del entrenamiento inicial, cuando dieron a los modelos un entrenamiento específico adicional (como enseñarles a escribir código específicamente), los modelos que comenzaron con MONA funcionaron mejor que los que comenzaron con Muon.

Hacerlo Práctico (MONA-Lite)

Los autores también se dieron cuenta de que añadir este sistema de "sonar" utiliza un poco más de memoria de computadora. Para solucionar esto, crearon una versión más ligera llamada MONA-Lite.

  • Utilizaron un truco para comprimir los datos de memoria (como cambiar de video de alta definición a definición estándar) y un método para calcular los cambios de pendiente sobre la marcha sin almacenar archivos extra.
  • Esto redujo la memoria adicional necesaria en aproximadamente un 75 %, haciéndola fácil de usar incluso en computadoras con memoria limitada, sin perder los beneficios.

Resumen

En resumen, MONA es una actualización del optimizador Muon. Mantiene la velocidad y eficiencia de Muon, pero añade un "sensor de curvatura" que ayuda a la IA a evitar quedar atrapada en malos puntos agudos durante el aprendizaje. Esto resulta en modelos de lenguaje más inteligentes y capaces, mejores en matemáticas, programación y razonamiento general, todo mientras son lo suficientemente eficientes para ejecutarse en hardware estándar.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →