← Últimos artículos
🤖 machine learning

Pretraining large language models with MXFP4

Este artículo identifica que la cuantización de los gradientes de peso (Wgrad) es la causa principal de la inestabilidad en el entrenamiento de modelos de lenguaje grandes con FP4 de pipeline completo y demuestra que las rotaciones de Hadamard deterministas, en lugar del redondeo estocástico, son esenciales para restaurar la estabilidad de la convergencia.

Autores originales: Musa Cim, Poovaiah Palangappa, Miro Hodak, Ravi Dwivedula, Meena Arunachalam, Mahmut Taylan Kandemir

Publicado 2026-05-12
📖 4 min de lectura☕ Lectura para el café

Autores originales: Musa Cim, Poovaiah Palangappa, Miro Hodak, Ravi Dwivedula, Meena Arunachalam, Mahmut Taylan Kandemir

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando enseñar a un estudiante gigante y brillante (un Modelo de Lenguaje Grande) a escribir historias. Por lo general, para mantener a este estudiante aprendiendo de manera efectiva, le das notas escritas con tinta de alta calidad y detallada (llamada precisión FP8). Esto funciona bien, pero las notas son pesadas, ocupan mucho espacio en la mochila del estudiante y ralentizan la velocidad a la que puede leerlas.

Los investigadores quisieron ver si podían cambiar a notas ultraligeras escritas con solo 4 bits de información (MXFP4). Estas notas son diminutas y rápidas, prometiendo hacer que el estudiante aprenda mucho más rápido. Sin embargo, hay un truco: cuando intentaron usar estas notas diminutas para todo el proceso de aprendizaje, el estudiante a menudo se confundía, comenzaba a hacer suposiciones salvajes y no lograba aprender nada (el entrenamiento "divergía").

El artículo pregunta: ¿Por qué sucede esto y cómo lo solucionamos?

El Experimento: Una Prueba de Tres Pasos

Los investigadores diseñaron un experimento controlado para determinar exactamente dónde reside el problema. Dividieron el proceso de aprendizaje en tres etapas e intercambiaron lentamente las notas pesadas por las ligeras, una etapa a la vez:

  1. Paso Adelante (Fprop): El estudiante lee la pregunta.
  2. Gradientes de Activación (Dgrad): El estudiante determina cuánto malinterpretó la pregunta.
  3. Gradientes de Peso (Wgrad): El estudiante actualiza su cerebro (los "pesos") para recordar la lección la próxima vez.

Los Hallazgos:

  • Etapa 1 y 2: Cuando usaron notas ligeras solo para leer y determinar malentendidos, al estudiante le fue bien. Aprendió casi tan bien como con las notas pesadas, solo necesitando algunas preguntas de práctica adicionales.
  • Etapa 3 (El Problema): En el momento en que cambiaron a notas ligeras para actualizar el cerebro (Wgrad), el estudiante comenzó a descontrolarse. Los investigadores descubrieron que este paso específico es el "eslabón débil". Es como intentar escribir una corrección matemática compleja en un pedazo de papel diminuto y arrugado; los detalles se pierden y el estudiante aprende la lección equivocada.

Las Soluciones Fallidas: Añadir Aleatoriedad

Cuando el estudiante comenzó a fallar, los investigadores probaron un truco común: Estocasticidad (añadir aleatoriedad).

  • La Analogía: Imagina que el estudiante está confundido, así que le dices: "¡Simplemente adivina al azar!" o "¡Gira una rueda para decidir tu respuesta!".
  • El Resultado: Esto no funcionó. De hecho, añadir aleatoriedad a las notas diminutas empeoró los errores. El "ruido" de las suposiciones aleatorias amplificó los pequeños errores ya presentes en las notas ligeras, provocando que el entrenamiento colapsara por completo.

La Solución Ganadora: El Barajado Determinista

Los investigadores luego probaron un enfoque diferente: Rotaciones Hadamard Deterministas.

  • La Analogía: En lugar de adivinar al azar, imagina que el estudiante tiene una regla especial y rígida que reorganiza perfectamente las notas diminutas antes de que sean escritas. Esta regla no añade aleatoriedad; simplemente organiza la información de una manera específica y predecible para que las notas diminutas no se arruguen ni se pierdan.
  • El Resultado: Esto funcionó perfectamente. Al usar este método específico y predecible de "reorganización", el estudiante pudo usar las notas diminutas y rápidas para todo el proceso (leer, analizar y actualizar) sin confundirse.

La Conclusión

El artículo concluye con dos conclusiones principales:

  1. El Cuello de Botella: La razón principal por la que el entrenamiento de 4 bits falla no es porque las notas sean demasiado pequeñas en general; es específicamente porque el paso de actualización del cerebro (Wgrad) es demasiado sensible a los pequeños errores en esas notas.
  2. La Solución: Para que el entrenamiento de 4 bits funcione, no necesitas añadir más aleatoriedad. Necesitas estructura. Al utilizar un barajado matemático específico y predecible (rotación Hadamard), puedes estabilizar el proceso.

La Recompensa:
Cuando solucionaron el problema con esta "regla de reorganización", el sistema se volvió un 20% más rápido en cada paso de aprendizaje. Como el estudiante aprendió de manera estable sin necesidad de preguntas de práctica adicionales, todo el proceso se completó aproximadamente un 10% más rápido de principio a fin en comparación con el antiguo método de tinta pesada.

En resumen: Puedes usar las notas diminutas y superrápidas, pero solo si las organizas perfectamente antes de escribirlas. Si simplemente añades algo de aleatoriedad, lo rompes todo.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →