← Últimos artículos
🤖 machine learning

Full-Stack FP4: Stable LLM Pretraining with Quantized Projections, Optimizers, and Attention

Este artículo presenta Full-Stack FP4, un marco modular que extiende la cuantización NVFP4 más allá de las proyecciones lineales para incluir estados de optimizador estables, computaciones de Root/Muon y atención de precisión mixta, logrando un rendimiento de preentrenamiento cercano a BF16 con ganancias significativas de memoria y velocidad en una sola RTX 5090.

Autores originales: Siyu Ding, Mingchuan Ma, Jiabo Tong, Xingrun Xing, Ziming Wang, Guoqi Li

Publicado 2026-08-11
📖 4 min de lectura☕ Lectura para el café

Autores originales: Siyu Ding, Mingchuan Ma, Jiabo Tong, Xingrun Xing, Ziming Wang, Guoqi Li

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando enseñar a un cerebro digital gigante a hablar, escribir y pensar. Este "cerebro" es un Modelo de Lenguaje Extenso (LLM), y para aprender, tiene que procesar montañas de información. Pero hay un inconveniente: cuanto más aprende, más hambre tiene de memoria de computadora y electricidad. Es como intentar reproducir una película masiva de alta definición en una laptop pequeña y vieja; la pantalla se vuelve borrosa y el ventilador grita. Para resolver esto, los científicos han estado intentando encoger los números que la computadora usa para hacer sus cálculos. En lugar de usar números súper precisos y pesados (como una fotografía detallada), han estado cambiando a números más pequeños y ligeros (como un boceto pixelado). Esto se llama "entrenamiento de baja precisión". Recientemente, ha llegado un nuevo tipo de número diminuto llamado "FP4" (punto flotante de 4 bits), que promete hacer estos cerebros gigantes mucho más pequeños y rápidos. Pero este es el problema: mientras que las partes principales del cerebro pueden manejar estos números diminutos, las partes "ayudantes" —como la memoria que guarda para aprender y las matemáticas complejas que realiza para entender las oraciones— siguen fallando o confundiéndose cuando se ven obligadas a usar números tan pequeños. Es como tener el motor de un auto de carreras pero intentar correrlo con la cadena de una bicicleta; el motor está listo, pero el resto de la máquina no puede seguirle el ritmo.

Este artículo presenta un nuevo y hábil conjunto de herramientas llamado Full-Stack FP4, que actúa como un maestro mecánico para estos cerebros digitales. Los investigadores se dieron cuenta de que no puedes usar las mismas reglas de números diminutos para cada parte del cerebro. Algunas partes, como las conexiones principales, pueden manejar los números diminutos sin problemas. Pero otras partes, como la "memoria" que la computadora usa para recordar lo que aprendió ayer, son muy sensibles y necesitan un cuidado especial. El equipo creó un sistema modular donde utilizan diferentes "recetas" para diferentes partes del cerebro. Para las conexiones principales, utilizan un truco llamado LoRA-SVD, que es como mantener un boceto de alta resolución de los detalles más importantes mientras se usan bloques pixelados para el resto. Para la memoria, inventaron una forma de "suavizar" los números antes de comprimirlos en cajas diminutas para que no se pierdan. Para las matemáticas que ayudan al cerebro a enfocarse en las palabras correctas (atención), decidieron mantener las partes más sensibles en alta definición mientras dejan que el resto permanezca pixelado.

Cuando probaron este sistema completo en un modelo de 3 mil millones de parámetros (un cerebro digital de tamaño mediano) utilizando 64 mil millones de palabras de datos de entrenamiento, los resultados fueron impresionantes. El cerebro "Full-Stack FP4" aprendió casi exactamente tan bien como la versión tradicional de alta capacidad. La diferencia en sus puntuaciones de aprendizaje fue un minúsculo 0.838%, algo que apenas se nota. De hecho, cuando probaron qué tan bien el cerebro respondía preguntas que nunca había visto antes, la nueva versión de números diminutos fue en realidad ligeramente mejor adivinando las palabras correctas, a pesar de que estaba usando mucha menos memoria. En una sola tarjeta gráfica potente (una RTX 5090), este nuevo método hizo que el proceso de aprendizaje del cerebro fuera de 2.5 a 2.8 veces más rápido para ciertas tareas y utilizó entre un 38% y un 42% menos de memoria que el método estándar de alta precisión.

Los investigadores advierten cuidadosamente que, si bien esto funciona de maravilla para modelos de hasta 3 mil millones de parámetros, aún no han demostrado si funcionará para cerebros aún más grandes o durante periodos de entrenamiento mucho más largos. También descubrieron que no puedes simplemente lanzar números diminutos a todo; si intentas forzar las partes más sensibles del cerebro a usar los números más pequeños sin estas recetas especiales, el aprendizaje se rompe. Pero por ahora, este enfoque "Full-Stack" muestra que podemos construir una IA más inteligente, rápida y barata al tratar las diferentes partes del cerebro con el nivel de precisión específico que realmente necesitan, en lugar de forzar a todo el sistema a ser de un solo tamaño para todos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →