← Últimos artículos
💬 NLP

Four Over Six: More Accurate NVFP4 Quantization with Adaptive Block Scaling

Este artículo presenta "Four Over Six" (4/6), una técnica adaptativa de escalado de bloques para la cuantización NVFP4 que reduce el error de cuantización al ajustar dinámicamente las escalas de los bloques para manejar mejor los valores grandes, logrando así un rendimiento en el entrenamiento y la inferencia más cercano al BF16 con una sobrecarga computacional mínima.

Autores originales: Jack Cook, Junxian Guo, Guangxuan Xiao, Yujun Lin, Song Han

Publicado 2026-05-08
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Jack Cook, Junxian Guo, Guangxuan Xiao, Yujun Lin, Song Han

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando guardar una biblioteca masiva de libros en una maleta portátil diminuta. Los libros representan el "cerebro" de un Modelo de Lenguaje Grande (IA), y la maleta representa la memoria de la computadora. Para que todo quepa, necesitas encoger los libros.

Durante mucho tiempo, hemos utilizado un método llamado BF16 (un formato estándar de alta precisión), que es como guardar los libros en cajas resistentes y pesadas. Es preciso, pero la maleta se llena rápidamente. Recientemente, los ingenieros probaron cambiar a NVFP4, un formato mucho más pequeño. Piensa en NVFP4 como un conjunto de cajas de origami diminutas y ligeras. Caben muchísimos más libros en la maleta y hacen que la IA funcione más rápido, pero hay un inconveniente: como las cajas son tan pequeñas, algunos de los libros "grandes" se aplastan, se arrugan o pierden páginas. Este "arrugamiento" se llama error de cuantización, y hace que la IA cometa errores.

El Problema: El "Borde Rugoso" de las Cajas Pequeñas

El artículo explica que NVFP4 tiene una peculiaridad extraña. Tiene tamaños específicos que puede contener: 0.5, 1, 1.5, 2, 3, 4 y 6.

  • Si un libro es exactamente de tamaño 4, encaja perfectamente.
  • Si un libro es de tamaño 5, no cabe. Tienes que forzarlo dentro de la caja de tamaño 4 o la de tamaño 6.
  • Si fuerzas un libro de tamaño 5 dentro de una caja de tamaño 4, pierdes mucha información (se aplasta). Si lo fuerzas dentro de una caja de tamaño 6, desperdicias mucho espacio (se mueve de un lado a otro).

Los autores descubrieron que el "aplastamiento" ocurre con más frecuencia en libros que son casi tan grandes como la caja más grande (los valores "cercanos al máximo"). En el método estándar, la maleta está dimensionada para contener el libro absolutamente más grande posible (tamaño 6). Pero esto deja un enorme hueco donde los libros de tamaño 5 se aplastan terriblemente.

La Solución: "Cuatro sobre Seis" (4/6)

Los autores, Jack Cook y su equipo, idearon un truco inteligente llamado Cuatro sobre Seis.

Imagina que estás haciendo una maleta. En lugar de forzar cada artículo individual para que quepa en una caja de "Tamaño 6", miras cada grupo de artículos.

  • La Vieja Forma: Asumes que cada grupo necesita una caja de "Tamaño 6". Si un grupo tiene un libro de tamaño 5, lo aplastas.
  • La Forma 4/6: Revisas el grupo. Si el libro más grande en ese grupo específico es solo de tamaño 5, dices: "Bien, no necesitamos una caja de Tamaño 6 para este grupo. Usemos una caja de Tamaño 4 en su lugar".

Al cambiar a una caja más pequeña de "Tamaño 4" para ese grupo específico, el libro de "Tamaño 5" (que ahora es relativamente más pequeño en comparación con el límite de la caja) encaja mucho más cómodamente. Ya no se está aplastando contra el borde.

La Analogía:
Piensa en ello como un personaje de videojuego saltando.

  • NVFP4 Estándar: El juego asume que el personaje puede saltar hasta 10 pies. Si intenta saltar 9 pies, el juego lo redondea hacia abajo a 8 pies (una gran caída).
  • Método 4/6: El juego verifica el nivel específico. Si la plataforma más alta tiene solo 6 pies de altura, cambia el "límite de salto" a 6 pies. Ahora, un salto de 5 pies se redondea a 6 pies (o 4 pies) con mucha más precisión. El personaje no cae tan lejos.

Cómo Funciona en la Práctica

El artículo describe un algoritmo inteligente que examina cada pequeño fragmento de datos (llamado "bloque") antes de guardarlo:

  1. Intenta guardar el fragmento en una caja de "Tamaño 6" y calcula cuánta información se pierde.
  2. Intenta guardar el mismo fragmento en una caja de "Tamaño 4" y calcula la pérdida.
  3. Elige la caja que cause menos daño (menos error).

Generalmente, para fragmentos con números muy grandes, la caja de "Tamaño 4" es la ganadora porque hace que los números "cercanos al máximo" encajen mejor.

Los Resultados

El equipo probó esto en un modelo de IA masivo llamado Nemotron 3 Nano (30 mil millones de parámetros).

  • Entrenamiento: Cuando entrenaron la IA usando 4/6, la IA aprendió mejor y cometió menos errores en comparación con el método estándar NVFP4. Se acercó mucho más al rendimiento del método pesado y lento "BF16", pero mantuvo las ventajas de velocidad y tamaño de NVFP4.
  • Velocidad: Demostraron que este "empaquetado inteligente" no ralentiza la computadora. Añade menos del 15% de trabajo extra, lo cual es un precio minúsculo a pagar por una precisión mucho mejor.
  • Modelos Existentes: También probaron esto en modelos ya entrenados (como Llama y Qwen). Incluso sin re-entrenar, usar 4/6 hizo que estos modelos fueran más inteligentes y precisos en pruebas como comprensión lectora y acertijos de lógica.

La Conclusión

El artículo afirma que, simplemente siendo más inteligentes sobre qué tamaño de caja usar para diferentes grupos de datos—usando a veces un "4" en lugar de un "6"—puedes detener el "aplastamiento" de información importante. Esto hace que la IA de baja precisión (NVFP4) sea mucho más precisa, permitiéndonos ejecutar modelos de IA más grandes y rápidos en el hardware actual sin que pierdan su "capacidad cerebral".

Incluso liberaron el código (kernels) para que otros puedan usar este método de "empaquetado inteligente" en las nuevas GPUs Blackwell de NVIDIA.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →