← Últimos artículos
💬 NLP

Is Finer Better? The Limits of Microscaling Formats in Large Language Models

Este artículo revela que la disminución de los tamaños de bloque en la cuantización de microescala puede degradar paradójicamente el rendimiento del modelo debido a la interacción entre las distribuciones estrechas de los tensores y el rango dinámico de escala limitado, lo que lleva a los autores a proponer un nuevo formato FP8 sin signo E5M3 para las escalas que mantiene la precisión al tiempo que elimina la necesidad de operaciones de escalado global.

Autores originales: Andrea Fasoli, Monodeep Kar, Chi-Chun Liu, Swagath Venkataramani, Viji Srinivasan, Leland Chang, Naigang Wang

Publicado 2026-01-28
📖 4 min de lectura☕ Lectura para el café

Autores originales: Andrea Fasoli, Monodeep Kar, Chi-Chun Liu, Swagath Venkataramani, Viji Srinivasan, Leland Chang, Naigang Wang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

La visión general: Encoger el modelo

Imagina que un Modelo de Lenguaje Extenso (LLM) es como una enorme biblioteca de conocimiento. Para lograr que esta biblioteca quepa en una mochila pequeña (para que funcione rápido en teléfonos o ahorre energía), los científicos han estado intentando encoger los libros. Hacen esto mediante la "cuantización" de los datos, lo que significa redondear los números para usar menos bits (como escribir "3.14" simplemente como "3").

Recientemente, una nueva técnica llamada Microescalado se volvió popular. En lugar de usar una sola regla para medir toda la biblioteca, empezaron a usar reglas diminutas e individuales para grupos pequeños de libros. La lógica era: "Cuanto más pequeño sea el grupo, más precisamente podemos medir los libros dentro de él".

La sorpresa: Más pequeño no siempre es mejor

Los investigadores en este artículo descubrieron un fallo extraño. Esperaban que hacer los grupos (o "bloques") más pequeños hiciera que el modelo fuera siempre más inteligente. Pero descubrieron lo contrario con ciertos modelos.

La analogía: La regla con marcas faltantes
Imagina que estás midiendo una piedra muy pequeña.

  • La forma antigua: Usas una regla gigante con marcas cada pulgada. No puedes medir bien la piedra, así que adivinas.
  • La nueva forma (Microescalado): Cambias a una regla diminuta que se ajusta perfectamente a la piedra. Esto debería ser mejor, ¿verdad?
  • El problema: La regla diminuta tiene una característica defectuosa. Su "punto cero" y sus marcas más pequeñas están demasiado separadas. Si la piedra es demasiado pequeña, la regla no puede verla en absoluto. Simplemente dice: "Eso es cero".

El artículo encontró que cuando los "bloques" de datos se vuelven demasiado pequeños, la "regla" (llamada escala) utilizada para medirlos pierde precisión. Ya no puede representar números muy pequeños. Por lo tanto, aunque estés midiendo un grupo más pequeño, en realidad estás perdiendo más información porque la regla es demasiado torpe para cosas tan diminutas.

Esto causó un fenómeno que los autores llaman "Inversión de Perplejidad". Normalmente, a medida que encogemos los bloques, el modelo se vuelve mejor. Pero con este fallo, una vez que los bloques son demasiado pequeños, el modelo de repente se vuelve peor.

¿Por qué sucede esto?

Los investigadores profundizaron en las matemáticas y encontraron al culpable: La Escala.

En este sistema, cada grupo de números tiene un número de "escala" que le dice a la computadora qué tan grandes son los números en ese grupo.

  1. Grupos amplios: Si un grupo tiene números grandes y pequeños, la escala es grande. La regla funciona bien.
  2. Grupos estrechos: Si un grupo tiene solo números diminutos (como 0.0001), la escala necesita ser diminuta para medirlos con precisión.
  3. El fallo: El hardware actual utiliza un tipo específico de regla (llamada FP8 E4M3) que tiene un rango limitado. No puede manejar escalas que sean demasiado pequeñas. Cuando el tamaño del bloque se reduce, los números dentro se vuelven tan pequeños que la escala más pequeña de la regla sigue siendo demasiado grande. La computadora redondea todo a cero, y el modelo olvida la información.

La solución: Una mejor regla

Los autores no solo señalaron el problema; construyeron una herramienta mejor para solucionarlo.

Propusieron un nuevo formato llamado FP8 Unsigned E5M3 (UE5M3).

  • El arreglo: Piensa en la regla antigua como si tuviera 4 marcas para el "tamaño" (exponente) y 3 marcas para el "detalle" (mantisa).
  • La mejora: Tomaron un bit sin usar (un interruptor diminuto) y lo convirtieron en una marca extra de "tamaño". Ahora la regla tiene 5 marcas para el tamaño y 3 para el detalle.

Por qué esto ayuda:
Esta nueva regla puede medir números mucho, mucho más pequeños sin redondearlos a cero. Extiende la parte "inferior" de la regla para que pueda ver esas piedras diminutas con claridad.

Los resultados

Los investigadores probaron esta nueva regla en varios modelos de IA (como Llama y Granite).

  • Sin el arreglo: Cuando hacían los bloques muy pequeños, los modelos se confundían y cometían más errores.
  • Con la nueva regla (UE5M3): Los modelos se mantuvieron precisos incluso con bloques diminutos. De hecho, funcionó tan bien como un método de trabajo complicado donde tenían que estirar manualmente los números antes de medirlos, pero sin necesidad de ese paso adicional y costoso.

Resumen

El artículo nos enseña que en la compresión de IA, más pequeño no siempre es mejor. Si encoges demasiado tus grupos de datos, podrías romper la herramienta de medición que usas para leerlos. Al simplemente ajustar el diseño de esa herramienta de medición (añadiendo un bit extra de rango), arreglaron el fallo, permitiendo que los modelos de IA se compriman de manera más eficiente sin perder su inteligencia.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →