← Últimos artículos
🤖 machine learning

HyperQuant: A Rate-Distortion-Optimal Quantization Pipeline for Large Language and Diffusion Models

HyperQuant es un pipeline de cuantización post-entrenamiento unificado que combina la Transformada de Hadamard Aleatorizada, la cuantización de red óptima, la codificación Rice y la corrección de sesgo para lograr una compresión con optimalidad de tasa-distorsión tanto para pesos como para cachés KV en modelos de lenguaje grande y de difusión, superando a los métodos existentes en diversas tasas de bits mientras mantiene una calidad casi sin pérdidas.

Autores originales: Yuval Domb, Hadar Sackstein, Tomer Solberg

Publicado 2026-06-23
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Yuval Domb, Hadar Sackstein, Tomer Solberg

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes una biblioteca masiva e increíblemente detallada de libros (un Modelo de Lenguaje Grande o un generador de video). Estos libros contienen miles de millones de palabras e imágenes, ocupando tanto espacio que apenas caben en el disco duro de tu computadora. Cuando le pides a la computadora que lea una oración o genere un video, tiene que estar moviendo estos pesados libros de un lado a otro constantemente, lo cual es lento y agotador para la máquina.

HyperQuant es un nuevo y astuto sistema diseñado para encoger estos libros a una fracción de su tamaño sin perder la historia, haciéndolos más rápidos de leer y más fáciles de almacenar.

Así es como funciona, desglosado en pasos simples utilizando analogías de la vida cotidiana:

1. El truco de "Barajar" (Transformada de Hadamard Aleatorizada)

Imagina que tienes una pila desordenada de papeles donde algunas páginas son enormes y pesadas, mientras que otras son pequeños fragmentos. Si intentas empacarlos en una caja, las páginas grandes sobresalen y desperdician espacio.
HyperQuant comienza por barajar las páginas. Mezcla los datos para que, en lugar de tener unos pocos valores atípicos gigantes y muchos trozos diminutos, todo se convierta en una distribución suave y uniforme (como una curva de campana perfecta). Esto hace que los datos sean mucho más fáciles de empacar eficientemente, tal como barajar un mazo de cartas facilita repartirlas de manera uniforme.

2. El "Empaque Perfecto" (Cuantización de Redes o Lattice Quantization)

Una vez que los datos han sido barajados, HyperQuant necesita convertir los números continuos en "puntos" discretos que puedan almacenarse.

  • La forma antigua: Imagina intentar empacar esferas en una caja usando una cuadrícula simple (como un tablero de ajedrez). Hay mucho espacio vacío desperdiciado entre las esferas.
  • La forma de HyperQuant: Utiliza "redes matemáticas" (como las formas E8 o D4). Piensa en esto como la forma más eficiente de apilar naranjas en un cajón. Encajan las esferas de forma tan apretada que casi no hay espacio desperdiciado. Esto permite al sistema almacenar la misma cantidad de información utilizando muchos menos bits.

3. El "Cremallera" (Codificación de Entropía y Códigos Rice)

Incluso con un empaque perfecto, todavía tienes una larga lista de números para escribir.

  • La forma antigua: Escribes cada número con la misma cantidad de espacio, incluso si algunos números aparecen muy a menudo y otros raramente.
  • La forma de HyperQuant: Utiliza un código de longitud variable (codificación Rice). Piensa en esto como un lenguaje secreto donde las palabras comunes reciben códigos muy cortos (como "u" para "you"), y las palabras raras reciben códigos más largos. Debido a que el sistema sabe qué números aparecen con más frecuencia, comprime los datos aún más, ahorrando espacio sin perder ningún significado.

4. El "Cancelador de Ruido" (Corrección de Sesgo para el KV Cache)

Cuando un modelo recuerda palabras previas (el "KV cache"), necesita ser muy preciso. Si redondeas los números de forma demasiado brusca, el modelo podría confundirse y empezar a tener alucinaciones sin sentido.
HyperQuant utiliza un truco llamado "dither sustractivo". Imagina que estás midiendo un líquido, pero tu taza es ligeramente inestable. En lugar de solo adivinar, añades una pequeña cantidad de agua de forma aleatoria, mides, y luego restas esa cantidad exacta de forma aleatoria más tarde. Esto cancela el error perfectamente, asegurando que el resultado final sea imparcial y preciso, incluso cuando los datos están fuertemente comprimidos.

5. La "Caja Mágica" (Integración de Hardware)

Finalmente, HyperQuant está diseñado para trabajar directamente con los chips de computación modernos (como los GPU NVIDIA H100 y Blackwell). No solo comprime los datos; los formatea para que el chip pueda leerlos instantáneamente sin necesidad de desempaquetarlos primero.

  • El Resultado: Descubrieron que usar enteros de 8 bits (números enteros estándar) funciona mejor que los números de punto flotante de 8 bits (números decimales) para este tipo específico de datos comprimidos. Es como darse cuenta de que, para este rompecabezas específico, los números enteros encajan mejor en los espacios que los decimales.

Las Grandes Victorias

El artículo afirma que HyperQuant logra lo siguiente:

  • Compresión Masiva: Encoge la "memoria" del modelo (pesos) aproximadamente 4 veces y la "memoria de trabajo" (KV cache) aproximadamente 3.8 veces.
  • Sin Pérdida de Calidad: A pesar de encoger tanto los datos, el modelo sigue entendiendo y generando texto o video casi tan bien como la versión original sin comprimir.
  • Éxito en Video: Comprimió con éxito un modelo de generación de video de 19 mil millones de parámetros (LTX-2) sin ningún fallo visible en el video.
  • Superando a la Competencia: Supera a los métodos anteriores más destacados (como HIGGS, TurboQuant y OCTOPUS) en casi todas las pruebas, especialmente cuando se intenta reducir los datos a tamaños muy pequeños (como 1.7 bits por número).

En resumen, HyperQuant es un nuevo "algoritmo de empaque" que baraja, apila y cierra con cremallera los modelos de IA para que quepan en tu bolsillo sin romper la historia.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →