← Últimos artículos
🤖 machine learning

KronQ: LLM Quantization via Kronecker-Factored Hessian

KroQ es un marco de cuantificación post-entrenamiento que mejora la compresión de modelos de lenguaje de gran tamaño al incorporar la covarianza del gradiente en el objetivo de cuantificación mediante la aproximación de Hessiano factorizado por Kronecker, permitiendo el procesamiento de incoherencia bidireccional y métricas de sensibilidad mejoradas que logran una perplejidad superior en comparación con métodos existentes como GPTQ, particularmente en escenarios de bits extremadamente bajos.

Autores originales: Donghyun Lee, Yuhang Li, Ruokai Yin, Priyadarshini Panda

Publicado 2026-07-10
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Donghyun Lee, Yuhang Li, Ruokai Yin, Priyadarshini Panda

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes un cerebro de robot gigante e increíblemente inteligente (un Modelo de Lenguaje Extenso o LLM) que puede escribir historias, resolver problemas matemáticos y charlar como un humano. ¿El problema? Este cerebro es tan masivo que necesita un almacén lleno de computadoras solo para caber en un estante. Para lograr que funcione en una computadora portátil o un teléfono normal, los científicos intentan "encogerlo" comprimiendo su memoria, un proceso llamado cuantización. Piensa en esto como empacar una maleta: quieres meter toda tu ropa (el conocimiento del modelo) en una bolsa diminuta sin perder nada importante.

Durante un tiempo, la mejor manera de empacar esta maleta fue un método llamado GPTQ. Funcionaba observando cómo variaba la "entrada" del robot (las palabras que lee) y ajustando los pesos en consecuencia. Pero los autores de este nuevo artículo, KronQ, notaron un fallo en esta estrategia. Se dieron cuenta de que GPTQ solo estaba mirando el lado de la entrada de la ecuación, asumiendo que cada posible salida (las palabras que el robot podría decir a continuación) era igualmente importante.

El Gran Error: Ignorar el Lado de la "Salida"
El artículo argumenta que esta suposición es como intentar empacar una maleta mirando solo qué tan pesada es la ropa, mientras se ignora qué tan frágil es. En realidad, algunas partes del cerebro del robot son súper sensibles. Si las aplastas demasiado, todo el sistema se desmorona.

Los autores midieron esto y descubrieron algo asombroso: en un modelo masivo como LLaMA-3-70B, los canales de "salida" (las rutas que el robot utiliza para generar respuestas) varían enormemente en importancia. Algunos son como vidrio delicado; otros son como ladrillos resistentes. Los métodos antiguos los trataban a todos por igual, lo que causaba que el robot se volviera loco cuando se comprimía demasiado. De hecho, cuando intentaron encoger LLaMA-3-70B a solo 2 bits (una cantidad de memoria minúscula), los métodos antiguos fallaron por completo, produciendo disparates con una "perplejidad" (una puntuación de qué tan confundido está el modelo) de más de 2000. Eso es como si un robot olvidara cómo hablar inglés por completo.

La Nueva Solución: KronQ
Entra KronQ. Los autores proponen una nueva forma de empacar la maleta que mira tanto la entrada como la salida. Utilizan un truco matemático llamado aproximación de Hessiano factorizado por Kronecker.

Aquí está la analogía: Imagina que el cerebro del robot es un tambor gigante.

  • Método Antiguo (GPTQ): Golpeas el tambor desde el frente (entrada) y ajustas la tensión basándote en cómo vibra el frente. Asumes que la parte trasera del tambor es una imagen especular.
  • KronQ: Golpeas el tambor desde el frente y desde la parte trasera. ¡Te das cuenta de que la parte trasera vibra de forma diferente! Algunas partes de la parte trasera están sueltas y tambaleantes, mientras que otras están tensas. KronQ mide esta "vibración trasera" (la covarianza del gradiente) y lo usa para empacar la maleta con mucho más cuidado.

Dos Superpoderes de KronQ
El artículo muestra que KronQ hace dos cosas ingeniosas:

  1. Incoherencia Bidireccional (El "Mezclado"):
    Antes de empacar, KronQ mezcla los pesos en dos direcciones (entrada y salida) para asegurarse de que ningún punto esté sobrecargado con artículos pesados o frágiles. Es como tomar una pila desordenada de libros y distribuirlos uniformemente para que la maleta no se abulte en un solo punto. El artículo muestra que esto reduce la "variabilidad" de los pesos, haciendo que sean mucho más fáciles de comprimir sin romperse.

  2. Asignación Inteligente de Bits (El "Pase VIP"):
    No todas las partes del robot necesitan la misma cantidad de espacio. KronQ calcula una "puntuación de sensibilidad" para cada subcapa del cerebro. Le da a las capas "VIP" (las más sensibles) más bits (más espacio de memoria) y a las menos importantes menos bits. Crucialmente, debido a que mira el lado de la salida, puede distinguir entre capas que parecen idénticas desde el lado de la entrada pero que actúan de manera muy diferente.

Los Resultados: Salvando el Día
Los autores probaron esto en varios modelos, desde 7 mil millones hasta 70 mil millones de parámetros. Los resultados fueron dramáticos, especialmente cuando intentaron encoger los modelos al límite extremo de 2 bits.

  • El Fallo: En el modelo masivo LLaMA-3-70B, los métodos antiguos (GPTQ y GPTAQ) divergieron o produjeron resultados basura (perplejidad > 2000).
  • El Éxito: KronQ logró comprimir este mismo modelo de 70 mil millones de parámetros a 2 bits y lo mantuvo funcionando perfectamente, logrando una perplejidad de 7.93 en el conjunto de datos WikiText-2. Esa es una diferencia enorme entre un "robot roto" y un "robot inteligente".

Incluso en configuraciones de 4 y 3 bits, KronQ superó consistentemente a la competencia, mostrando puntuaciones de confusión más bajas y mejor precisión en pruebas de razonamiento como PiQA y Arc-Challenge. Por ejemplo, en LLaMA-2-7B a 2 bits, KronQ obtuvo una perplejidad de 8.15, mientras que GPTQ tuvo dificultades con 31.11.

El Costo
¿Hay alguna trampa? El artículo admite que para obtener estos datos de la "vibración de salida", KronQ necesita realizar un paso hacia atrás (backward pass) adicional a través del modelo antes de empacar. Esto toma un poco más de tiempo y memoria durante la fase de configuración (unos 8–11 segundos más por capa en comparación con GPTAQ). Sin embargo, una vez que el modelo está empacado, la velocidad de ejecución real y el uso de memoria durante el uso son tan eficientes como los de los métodos anteriores. El trabajo extra es un costo de configuración de una sola vez que rinde frutos al permitir que el modelo se reduzca mucho más sin romperse.

Lo Que Descartaron
El artículo argumenta explícitamente en contra de la idea de que puedes ignorar el lado de la salida de las matemáticas. Demuestran que asumir que todas las direcciones de salida son iguales (estableciendo la matriz de covarianza del gradiente como una matriz identidad) es una "aproximación suboptimal" que conduce al fracaso en escenarios de ultra bajo bit. También muestran que los métodos que solo miran las estadísticas de entrada (como el GPTQ estándar) no pueden distinguir entre diferentes subcapas que comparten la misma entrada, lo que lleva a decisiones deficientes sobre dónde asignar la memoria.

¿Qué tan seguros están?
Los autores están muy seguros de estos resultados porque se basan en mediciones reales, no solo en simulaciones. Realizaron estas pruebas en hardware real (GPUs A100) con modelos reales (LLaMA-2, LLaMA-3, Gemma, DeepSeek) y midieron la perplejidad y la precisión real. No solo sugirieron que podría funcionar; demostraron que, en estos experimentos específicos, los métodos antiguos literalmente fallaron en producir un modelo funcional a 2 bits, mientras que KronQ tuvo éxito.

En resumen, KronQ es como un maestro empacador que se dio cuenta de que, para meter un cerebro gigante en una caja pequeña, tienes que entender cómo el cerebro genera información, no solo cómo la recibe. Al hacerlo, desbloquea la capacidad de ejecutar modelos de IA masivos en dispositivos que antes pensaban que era imposible.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →