← Últimos artículos
🤖 machine learning

High-Rate Quantized Matrix Multiplication II

Este artículo investiga la multiplicación de matrices cuantizada de alta tasa para la cuantización post-entrenamiento de LLM solo de pesos, demostrando cómo el relleno de agua consciente de la covarianza mejora la asignación de tasas iguales, analizando el rendimiento libre de bases y casi óptimo del esquema WaterSIC, y mostrando que GPTQ con rotación aleatoria logra resultados comparables casi óptimos.

Autores originales: Or Ordentlich, Yury Polyanskiy

Publicado 2026-05-14
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Or Ordentlich, Yury Polyanskiy

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

La Gran Imagen: Comprimiendo el Cerebro de la IA

Imagina un modelo masivo de Inteligencia Artificial (IA), como una biblioteca gigante de conocimientos, intentando resolver un problema. Para hacerlo, realiza una operación matemática llamada Multiplicación de Matrices (MatMul) miles de millones de veces. Piensa en esto como el proceso de "pensamiento" de la IA.

Sin embargo, estos "pesos" (los números dentro de la IA) ocupan una enorme cantidad de memoria. Para hacer que la IA funcione más rápido y en dispositivos más pequeños, los ingenieros comprimen estos números, un proceso llamado Cuantización. Es como reducir una foto de alta resolución a un tamaño de archivo más pequeño para que cargue más rápido.

Este artículo es la segunda parte de un estudio sobre cómo realizar esta reducción de manera más eficiente. Mientras que la primera parte examinó la reducción sin ningún conocimiento previo, este artículo se centra en un escenario donde tenemos algún conocimiento previo: conocemos la "forma" estadística de los datos que la IA está procesando.

El Problema Central: El Rompecabezas de "Solo Pesos"

En muchos sistemas modernos de IA (como los LLM), los datos que fluyen a través del sistema (activaciones) se mantienen en precisión completa, pero los "pesos" (el conocimiento estático) se comprimen.

  • El Objetivo: Queremos comprimir los pesos (WW) tanto como sea posible sin hacer que las respuestas de la IA (YY) sean demasiado incorrectas.
  • El Truco: La "incorrectitud" (distorsión) depende de cómo interactúan los pesos con los datos entrantes. Si los datos entrantes tienen un patrón específico (como una forma ovalada larga y delgada), comprimir los pesos de una manera estándar, en una cuadrícula cuadrada, es ineficiente. Es como intentar meter una maleta larga y delgada en una caja cuadrada; desperdicias mucho espacio.

La Vieja Forma: "Una Talla Única" (GPTQ)

Actualmente, métodos populares como GPTQ tratan cada parte de la matriz de pesos de la misma manera. Utilizan una cuadrícula estándar (como papel milimetrado) para redondear los números.

  • La Analogía: Imagina que estás empacando una maleta con objetos de diferentes tamaños. El método antiguo utiliza una cuadrícula de cajas idénticas para todo. Pones una piedrita diminuta en una caja grande y una roca gigante en una caja grande. Desperdicias espacio con la piedrita y quizás no encajes la roca perfectamente.
  • El Defecto: Este método no observa la forma específica de los datos. Asume que los datos son perfectamente redondos (isótropos). Si los datos son en realidad un óvalo, este método es subóptimo.

La Nueva Teoría: "Relleno de Agua" (La Solución Ideal)

Los autores examinan las matemáticas del Error Cuadrático Medio Ponderado (WMSE). Utilizan un concepto llamado Relleno de Agua.

  • La Analogía: Imagina que tienes un paisaje con colinas y valles (que representan la importancia de diferentes partes de los datos). Quieres verter una cantidad fija de "agua" (tus bits/banda limitada) sobre este paisaje.
    • La estrategia de Relleno de Agua dice: Vierte el agua primero en los valles más profundos. Estas son las partes de los datos que más importan o son más sensibles. Les das más "resolución" (más bits).
    • Las colinas poco profundas reciben menos agua (menos bits).
    • Esto asegura que obtengas la mejor imagen posible para la cantidad de agua que tienes.

Matemáticamente, este es el "Límite Teórico de la Información": lo mejor absoluto que se puede hacer.

La Solución Práctica: WaterSIC

El problema con el Relleno de Agua es que es difícil de calcular en tiempo real. Los autores proponen un algoritmo práctico llamado WaterSIC.

  • Cómo funciona: Utiliza una técnica llamada Cancelación de Interferencia Sucesiva (SIC). Imagina que intentas escuchar una conversación en una habitación ruidosa. Escuchas primero la voz más fuerte, la entiendes y luego la "cancelas" para poder escuchar mejor las voces más silenciosas.
  • La Innovación: WaterSIC aplica esta idea a los pesos. Observa la forma de los datos (utilizando una herramienta matemática llamada descomposición de Cholesky) y ajusta el "tamaño de la cuadrícula" para cada parte del peso.
    • Para las partes de los datos que son "rígidas" o importantes, utiliza una cuadrícula más fina (más bits).
    • Para las partes que son "sueltas" o menos importantes, utiliza una cuadrícula más gruesa (menos bits).

Hallazgos Clave

  1. Eficiencia Casi Perfecta: Los autores demuestran que WaterSIC está increíblemente cerca del límite teórico de "Relleno de Agua". Está a solo aproximadamente 0.25 bits del rendimiento absolutamente mejor posible. Esta es una brecha diminuta, lo que significa que el método es casi perfecto.
  2. Inmunidad a la Rotación: Uno de los hallazgos más interesantes es que WaterSIC es "libre de base".
    • La Analogía: Imagina que tienes un mapa. Si giras el mapa, el Polo Norte se mueve. Algunos métodos de compresión se rompen o empeoran si giras los datos (como girar el mapa). Sin embargo, WaterSIC funciona igual de bien independientemente de cómo se roten los datos. Se adapta a la forma de los datos, no a la dirección en la que miran.
  3. GPTQ es Sorprendentemente Bueno (con un giro): El artículo también encontró que el método estándar GPTQ (que no utiliza los ajustes sofisticados de relleno de agua) funciona sorprendentemente bien si primero giras los datos aleatoriamente.
    • Resulta que la forma en que se organizan actualmente los datos de la IA es en realidad "afortunada" (está cerca de la forma óptima). Pero si la alteras (la giras), GPTQ empeora, mientras que WaterSIC se mantiene fuerte.

Resumen

Este artículo introduce WaterSIC, una forma más inteligente de comprimir los pesos de la IA.

  • Vieja Forma: Usar una cuadrícula estándar para todo (GPTQ).
  • Nueva Forma: Observar la forma de los datos y ajustar el tamaño de la cuadrícula para cada parte (WaterSIC).
  • Resultado: El nuevo método es casi perfecto, teóricamente imbatible y robusto incluso si los datos se mezclan o giran. Cierra la brecha entre la teoría matemática compleja y la compresión de IA práctica y rápida.

Los autores concluyen que, aunque los métodos actuales son buenos, todavía hay margen para mejorar, especialmente para la compresión de muy pocos bits (donde tienes muy pocos bits con los que trabajar) y para hacer que la "configuración" de los datos sea más rápida en los chips informáticos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →