← Últimos artículos
🤖 machine learning

QAM-W: Joint 2D Codebook Quantization for LLM Weights via Hadamard Rotation and Activation-Aware Scaling

QAM-W introduce un método de cuantización de código conjunto 2D para los pesos de los LLM que utiliza rotación de Hadamard y escalado consciente de la activación para preservar las estructuras de coordenadas por pares, logrando una perplejidad cercana a BF16 con aproximadamente 5,5 bits por peso mientras supera a la codificación polar y iguala la calidad de SmoothQuant con significativamente menos bits de peso.

Autores originales: Preetam Sharma, Kacper Dobek

Publicado 2026-05-27
📖 4 min de lectura☕ Lectura para el café

Autores originales: Preetam Sharma, Kacper Dobek

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes una biblioteca masiva de libros (un Modelo de Lenguaje Grande, o LLM) que es increíblemente inteligente pero ocupa un espacio enorme. Para hacerla más fácil de transportar, quieres reducir el tamaño de los libros. Este proceso se llama cuantización.

La mayoría de los métodos actuales para reducir estos libros son como tomar un diccionario y reemplazar cada palabra individual con un código numérico corto, una palabra a la vez. Es simple, pero ignora el hecho de que las palabras a menudo vienen en pares o grupos que tienen una relación específica entre sí. Si los tratas como individuos aislados, pierdes parte de la sutileza de la historia.

Este artículo introduce un nuevo método llamado QAM-W (Modulación por Amplitud en Cuadratura para Pesos). Piénsalo como una forma más inteligente y eficiente de empacar esos libros.

Así es como funciona, usando analogías simples:

1. El Problema: El "Bailarín Solitario" vs. El "Dúo"

Imagina que los pesos en un modelo de IA son bailarines.

  • Método Antiguo (Cuantización Escalar): La forma antigua trata a cada bailarín como si estuviera actuando en solitario. Mira a cada bailarín individualmente y dice: "Eres un '3', eres un '7'". Ignora que dos bailarines podrían estar tomados de la mano o moviéndose al unísono.
  • La Perspectiva de QAM-W: Los autores se dieron cuenta de que, dentro de una fila de datos, estos "bailarines" en realidad están bailando en parejas. Están correlacionados. En lugar de codificarlos como dos solistas separados, QAM-W los trata como un duo.

2. La Solución: El "Giro Mágico" y el "Emparejamiento"

QAM-W utiliza un proceso de tres pasos para reducir el modelo sin perder la historia:

  • Paso A: El Giro Mágico (Rotación de Hadamard):
    Imagina que los bailarines están de pie en una habitación desordenada y abarrotada. QAM-W aplica un "Giro Mágico" (una rotación matemática) que los reorganiza. De repente, los bailarines que se movían al azar ahora están emparejados perfectamente, moviéndose en un patrón circular y suave. Esto hace que sea mucho más fácil describirlos matemáticamente.

  • Paso B: El Libro de Códigos del "Dúo":
    En lugar de dar a cada bailarín un número separado, QAM-W mira al par como un solo punto en un mapa. Utiliza un "mapa" predefinido (un libro de códigos) entrenado sobre cómo suelen comportarse estos pares. Es como tener una biblioteca de movimientos de baile estándar para dúos. En lugar de describir dos pasos separados, simplemente dices: "Hicieron el movimiento 'Vals #42'". Esto captura la relación entre los dos números, ahorrando espacio.

  • Paso C: El "Botón de Volumen" (Escala Consciente de la Activación):
    A veces, ciertas partes del modelo son muy fuertes (muy activas) y otras son silenciosas. Si reduces demasiado las partes fuertes, la música se distorsiona. QAM-W escucha el "volumen" de cada canal antes de reducir. Baja ligeramente el volumen de los canales fuertes para que encajen mejor en el pequeño espacio, asegurando que la información más importante no sea aplastada.

3. Los Resultados: Menor Tamaño, Misma Calidad

El artículo probó este nuevo método en cinco modelos de IA diferentes (que van desde pequeños hasta medianos-grandes).

  • El "Punto Dulce": En un nivel de compresión específico (aproximadamente 5.5 bits por peso), QAM-W logró resultados casi idénticos al modelo original, sin comprimir.
  • La Comparación: Un método competidor popular llamado SmoothQuant necesitaba usar aproximadamente 8.1 bits para obtener la misma calidad. QAM-W obtuvo el mismo resultado usando 32% menos de bits.
    • Analogía: Es como hacer una maleta. SmoothQuant necesita una maleta grande para que quepan todas tus prendas ordenadamente. QAM-W dobla la ropa de manera tan eficiente que puedes meter exactamente la misma cantidad en una bolsa mucho más pequeña.

4. Lo Que No Hace (Los Límites)

El artículo es muy específico sobre lo que no afirma:

  • No el Más Pequeño: Si intentas reducir el modelo aún más (hasta 4 bits), otro método llamado QTIP en realidad funciona mejor. QAM-W es el campeón en el rango "mediano-pequeño" (5–6 bits), no en el rango "minúsculo".
  • Almacenamiento vs. Velocidad: El artículo mide cuánto espacio ocupa el modelo en un disco duro o en la memoria. Aún no afirma hacer que el modelo ejecute más rápido en un chip informático, porque el software para usar realmente estos números comprimidos en tiempo real aún se está construyendo.

Resumen

QAM-W es una nueva "técnica de empaquetado" para modelos de IA. Al reconocer que los datos vienen en pares, girándolos hacia una mejor forma y ajustando el volumen, puede reducir los modelos de IA en aproximadamente un tercio sin hacerlos menos inteligentes. Es una herramienta especializada que funciona mejor en un rango de tamaño específico, ofreciendo un ahorro significativo en espacio de almacenamiento en comparación con los métodos actuales.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →