← Últimos artículos
🤖 machine learning

ADMM-Q: An Improved Hessian-based Weight Quantizer for Post-Training Quantization of Large Language Models

ADMM-Q es un algoritmo novedoso y modular de cuantización de pesos post-entrenamiento basado en una variante combinatoria del Método de Direcciones Alternas de Multiplicadores que mejora significativamente la utilidad de los Modelos de Lenguaje Grandes en niveles de cuantización agresivos por debajo de 4 bits al minimizar el error de reconstrucción por capa mientras se imponen restricciones de cuantización.

Autores originales: Ryan Lucas, Mehdi Makni, Xiang Meng, Adam Deng, Rahul Mazumder

Publicado 2026-05-13
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Ryan Lucas, Mehdi Makni, Xiang Meng, Adam Deng, Rahul Mazumder

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

El Panorama General: Encogiendo Cerebros Gigantes

Imagina los Modelos de Lenguaje Grandes (LLM) como Qwen o LLaMA como bibliotecas masivas y altamente detalladas. Estas bibliotecas contienen miles de millones de libros (parámetros) que permiten a la IA escribir, razonar y conversar. Sin embargo, debido a que estas bibliotecas son tan enormes, son difíciles de transportar (alto uso de memoria) y tardan mucho tiempo en leerse (computación lenta).

La Cuantización es el proceso de encoger estas bibliotecas. En lugar de mantener cada libro escrito con tinta de alta definición y color completo (precisión de 32 bits o 16 bits), intentamos reescribirlos usando menos colores o símbolos más simples (4 bits o incluso 2 bits). El objetivo es hacer que la biblioteca sea lo suficientemente pequeña para caber en una mochila sin perder la historia.

El Problema: Los Encogedores "Codiciosos"

Los métodos existentes para encoger estos modelos, como GPTQ (el estándar actual de la industria), funcionan como un editor codicioso.

  • Cómo funcionan: Miran la primera frase, la encogen y pasan a la siguiente. Luego miran la segunda frase, la encogen y pasan a la siguiente.
  • El defecto: Cuando el editor encoge la primera frase, puede cometer un pequeño error. Como pasa inmediatamente a la siguiente, nunca vuelve atrás para corregir ese error. Para cuando llega al final del libro, todos esos pequeños errores se han acumulado, haciendo que la historia sea confusa o sin sentido. Esto es especialmente malo al intentar encoger los libros muy agresivamente (hasta 2 o 3 bits).

La Solución: ADMM-Q (El Enfoque de "Reunión de Equipo")

Los autores proponen un nuevo método llamado ADMM-Q. En lugar de un editor codicioso trabajando solo, imagina un equipo de editores sosteniendo una reunión en mesa redonda para cada capítulo.

  1. La Reunión de Equipo (Optimización Conjunta):
    En lugar de arreglar una frase a la vez, el equipo mira el capítulo completo de una sola vez. Se preguntan: "Si cambiamos esta palabra aquí, ¿cómo afecta a esa palabra allá?". Ajustan todas las palabras simultáneamente para encontrar la mejor combinación posible que mantenga la historia clara, incluso usando muy pocos colores.

  2. El Baile "Suave" vs. "Bloqueado" (ADMM):
    Las matemáticas detrás de esto se llaman ADMM (Método de Direcciones Alternas de Multiplicadores). Imagínalo como un baile entre dos pasos:

    • Paso A (El Deslizamiento Suave): El equipo hace pequeños ajustes continuos a las palabras para mejorar el flujo de la historia.
    • Paso B (El Encaje a la Rejilla): De repente, deben encajar esas palabras en valores específicos y permitidos (como encajar un bloque de Lego en su lugar).
    • Siguen alternando entre deslizarse y encajar. Con el tiempo, este proceso obliga a las palabras a asentarse en las mejores "posiciones de Lego" posibles sin romper la historia.
  3. El Problema de los "Valores Atípicos" (Escalado Diagonal):
    En estos modelos, algunas palabras son "ruidosas" (valores atípicos) y otras son "silenciosas". Si intentas encogerlas todas a la vez, las palabras ruidosas dominan la conversación y las silenciosas se pierden.

    • La solución de ADMM-Q: Utilizan una técnica llamada Escalado Diagonal. Imagina darle un micrófono a las palabras silenciosas y bajar el volumen de las palabras ruidosas solo para la sesión de edición. Esto asegura que cada palabra tenga una oportunidad justa de ser optimizada, lo que lleva a una historia final mucho más clara.
  4. El Pulido Final (Búsqueda Local):
    Una vez que el equipo termina su reunión, hacen una rápida "revisión puntual". Buscan pares de palabras que podrían haberse intercambiado por accidente y ven si volver a intercambiarlas mejora la historia. Esto es un pulido rápido y final para atrapar cualquier error de última hora.

Por Qué Importa: Los Resultados

El artículo probó este nuevo método en varios modelos (Qwen y LLaMA) y descubrió que:

  • Mejores Historias: Cuando encogieron los modelos a tamaños muy pequeños (como 3 bits o 2 bits), los antiguos métodos "codiciosos" (GPTQ) producían sinsentidos o respuestas muy confusas. ADMM-Q mantuvo a los modelos inteligentes y coherentes.
    • Ejemplo: En una prueba llamada "WikiText-2", el método antiguo tuvo una puntuación de 12.85 (más alto es peor), mientras que ADMM-Q la redujo a 10.06. Eso es una gran mejora en claridad.
  • Funciona con Otras Herramientas: ADMM-Q no es un reemplazo para todo; es un reemplazo directo para la parte de "encogedor". Funciona perfectamente junto con otros trucos que la gente usa, como rotar los datos o escalarlos.
  • La Misma Velocidad: Una vez que el modelo está encogido, se ejecuta tan rápido como los métodos antiguos. El tiempo extra que toma ADMM-Q es solo durante el proceso de encogimiento "offline" (como editar un libro antes de publicarlo), no mientras estás usando realmente la IA.

La Desventaja (Limitaciones)

  • Tarda más en editar: Debido a que ADMM-Q realiza una compleja "reunión de equipo" para cada capa, requiere más tiempo de computadora para encoger el modelo inicialmente en comparación con los métodos codiciosos simples. Sin embargo, los autores dicen que esta espera única vale la pena por la calidad mucho mejor.
  • Necesita una muestra: Como todos estos métodos, necesita una pequeña muestra de texto (datos de calibración) para entender qué intenta decir el modelo antes de comenzar a encogerlo.

Resumen

ADMM-Q es una forma más inteligente de comprimir modelos de IA. En lugar de apresurarse a través del paso de compresión paso a paso y cometer errores en el camino, adopta un enfoque holístico y matemático para ajustar todas las partes del modelo juntas. El resultado es una IA mucho más pequeña que aún recuerda cómo pensar con claridad, incluso cuando está apretada en un espacio muy reducido.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →