← Últimos artículos
🤖 machine learning

InfoQuant: Shaping Activation Distributions for Low-Bit LLM Quantization

InfoQuant es un método de cuantización post-entrenamiento sin entrenamiento que emplea la Transformación Ortogonal de Supresión de Picos (PSOT) y la selección adaptativa de tokens atípicos para remodelar las distribuciones de activación en una forma compacta y bien dispersa, reduciendo así significativamente el error de cuantización y superando las líneas base existentes de despliegue de LLM de bajo bit.

Autores originales: Ke Li, Dong An, Xiaoling Zang, Can Ye, Liang Xie, Qibo Qiu, Chen Shen, Xiaofei He, Wenxiao Wang

Publicado 2026-05-27
📖 4 min de lectura☕ Lectura para el café

Autores originales: Ke Li, Dong An, Xiaoling Zang, Can Ye, Liang Xie, Qibo Qiu, Chen Shen, Xiaofei He, Wenxiao Wang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

El Gran Problema: La Caja "Demasiado Alta"

Imagina que tienes una pila gigante y caótica de arena (esto representa los datos dentro de un Modelo de Lenguaje Grande, o LLM). Quieres empaquetar esta arena en una caja pequeña y ordenada para ahorrar espacio y hacerla más fácil de transportar (esto es la cuantización—reducir el modelo para que se ejecute más rápido y use menos memoria).

Por lo general, la mayor parte de la arena tiene una altura normal y manejable. Pero, hay unos pocos picos gigantes de arena que se extienden muy alto hacia el cielo (estos se llaman valores atípicos o outliers).

Debido a estos pocos picos gigantes, se te obliga a usar una caja enorme para que quepa todo. Una vez que pones la arena en esa caja enorme, la arena "normal" en la parte inferior queda aplastada en una capa diminuta y plana. Cuando intentas sacar la arena más tarde, no puedes distinguir las diferentes capas de arena normal porque todas han sido aplanadas en el mismo lugar. El modelo pierde su capacidad de "pensar" con claridad.

Las Soluciones Antiguas: Aplastar los Picos

Los métodos anteriores intentaron solucionar esto mediante:

  1. Aplastar los picos: Intentar cortar la parte superior de las pilas gigantes de arena.
  2. Mover los picos: Desplazar la arena pesada de un lugar a otro.

El problema es que, incluso si cortas los picos, la arena restante podría seguir agrupada de una manera que no encaja bien en la caja pequeña. Podrías tener una caja más pequeña, pero la arena sigue amontonada de una forma que dificulta distinguir entre los diferentes granos.

La Nueva Idea: INFOQUANT

Los autores de este artículo, INFOQUANT, se dieron cuenta de que el objetivo no es solo hacer la arena "más pequeña". El objetivo es hacer que la arena parezca que fue diseñada para la caja.

Se hacen una nueva pregunta: "¿Cómo se ve una pila de arena que encaja perfectamente en una caja pequeña?"

Su respuesta: Necesita ser baja (para que quepa en la caja) pero también distribuida uniformemente (para que puedas ver cada grano de arena).

Cómo Funciona INFOQUANT (La Receta de 3 Pasos)

1. El "Giro y Distribución" (Transformación Ortogonal de Supresión de Picos)
Imagina que la arena está dentro de un trompo. Los autores utilizan un truco matemático especial (una rotación ortogonal) para girar la arena.

  • Qué hace: Toma esos picos gigantes y distribuye su energía por toda la pila.
  • El Resultado: Los picos gigantes desaparecen y la arena se convierte en una colina suave y ancha. Crucialmente, la colina ahora es más baja (cabe en la caja) pero más ancha (la arena está distribuida para que puedas distinguir las capas).

2. El "Explorador Inteligente" (Selección Adaptativa de Tokens Atípicos)
A veces, la pila de arena tiene unos pocos lugares extraños y ruidosos que parecen picos pero no son realmente importantes. Si intentas arreglar esos, podrías estropear las partes buenas.

  • Qué hace: INFOQUANT tiene un "explorador" que mira la arena y dice: "Bien, ese pico allí es real y peligroso, vamos a arreglarlo. Pero ese pequeño bulto de allá? Ignóralo."
  • El Resultado: El modelo centra su energía en arreglar los problemas reales, haciendo el proceso más robusto y menos propenso a confundirse con el ruido.

3. El "Recorte de Ajuste Fino" (Recorte de Activación Aprendible)
Después de girar y distribuir la arena, los autores hacen una última comprobación. Ajustan el tamaño exacto de la caja para asegurarse de que la arena encaje perfectamente sin huecos ni aplastamientos.

  • El Resultado: El paquete final está optimizado para el tamaño específico de la caja, asegurando que no se pierda información en las esquinas.

Por Qué Esto Importa

El artículo probó esto en modelos de IA famosos (como LLaMA-2 y LLaMA-3).

  • El Resultado: Cuando redujeron los modelos a 4 bits (un tamaño muy pequeño, como reducir un libro de 100 páginas a una postal), INFOQUANT mantuvo el 97% de la inteligencia original.
  • La Comparación: Los métodos anteriores perdieron mucha más inteligencia al reducirse a este tamaño. INFOQUANT logró mantener la "postal" legible y útil, mientras que otros la convirtieron en un garabato borroso.

La Conclusión

Piensa en INFOQUANT como un maestro empacador. En lugar de simplemente intentar forzar una pila desordenada y con picos de arena en una caja pequeña (lo cual aplasta los detalles), primero reconfiguran la pila para que encaje naturalmente y perfectamente en la caja. Hacen que la pila sea lo suficientemente baja para caber, pero lo suficientemente distribuida para mantener todos los detalles visibles.

Esto nos permite ejecutar modelos de IA enormes y potentes en computadoras más pequeñas y baratas sin perder su "capacidad cerebral".

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →