← Últimos artículos
🤖 machine learning

RDQ: Residual Distribution Quantization for Large Language Models

Este artículo presenta RDQ, un marco de cuantificación post-entrenamiento que mitiga la acumulación superlineal del ruido de cuantificación en los modelos de lenguaje de gran tamaño mediante el empleo de Compensación de Error en Cascada para ajustar las escalas por canal frente a distribuciones de residuos desviadas, logrando así una perplejidad de vanguardia con precisión de 3 y 4 bits con cero sobrecarga de inferencia.

Autores originales: Prateek Singh

Publicado 2026-07-14
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Prateek Singh

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando enviar un mensaje secreto a través de un largo y sinuoso túnel compuesto por 32 habitaciones conectadas. En la versión original de alta calidad de este túnel (llamada FP16), el mensaje viaja perfectamente claro de principio a fin. Pero cuando intentamos encoger el mensaje para que quepa en un formato comprimido y diminuto (cuantización) para ahorrar espacio en tu teléfono o dispositivo periférico, las cosas empiezan a salir mal.

Durante mucho tiempo, los científicos pensaron que el problema era simplemente que cada habitación estaba un poco desordenada por sí sola. Pensaban: "Si limpiamos la Habitación 1, luego la Había 2, luego la Habitación 3, todo estará bien". Pero este nuevo artículo, RDQ (Cuantización de Distribución Residual), descubrió que este enfoque de "limpiar cada habitación por separado" es en realidad la forma equivocada de pensar.

El verdadero culpable: El efecto "bola de nieve"

Los autores descubrieron que el verdadero problema es un efecto de bola de nieve. Cada vez que un mensaje pasa por una habitación, se le añade un poco de "ruido" o estática. En un túnel normal, esto no importa. Pero en un túnel comprimido, ese pequeño trozo de ruido no desaparece; se transporta a la siguiente habitación, donde se mezcla con el nuevo ruido de esa habitación.

Para cuando el mensaje llega a la 32ª habitación, esa pequeña estática se ha convertido en un estruendo masivo. Los autores midieron esta "acumulación de ruido" (que llaman deriva del flujo residual) y descubrieron algo asombroso: la cantidad de ruido predice perfectamente qué tan malo suena el mensaje. De hecho, encontraron una correlación tan fuerte (Pearson r=0.999) que, si conoces cuánto se ha desviado la señal, puedes predecir exactamente qué tan confundida se pondrá la computadora.

El gran descubrimiento: El túnel no es liso

Antes de este artículo, la mayoría de los expertos asumían que el ruido en estos túneles parecía una colina suave y predecible (una distribución "Gaussiana"). Construyeron sus herramientas de limpieza basados en esa colina suave.

Pero los autores entraron y echaron un vistazo. Descubrieron que el 84% de las habitaciones en el modelo LLaMA-3-8B no tienen colinas suaves en absoluto. En su lugar, el ruido es dentado, extraño y, a veces, tiene dos picos (bimodal). Es como esperar un lago tranquilo y encontrar un océano agitado con olas repentinas. Debido a que el ruido es tan extraño, las antiguas herramientas de limpieza de "colina suave" estaban fallando estrepitosamente, especialmente cuando intentaban encoger el mensaje a solo 3 bits (un tamaño muy diminuto).

La solución: "Compensación de Error en Cascada" (CEC)

Entonces, ¿cómo arreglamos un túnel donde el ruido cambia a medida que avanzas más profundamente? Los autores proponen un nuevo método llamado Compensación de Error en Cascada (CEC).

En lugar de limpiar cada habitación pretendiendo que el mensaje aún está fresco y limpio (que es lo que hacían los métodos antiguos), el CEC dice: "Primero atravesemos el túnel, veamos exactamente cómo luce el mensaje cuando llega a cada habitación, y entonces lo limpiamos".

Así es como funciona:

  1. El recorrido de prueba: La computadora ejecuta un mensaje de prueba a través del túnel. Deja que las primeras habitaciones se "ensucien" (se cuanticen) tal como ocurriría en la vida real.
  2. La apariencia real: Cuando el mensaje llega a la Habitación 10, ya está un poco ruidoso debido a las Habitaciones 1 hasta la 9. El sistema captura esta señal real y desordenada.
  3. El arreglo personalizado: En lugar de usar una herramienta de limpieza genérica, el sistema construye una herramienta de limpieza personalizada específicamente para esa señal desordenada. Ajusta el "volumen" (escalas) del mensaje justo ahí, en la habitación.
  4. El plegado mágico: Una vez construida la herramienta de limpieza, esta se pliega en el marco de la puerta de la habitación (los pesos de RMSNorm). Esto significa que cuando el mensaje real viaje más tarde, la limpieza ocurrirá automáticamente, con cero pérdida de tiempo o velocidad adicional.

Los resultados: Una mejora masiva

El equipo probó esto en tres modelos de IA famosos: LLaMA-3-8B, Qwen-2.5-7B y Mistral-7B.

  • La forma antigua: Cuando intentaron encoger LLaMA-3-8B a 3 bits usando el método estándar (RTN), el mensaje se volvió casi ininteligible, con una puntuación (Perplexity) saltando de 5.83 a 14.09. Esa es una caída enorme en la calidad.
  • La forma de RDQ: Usando su nuevo método de "recorrido", lograron bajar la puntuación a 7.55. ¡Eso es una mejora del 46.4% sobre el método antiguo!
  • A 4 bits: También obtuvieron los mejores resultados jamás registrados, superando a los campeones anteriores por un amplio margen (por ejemplo, 5.62 frente a 6.92 para LLaMA).

Qué significa esto

Los autores son muy claros: esto no es solo una mejor herramienta; es una nueva forma de ver el problema. Demostraron que la "deriva" es la razón principal por la que estos modelos fallan en anchos de bits bajos. También demostraron que la vieja idea de "limpiar cada habitación de forma independiente" es un callejón sin salida porque ignora la bola de nieve de ruido proveniente de las habitaciones anteriores.

Aunque todavía no pueden solucionar el problema para la compresión de 2 bits (el ruido es demasiado fuerte allí), han demostrado que para la compresión de 3 bits y 4 bits, podemos mantener los modelos inteligentes y rápidos. ¿Lo mejor de todo? Este nuevo método funciona con las herramientas estándar que los ingenieros ya utilizan, por lo que puede implementarse en teléfonos y computadoras ahora mismo sin necesidad de hardware especial o lento.

En resumen: el túnel se estaba ensuciando porque estábamos limpiando las habitaciones en el orden incorrecto. Al limpiarlas en el orden en que el mensaje realmente viaja, podemos mantener la señal clara hasta el final.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →