← Últimos artículos
🤖 machine learning

TORQ: Two-Level Orthogonal Rotation for MXFP4 Quantization

Este artículo presenta TORQ, un marco de cuantización post-entrenamiento sin entrenamiento que emplea rotaciones ortogonales de dos niveles para abordar teóricamente los desequilibrios estructurales en la cuantización de activaciones MXFP4, reduciendo así significativamente la brecha de precisión entre la inferencia de 4 bits y los modelos de precisión completa en modelos de lenguaje grandes.

Autores originales: Zukang Xu, Xing Hu, Dawei Yang

Publicado 2026-05-20
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Zukang Xu, Xing Hu, Dawei Yang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando empaquetar una biblioteca masiva y caótica de libros (las "activaciones" dentro de una IA inteligente) en cajas de envío pequeñas y uniformes (el formato "MXFP4") para que puedan enviarse de forma rápida y económica.

El artículo argumenta que simplemente meter estos libros en las cajas no funciona bien. Los libros son demasiado desordenados y las cajas tienen una forma muy específica y rígida. Esto causa dos problemas principales, que los autores denominan TORQ (Rotación Ortogonal de Dos Niveles).

Aquí se explica cómo el artículo describe el problema y su solución, utilizando analogías sencillas:

El Problema: Dos formas en que falla el empaquetado

1. El problema del "Vecino Ruidoso" (Desequilibrio de Varianza Inter-bloque)
Imagina que tu biblioteca está dividida en grupos de 32 libros. En el sistema actual, cada grupo recibe una sola "etiqueta de tamaño" (un factor de escala) para todo el grupo.

  • El Problema: En la mayoría de los grupos, los libros son pequeños y ligeros. Pero en unos pocos grupos, hay una enciclopedia gigante y pesada.
  • El Resultado: Debido a ese único libro pesado, la etiqueta para todo el grupo debe establecerse en "Extra Grande". Esto significa que todos los libros diminutos y ligeros en ese mismo grupo ahora se ven forzados a entrar en una caja gigante. Se aplastan, se pierden o se convierten en cero porque la caja es demasiado grande para contener sus pequeños detalles. Unos pocos grupos "ruidosos" arruinan la precisión para todos los demás.

2. El problema del "Estante Vacío" (Desequilibrio en la Utilización del Diccionario de Código Intra-bloque)
Las cajas de envío (MXFP4) vienen con una lista preimpresa de tamaños específicos que pueden contener (un "diccionario de código"). Estos tamaños están espaciados como los peldaños de una escalera: pequeño, mediano, grande, extra grande.

  • El Problema: Los datos reales de la IA son como una multitud de personas donde el 90% son muy bajas y solo el 10% son altas.
  • El Resultado: Casi todos los datos caen en los peldaños "pequeños" de la escalera. Los peldaños "medianos" y "grandes" permanecen completamente vacíos y sin usar. Es como tener un almacén lleno de cajas gigantes, pero solo estás usando las diminutas, mientras que las grandes acumulan polvo. Esto es un desperdicio masivo de espacio y potencial.

La Solución: TORQ (La Gran Reorganización)

En lugar de intentar forzar a los libros desordenados a que quepan en las cajas, los autores proponen rotar los libros antes de que sean empaquetados. Piénsalo como barajar una baraja de cartas para que las cartas pesadas y las ligeras estén mezcladas uniformemente, y las personas altas y las bajas estén distribuidas.

Lo hacen en dos pasos:

Paso 1: El Barajado Macro (Arreglando al "Vecino Ruidoso")

  • La Analogía: Imagina que tienes 100 grupos de libros. Algunos grupos son pesados, otros ligeros. Los autores utilizan un truco matemático (basado en el teorema de Schur-Horn) para intercambiar libros entre grupos.
  • El Objetivo: Mueven los libros "pesados" de los grupos pesados a los grupos ligeros, y viceversa.
  • El Resultado: Ahora, cada grupo individual tiene aproximadamente el mismo peso total. Ningún grupo está dominado por un solo libro gigante. Esto permite que la "etiqueta de tamaño" para cada grupo se establezca en un tamaño medio perfecto, preservando los detalles de los libros pequeños.

Paso 2: El Barajado Micro (Arreglando el "Estante Vacío")

  • La Analogía: Ahora que los grupos están equilibrados, mira dentro de un grupo. Los libros siguen agrupados en la sección "pequeña". Los autores rotan los libros dentro del grupo.
  • El Objetivo: Giran los libros para que se distribuyan uniformemente a lo largo de toda la escalera de tamaños. En lugar de que el 90% de los libros sean "pequeños", ahora están distribuidos de modo que algunos golpean los peldaños "medianos" y otros los peldaños "grandes".
  • El Resultado: Utilizan cada peldaño individual de la escalera. No se desperdicia espacio. El "diccionario de código" se utiliza completamente.

El Resultado

Al realizar esta rotación de dos pasos antes de que la IA sea comprimida (un proceso llamado Cuantización Post-Entrenamiento, lo que significa que no necesitan volver a enseñar a la IA), logran resultados increíbles:

  • Precisión: Lograron reducir la IA a una precisión de 4 bits (cajas diminutas) sin perder gran parte de su "poder cerebral". En las pruebas, su método (TORQ) fue mucho más inteligente que los métodos anteriores, obteniendo puntuaciones cercanas a la IA de tamaño completo y sin comprimir.
  • Velocidad y Tamaño: Debido a que las cajas son más pequeñas, la IA se ejecuta más rápido y ocupa menos memoria en dispositivos como teléfonos o servidores.
  • Sin Trabajo Extra: La "rotación" se calcula una vez y luego se integra en los pesos de la IA. Cuando la IA se ejecuta, no siente ninguna ralentización adicional; la rotación ocurre automáticamente como parte de las matemáticas.

En resumen: El artículo dice: "No intentes exprimir una multitud desordenada y desigual en una caja rígida. En su lugar, mezcla suavemente a la multitud para que todos estén distribuidos uniformemente, y luego mételos en la caja. Esto hace que la caja funcione perfectamente".

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →