← Últimos artículos
🤖 AI

FOCUS: FP4 Optimization via Coupled-Relaxation and Dual-Granularity Scaling

Este artículo presenta FOCUS, un marco de cuantización de post-entrenamiento que mejora la precisión de FP4 para modelos de lenguaje extensos mediante el empleo de Escalamiento de Relajación Acoplada para desacoplar las escalas de cuantificación aprendibles de las restricciones de hardware y Escalamiento de Doble Granularidad para una adaptación de pesos más fina, logrando un rendimiento de vanguardia sin sobrecarga adicional de inferencia.

Autores originales: Xianglong Yan, Hong Liu, Chengzhu Bao, Tianao Zhang, Guanghua Yu, Jianchen Zhu, Yulun Zhang

Publicado 2026-08-04
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Xianglong Yan, Hong Liu, Chengzhu Bao, Tianao Zhang, Guanghua Yu, Jianchen Zhu, Yulun Zhang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando meter una biblioteca de conocimiento masiva e intrincada en una mochila pequeña y portátil. Este es el lucha diaria de los "Modelos de Lenguaje de Gran Tamaño" (LLM, por sus siglas en inglés), los cerebros informáticos superinteligentes que pueden escribir historias, resolver problemas matemáticos y charlar como humanos. El problema es que estos cerebros son tan enormes que necesitan cantidades enormes de memoria y potencia para funcionar, lo que los hace costosos y lentos de usar en dispositivos cotidianos. Para solucionar esto, los científicos utilizan un truco llamado "cuantización". Piensa en esto como traducir una película de alta definición, en 4K, a un formato de menor resolución para que quepa en un teléfono viejo. El objetivo es reducir los datos sin perder la trama. Recientemente, ha surgido un formato nuevo y superpequeño llamado "FP4", compatible con chips informáticos modernos, que promete encoger estos modelos aún más. Sin embargo, hay un inconveniente: comprimir los datos de forma tan pequeña a menudo hace que el modelo "olvide" cosas o se confunda, perdiendo precisión. La gran pregunta es: ¿cómo encogemos el modelo a este tamaño diminuto sin arruinar su inteligencia?

Este artículo presenta un nuevo y astuto método llamado FOCUS para resolver exactamente ese problema. Los investigadores se dieron cuenta de que la forma actual de encoger estos modelos era demasiado rígida. Imagina que estás empacando una maleta. La regla estándar dice: "Debes usar exactamente las mismas cajas pequeñas y prefabricadas para empacar tu ropa, y debes usar esas mismas cajas para desempacarla más tarde". El artículo argumenta que esto es una tontería. Si bien necesitas usar las cajas pequeñas para guardar la ropa (porque eso es lo que cabe en la maleta), no necesitas usar esas mismas cajas pequeñas para descubrir cómo doblar la ropa en primer lugar. Podrías usar una cinta métrica gigante y flexible para planificar el empaque, y luego simplemente ajustar el resultado en las cajas pequeñas.

FOCUS utiliza esta idea para mejorar la forma en que se preparan los modelos para el diminuto formato FP4. Introduce dos trucos principales:

  1. Escalamiento de Relajación Acoplada (CRS): Esta es la "cinta métrica flexible". En la forma antigua, la computadora tenía que usar una regla muy tosca y de baja precisión para decidir cómo encoger los números, y tenía que usar esa misma regla tosca para volver a armarlos. FOCUS dice: "Usemos una regla súper precisa y de tamaño completo para hacer las matemáticas del encogimiento, y luego comprimimos el resultado en la caja tosca". Esto permite que la computadora encuentre una mejor manera de empacar los datos sin romper las reglas del formato diminuto.
  2. Escalamiento de Doble Granularidad (DGS): Esto trata sobre empacar artículos más pequeños. El método antiguo trataba a un grupo entero de 32 números como un solo bloque grande, usando una sola regla para todos ellos. Pero, ¿qué pasa si algunos números en ese grupo son enormes y otros son diminutos? FOCUS divide ese grupo grande en subgrupos más pequeños (como cortar una pizza grande en rebanadas) y le da a cada rebanada su propia regla personalizada. Esto permite que la computadora se adapte a los detalles específicos de los datos, en lugar de forzar todo en una caja de talla única.

Los resultados son impresionantes. Cuando los investigadores probaron FOCUS en varios modelos de IA diferentes (como Qwen y LLaMA), superó consistentemente a todos los demás métodos. Por ejemplo, en un modelo llamado Qwen3-4B, FOCUS logró recuperar el 98.2% de la precisión del modelo original al usar el formato NVFP4, y un 96.2% con MXFP4. Este es un salto significativo comparado con técnicas anteriores, que a menudo luchaban por mantenerse por encima del 90% o 94%.

Crucialmente, el artículo muestra que FOCUS no hace que el modelo sea más lento o difícil de usar. Incluso aunque la computadora realiza matemáticas adicionales mientras prepara el modelo (durante la fase de "entrenamiento" o "calibración"), el modelo final se ejecuta tan rápido como cualquier otro modelo FP4. Toma aproximadamente 19 minutos preparar un modelo Qwen3-4B en una sola GPU de alto nivel, lo cual es de hecho más rápido que algunos métodos competidores. Los investigadores enfatizan que este es un método de "post-entrenamiento", lo que significa que no necesitan reenseñar al modelo desde cero; solo ajustan las instrucciones de empaque.

En resumen, FOCUS sugiere que al relajar las reglas sobre cómo calculamos el encogimiento (mientras mantenemos estricto el formato de almacenamiento final), podemos meter estos gigantescos cerebros de IA en espacios diminutos sin perder su inteligencia. Es un poco como darse cuenta de que puedes doblar una camisa perfectamente usando una mesa grande, incluso si solo tienes un cajón pequeño para guardarla. El artículo demuestra que este enfoque funciona mejor que las formas antiguas y rígidas, ofreciendo un camino para ejecutar IA poderosa en dispositivos que actualmente no pueden manejarla.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →