An Empirical Study of OpenPangu Quantization on Ascend NPUs
Este artículo presenta un estudio empírico que evalúa diversos métodos de cuantificación post-entrenamiento para los modelos OpenPangu 1B y 7B en NPUs Huawei Ascend 910B1, revelando que la cuantificación de 8 bits es efectivamente sin pérdida mientras que la de 4 bits sigue siendo práctica solo para el modelo más grande, y que las configuraciones de precisión ultra baja fallan en gran medida.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que tienes dos robots muy inteligentes, uno pequeño (el modelo 1B) y uno grande (el modelo 7B). Estos robots son como bibliotecarios brillantes que pueden leer, escribir y resolver problemas. Sin embargo, actualmente llevan puestos abrigos pesados y voluminosos (el formato original "FP16") que ocupan mucho espacio en tu mochila. Quieres encoger estos abrigos para poder llevarlos en un equipo de senderismo específico llamado Ascend NPU (un chip especial hecho por Huawei), pero te preocupa que, si encoges demasiado los abrigos, los robots olviden cómo pensar.
Este artículo es una "prueba de esfuerzo" para ver cuánto podemos encoger estos abrigos de los robots antes de que dejen de funcionar correctamente. Los investigadores probaron diferentes formas de comprimir los datos, que iban desde un ligero recorte hasta una reducción drástica.
Aquí está lo que encontraron, explicado mediante analogías sencillas:
1. El "Recorte Ligero" (Cuantización de 8 bits)
El Resultado: Si recortas los abrigos solo un poco (hasta 8 bits), los robots son indistinguibles de sus versiones originales con abrigos pesados.
- La Analogía: Es como tomar un abrigo de invierno pesado y quitarle el forro extra. Es más ligero y fácil de llevar, pero el robot se siente exactamente igual y puede resolver problemas matemáticos, escribir código y contar chistes tan bien como antes.
- Veredicto: Esta es la apuesta más segura. Si quieres ahorrar espacio sin perder inteligencia, haz esto.
2. El "Encogimiento Drástico" (Cuantización de 4 bits)
El Resultado: Aquí es donde el tamaño del robot importa.
- El Robot Grande (7B): Cuando encoges el abrigo del robot grande a 4 bits, todavía funciona bastante bien. Todamente puede hacer la mayoría de las cosas, aunque podría tropezar un poco en acertijos de matemáticas o programación muy difíciles.
- El Robot Pequeño (1B): Cuando intentas encoger el abrigo del robot pequeño a 4 bits, este empieza a perder la cabeza. Se confunde en tareas de razonamiento, matemáticas y programación.
- La Analogía: Imagina que el robot grande es un adulto fuerte que aún puede correr un maratón incluso si le quitas las botas pesadas. El robot pequeño es un niño; si le quitas sus botas pesadas, ni siquiera puede caminar por la habitación sin tropezar.
- Veredicto: Para el robot grande, 4 bits está bien. Para el robot pequeño, 4 bits es demasiado arriesgado para tareas serias.
3. La "Compresión Extrema" (2 bits y Binaria)
El Resultado: Cuando los investigadores intentaron encoger los abrigos a 2 bits o incluso a 1 bit (binaria), los robots se rompieron por completo.
- La Analogía: Esto es como intentar meter una enciclopedia completa en una sola nota adhesiva (post-it). Los robots empezaron a adivinar al azar. Sus respuestas se convirtieron en disparates, y su "perplejidad" (una puntuación de qué tan confundidos están) se disparó, volviéndose esencialmente infinita.
- Veredicto: No hagas esto. Los robots son efectivamente inútiles en este nivel de compresión.
4. Los "Envoltorios Especiales para Encoger" (Diferentes Métodos)
Los investigadores probaron diferentes "técnicas" para encoger los abrigos, como AWQ, GPTQ y SmoothQuant.
- AWQ era como un sastre que sabía exactamente dónde cortar la tela para mantener la forma perfecta. Funcionó mejor, especialmente para el robot grande a 4 bits.
- SmoothQuant intentó encoger tanto el abrigo como el sistema nervioso interno del robot (activaciones). Aunque funcionó bien a 8 bits, cuando intentaron encogerlo a 4 bits, el sistema nervioso del robot sufrió un cortocircuito, causando que colapsara (errores de valores no finitos).
- Veredicto: Algunos métodos de encogimiento son más inteligentes que otros. AWQ es el mejor sastre para este trabajo, pero encoger el sistema nervioso interno (activaciones) es actualmente demasiado peligroso.
5. La "Granularidad" (Cómo cortas la tela)
El artículo también analizó cómo cortaban la tela. Encontraron que cortar la tela en parches pequeños y específicos (per-group) funcionaba mejor que cortarla en una tira larga (per-channel).
- La Analogía: Imagina parchar una colcha. Si parcheas toda la colcha con una sola pieza gigante de tela, se ve rara y no encaja bien. Si cortas la tela en cuadrados pequeños que encajen con cada parche específico, la colcha queda perfecta.
- Veredicto: Utiliza siempre el método de "parches pequeños" (per-group) si tu hardware lo permite. Esto mantiene al robot más inteligente.
Resumen para el Senderista
Si estás preparando tu equipo de Ascend NPU:
- Opción Segura: Encoge el abrigo a 8 bits. El robot mantiene su inteligencia y ahorras espacio.
- Opción Arriesgada: Encoge a 4 bits solo si tienes el Robot Grande (7B) y usas el método AWQ. Evita esto para el Robot Pequeño (1B) si necesitas que haga matemáticas o programación.
- Evitar: No intentes encoger a 2 bits o 1 bit. El robot dejará de funcionar.
- Advertencia: No intentes encoger el sistema nervioso interno del robot (activaciones) todavía; eso provoca fallos.
El artículo concluye que, si bien podemos hacer que estos robots sean más pequeños y portátiles, hay un límite duro. No podemos simplemente seguir encogiéndolos para siempre sin romper sus cerebros.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.