An Empirical Study of OpenPangu Quantization on Ascend NPUs
Cet article présente une étude empirique évaluant diverses méthodes de quantification post-entraînement pour les modèles OpenPangu 1B et 7B sur des NPU Huawei Ascend 910B1, révélant que la quantification en 8 bits est effectivement sans perte tandis que le 4 bits ne reste pratique que pour le modèle le plus large, et que les réglages de précision ultra-basse échouent largement.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous avez deux robots très intelligents, un petit (le modèle 1B) et un grand (le modèle 7B). Ces robots sont comme des bibliothécaires brillants qui savent lire, écrire et résoudre des problèmes. Cependant, ils portent actuellement des manteaux lourds et volumineux (le format original « FP16 ») qui prennent beaucoup de place dans votre sac à dos. Vous voulez réduire la taille de ces manteaux pour pouvoir les transporter sur un type d'équipement de randonnée spécifique appelé Ascend NPU (une puce spéciale fabriquée par Huawei), mais vous craignez que si vous réduisez trop leurs manteaux, les robots oublient comment réfléchir.
Ce document est un « test de résistance » pour voir jusqu'à quel point nous pouvons réduire la taille de ces manteaux de robots avant qu'ils ne cessent de fonctionner correctement. Les chercheurs ont essayé différentes façons de compresser les données, allant d'une légère réduction à une diminution drastique.
Voici ce qu'ils ont trouvé, expliqué par des analogies simples :
1. La « Taille Légère » (Quantification 8-bits)
Le Résultat : Si vous réduisez les manteaux juste un peu (jusqu'à 8 bits), les robots sont indiscernables de leurs versions originales aux manteaux lourds.
- L'Analogie : C'est comme prendre un manteau d'hiver lourd et retirer la doublure supplémentaire. Il est plus léger et plus facile à porter, mais le robot semble exactement le même et peut résoudre des problèmes de mathématiques, écrire du code et raconter des blagues tout aussi bien qu'avant.
- Verdict : C'est le choix le plus sûr. Si vous voulez gagner de l'espace sans perdre d'intelligence, faites cela.
2. Le « Rétrécissement Drastique » (Quantification 4-bits)
Le Résultat : C'est ici que la taille du robot importe.
- Le Grand Robot (7B) : Lorsque vous réduisez le manteau du grand robot à 4 bits, il fonctionne encore plutôt bien. Il peut encore faire la plupart des choses, bien qu'il puisse trébucher un peu sur des puzzles de mathématiques ou de codage très difficiles.
- Le Petit Robot (1B) : Lorsque vous essayez de réduire le manteau du petit robot à 4 bits, il commence à perdre la tête. Il se confond sur les tâches de raisonnement, les mathématiques et le codage.
- L'Analogie : Imaginez que le grand robot est un adulte fort qui peut encore courir un marathon même si vous lui retirez ses bottes lourdes. Le petit robot est un enfant ; si vous lui retirez ses bottes lourdes, il ne peut même pas traverser la pièce sans trébucher.
- Verdict : Pour le grand robot, 4 bits, c'est acceptable. Pour le petit robot, 4 bits est trop risqué pour des tâches sérieuses.
3. La « Compression Extrême » (2-bits et Binaire)
Le Résultat : Lorsque les chercheurs ont essayé de réduire les manteaux à 2 bits ou même à 1 bit (binaire), les robots se sont complètement cassés.
- L'Analogie : C'est comme essayer de faire tenir une encyclopédie complète dans un simple post-it. Les robots ont commencé à répondre au hasard. Leurs réponses sont devenues des absurdités, et leur « perplexité » (un score pour mesurer leur confusion) est devenue infinie.
- Verdict : Ne faites pas cela. Les robots sont effectivement inutilisables à ce niveau de compression.
4. Les « Emballages Spéciaux » (Différentes Méthodes)
Les chercheurs ont essayé différentes « techniques » pour réduire la taille des manteaux, comme AWQ, GPTQ et SmoothQuant.
- AWQ était comme un tailleur qui savait exactement où couper le tissu pour garder la forme parfaite. Cela a le mieux fonctionné, surtout pour le grand robot à 4 bits.
- SmoothQuant a essayé de réduire à la fois le manteau et le système nerveux interne du robot (les activations). Bien que cela ait fonctionné correctement à 8 bits, lorsqu'ils ont essayé de réduire à 4 bits, le système nerveux du robot a court-circuité, provoquant un plantage (erreurs non-finies).
- Verdict : Certaines méthodes de rétrécissement sont plus intelligentes que d'autres. AWQ est le meilleur tailleur pour ce travail, mais réduire le système nerveux interne (les activations) est actuellement trop dangereux.
5. La « Granularité » (Comment vous coupez le tissu)
Le document a également examiné comment ils coupaient le tissu. Ils ont découvert que couper le tissu en petits morceaux spécifiques (per-group) fonctionnait mieux que de le couper en une longue bande (per-channel).
- L'Analogie : Imaginez que vous réparez un patchwork. Si vous réparez tout le patchwork avec une seule grande pièce de tissu, cela aura l'air bizarre et ne conviendra pas bien. Si vous coupez le tissu en petits carrés qui s'adaptent à chaque patch spécifique, votre patchwork sera parfait.
- Verdict : Utilisez toujours la méthode des « petits patchs » (per-group) si votre matériel le permet. Cela permet de garder le robot plus intelligent.
Résumé pour le Randonneur
Si vous préparez votre équipement Ascend NPU :
- Choix Sûr : Réduisez le manteau à 8 bits. Le robot reste intelligent et vous gagnez de l'espace.
- Choix Risqué : Réduisez à 4 bits uniquement si vous avez le Grand Robot (7B) et que vous utilisez la méthode AWQ. Évitez cela pour le Petit Robot (1B) si vous avez besoin qu'il fasse des mathématiques ou du codage.
- À Éviter : N'essayez pas de réduire à 2 bits ou 1 bit. Le robot cessera de fonctionner.
- Avertissement : N'essayez pas de réduire le système nerveux interne du robot (les activations) pour le moment ; cela provoque des plantages.
Le document conclut que bien que nous puissions rendre ces robots plus petits et plus portables, il existe une limite stricante. Nous ne pouvons pas simplement continuer à les rétrécir indéfiniment sans briser leur cerveau.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.