An Empirical Study of OpenPangu Quantization on Ascend NPUs
Dit artikel presenteert een empirische studie die diverse post-training kwantisatiemethoden evalueert voor de OpenPangu 1B en 7B modellen op Huawei Ascend 910B1 NPU's, waarbij wordt onthuld dat 8-bit kwantisatie effectief verliesloos is terwijl 4-bit alleen praktisch blijft voor het grotere model, en ultra-lage precisie-instellingen grotendeels falen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je twee zeer slimme robots hebt, een kleine (het 1B-model) en een grote (het 7B-model). Deze robots zijn als briljante bibliothecarissen die kunnen lezen, schrijven en problemen oplossen. Echter, ze dragen momenteel zware, dikke jassen (het oorspronkelijke "FP16"-formaat) die veel ruimte innemen in je rugzak. Je wilt deze jassen verkleinen zodat je ze kunt meenemen op een specifieke soort wandeluitrusting genaamd een Ascend NPU (een speciale chip gemaakt door Huawei), maar je maakt je zorgen dat als je de jassen te veel krimpt, de robots kunnen vergeten hoe ze moeten denken.
Dit paper is een "stress test" om te zien hoeveel we deze robotjassen kunnen verkleinen voordat ze niet meer goed functioneren. De onderzoekers probeerden verschillende manieren om de gegevens te comprimeren, variërend van een lichte inkorting tot een drastische reductie.
Dit is wat ze vonden, uitgelegd aan de hand van eenvoudige analogieën:
1. De "Lichte Inkorting" (8-bit Kwantisatie)
Het resultaat: Als je de jassen slechts een beetje inkort (naar 8 bits), zijn de robots niet te onderscheiden van hun oorspronkelijke versies met de zware jassen.
- De analogie: Het is alsof je een zware winterjas neemt en de extra voering verwijdert. Het is lichter en makkelijker te dragen, maar de robot voelt nog precies hetzelfde aan en kan even goed wiskundige problemen oplossen, code schrijven en grappen vertellen als voorheen.
- Oordeel: Dit is de veiligste keuze. Als je ruimte wilt besparen zonder slimheid te verliezen, doe dit dan.
2. De "Drastische Krimp" (4-bit Kwantisatie)
Het resultaat: Hierbij maakt de grootte van de robot uit.
- De Grote Robot (7B): Wanneer je de jas van de grote robot naar 4 bits krimpt, werkt hij nog steeds redelijk goed. Hij kan nog steeds de meeste dingen, hoewel hij misschien wat struikelt bij zeer moeilijke wiskunde- of programmeerpuzzels.
- De Kleine Robot (1B): Wanneer je probeert de jas van de kleine robot naar 4 bits te krimpen, begint hij zijn verstand te verliezen. Hij raakt in de war bij redeneertaken, wiskunde en programmeren.
- De analogie: Stel je voor dat de grote robot een sterke volwassene is die nog steeds een marathon kan lopen, zelfs als je zijn zware laarzen afneemt. De kleine robot is een kind; als je de zware laarzen van het kind afneemt, kan het zelfs niet eens de kamer doorlopen zonder te struikelen.
- Oordeel: Voor de grote robot is 4 bits oké. Voor de kleine robot is 4 bits te riskant voor serieuze taken.
3. De "Extreme Compressie" (2-bit en Binair)
Het resultaat: Toen de onderzoekers probeerden de jassen terug te brengen naar 2 bits of zelfs 1 bit (binair), gingen de robots volledig kapot.
- De analogie: Dit is alsof je probeert een volledige encyclopedie in een enkel plakz sticky note te passen. De robots begonnen willekeurig te gokken. Hun antwoorden werden onzin, en hun "perplexity" (een score voor hoe in de war ze zijn) schoot de hoogte in, wat in feite oneindig werd.
- Oordeel: Doe dit niet. De robots zijn op dit niveau van compressie effectief nutteloos.
4. De "Speciale Inpakfolies" (Verschillende Methoden)
De onderzoekers probeerden verschillende "technieken" om de jassen te verkleinen, zoals AWQ, GPTQ en SmoothQuant.
- AWQ was als een kleermaker die precies wist waar hij de stof moest snijden om de vorm perfect te houden. Het werkte het beste, vooral voor de grote robot bij 4 bits.
- SmoothQuant probeerde zowel de jas als het interne zenuwstelsel van de robot (activaties) te verkleinen. Hoewel het redelijk werkte bij 8 bits, zorgde het wanneer ze probeerden het naar 4 bits te verkleinen, ervoor dat het zenuwstelsel van de robot kortsluiting maakte, wat leidde tot crashes (non-finite errors).
- Oordeel: Sommige inkrimpingmethoden zijn slimmer dan andere. AWQ is de beste kleermaker voor deze klus, maar het verkleinen van het interne zenuwstelsel (activaties) is momenteel te gevaarlijk.
5. De "Granulariteit" (Hoe je de stof snijdt)
Het paper keek ook naar hoe ze de stof sneden. Ze ontdekten dat het snijden van de stof in kleine, specifieke stukjes (per-group) beter werkte dan het snijden in één lange strook (per-channel).
- De analogie: Stel je voor dat je een patchworkdeken maakt. Als je de hele deken met één groot stuk stof plakt, ziet het er vreemd uit en past het niet goed. Als je de stof in kleine vierkantjes snijdt die bij elk specifiek lapje passen, ziet de deken er perfect uit.
- Oordeel: Gebruik altijd de "kleine stukjes"-methode (per-group) als je hardware dit ondersteunt. Het houdt de robot slimmer.
Samenvatting voor de Wandelaar
Als je je Ascend NPU-uitrusting inpakt:
- Veilige Keuze: Verklein de jas naar 8 bits. De robot blijft slim en je bespaart ruimte.
- Risicovolle Keuze: Verklein naar 4 bits alleen als je de Grote Robot (7B) hebt en je de AWQ-methode gebruikt. Vermijd dit voor de Kleine Robot (1B) als je hem nodig hebt voor wiskunde of programmeren.
- Vermijden: Probeer niet te verkleinen naar 2 bits of 1 bit. De robot zal stoppen met werken.
- Waarschuwing: Probeer het interne zenuwstelsel van de robot (activaties) nog niet te verkleinen; dit veroorzaakt crashes.
Het paper concludeert dat hoewel we deze robots kleiner en draagbaarder kunnen maken, er een harde grens is. We kunnen ze niet eeuwig blijven verkleinen zonder hun hersenen te breken.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.