F-WANDA: Fisher-Reweighted Post-Training Pruning for Sustainable Deployment of Large Language Models
F-WANDA is een energiezuinige, one-shot post-training pruning-methode die WANDA verbetert door het budget voor het behoud van neuronen te herverdelen op basis van empirische Fisher-informatie, waarmee superieure prestaties van taalmodellen wordt bereikt met aanzienlijk lagere computationele kosten dan SPARSEGPT.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een gigantische, ongelooflijk slimme robot hebt die verhalen kan schrijven, wiskundige problemen kan oplossen en kan chatten als een mens. Deze robot is een "Large Language Model" (LLM). Maar er is een addertje onder het gras: deze robot is enorm groot. Het draaien ervan vereist massieve computers en veel elektriciteit, een beetje zoals proberen een stad van stroom te voorzien met één enkele batterij. Wetenschappers zoeken altijd naar manieren om deze robots kleiner te maken, zodat ze op kleinere apparaten kunnen draaien zonder hun intelligentie te verliezen.
Een populaire manier om ze te verkleinen is "pruning" (snoeien). Denk aan de hersenen van de robot als een enorme bibliotheek van verbindingen tussen neuronen. Pruning is als het doorzoeken van die bibliotheek en het weggooien van de boeken die het minst belangrijk lijken. Het doel is om de bibliotheek klein genoeg te krijgen om in een rugzak te passen, maar nog steeds slim genoeg om vragen te beantwoorden. Echter, er is een lastige balans: als je per ongeluk te veel "belangrijke" boeken weggooit, begint de robot fouten te maken of klinkt hij robotachtig. Als je te voorzichtig probeert te zijn over welke boeken je bewaart, duurt het sorteren van de boeken eeuwig en verbruik je al je energie. Dit artikel gaat over precies dat probleem: hoe je de boeken snel, goedkoop en zonder de genialiteit van de robot te verliezen, kunt sorteren.
Het Probleem: De "One-Size-Fits-All" Fout
De onderzoekers begonnen door te kijken naar een populaire methode genaamd WANDA. Stel je voor dat WANDA een bibliothecaris is die beslist welke boeken weggegooid moeten worden. WANDA kijkt naar twee dingen: hoe "luid" een boek is (het gewicht) en hoe vaak het gelezen wordt (de input-activatie). Als een boek stil is en zelden gelezen wordt, gooit WANDA het weg.
Het probleem is dat WANDA een uniforme aanpak hanteert. Het behandelt elke plank in de bibliotheek precies hetzelfde. Het besluit: "Oké, ik gooi 50% van de boeken op elke plank weg." Maar hier is het probleem: sommige planken zitten vol met de meest cruciale feiten van de robot (zoals "Parijs is de hoofdstad van Frankrijk"), terwijl andere planken vol zitten met saai, repetitief materiaal. Door 50% van de boeken op de "Parijs"-plank weg te gooien, simpelweg omdat het een plank is, verwijdert WANDA per ongeluk de kennis van de robot.
Een andere methode, SPAREGPT, probeert supervoorzichtig te zijn. Het bekijkt elk afzonderlijk boek, berekent precies hoeveel pijn de robot zou doen als het verwijderd zou worden, en past de resterende boeken zorgvuldig aan om de schade te herstellen. Dit werkt geweldig om de robot slim te houden, maar het is alsof je een team van PhD's inhuurt om de bibliotheek te sorteren. Het kost een enorme hoeveelheid tijd en energie—zoveel dat het vaak niet de moeite waard is.
De Oplossing: F-WANDA (De Slimme Bibliothecaris)
De auteur van dit artikel introduceerde F-WANDA, een slimme upgrade van de standaardmethode. Ze realiseerden zich dat ze, in plaats van alleen te kijken naar hoe luid een boek is, ook moesten vragen: "Hoeveel geeft de robot om deze specifieke plank?"
Om dit te achterhalen, voert F-WANDA een extra snelle controle uit. Het stuurt de hersenen van de robot door een kleine test (een "backward pass") om te zien welke planken daadwerkelijk de antwoorden van de robot aansturen. Als een plank cruciaal is voor het krijgen van het juiste antwoord, vertoont de hersenen van de robot een sterk signaal (genaamd Fisher-informatie). Als een plank slechts ruis is, is het signaal zwak.
Hier zit de magische truc: F-WANDA gebruikt dit signaal om de regels aan te passen.
- Op de "Parijs"-plank (hoog signaal): De robot geeft veel om deze plank. F-WANDA zegt: "Gooi niet 50% van deze boeken weg! Gooi slechts 20% weg. We moeten de meeste van hen bewaren."
- Op de "Saai"-plank (laag signaal): De robot geeft er niet om. F-WANDA zegt: "Ga je gang, gooi 80% van deze boeken weg. We hebben ze niet nodig."
Op deze manier behoudt de robot zijn belangrijkste feiten veilig, terwijl hij nog steeds veel kleiner wordt. En het beste deel? F-WANDA hoeft de robot niet opnieuw te trainen of de gewichten bij te werken. Het voert gewoon één snelle controle uit en begint dan met het snoeien.
Wat Ze Hebben Gevonden
Het team heeft dit getest op LLAMA-2, een beroemde familie van grote taalmodellen (specifiek de versies met 7 miljard en 13 miljard parameters). Ze wilden zien of F-WANDA de concurrentie kon verslaan.
- Slimheid: Wanneer ze de modellen terugbrachten naar 50% ongestructureerde sparsity (wat betekent dat de helft van de verbindingen werd verwijderd), hield F-WANDA de robot veel slimmer dan de originele WANDA. Op een test genaamd MMLU (die algemene kennis meet), verbeterde F-WANDA de score met 1,6 procentpunt op het 7B-model en met 1,4 procentpunt op het 13B-model vergeleken met WANDA. Het versloeg zelfs de supervoorzichtige SPARSEGPT-methode.
- Vloeiendheid: De robot klonk nog steeds natuurlijk. Op een test genaamd WikiText-2 behaalde F-WANDA een perplexity-score van 6,85 voor het 7B-model, wat bijna identiek is aan de originele WANDA. Dit betekent dat de robot niet begon te klinken als een robot of verward raakte.
- Energie en Snelheid: Hier blinkt F-WANDA echt uit. De supervoorzichtige SPARSEGPT-methode kostte veel tijd en energie om het model te snoeien. F-WANDA was veel sneller en goedkoper. Sterker nog, F-WANDA gebruikte slechts één derde van de energie en tijd die SPARSEGPT gebruikte. Het duurde ongeveer 12 minuten om het 7B-model te snoeien op een krachtige H100 GPU, waarbij 4,3 kJ aan energie werd verbruikt, terwijl SPARSEGPT 35 minuten duurde en 12,6 kJ verbruikte.
De Afwegingen en Limieten
De auteur is voorzichtig om aan te geven dat F-WANDA niet voor elke situatie een toverstaf is.
- Hardware-regels: Als de computerchip een strikt patroon vereist voor het behouden en verwijderen van verbindingen (zoals het behouden van precies 2 van de 4 verbindingen in een blok), kan F-Wണ്ട niet zijn slimme budgettering toepassen. In die specifieke gevallen gedraagt het zich als de originele WANDA.
- Geheugen: Omdat F-WANDA die ene extra controle uitvoert, heeft het iets meer computergeheugen nodig (ongeveer het dubbele van wat WANDA nodig heeft) terwijl het werkt. Voor zeer grote modellen (zoals 70 miljard parameters) kan dit speciale trucs vereisen om in het geheugen te passen.
- Generalisatie: Ze hebben dit alleen getest op de LLAMA-2 familie. Ze weten nog niet zeker of het precies hetzelfde werkt op andere soorten robotbreinen (zoals LLaMA-3 of Mistral), hoewel ze vermoeden dat dit wel zo zal zijn.
Waarom Dit Belangrijk Is
De belangrijkste les is dat F-WANDA op de "Pareto-front" ligt. Dat is een chique manier om te zeggen dat het de best mogelijke deal is die je kunt krijgen: je krijgt de hoogste kwaliteit (slimste robot) voor de laagste kosten (minste energie en tijd).
Door simpelweg één snelle controle toe te voegen om te zien welke delen van de hersenen daadwerkelijk hard werken, hebben de onderzoekers een enorme hoeveelheid energie bespaard terwijl ze de robot slimmer maakten. Het is een herinnering dat je soms niet de hele bibliotheek hoeft te herbouwen om het beter te maken; je moet alleen slimmer zijn over welke boeken je weggooit. Dit maakt het veel gemakkelijker en goedkoper om deze krachtige AI-modellen in de echte wereld te gebruiken, wat helpt om AI duurzamer te maken voor iedereen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.