Generalized Fisher-Weighted SVD: Scalable Kronecker-Factored Fisher Approximation for Compressing Large Language Models
Dit artikel stelt Generalized Fisher-Weighted SVD (GFWSVD) voor, een schaalbare post-training compressiemethode voor grote taalmodellen die gebruikmaakt van een Kronecker-gefactoreerde benadering van de volledige Fisher-informatie-matrix om parametercorrelaties te vangen en bestaande op diagonalen gebaseerde compressietechnieken significant te overtreffen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een enorme, complexe bibliotheek probeert te verkleinen zodat deze in een rugzak past, zonder de verhalen binnenin te verliezen. Dit is de dagelijkse uitdaging voor wetenschappers die werken op het gebied van kunstmatige intelligentie, specifiek met "neurale netwerken" — computerprogramma's die ontworpen zijn om te leren als hersenen. Deze programma's zijn gebouwd uit miljoenen kleine schakelaars genaamd "parameters". Om deze programma's sneller te laten draaien en op kleinere apparaten te laten werken, proberen onderzoekers de schakelaars weg te snijden die niet veel werk verrichten. Maar hier komt het lastige gedeelte bij: de schakelaars werken niet alleen. Ze zijn als een complexe dansgroep; als je één danser eruit trekt, kan de hele routine instorten omdat die danser de handen vasthield van iemand anders.
Jarenlang was de standaardmanier om te beslissen welke dansers eruit moesten, door naar elke danser individueel te kijken, waarbij de hand-in-hand-act werd genegeerd. Het was alsof je controleerde of een danser moe was zonder op te merken dat hij een partner ondersteunde. Deze methode was snel, maar het verpestte vaak de uitvoering. Dit paper dat je nu gaat lezen, pakt dit probleem aan door een nieuwe manier te introduceren om de "dans" van de parameters te zien. Het gebruikt een wiskundig hulpmiddel genaamd de "Fisher Information Matrix", die fungeert als een kaart die laat zien hoe elke schakelaar met elke andere schakelaar verbonden is. Het doel is om de bibliotheek (het AI-model) te verkleinen (de "shrink") terwijl de verhalen (de intelligentie) perfect intact blijven.
Het Grote Idee: De Hele Dans Zien, Niet Alleen de Dansers
De auteurs van dit paper, Viktoriia Chekalina en haar team, realiseerden zich dat de oude kaarten te wazig waren. Ze wilden een kaart die niet alleen liet zien welke dansers belangrijk waren, maar ook hoe ze aan elkaar verbonden waren. Om dit te doen, hebben ze een nieuw algoritme uitgevonden genaamd Matrix-free Fisher Factorization (MFF).
Beschouw de Fisher Information Matrix als een gigantische, dichte mist die de hele dansvloer bedekt. In het verleden was het proberen door deze mist heen te kijken om de verbindingen te vinden onmogelijk, omdat de mist te dik was en de dansvloer te groot. De oude methoden gingen ervan uit dat de verbindingen simpel waren (zoals een rechte lijn), waardoor de complexe krommingen van de echte dans werden gemist.
De truc van het team, MFF, is als het hebben van een speciale bril waarmee je de structuur van de mist kunt zien zonder de hele mist ooit weg te hoeven blazen. In plaats van te proberen elke enkele verbinding op te schrijven (wat te veel geheugen zou kosten), berekent hun algoritme de verbindingen on the fly, waarbij het zich alleen richt op de specifiekiem specifieke "lagen" van de dans. Het is een "matrix-free" benadering, wat betekent dat het de gigantische, zware kaart nooit daadwerkelijk opbouwt; het gebruikt alleen de vorm van de kaart om de snijwerkzaamheden te begeleiden.
De Oplossing: Een Nieuwe Manier om het Model te Verkleinen
Met behulp van deze nieuwe manier om verbindingen te zien, heeft het team een methode ontwikkend genaamd GFWSVD (Generalized Fisher-Weighted SVD). Als je het AI-model als een blok klei voor je ziet, zouden standaardmethoden misschien alleen de randen eraf snijden. GFWSVD begrijpt echter de interne nerf van de klei. Het weet dat sommige delen van de klei nauw met elkaar verweven zijn en op een specifieke manier gesneden moeten worden om de vorm te behouden.
Het paper bewijst dat onder bepaalde wiskundige omstandigheden (specifiek, als de verbindingen een patroon volgen dat een "Matrix-Variate Normal distribution" wordt genoemd), hun methode de unieke, optimale manier is om het model te verkleinen. Het is niet zomaar een gok; het is de wiskundig perfecte manier om de schade aan de prestaties van het model te minimaliseren wanneer je parameters verwijdert.
Wat Ze Vonden: Het Halveren van het Model
Het team heeft hun nieuwe methode getest op enkele van de meest beroemde AI-modellen van nu, waaronder Llama 2 en Llama 3.1, die enorme taalmodellen zijn die worden gebruikt voor alles van het schrijven van code tot chatten. Ze testten het ook op BERT, een model dat wordt gebruikt voor het begrijpen van tekst.
Dit is wat ze ontdekten:
- De Compressiekracht: Ze waren in staat om deze gigantische modellen met wel 50% te verkleinen. Dat betekent het halveren van het aantal parameters.
- De Prestaties: Zelfs met de helft van de omvang presteerden de modellen even goed als, of soms zelfs beter dan, de originele versies. In veel tests versloeg GFWSVD de huidige beste methoden (zoals diagonale benaderingen en activatie-gebaseerde methoden) over de hele linie.
- Het Voorkomen van de Instorting: Wanneer ze probeerden de modellen met 40% te comprimeren, begonnen standaardmethoden te falen, wat ervoor zorgde dat de AI het vermogen verloor om te redeneren of vragen correct te beantwoorden. GFWSVD bleef echter robuust en betrouwbaar.
- De Snelheid: Omdat de modellen kleiner zijn, draaien ze sneller. Op een krachtige computerchip (een NVIDIA A100) verwerkten de gecomprimeerde modellen tekst 1,34 keer sneller dan de originele, ongecomprimeerde modellen.
Waarom Dit Ertoe Doet
De auteurs hebben aangetoond dat door aandacht te besteden aan de verborgen verbindingen tussen parameters (de off-diagonal elementen), je AI-modellen veel agressiever kunt verkleinen zonder ze kapot te maken. Ze bewezen dat het negeren van deze verbindingen, zoals de meeste andere methoden doen, veel potentieel aan prestaties onbenut laat.
Ze lieten ook zien dat deze methode werkt als een uitstekende "starter" voor andere trainingsprocessen. Als je eerst GFWSVD gebruikt om een model te verkleinen en het model vervolgens nog een beetje meer laat leren (fine-tuning), behoudt het zijn nauwkeurigheid veel beter dan wanneer je standaard inkrimingsmethoden zou gebruiken.
Kortom, dit paper biedt een nieuwe, wiskundig onderbouwde "schaar" om de enorme AI-modellen terug te brengen naar de kern. Het stelt ons in staat om de intelligentie te behouden terwijl we de bulk weggooien, waardoor krachtige AI toegankelijk wordt op kleinere apparaten en goedkoper te draaien is, zonder de magie van het originele model te verliezen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.