DarwinLM: Evolutionary Structured Pruning of Large Language Models
DarwinLM is een tijdens de training bewuste gestructureerde pruning-methode die een evolutionair zoekproces met lichtgewicht meerstaps-training gebruikt om optimale niet-uniforme modelsubstructuren te identificeren, waarbij het een state-of-the-art prestatie bereikt op diverse grote taalmodellen terwijl de vereisten voor trainingsdata na compressie aanzienlijk worden verminderd.
Oorspronkelijke auteurs:Shengkun Tang, Oliver Sieberling, Eldar Kurtic, Zhiqiang Shen, Dan Alistarh
Oorspronkelijke auteurs: Shengkun Tang, Oliver Sieberling, Eldar Kurtic, Zhiqiang Shen, Dan Alistarh
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een gigantisch, superintelligent robotbrein hebt dat verhalen kan schrijven, wiskundige problemen kan oplossen en kan chatten als een mens. Dit is wat wetenschappers een Large Language Model (LLM) noemen. Deze breinen zijn geweldig, maar ze zijn ook ongelooflijk zwaar en hongerig naar elektriciteit, zoals een draak die een hele kasteelwijdte aan goud nodig heeft om alleen al wakker te worden. Omdat ze zo groot zijn, zijn ze moeilijk mee te nemen of te draaien op gewone computers. Om dit op te lossen, proberen onderzoekers deze breinen te "verkleinen". Een populaire manier om dit te doen, is "pruning" (snoeien). Denk bij pruning aan het snoeien van een bonsai-boom: je knipt de takken weg die je niet nodig hebt om de boom kleiner en sneller te maken, in de hoop dat hij er nog steeds hetzelfde uitziet en hetzelfde functioneert. Maar hier komt het lastige deel bij: niet alle takken zijn hetzelfde. Sommige zijn essentieel voor de vorm van de boom, terwijl andere slechts extra blaadjes zijn. Als je de verkeerde takken weghaalt, gaat de boom dood. Als je de juiste takken weghaalt, krijg je een kleine, snelle boom die nog steeds vruchten draagt. De grote vraag is: hoe weet je precies welke takken je moet wegknippen zonder per ongeluk het genie binnenin te doden?
Maak kennis met DarwinLM, een nieuwe methode die werkt als een digitale naturalist die probeert het perfecte kleine brein te laten evolueren. In plaats van simpelweg te raden welke delen eruit moeten, laten de onderzoekers het model "evolueren" via een proces dat geïnspireerd is op hoe de natuur de sterkste dieren selecteert. Ze beginnen met een groot model en creëren veel licht verschillende "nakomelingen", elk met een uniek patroon van inkepingen. Vervolgens laten ze deze nakomelingen een korte, lichte trainingstest doorlopen — een soort sprint — om te zien welke nog steeds snel kunnen rennen en helder kunnen denken. De winnaars overleven om de volgende generatie te vormen, terwijl de verliezers worden weggegooid. Deze cyclus herhaalt zich, waardoor het model langzaam wordt verfijnd totdat het de perfecte balans tussen grootte en intelligentie vindt. Het artikel laat zien dat deze evolutionaire aanpak veel beter is dan simpelweg dingen gelijkmatig wegknippen (zoals het weghalen van dezelfde hoeveelheid uit elke laag). Sterker nog, DarwinLM kan modellen zoals Llama-2 en Llama-3.1 tot de helft van hun omvang verkleinen terwijl de intelligentie bijna intact blijft, en dit doet het met veel minder trainingsdata dan eerdere methoden. Zo had een andere beroemde methode bijvoorbeeld 50 miljard woorden nodig om zijn kleine model te trainen, terwijl DarwinLM met slechts 10 miljard woorden zelfs betere resultaten behaalde. Het werkt zelfs op complexe "Mixture of Experts"-modellen, wat bewijst dat je het overtollige vet kunt wegknippen zonder het spierweefsel te verliezen, waardoor krachtige AI toegankelijk wordt op alledaagse apparaten.
Technische Samenvatting: DarwinLM
Probleemstelling Large Language Models (LLMs) hebben aanzienlijk succes geboekt, maar worden gehinderd door enorme computationele kosten die implementatie bemoeilijken, met name in real-time toepassingen. Hoewel gestructureerde pruning een oplossing biedt door modellen te comprimeren om end-to-end snelheidswinsten op mainstream hardware te bieden, schieten bestaande methoden vaak tekort omdat ze geen rekening houden met twee cruciale factoren:
Niet-uniforme Gevoeligheid: Verschillende modelcomponenten (lagen, attention heads, MLP-dimensies) vertonen variërende gevoeligheid voor pruning. Uniforme compressie leidt vaak tot prestatie-instorting.
Post-Compressie Training: Een pruning-methode moet niet alleen een capabel substraat identificeren, maar ook ervoor zorgen dat de structuur geschikt is voor herstel via post-compressie fine-tuning. Eerdere methoden, zoals ZipLM, optimaliseren vaak voor lokale laag-specifieke fouten of one-shot prestaties, wat niet goed correleert met de prestaties bij downstream taken of het vermogen tot herstel via fine-tuning.
Methodologie De auteurs stellen DarwinLM voor, een training-bewuste gestructureerde pruning-methode die gebruikmaakt van een evolutionair zoekproces om optimale niet-uniforme sparsity-allocaties te vinden. De pipeline bestaat uit twee hoofdfasen:
Evolutionaire Zoektocht met Training-Bewuste Selectie:
Initialisatie: De zoektocht begint met een "parent" model dat is gegenereerd via one-shot gestructureerde pruning met behulp van tweede-orde informatie (Optimal Brain Surgeon formulering).
Mutatie: In elke generatie genereert het algoritme "offspring" modellen door de parent te kopiëren en een "level switch" mutatie toe te passen. Dit houdt in dat sparsity-niveaus tussen sub-blokken worden verschoven (bijvoorbeeld het verhogen van de sparsity in één laag terwijl deze in een andere laag wordt verlaagd) om de globale doelstelling voor sparsity of de snelheidswinst-constraint te handhaven.
Training-Bewuste Selectie: Een kerninnovatie is de integratie van lichtgewicht fine-tuning in het selectieproces. In plaats van offspring te selecteren op basis van enkel one-shot metrieken (zoals KL-divergentie op een kleine kalibratieset), hanteert de methode een meerstaps selectieproces. Offspring worden getraind op progressief grotere token-budgetten (bijv. 10K → 50K → 200K tokens). Slecht presterende modellen worden in elke fase geëlimineerd. Dit zorgt ervoor dat het geselecteerde "fittest" model niet alleen accuraat is in een statische staat, maar ook robuust en herstelbaar is na voortgezette training.
Terminatie: Zodra de zoektocht convergeert, ondergaat de uiteindelijke kandidaat een uitgebreidere fine-tuning fase (bijv. 10B tokens) vóór de definitieve evaluatie.
Pruned Layer Database:
Om een efficiënte zoektocht te faciliteren, pre-compute de methode een database van sparse sub-blokken (MLP en Attention modules) op verschillende gediscretiseerde sparsity-niveaus.
Voor Attention modules wordt pruning uitgevoerd per head. Voor MLPs worden dimensies gepruned in veelvouden van 32.
Voor modellen met Group-Query Attention (GQA) worden de K- en V-matrices niet direct gepruned; in plaats daarvan worden de corresponderende heads verwijderd tijdens de forward pass om computationele compatibiliteit te behouden.
Extensie naar MoE Architecturen:
De methode wordt uitgebreid naar Mixture-of-Experts (MoE) modellen (bijv. Qwen3-30B-A3B). In deze setting optimaliseert de zoektocht de sparsity binnen de expert MLP's, terwijl een uniforme sparsity over de MoE-blokken wordt behouden. Attention modules worden over het algemeen niet gepruned, aangezien experts de meerderheid van de parameters bevatten.
Belangrijkste Bijdragen
Training-Bewuste Evolutionaire Zoektocht: DarwinLM introduceert een nieuw evolutionair framework dat expliciet rekening houdt met het vermogen van het model om prestaties te herstellen tijdens fine-tuning, in plaats van enkel te optimaliseren voor one-shot accuratesse.
Niet-Uniforme Gestructureerde Pruning: De methode maakt fijnmazige, niet-uniforme compressie van LLM's mogelijk door gebruik te maken van de variërende gevoeligheid van verschillende lagen om hogere compressieratio's te bereiken zonder verlies van accuratesse.
MoE Adaptatie: Dit werk vormt de eerste exploratie van niet-uniforme gestructureerde pruning specifiek voor MoE-architecturen, waarbij wordt aangetoond dat gestructureerde sparsity effectief is, zelfs in complexe expert-gebaseerde modellen.
Efficiëntie: Het zoekproces is zeer efficiënt en wordt voltooid in ongeveer 8 uur op 4 consumenten-GPU's, waarbij de uiteindelijke fine-tuning fase ongeveer een halve dag duurt op een standaard cluster.
Experimentele Resultaten De auteurs valideren DarwinLM op Llama-2-7B, Llama-3.1-8B, Qwen-2.5-14B-Instruct, en Qwen3-30B-A3B (MoE).
Prestaties: DarwinLM bereikt state-of-the-art prestaties in one-shot gestructureerde pruning. Bijvoorbeeld, wanneer Llama-3.1-8B tot de helft van zijn omvang wordt gepruned, behaalt het een 5,9% hogere gemiddelde zero-shot accuratesse vergeleken met de beste eerdere methode (ZipLM).
Data Efficiëntie: De methode vermindert het benodigde trainingsbudget voor herstel aanzienlijk. DarwinLM overtreft ShearedLlama (dat 50B tokens gebruikt voor fine-tuning) terwijl het slechts 10B tokens vereist. In dezelfde 10B token setting presteert DarwinLM beter dan ShearedLlama.
MoE Resultaten: Op het Qwen3-30B-A3B model produceert DarwinLM een 16B-A2B variant die ≥90% van de accuratesse van het originele model behoudt na 10B token fine-tuning.
Hardware Efficiëntie: De geprunede modellen vertonen directe snelheidswinsten en reducties in geheugengebruik. Zo behaalt de 2.7B DarwinLM model een 1.98× throughput en gebruikt het 2.43× minder geheugen vergeleken met de dense 7B baseline op L40s GPU's.
Vergelijking: De methode presteert beter dan uniforme pruning baselines en andere gestructureerde pruning methoden (inclusief ShortGPT, Shortened-Llama, en EvoPress) over diverse sparsity-niveaus, met name bij hoge compressieratio's waar andere methoden snel degraderen.
Betekenis Het artikel stelt dat DarwinLM een significante vooruitgang vertegenwoordigt in LLM-compressie door de kloof te overbruggen tussen structurele zoektocht en post-training herstel. Door aan te tonen dat niet-uniforme gestructureerde pruning effectief kan worden toegepast op zowel dense als MoE-architecturen met minimale trainingsdata, daagt dit werk het idee uit dat hoogwaardige compressie massale hertrainingsbudgetten vereist. De auteurs positioneren DarwinLM als een praktische, hardware-agnostische oplossing die de implementatie van efficiënte LLM's mogelijk maakt zonder accuratesse op te offeren.