Compressing LLMs with MoP: Mixture of Pruners
Het artikel introduceert MoP (Mixture of Pruners), een iteratief framework dat diepte- en breedtepruning verenigt om bestaande enkelvoudige dimensie-methoden te overtreffen in nauwkeurigheid en latentiereductie over LLaMA- en LLaVA-modellen heen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een enorme, zware bibliotheek in een rugzak probeert te dragen. Deze bibliotheek bevat de som van de menselijke kennis, geschreven in een taal die zo complex is dat alleen de slimste computers hem kunnen lezen. Deze "bibliotheken" worden Large Language Models (LLM's) genoemd. Ze zijn geweldig in het schrijven van verhalen, het oplossen van wiskundige problemen en zelfs in het chatten als een vriend. Maar er is een addertje onder het gras: ze zijn zo groot en zwaar dat ze enorme hoeveelheden elektriciteit en supersnelle computers vereisen om slechts één boek open te slaan en één zin te lezen. Als je ze op een gewone laptop of telefoon wilt gebruiken, zijn ze vaak te traag en te zwaar om mee te dragen.
Om dit op te lossen, proberen wetenschappers deze bibliotheken kleiner te maken zonder de belangrijke boeken weg te gooien. Eén manier om dit te doen, heet "pruning" (snoeien). Denk bij pruning aan tuinieren. Je hebt een gigantische, overwoekerde struik (het grote computermodel) en je wilt deze inkorten tot een nette, kleinere vorm. Je kunt hele takken afknippen (om de struik korter te maken), of je kunt de bladeren van de takken trimmen (om de struik dunner te maken). Een lange tijd moesten tuiniers kiezen: ofwel hele takken afknippen, ofwel de bladeren trimmen, maar niet beide tegelijkertijd. De vraag was: welke manier maakt de struik kleiner terwijl de struik gezond blijft en vruchten kan dragen?
Dit artikel introduceert een nieuw tuinwerktuig genaamd MoP, wat staat voor Mixture of Pruners. In plaats van slechts één manier te kiezen om te snoeien, is MoP een slimme, iteratieve tuinman die beide methoden bij elke stap probeert. Stel je voor dat je je struik bijwerkt. Bij elke knip vraagt MoP zich twee vragen: "Hoe ziet de struik eruit als ik deze hele tak afknipt?" en "Hoe ziet hij eruit als ik in plaats daarvan de bladeren van deze tak trim?" Vervolgens kiest het de versie die de struik het meest doet lijken op de originele, gezonde plant. Het herhaalt dit proces, waarbij het wisselt tussen het afknippen van takken en het trimmen van bladeren, totdat de struik klein genoeg is om in je rugzak te passen.
De onderzoekers hebben deze methode getest op enkele van de slimste computerbreinen ter wereld, zoals de LLaMA-2 en LLaMA-3 modellen. Ze ontdekten dat MoP veel beter is in het verkleinen van deze modellen dan wanneer men slechts één methode alleen gebruikt. Wanneer ze de modellen met 40% inkrompen (ze 40% kleiner maakten), hield MoP de modellen net zo slim als de concurrentie, maar maakte het de modellen ook aanzienlijk sneller. In feite werden de modellen 39% sneller in het beantwoorden van vragen. Nog verrassender was dat ze dit probeerden op een model dat afbeeldingen kan zien en tekst kan lezen (genaamd LLaVA-1.5). Ze ontdekten dat, zelfs al hebben ze het ingekorte model alleen met tekst "onderwezen" (geen afbeeldingen), het model nog steeds afbeeldingen bijna net zo goed kon begrijpen als voorheen. Dit suggereert dat het mengen van de twee snoeistrategieën een kleiner, sneller en slimmer computerbrein creëert dat niet de weg kwijtraakt, zelfs niet wanneer het erg klein wordt.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.