Lossless Tensor Compression as Program Synthesis
Het artikel introduceert Brevis, een nieuw systeem voor verliesvrije tensorcompressie dat het probleem formuleert als programma-synthese met behulp van een getypeerde domeinspecifieke taal en een geleerde productie-prior om automatisch compacte, zelfstandige programma's te genereren die aanzienlijke opslagreducties en concurrerende doorvoer bereiken over diverse modelcheckpoints heen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een enorme bibliotheek aan digitale blauwdrukken over de oceaan probeert te verschepen. Dit zijn niet zomaar blauwdrukken; het zijn de complexe, wiskundige instructies die computers leren hoe ze kunnen spreken, tekenen of zingen. In de wereld van kunstmatige intelligentie worden deze blauwdrukken "model checkpoints" genoemd, en ze groeien zo groot en talrijk dat het verschepen ervan een logistieke nachtmerrie wordt, wat een fortuin kost aan opslagruimte en overdrachtstijd.
Om dit op te lossen, proberen ingenieurs meestal twee dingen. De eerste is "lossy" compressie, wat is als het maken van een foto van een blauwdruk, waarbij de details worden samengedrukt, in de hoop dat de architect de ontbrekende delen kan raden. Dit bespaart ruimte, maar verpest de exacte precisie; je kunt de originele blauwdruk niet perfect reconstrueren. De tweede is "lossless" compressie, zoals het zippen van een bestand. Dit houdt elke enkele bit aan informatie veilig, maar standaard zipprogramma's behandelen de blauwdruk als een willekeurige stapel papierresten, waarbij ze het verband voorbijgaan aan het feit dat de blauwdruk eigenlijk een slimme, herhalende structuur heeft. Ze missen de patronen.
De grote vraag is: kunnen we het beter doen? In plaats van de bestanden alleen maar samen te drukken of blindelings te zippen, kunnen we de blauwdruk bekijken, de verborgen patronen begrijpen en een piepkleine, op maat gemaakte instructiehandleiding schrijven die een computer precies vertelt hoe hij het originele bestand vanaf nul kan reconstrueren? Als we voor elke blauwdruk een uniek, perfect recept zouden kunnen schrijven, zouden we een enorme hoeveelheid ruimte kunnen besparen zonder ook maar één detail te verliezen.
Dit is precies wat een team van onderzoekers heeft gedaan met een nieuwe tool genaamd Brevis. Zij behandelen het probleem van het comprimeren van deze gigantische AI-blauwdrukken niet als een bestandspakket-klus, maar als een "programmasynthese"-uitdaging. Denk er zo over na: in plaats van alleen een speeltje in een doos te stoppen, kijkt Brevis naar het speeltje, ziet dat het gemaakt is van drie rode blokjes en twee blauwe blokjes, en schrijft een klein briefje dat zegt: "Neem drie rode blokjes, stapel ze op, en voeg dan twee blauwe blokjes toe."
Brevis gebruikt een speciale, op maat gemaakte taal (een "Domain-Specific Language" of DSL) om deze briefjes te schrijven. Deze taal heeft speciale commando's die kunnen herkennen wanneer een patroon zich herhaalt, wanneer een getal slechts een kopie is van het vorige getal, of wanneer een sectie van de data perfect uniform is. Wanneer Brevis een bestand comprimeert, kiest het niet zoma een kant-en-klaar zipprogramma; het gedraagt zich als een detective die door miljoenen mogelijke "recepten" zoekt om de kortste, meest efficiënte één te vinden die het bestand bit voor bit kan reconstrueren. Om deze zoektocht snel te laten verlopen, leert het van een kleine steekproef van het bestand om te raden welke recepten het meest waarschijnlijk zullen werken, een beetje zoals een chef die weet dat een specifieke soep meestal zout nodig heeft voordat hij zelfs maar geproefd heeft.
De resultaten zijn indrukwekkend. De onderzoekers hebben Brevis getest op 10 verschillende publieke AI-modellen, inclusief die voor taal, audio en afbeeldingen, die samen een totaal van 2,13 TB aan data beslaan. Ze ontdekten dat Brevis deze enorme hoeveelheid data kon verkleinen tot 1,41 TB. Dat is een reductie van 33,93% in opslagruimte. Om dat in perspectief te plaatsen: Brevis creëerde archieven die tot wel 30,87% kleiner waren dan die van populaire, algemene tools zoals gzip en zstd. Het versloeg zelfs gespecialiseerde tools die specifiek voor AI-data zijn ontworpen, met archieven die tot 2,90% kleiner waren dan de beste concurrent, ZipNN.
Misschien nog wel het meest opwindende is dat Brevis niet alleen ruimte bespaart; het doet het ook snel. Het kan data comprimeren met een snelheid van 3,60 GB per seconde en decompresseren met 6,61 GB per second. En omdat het "recept" dat het schrijft een zelfstandig programma is, kan de computer het direct uitvoeren om het bestand perfect te reconstrueren, zonder opnieuw naar patronen te hoeven zoeken. De onderzoekers suggereren dat deze aanpak van "het schrijven van een programma om data te representeren" een krachtige nieuwe manier kan zijn om de explosieve groei van de omvang van AI-modellen te beheren, en een manier biedt om ze efficiënt op te slaan en te verplaatsen zonder een enkele byte van de originele informatie te verliezen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.