← Nieuwste papers
🤖 machine learning

FluxBin: Flexible LUT-based Ultra-low-bit LLM Inference by Algorithm-Kernel Synergy

FluxBin is een algoritme-kernel co-design framework dat een nieuwe gedecoupleerde binaire decompositie methode combineert met een gespecialiseerde CUDA-kernel met behulp van lookup tables en virtuele kolomaire mapping om ultra-low-bit LLM-inferentie mogelijk te maken met significante versnellingen, energiebesparingen en geheugenreductie, terwijl de hoge nauwkeurigheid behouden blijft.

Oorspronkelijke auteurs: Qingyao Yang, Runming Yang, He Xiao, Wendong Xu, Junyu Chen, Haobo Liu, Chenchen Ding, Ruihan Hu, Yik-Chung Wu, Ngai Wong

Gepubliceerd 2026-08-18
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Qingyao Yang, Runming Yang, He Xiao, Wendong Xu, Junyu Chen, Haobo Liu, Chenchen Ding, Ruihan Hu, Yik-Chung Wu, Ngai Wong

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Grote taalmodellen zijn de krachtige computerprogramma's die verhalen kunnen schrijven, problemen kunnen oplossen en gesprekken kunnen voeren, maar ze brengen een enorme fysieke kost met zich mee. Om deze modellen te draaien, heb je enorme hoeveelheden computergeheugen en energie nodig, wat vaak gespecialiseerde, dure hardware vereist waar slechts weinig mensen toegang toe hebben. Dit komt omdat de modellen hun kennis opslaan in uitgestrekte rasters van getallen, en het bewaren van al die getallen in hun oorspronkelijke, hoogwaardige vorm neemt te veel ruimte in beslag. Wetenschappers proberen deze modellen al lang te verkleinen door de getallen te comprimeren, vergelijkbaar met het omzetten van een foto met een hoge resolutie naar een kleiner bestand. Een extreme versie van deze compressie is om de getallen te reduceren tot hun eenvoudigste vorm, waarbij slechts twee waarden worden gebruikt, wat ze in essentie verandert in een reeks aan/uit-schakelaars. Theoretisch zou dit de modellen ongelooflijk snel en efficiënt moeten maken, maar in de praktijk worstelen computers ermee om deze vereenvoudigde getallen te gebruiken zonder dat ze trager worden of aan nauwkeurigheid verliezen. Het proces van het converteren van de vereenvoudigde getallen terug naar een bruikbaar formaat kost vaak zoveel tijd dat het de snelheidswinst tenietdoet, waardoor de modellen net zo traag blijven als voorheen.

Een team van onderzoekers heeft nu een manier gevonden om deze patstelling te doorbreken, door een nieuwe methode te creëren die deze ultra-vereenvoudigde modellen met hoge snelheid kan laten draaien zonder hun vermogen om helder na te denken te verliezen. Ze ontwikkelden een systeem genaamd FluxBin, dat werkt door te veranderen hoe de computer het geheugen van het model leest. In plaats van te proberen de vereenvoudigde getallen elke keer terug te converteren naar complexe getallen wanneer het model iets moet berekenen, gebruikt het nieuwe systeem een vooraf gemaakte tabel met opzoekwaarden (lookup table). Stel je een bibliotheek voor waar je, in plaats van elk boek te lezen om een antwoord te vinden, simpelweg een code op een plank opzoekt en direct het voltooide antwoord ontvangt. De onderzoekers bouwden een gespecialiseerd computerprogramma dat deze opzoektabellen op een manier creëert die de belangrijkste onderdelen van het model met extra zorg behandelt, om er zeker van te zijn dat de meest kritieke informatie niet verloren gaat tijdens de compressie. Ze ontwierpen ook een nieuwe manier om de gegevens te organiseren, zodat de computer er soepel bij kan, waardoor de verkeersopstoppingen die gewoon voorkomen bij het lezen van ijle of verspreide informatie, worden vermeden.

De resultaten van dit werk zijn significant omdat ze bewijzen dat extreme compressie niet ten koste hoeft te gaan van de snelheid. Toen de onderzoekers hun systeem testten op een krachtige computerchip, ontdekten ze dat het een enorm model kon draaien, een model dat normaal gesproken een enorme hoeveelheid geheugen vereist, op een enkele standaard grafische kaart. Het systeem was in staat om tekst bijna zes keer sneller te genereren dan de standaard, ongecomprimeerde versie van het model. Bovendien, omdat de computer minder zwaar werk verrichtte en minder gegevens verplaatste, verbruikte het ongeveer tien keer minder energie. Deze efficiëntie betekent dat modellen die voorheen te groot waren om op een enkele machine te draaien, nu effectief kunnen passen en functioneren, wat de deur opent voor het gebruik van krachtigere kunstmatige intelligentie op plaatsen waar de middelen beperkt zijn.

Het succes van deze aanpak berust op een zorgvuldige balans tussen hoe de gegevens worden gecomprimeerd en hoe de computerhardware wordt geïnstruerd om ze te lezen. De onderzoekers realiseerden zich dat het simpelweg maken van alles eenvoudig niet genoeg was; ze moesten identificeren welke delen van het model het meest gevoelig waren voor fouten en deze anders behandelen. Ze creëerden een methode die de kennis van het model scheidt in een algemene, vereenvoudigde basis en een set speciale, gedetailleerde aantekeningen voor de belangrijkste onderdelen. Deze hybride aanpak zorgt ervoor dat het model zijn intelligentie behoudt terwijl het nog steeds profiteert van de snelheid van het vereenvoudigde formaat. Door deze slimme compressiestrategie te combineren met een op maat gemaakt programma dat rechtstreeks op de processor van de computer draait, elimineerden ze de noodzaak voor de trage conversiestappen die eerdere pogingen hadden gehinderd. Het systeem werkt door de vereenvoudigde gegevens direct in te mappen naar vooraf berekende resultaten, waardoor de computer de wiskunde volledig kan overslaan en direct naar het antwoord kan springen.

In hun experimenten testte het team hun methode op verschillende versies van grote taalmodellen, variërend van kleinere modellen tot massieve modellen met miljarden parameters. In elk geval leverde het nieuwe systeem een dramatische toename in snelheid en een enorme vermindering in energieverbruik. Voor de grootste geteste modellen was het systeem in staat om ze op een enkele computerkaart te draaien waar de standaardversie volledig zou zijn gefaald vanwege een gebrek aan geheugen. De nauwkeurigheid van de modellen bleef hoog en kwam overeen met de prestaties van andere geavanceerde methoden die veel meer tijd en rekenkracht vereisen voor de opzet. De onderzoekers merkten op dat hun methode werkt zonder dat de modellen opnieuw getraind hoeven te worden, wat betekent dat het onmiddellijk kan worden toegepast op bestaande systemen. Dit suggereert dat de barrière voor het draaien van krachtige kunstmatige intelligentie op alledaagse hardware niet langer een vraag is of het mogelijk is, maar eerder een kwestie is van het gebruik van de juiste instrumenten om het potentieel dat er al was te ontsluiten.

De implicaties van dit werk reiken verder dan alleen het sneller maken van modellen; het verandert fundamenteel de relatie tussen software en hardware. Jarenlang zat het vakgebied vast in een cyclus waarin nieuwe algoritmen werden ontworpen voor theoretische efficiëntie, maar die in de praktijk niet konden worden gerealiseerd omdat de hardware het niet kon bijhouden. Deze nieuwe aanpak overbrugt die kloof door het algoritme en de hardware-instructies samen te ontwerpen, waardoor elke stap van het proces wordt geoptimaliseerd voor de specifieke machine waarop het draait. De onderzoekers hebben aangetoond dat het, door zorgvuldig te beheren hoe gegevens worden opgeslagen en geraadpleegd, mogelijk is om niveaus van prestaties te bereiken die voorheen als onbereikbaar werden beschouwd voor dergelijke sterk gecomprimeerde modellen. Naarmate kunstmatige intelligentie groter en complexer wordt, zullen methoden zoals deze essentieel zijn om deze technologieën toegankelijk en praktisch te maken voor een breder scala aan toepassingen, van persoonlijke apparaten tot grootschalige datacentra. Het werk laat zien dat met de juiste combinatie van slimme wiskunde en efficiënt engineering, de beperkingen van de huidige technologie kunnen worden overwonnen, wat de weg vrijmaakt voor een toekomst waarin krachtige intelligentie niet slechts een luxe is, maar een standaard hulpmiddel.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →