A 35B Hybrid-Attention Mixture-of-Experts Model on a 6GB 2011 GPU: Hand-Written 4-bit CUDA Inference for Fermi
Dit artikel demonstreert de end-to-end inferentie van een 35 miljard parameters tellend Qwen3.6 MoE-model op een 2011 6GB Fermi GPU door een hybride executiestrategie te implementeren die gewichten streamt voor GPU-prefill en een handgeschreven SSSE3-integerkernel gebruikt voor CPU-decoding, terwijl zowel de prestatiewinsten als de praktische hardwarebeperkingen van het draaien van frontier-klasse AI op legacy-silicium worden gedocumenteerd.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een enorme, ongelooflijk slimme bibliotheek hebt met 35 miljard boeken (een modern AI-model). Stel je nu voor dat je een specifiek verhaal uit deze bibliotheek wilt lezen, maar je zit vast in een piepklein, 14 jaar oud schuurtje met slechts een klein bureau en een zeer oude, trage computer.
Dat is precies wat dit artikel beschrijft. De onderzoekers zijn erin geslaagd om een geavanceerd AI-model te laten draaien op een videokaart (GPU) uit 2011 die slechts 6 GB geheugen heeft—ongeveer de helft van de grootte van het model zelf.
Hier is hoe ze deze "onmogelijke" prestatie hebben geleverd, uitgelegd via eenvoudige analogieën:
1. Het Problek: De bibliotheek is te groot voor het schuurtje
Het AI-model is als een enorme encyclopedie. Zelfs wanneer het wordt verkleind (gecomprimeerd naar 4-bit precisie), neemt het ongeveer 10,5 GB ruimte in beslag. De oude computer heeft slechts een bureau van 6 GB.
- Het Probleem: Je kunt niet het hele boek op het bureau leggen.
- De Oude Manier: Moderne computers hebben "Tensor Cores" (gespecialiseerde rekenmachines) en snel geheugen om dit te verwerken. De kaart uit 2011 heeft dat niet. Het is alsof je geavanceerde wiskunde probeert te doen met een rekenmachine die alleen knoppen heeft voor optellen en aftrekken.
2. De Oplossing: Een estafette met twee teams
Omdat het hele model niet past, hebben de onderzoekers het werk verdeeld in twee teams: een GPU-team (de oude videokaart) en een CPU-team (de centrale processor van de computer).
Fase 1: De "Prefill" (De prompt lezen)
- De Analogie: Stel je voor dat je een lange lijst met instructies moet lezen (de prompt) om te beginnen.
- De Truc: De GPU werkt als een snelle lopende band. Het pakt een klein deel van de "boeken" (modelgewichten) uit de harde schijf van de hoofdcomputer, legt ze op zijn kleine bureau, doet de berekeningen voor dat deel, en wisselt ze dan uit voor het volgende deel.
- Het Resultaat: In plaats van het hele boek in één keer te lezen, leest het deel voor deel in een continue stroom. Dit stelde hen in staat om de initiële instructies 34% sneller te verwerken dan voorheen.
Fase 2: De "Decode" (Het verhaal schrijven)
- De Analogie: Nu moet de AI het verhaal woord voor woord schrijven.
- Het Probleem: Als de GPU dit zou proberen te doen, zou hij voor elk woord heen en weer moeten rennen naar de harde schijf. Dat is alsof een hardloper telkens naar de bibliotheek sprint, één boek pakt, terugrent, één woord schrijft, en dit herhaalt. Dat is te traag.
- De Truc: Ze verplaatsten dit deel naar het brein van de hoofdcomputer (de CPU). Ze schreven een aangepaste, uiterst efficiënte "handgeschreven" code die de getallen behandelt als eenvoudige gehele getallen (integers) in plaats van complexe decimalen.
- Het Resultal: Dit maakte de AI 3 keer sneller bij het schrijven van woorden, waardoor een trage kruip veranderde in een stevige jog.
3. De "Magische" Afkortingen
De onderzoekers hebben de taken niet alleen verdeeld; ze hebben slimme afkortingen uitgevonden om de oude hardware nieuw te laten aanvoelen.
De "Snapshot" Cache:
- Het Probleem: Een AI heeft een "geheugen" dat verandert terwijl het leest. Normaal gesproken kun je oud werk niet hergebruiken omdat de geheugenstatus anders is.
- De Oplossing: Ze namen "snapshots" (momentopnames) van het geheugen van de AI op specifieke controlepunten. Als je de AI vraagt om een verhaal te herhalen dat het al heeft gehoord, leest het niet het hele verhaal opnieuw. Het springt direct naar de laatste opgeslagen snapshot.
- Het Resultaat: Het herhalen van een lange prompt ging van 78 seconden naar slechts 0,5 seconde. Het is alsof je naar het einde van een film springt die je al hebt gezien, in plaats van hem opnieuw te kijken.
Het "Pinned" Geheugen:
- De Analogie: Normaal gesproken is het verplaatsen van gegevens van de harde schijf naar de GPU als het verplaatsen van dozen met een wiebelende heftruck.
- De Oplossing: Ze "vergrendelden" de dozen op hun plaats (pinned memory), zodat de heftruck de dozen soepel kon verplaatsen zonder te wiebelen. Dit halveerde de tijd die nodig was voor het verplaatsen van gegevens.
4. Wat niet werkte (De "Doodlopende Wegen")
Een deel van het artikel gaat over wat er mislukt is, wat net zo belangrijk is. Het vertelt ons waar de grens ligt.
- De GPU gebruiken voor het schrijven: Ze probeerden de GPU het schrijven van de woorden te laten doen, maar de oude kaart was te traag in het heen en weer bewegen van gegevens. Het was zelfs trager dan de CPU.
- Alle threads van de computer gebruiken: Ze probeerden elke beschikbare verwerkingsthread te gebruiken (zoals het inhuren van 24 werkers in plaats van 12). Dit veroorzaakte een verkeersopstopping, wat alles enorm vertraagde.
- De wiskunde herschrijven: Ze probeerden de wiskundige kernels op drie verschillende manieren te herschrijven, maar de oude hardware kon het specifieke type wiskunde dat vereist was simpelweg niet aan.
De Kernboodschap
Dit artikel gaat niet over het vestigen van een nieuw snelheidsrecord. Het is een bewijs van concept dat zegt: "Je hebt geen supercomputer van $20.000 nodig om een 35-miljard parameter AI te draaien."
Door de oude hardware als een puzzel te behandك en een aangepaste motor vanaf nul op te bouwen (handgeschreven code voor een computerarchitectuur die softwareontwikkelaars 14 jaar geleden al hadden verlaten), bewezen ze dat moderne AI op "afgedankte" hardware kan draaien als je technisch genoegwijs bent.
Kortom: Ze hebben een Ferrari-motor (het AI-model) genomen en deze op een fietsframe uit de jaren '90 (de 2011 GPU) laten rijden door een aangepaste transmissie te bouwen en het type brandstof te veranderen, waarmee ze bewezen dat je met genoeg vindingrijkheid verrassend ver kunt komen met oude technologie.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.