Decentralised AI Training and Inference with BlockTrain
Het artikel introduceert Spheroid BlockTrain, een gedecentraliseerd trainingsprotocol dat modellen partitioneert in onafhankelijk geoptimaliseerde blokken om toegang tot frontier AI te democratiseren door efficiënte training en hoogwaardige inferentie mogelijk te maken over gedistribueerde, beperkte netwerken zonder de noodzaak van gecentraliseerde acceleratorclusters.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een enorme, ongelooflijk slimme encyclopedie wilt bouwen. In de wereld van moderne AI is de gebruikelijke manier om dit te doen het inhuren van één enkel, superrijk bouwbedrijf (een "hyperscaler") dat een gigantische loods bezit vol met de meest krachtige computers ter wereld. Zij bouwen de hele encyclopedie op één plek, tegelijkertijd. Als je die loods niet bezit, kun je niet helpen bij het bouwen van de encyclopedie.
Spheroid Labs' "BlockTrain" stelt een andere manier voor om deze encyclopedie te bouwen. In plaats van één gigantisch team in één loods, stel je een wereldwijde buurt voor waar duizenden mensen met gewone thuiscomputers elk slechts één klein hoofdstuk van de encyclopedie bouwen.
Hier is hoe het artikel deze nieuwe methode uitlegt, met behulp van eenvoudige analogieën:
1. Het Probleen: De "Gigantische Loods"-bottleneck
Momenteel vereist het trainen van geavanceerde AI zoveel rekenkracht dat alleen een paar grote bedrijven het kunnen betalen. Het is alsof je zegt dat alleen een bedrijf met een fabriek van een miljard dollar een wolkenkrabber kan bouwen. Dit sluit iedereen anders uit. Het artikel stelt dat als we blijven proberen om het "hele gebouw" op één plek te bouwen, we nooit echte decentralisatie zullen bereiken.
2. De Oplossing: De "Hoofdstuk-voor-Hoofdstuk"-aanpak
BlockTrain verandert de spelregels. In plaats van elke computer de volledige encyclopedie in zijn geheugen te laten houden (wat onmogelijk is voor een thuiscomputer), breekt het de AI-modellen op in kleine, onafhankelijke stukjes die blokken worden genoemd.
- De Analogie: Denk aan het AI-model als een lange estafette. In de oude manier moest elke hardloper de hele stapel estafettestokken dragen. In BlockTrain wordt de race opgedeeld in etappes. Elke hardloper (de computer van een werker) draagt alleen zijn eigen specifieke etappe.
- Hoe het werkt: Elke computer traint zijn eigen "blok" (een klein deel van de AI) om een specifieke, lokale puzzel op te lossen. De computer hoeft het hele plaatje niet te zien om zijn werk te doen. Hij moet alleen zijn specifieke deel goed krijgen.
3. Het Geheime Ingrediënt: De Puzzel "Ontruisen"
Het artikel gebruikt een specifieke techniek genaamd DiffusionBlocks.
- De Analogie: Stel je voor dat je probeert te raden hoe een afbeelding eruitziet, maar iemand heeft deze bedekt met statische ruis.
- Bij traditionele AI probeer je de hele afbeelding in één keer te raden.
- Bij BlockTrain wordt de "ruis" in stadia verwijderd. Het eerste blok van de AI leert de zware, wazige ruis te verwijderen (het grote plaatje). Het volgende blok verwijdert de middelgrote ruis. Het laatste blok verwijdert de minuscule stofjes.
- De Magie: Elke computer hoeft alleen maar te leren hoe hij zijn specifieke type ruis moet verwijderen. Hij hoeft niet te weten hoe hij de ruis voor de andere blokken moet verwijderen. Dit maakt de taak klein genoeg voor een gewone thuiscomputer om te kunnen afhandelen.
4. De Puzzel Samenvoegen
Zodra alle buren hun specifieke hoofdstukken hebben getraind, sturen ze hun updates naar een centrale "aggregator".
- De Assemblage: Het systeem neemt Blok 1, Blok 2 en Blok 3 en klikt ze aan elkaar zoals LEGO-stenen.
- Het Resultaat: Hoewel geen enkele computer ooit het hele model in zijn geheugen heeft gehad, is het samengestelde model slim genoeg om tekst te lezen en te schrijven. Het artikel laat zien dat dit samengestelde model op een test met echte tekst (WikiText) bijna net zo goed presteerde als een model dat in een gigantisch datacenter is getraind (een score van 1,359 versus 1,32 op een specifieke foutenschaal).
5. De "Verkeersopstopping"-test (Real-World Snelheid)
De onderzoekers hebben dit niet alleen op één computer getest; ze hebben het over het internet getest.
- Het Experiment: Ze verbonden computers op verschillende locaties (sommigen in hetzelfde gebouw, anderen verspreid over het land) om te zien of de "hoofdstukken" heen en weer gestuurd konden worden zonder verloren te gaan of vertraging op te lopen.
- Het Resultaat: Het werkte. Ze hebben de "hoofdstukken" (data) succesvol over het publieke internet verplaatst. Zelfs met internetvertragingen en tragere verbindingen bleef het systeem leren. Het bewees dat je niet nodig hebt om een super-snelle, private glasvezelkabel tussen computers te hebben om een AI te trainen; het gewone internet is snel genoeg als de stukjes klein genoeg zijn.
6. De "Eén-Rit"-Levering (Inference)
Normaal gesproken, wanneer je een gedecentraliseerde AI een vraag stelt, moet de vraag door elke computer heen worden gestuurd, één voor één, als een spelletje "telefoontje spelen", wat traag is.
- BlockTrain's Truc: Het artikel beweert dat hun systeem anders is. Zodra het model is samengesteld, kan het een hele zin of paragraaf genereren in één enkele passage door het netwerk.
- De Analogie: In plaats van een briefje door een lange rij mensen door te geven (woord voor woord), geeft BlockTrain het hele vel papier aan de rij, en de rij verwerkt het hele vel in één keer. Dit maakt het veel sneller om een antwoord te krijgen.
Samenvatting van Claims
Het artikel maakt drie concrete claims op basis van hun experimenten:
- Het Leert: Je kunt een echte AI trainen op echte tekst met deze "blok-voor-blok" methode, en het wordt bijna even slim als de grote gecentraliseerde modellen.
- Het Reist: Je kunt de trainingsdata over het publieke internet sturen (met standaard internetverbindingen) en nog steeds vooruitgang boeken.
- Het Dient: Je kunt het voltooide model over verschillende computers laten draaien om vragen te beantwoorden, en dat doet het efficiënt zonder dat één grote computer alles moet vasthouden.
Wat het artikel NIET claimt:
- Het beweert niet dat dit vandaag de dag klaar is voor commercieel gebruik.
- Het beweert niet dat dit alle beveiligings- of prikkelproblemen oplost (hoe mensen te betalen voor hun hulp).
- Het beweert niet dat dit al werkt voor medische diagnoses of andere specifieke real-world toepassingen.
- Het richt zich strikt op de technische mogelijkheid om het model te trainen en te bedienen met behulp van deze specifieke "blok"-methode.
Kortom, BlockTrain is een blauwdruk voor hoe je een gigantisch AI-brein kunt bouwen met behulp van duizenden kleine, onafhankelijke breinen die samenwerken, in plaats van één gigantisch brein in één kamer.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.