← Nieuwste papers
🤖 machine learning

Lakestream: A Consistent and Brokerless Data Plane for Large Foundation Model Training

Lakestream is een brokerloze, objectopslag-natieve dataplane voor de training van grote fundamentele modellen die Transactionele Globale Batches en een Gedecentraliseerd Adaptief Commit-algoritme introduceert om ACID-achtige consistentie, foutisolatie en opname met hoge doorvoer te bieden met een lagere latentie dan bestaande berichtwachtrij- of colocalisatieoplossingen.

Oorspronkelijke auteurs: Ting Sun, Junjie Zhang, Xiao Yan, Songxin Zhang, Zhuoyang Song, Jingyi Xi, Zunyao Mao, Bingyi Jing, Jiaxing Zhang, Zejian Xie

Gepubliceerd 2026-05-12
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Ting Sun, Junjie Zhang, Xiao Yan, Songxin Zhang, Zhuoyang Song, Jingyi Xi, Zunyao Mao, Bingyi Jing, Jiaxing Zhang, Zejian Xie

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je probeert een reusachtige, superintelligente robot (een Large Foundation Model) te leren de wereld te begrijpen. Om dit te doen, moet je enorme hoeveelheden data, zoals video's, afbeeldingen en tekst, één "batch" per keer aan de robot voeren.

In het verleden was het voeren van deze robot vergelijkbaar met een simpele transportband in een fabriek. De data was al voorverpakt in dozen, en de band verplaatste ze met een constant tempo naar de robot. Maar moderne AI is anders. De data is rommelig, enorm en verandert van grootte afhankelijk van wat erin zit. Soms moet een enkel videobestand worden uitgepakt en uitgerekt tot iets dat 1.000 keer groter is voordat de robot het kan gebruiken.

De oude transportbanden (bestaande systemen) konden hier niet mee omgaan. Ze raakten ofwel verstopt, of als één arbeider een doos liet vallen, stopte de hele fabriek.

Maak kennis met Lakestream: het "slimme, brokerloze" datavlak.

De auteurs van dit artikel hebben een nieuw systeem gebouwd dat Lakestream heet. Denk hierbij aan een revolutionaire manier om de datalevering voor deze gigantische AI-modellen te organiseren. Hieronder wordt uitgelegd hoe het werkt, met behulp van eenvoudige analogieën:

1. Het probleem met de oude methoden

  • Het "Colocated"-probleem (De keuken in de sportschool): Stel je voor dat de robot (de trainer) gewichten tilt, en de persoon die het eten bereidt (de data-lader) direct naast hem staat in dezelfde kleine ruimte. Als de etenbereiding te lang duurt, moet de robot stoppen met tillen. Als de etenbereider struikelt en valt, stopt de robot voorgoed. Ze zijn te verstrengeld met elkaar.
  • Het "Message Queue"-probleem (De verwarde koerier): Stel je voor dat je een centraal postkantoor (zoals Kafka) gebruikt om data te bezorgen. Het postkantoor behandelt elk stuk papier als een aparte brief. Maar de robot heeft een volledige maaltijd (een batch) tegelijk nodig. Als het postkantoor het "kip"-gedeelte van de maaltijd op een ander tijdstip naar de ene robotarm stuurt dan het "rijst"-gedeelte naar de andere arm, raakt de robot in de war en leert het verkeerde dingen. Bovendien is het postkantoor een enkel punt van falen; als de postmeester ziek wordt, krijgt niemand te eten.

2. De Lakestream-oplossing: Een gedeelde digitale magazijn

Lakestream doet het centrale postkantoor en de benauwde keuken uit de weg. In plaats daarvan maakt het gebruik van een enorm, gedeeld Object Storage-systeem (zoals een gigantisch, oneindig digitaal magazijn, bijvoorbeeld Amazon S3) en een Versie-manifest (een hoofdkladboek).

Hier zijn de drie magische trucs die Lakestream gebruikt:

A. De "Transactionele Globale Batch" (De perfecte maaltijd)

In de oude dagen was data gewoon een stroom van individuele records. Lakestream behandelt een hele "batch" data als één ondeelbare eenheid, genaamd een Transactionele Globale Batch (TGB).

  • De Analogie: Stel je een chef voor die een volledig banket bereidt. Het eten is gaar en op tafel gezet, maar het is bedekt met een deksel. Het deksel is vergrendeld. Niemand kan het eten nog zien.
  • De Magie: Wanneer de chef zeker weet dat het hele banket klaar is, schakelt hij een schakelaar op het hoofdkladboek (het Manifest) om. Plotseling tilt het deksel zich op, en ziet elke robotarm de volledige, perfecte maaltijd op precies hetzelfde moment. Als de chef een bord laat vallen voordat hij de schakelaar omzet, blijft het deksel gesloten en ziet niemand de rommel. Dit zorgt ervoor dat iedereen altijd met dezelfde data werkt.

B. De "Decentraliseerde Adaptieve Commit" (De slimme verkeerslicht)

Wanneer veel chefs (producenten) proberen tegelijk het hoofdkladboek bij te werken, kunnen ze proberen op dezelfde pagina te schrijven, wat een conflict veroorzaakt.

  • De Oude Manier: Ze zouden gewoon blijven bonken op de deur tot iemand hen binnenliet, wat tijd kostte.
  • De Lakestream-manier (DAC): De chefs hebben een slim, zelfgeleerd ritme. Ze kijken hoe druk het kladboek is. Als het kladboek enorm wordt en updates traag verlopen, wachten ze automatisch een heel klein beetje langer voordat ze opnieuw proberen te schrijven. Als het rustig is, schrijven ze sneller. Ze doen dit zonder met elkaar te praten, alleen door naar het kladboek te kijken. Dit houdt het verkeer soepel, zelfs wanneer honderden chefs tegelijk werken.

C. De "Checkpoint-uitgelijnde Levenscyclus" (De tijdsreiskluis)

AI-modellen moeten vaak hun voortgang opslaan (checkpoint) en soms terugkeren naar een eerdere opslag om een ander pad te proberen.

  • Het Probleem: In oude systemen is data, zodra het opgegeten is, weg. Als je terug wilt gaan, kan dat niet.
  • De Lakestream-manier: Het systeem houdt een geschiedenis bij van elke geserveerde maaltijd, gekoppeld aan het specifieke "opslagpunt" van de robot. Wanneer de robot zijn voortgang opslaat, schrijft het ook een "watermerk" (een veiligheidslijn) in het kladboek. Het systeem weet dat het alle data voor die lijn veilig en wel moet houden. Het verwijdert de oude data pas wanneer het zeker weet dat geen enkel robot-opslagpunt het meer nodig heeft. Dit betekent dat je de tijd perfect kunt terugspoelen zonder je data te verliezen, en je hoeft niet te betalen voor het opslaan van data die niemand nodig heeft.

3. De resultaten

Het artikel testte dit systeem uit op 64 krachtige GPU's met enorme video- en afbeeldingsdatasets.

  • Snelheid: Het was 2,7 tot 7,7 keer sneller dan de beste bestaande "colocated"-systemen (waar data-bereiding en training samen plaatsvinden).
  • Betrouwbaarheid: Het ging veel beter om met storingen. Als een data-bereidingsarbeider crashte, bleef de robot trainen zonder te stoppen.
  • Efficiëntie: Het was veel sneller dan het gebruik van een centrale message queue (zoals Kafka), die moeite had om bij te blijven met de grootte en complexiteit van de data.

Samenvatting

Lakestream is vergelijkbaar met het vervangen van een chaotische, éénbaansweg door een slim, gedecentraliseerd autosnelwegsysteem. Het maakt gebruik van een gedeeld magazijn en een hoofdkladboek om ervoor te zorgen dat:

  1. Iedereen op hetzelfde moment precies dezelfde "batch" data ontvangt.
  2. Het systeem snel blijft bewegen, zelfs wanneer het verkeer zwaar wordt.
  3. Je het trainingsproces kunt terugspoelen naar elk punt in de geschiedenis zonder je data te verliezen.

Het bereikt dit alles zonder dat er een centrale manager (broker) nodig is om iedereen te vertellen wat hij moet doen, waardoor het sneller, goedkoper en betrouwbaarder wordt voor het trainen van 's werelds grootste AI-modellen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →