← Neueste Arbeiten
🤖 machine learning

Lakestream: A Consistent and Brokerless Data Plane for Large Foundation Model Training

Lakestream ist eine brokerlose, objektspeicherspezifische Datenplane für das Training großer Fundamentaler Modelle, die Transaktionale Globale Batches und einen dezentralen adaptiven Commit-Algorithmus einführt, um ACID-ähnliche Konsistenz, Fehlerisolierung und eine hochdurchsatzfähige Datenerfassung mit geringerer Latenz als bestehende Nachrichtenwarteschlangen- oder kollokatierte Lösungen zu gewährleisten.

Ursprüngliche Autoren: Ting Sun, Junjie Zhang, Xiao Yan, Songxin Zhang, Zhuoyang Song, Jingyi Xi, Zunyao Mao, Bingyi Jing, Jiaxing Zhang, Zejian Xie

Veröffentlicht 2026-05-12
📖 6 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Ting Sun, Junjie Zhang, Xiao Yan, Songxin Zhang, Zhuoyang Song, Jingyi Xi, Zunyao Mao, Bingyi Jing, Jiaxing Zhang, Zejian Xie

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie versuchen, einem riesigen, superschlauen Roboter (einem Large Foundation Model) beizubringen, die Welt zu verstehen. Um dies zu tun, müssen Sie ihm massive Datenmengen zuführen, wie Videos, Bilder und Text, jeweils einen „Batch" nach dem anderen.

In der Vergangenheit war das Füttern dieses Roboters wie ein einfacher Förderband in einer Fabrik. Die Daten waren bereits in Kisten verpackt, und das Band bewegte sie in einem gleichmäßigen Tempo zum Roboter. Doch moderne KI ist anders. Die Daten sind unordentlich, riesig und ändern ihre Größe je nachdem, was sich darin befindet. Manchmal muss eine einzelne Videodatei entpackt und auf das Tausendfache ihrer ursprünglichen Größe gedehnt werden, bevor der Roboter sie nutzen kann.

Die alten Förderbänder (bestehende Systeme) konnten damit nicht umgehen. Sie wurden entweder verstopft, oder wenn ein Arbeiter eine Kiste fallen ließ, kam die gesamte Fabrik zum Stillstand.

Hier kommt Lakestream ins Spiel: Die „intelligente, brokerlose" Datenebene.

Die Autoren dieses Papiers haben ein neues System namens Lakestream entwickelt. Stellen Sie es sich als eine revolutionäre Art vor, die Datenlieferung für diese gigantischen KI-Modelle zu organisieren. So funktioniert es, unter Verwendung einfacher Analogien:

1. Das Problem mit den alten Methoden

  • Das „Co-Located"-Problem (Die Küche im Fitnessstudio): Stellen Sie sich vor, der Roboter (der Trainer) hebt Gewichte, und die Person, die sein Essen zubereitet (der Datenloader), steht direkt daneben in demselben kleinen Raum. Wenn die Essenszubereitung zu lange dauert, muss der Roboter das Gewichtheben unterbrechen. Wenn die Person, die das Essen zubereitet, stolpert und fällt, stoppt der Roboter für immer. Sie sind zu sehr miteinander verstrickt.
  • Das „Message Queue"-Problem (Der verwirrte Kurier): Stellen Sie sich vor, Sie nutzen eine zentrale Poststelle (wie Kafka), um Daten zu liefern. Die Poststelle behandelt jedes Papierstück als separaten Brief. Doch der Roboter benötigt eine komplette Mahlzeit (einen Batch) auf einmal. Wenn die Poststelle den „Hähnchen"-Teil der Mahlzeit zu einem Roboterarm und den „Reis"-Teil zu einem anderen Arm zu unterschiedlichen Zeiten liefert, gerät der Roboter in Verwirrung und lernt die falschen Dinge. Außerdem ist die Poststelle ein einzelner Ausfallpunkt; wenn der Postmeister krank wird, bekommt niemand etwas zu essen.

2. Die Lakestream-Lösung: Ein gemeinsames digitales Lagerhaus

Lakestream beseitigt die zentrale Poststelle und die beengte Küche. Stattdessen nutzt es einen massiven, gemeinsamen Object Storage (wie ein riesiges, unendliches digitales Lagerhaus, z. B. Amazon S3) und ein versioniertes Manifest (ein Hauptbuch).

Hier sind die drei magischen Tricks, die Lakestream anwendet:

A. Der „Transaktionale Globale Batch" (Die perfekte Mahlzeit)

In der Vergangenheit waren Daten nur ein Strom einzelner Datensätze. Lakestream behandelt einen ganzen „Batch" von Daten als eine einzelne, unzerstörbare Einheit, die Transaktionale Globale Batch (TGB) genannt wird.

  • Die Analogie: Stellen Sie sich einen Koch vor, der ein komplettes Bankett zubereitet. Das Essen ist gekocht und auf den Tisch gestellt, aber es ist mit einem Deckel abgedeckt. Der Deckel ist verschlossen. Niemand kann das Essen noch sehen.
  • Der magische Trick: Wenn der Koch sicher ist, dass das gesamte Bankett fertig ist, schaltet er am Hauptbuch (dem Manifest) einen Schalter um. Plötzlich hebt sich der Deckel, und jeder Roboterarm sieht die vollständige, perfekte Mahlzeit im exakt gleichen Moment. Wenn der Koch einen Teller fallen lässt, bevor er den Schalter umlegt, bleibt der Deckel unten, und niemand sieht das Chaos. Dies stellt sicher, dass alle stets mit denselben Daten arbeiten.

B. Der „Dezentrale Adaptive Commit" (Die intelligente Ampel)

Wenn viele Köche (Produzenten) versuchen, das Hauptbuch gleichzeitig zu aktualisieren, könnten sie versuchen, auf dieselbe Seite zu schreiben, was zu Konflikten führt.

  • Der alte Weg: Sie würden einfach weiter gegen die Tür hämmern, bis jemand sie hereinlässt, was Zeit verschwendet.
  • Der Lakestream-Weg (DAC): Die Köche haben einen intelligenten, selbstgelernten Rhythmus. Sie beobachten, wie beschäftigt das Hauptbuch ist. Wenn das Hauptbuch riesig wird und Updates langsam sind, warten sie automatisch ein winziges Stück länger, bevor sie erneut versuchen zu schreiben. Wenn es ruhig ist, schreiben sie schneller. Sie tun dies, ohne miteinander zu sprechen, sondern indem sie einfach das Hauptbuch betrachten. Dies hält den Verkehr auch dann flüssig, wenn Hunderte von Köchen gleichzeitig arbeiten.

C. Der „Checkpoint-Abgestimmte Lebenszyklus" (Der Zeitreise-Safe)

KI-Modelle müssen oft ihren Fortschritt speichern (Checkpoint) und manchmal zu einem früheren Speicherstand zurückkehren, um einen anderen Pfad zu versuchen.

  • Das Problem: In alten Systemen ist Daten, sobald sie „gegessen" wurden, weg. Wenn Sie zurückkehren müssen, können Sie es nicht.
  • Der Lakestream-Weg: Das System bewahrt eine Geschichte jeder servierten Mahlzeit auf, die mit dem spezifischen „Speicherstand" des Roboters verknüpft ist. Wenn der Roboter seinen Fortschritt speichert, schreibt er auch einen „Wasserzeichen" (eine Sicherheitslinie) in das Hauptbuch. Das System weiß, dass alle Daten vor dieser Linie sicher und geborgen bleiben müssen. Es löscht die alten Daten erst, wenn es weiß, dass kein Roboter-Speicherstand sie mehr benötigt. Dies bedeutet, dass Sie die Zeit perfekt zurückspulen können, ohne Ihre Daten zu verlieren, und Sie müssen nicht für die Speicherung von Daten bezahlen, die niemand benötigt.

3. Die Ergebnisse

Das Papier testete dieses System auf 64 leistungsstarken GPUs mit riesigen Video- und Bilddatensätzen.

  • Geschwindigkeit: Es war 2,7- bis 7,7-mal schneller als die besten bestehenden „co-locierten" Systeme (bei denen Datenvorbereitung und Training zusammen stattfinden).
  • Zuverlässigkeit: Es ging viel besser mit Ausfällen um. Wenn ein Datenvorbereitungs-Arbeiter abstürzte, setzte der Roboter das Training ohne Unterbrechung fort.
  • Effizienz: Es war viel schneller als die Nutzung einer zentralen Nachrichtenwarteschlange (wie Kafka), die mit der Größe und Komplexität der Daten kaum Schritt halten konnte.

Zusammenfassung

Lakestream ist wie der Ersatz einer chaotischen, einspurigen Straße durch ein intelligentes, dezentrales Autobahnsystem. Es nutzt ein gemeinsames Lagerhaus und ein Hauptbuch, um sicherzustellen, dass:

  1. Jeder zur exakt gleichen Zeit den exakt gleichen „Batch" von Daten erhält.
  2. Das System auch dann schnell bleibt, wenn der Verkehr stark wird.
  3. Sie den Trainingsprozess zu jedem Zeitpunkt in der Geschichte zurückspulen können, ohne Ihre Daten zu verlieren.

Es erreicht all dies, ohne einen zentralen Manager (Broker) zu benötigen, der allen sagt, was zu tun ist, was es schneller, günstiger und zuverlässiger für das Training der größten KI-Modelle der Welt macht.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →