← Ultimi articoli
🤖 machine learning

Lakestream: A Consistent and Brokerless Data Plane for Large Foundation Model Training

Lakestream è un piano dati nativo per l'archiviazione di oggetti e privo di broker, destinato all'addestramento di grandi modelli fondazionali, che introduce i Lotti Globali Transazionali e un algoritmo di Commit Adattivo Decentralizzato per fornire consistenza simile a quella ACID, isolamento dei guasti e ingestione ad alta velocità con latenza inferiore rispetto alle soluzioni esistenti basate su code di messaggi o collocate.

Autori originali: Ting Sun, Junjie Zhang, Xiao Yan, Songxin Zhang, Zhuoyang Song, Jingyi Xi, Zunyao Mao, Bingyi Jing, Jiaxing Zhang, Zejian Xie

Pubblicato 2026-05-12
📖 6 min di lettura🧠 Approfondimento

Autori originali: Ting Sun, Junjie Zhang, Xiao Yan, Songxin Zhang, Zhuoyang Song, Jingyi Xi, Zunyao Mao, Bingyi Jing, Jiaxing Zhang, Zejian Xie

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immagina di dover insegnare a un robot gigante e super-intelligente (un Modello Fondazionale di grandi dimensioni) come comprendere il mondo. Per farlo, devi fornirgli enormi quantità di dati, come video, immagini e testo, un "batch" alla volta.

In passato, nutrire questo robot era come un semplice nastro trasportatore in una fabbrica. I dati erano già pre-confezionati in scatole, e il nastro le spostava verso il robot a un ritmo costante. Ma l'IA moderna è diversa. I dati sono disordinati, enormi e cambiano dimensione in base a ciò che contengono. A volte un singolo file video deve essere decompresso e "stirato" fino a diventare 1.000 volte più grande prima che il robot possa utilizzarlo.

I vecchi nastri trasportatori (i sistemi esistenti) non potevano gestire questa situazione. O si intasavano, oppure, se un lavoratore lasciava cadere una scatola, l'intera fabbrica si fermava.

Ecco Lakestream: il piano dati "Intelligente, senza Broker".

Gli autori di questo articolo hanno costruito un nuovo sistema chiamato Lakestream. Pensalo come un modo rivoluzionario per organizzare la consegna dei dati per questi giganti modelli di IA. Ecco come funziona, utilizzando semplici analogie:

1. Il problema dei vecchi metodi

  • Il problema "Colocato" (La cucina in palestra): Immagina che il robot (l'allenatore) stia sollevando pesi e la persona che gli prepara il cibo (il caricatore di dati) sia in piedi proprio accanto a lui nella stessa piccola stanza. Se la preparazione del cibo richiede troppo tempo, il robot deve smettere di sollevare pesi. Se la persona che prepara il cibo inciampa e cade, il robot si ferma per sempre. Sono troppo intrecciati tra loro.
  • Il problema della "Coda di messaggi" (Il corriere confuso): Immagina di usare un ufficio postale centrale (come Kafka) per consegnare i dati. L'ufficio postale tratta ogni foglio di carta come una lettera separata. Ma il robot ha bisogno di un pasto completo (un batch) tutto insieme. Se l'ufficio postale consegna la parte di "pollo" del pasto a un braccio del robot e la parte di "riso" a un altro braccio in momenti diversi, il robot si confonde e impara le cose sbagliate. Inoltre, l'ufficio postale è un singolo punto di guasto; se il direttore dell'ufficio postale si ammala, nessuno viene nutrito.

2. La soluzione Lakestream: un magazzino digitale condiviso

Lakestream elimina l'ufficio postale centrale e la cucina angusta. Invece, utilizza un massiccio Object Storage condiviso (come un magazzino digitale gigante e infinito, ad esempio Amazon S3) e un Manifesto Versionato (un libro mastro principale).

Ecco i tre trucchi magici che Lakestream utilizza:

A. Il "Batch Globale Transazionale" (Il pasto perfetto)

In passato, i dati erano semplicemente un flusso di record individuali. Lakestream tratta un intero "batch" di dati come un'unica unità indivisibile chiamata Transactional Global Batch (TGB).

  • L'analogia: Immagina uno chef che prepara un banchetto completo. Il cibo è cucinato e messo sul tavolo, ma è coperto da un coperchio. Il coperchio è bloccato. Nessuno può vedere il cibo ancora.
  • La magia: Quando lo chef è certo che l'intero banchetto sia pronto, preme un interruttore sul libro mastro (il Manifesto). Improvvisamente, il coperchio si alza e ogni braccio del robot vede il pasto completo e perfetto esattamente nello stesso momento. Se lo chef lascia cadere un piatto prima di premere l'interruttore, il coperchio rimane giù e nessuno vede il disastro. Questo garantisce che tutti lavorino sempre con gli stessi dati.

B. Il "Commit Adattivo Decentralizzato" (Il semaforo intelligente)

Quando molti chef (produttori) cercano di aggiornare il libro mastro contemporaneamente, potrebbero provare a scrivere sulla stessa pagina, causando un conflitto.

  • Il vecchio modo: Continuerebbero a bussare alla porta finché qualcuno non li lasciasse entrare, sprecando tempo.
  • Il modo Lakestream (DAC): I chef hanno un ritmo intelligente e auto-appreso. Osservano quanto è occupato il libro mastro. Se il libro mastro sta diventando enorme e gli aggiornamenti sono lenti, aspettano automaticamente un po' più a lungo prima di riprovare a scrivere. Se è tranquillo, scrivono più velocemente. Fanno questo senza parlarsi tra loro, guardando solo il libro mastro. Questo mantiene il traffico fluido anche quando centinaia di chef lavorano contemporaneamente.

C. Il "Ciclo di vita allineato ai checkpoint" (La cassaforte che viaggia nel tempo)

I modelli di IA spesso devono "salvare i progressi" (checkpoint) e talvolta tornare a un salvataggio precedente per provare un percorso diverso.

  • Il problema: Nei vecchi sistemi, una volta che i dati sono stati consumati, sono persi. Se hai bisogno di tornare indietro, non puoi.
  • Il modo Lakestream: Il sistema mantiene la cronologia di ogni pasto servito, legata al specifico "punto di salvataggio" del robot. Quando il robot salva i suoi progressi, scrive anche un "marcatore" (una linea di sicurezza) nel libro mastro. Il sistema sa di mantenere tutti i dati prima di quella linea al sicuro. Elimina i vecchi dati solo quando sa che nessun punto di salvataggio del robot ne ha più bisogno. Questo significa che puoi riavvolgere il tempo perfettamente senza perdere i tuoi dati, e non devi pagare per immagazzinare dati che nessuno necessita.

3. I risultati

L'articolo ha testato questo sistema su 64 GPU potenti con enormi dataset di video e immagini.

  • Velocità: È stato da 2,7 a 7,7 volte più veloce dei migliori sistemi "colocati" esistenti (dove la preparazione dei dati e l'addestramento avvengono insieme).
  • Affidabilità: Ha gestito i guasti molto meglio. Se un lavoratore della preparazione dei dati si bloccava, il robot continuava ad addestrarsi senza fermarsi.
  • Efficienza: Era molto più veloce rispetto all'uso di una coda di messaggi centrale (come Kafka), che faticava a tenere il passo con la dimensione e la complessità dei dati.

Riepilogo

Lakestream è come sostituire una strada caotica a una sola corsia con un sistema autostradale intelligente e decentralizzato. Utilizza un magazzino condiviso e un libro mastro principale per garantire che:

  1. Tutti ricevano esattamente lo stesso "batch" di dati nello stesso momento.
  2. Il sistema continui a muoversi velocemente anche quando il traffico diventa intenso.
  3. Possi riavvolgere il processo di addestramento a qualsiasi punto della storia senza perdere i tuoi dati.

Raggiunge tutto questo senza aver bisogno di un manager centrale (broker) per dire a tutti cosa fare, rendendolo più veloce, economico e affidabile per l'addestramento dei più grandi modelli di IA al mondo.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →