← Ultimi articoli
🤖 AI

Decentralised AI Training and Inference with BlockTrain

Il documento introduce Spheroid BlockTrain, un protocollo di addestramento decentralizzato che suddivide i modelli in blocchi ottimizzati indipendentemente per democratizzare l'accesso all'IA all'avanguardia, consentendo un addestramento efficiente e un'inferenza ad alto throughput attraverso reti distribuite e con risorse limitate senza richiedere cluster di acceleratori centralizzati.

Autori originali: Peter Toth

Pubblicato 2026-06-24
📖 6 min di lettura🧠 Approfondimento

Autori originali: Peter Toth

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immagina di voler costruire un'enciclopedia enorme e incredibilmente intelligente. Nel mondo dell'IA moderna, il modo consueto per farlo è assumere un'unica, super-ricca società di costruzioni (un "hypscaler") che possiede un enorme magazzino pieno dei computer più potenti del mondo. Costruiscono l'intera enciclopedia in un unico luogo, tutto in una volta. Se non possiedi quel magazzino, non puoi aiutare a costruire l'enciclopedia.

"BlockTrain" di Spheroid Labs propone un modo diverso di costruire l'enciclopedia. Invece di un unico grande team in un unico magazzino, immagina un quartiere globale dove migliaia di persone con normali computer domestici costruiscono ciascuno solo un piccolo capitolo dell'enciclopedia.

Ecco come il documento spiega questo nuovo metodo, utilizzando analogie semplici:

1. Il Problema: Il collo di bottiglia del "Gigantesco Magazzino"

Attualmente, l'addestramento di un'IA avanzata richiede una potenza di calcolo tale che solo poche grandi aziende possono permetterselo. È come dire che solo un'azienda con una fabbrica da un miliardo di dollari può costruire un grattacielo. Questo esclude tutti gli altri. Il documento sostiene che se continuiamo a cercare di far costruire l'intero edificio in un unico luogo, non otterremo mai una vera decentralizzazione.

2. La Soluzione: L'approccio "Capitolo per Capitolo"

BlockTrain cambia le regole del gioco. Invece di chiedere a ogni computer di contenere l'intera enciclopedia nella sua memoria (il che è impossibile per un computer domestico), suddivide il modello di IA in piccoli pezzi indipendenti chiamati blocchi.

  • L'Analogia: Pensa al modello di IA come a una lunga staffetta. Nel vecchio modo, ogni corridore doveva trasportare l'intero mazzo di testimoni. In BlockTrain, la corsa è divisa in tratti. Ogni corridore (il computer di un lavoratore) trasporta solo il proprio specifico tratto della corsa.
  • Come funziona: Ogni computer addestra il proprio "blocco" (una piccola sezione dell'IA) per risolvere un puzzle specifico e locale. Non ha bisogno di vedere l'intera immagine per fare il suo lavoro. Deve solo far sì che la sua parte specifica sia corretta.

3. Il "Tocco Segreto": "Denoising" del Puzzle

Il documento utilizza una tecnica specifica chiamata DiffusionBlocks.

  • L'Analogia: Immagina di cercare di indovinare che aspetto abbia un'immagine, ma qualcuno l'ha coperta con del rumore statico.
    • Nell'IA tradizionale, cerchi di indovinare l'intera immagine in una volta sola.
    • In BlockTrain, il "rumore" viene rimosso a stadi. Il primo blocco dell'IA impara a rimuovere il rumore pesante e sfocato (l'immagine generale). Il blocco successivo rimuove il rumore medio. Il blocco finale rimuove i minuscoli granelli di polvere.
  • La Magia: Ogni computer deve solo imparare come rimuovere il suo specifico tipo di rumore. Non ha bisogno di sapere come rimuovere il rumore per gli altri blocchi. Questo rende il compito abbastanza piccolo da poter essere gestito da un normale computer domestico.

4. Mettere Insieme il Puzzle

Una volta che tutti i vicini hanno addestrato il loro specifico capitolo, inviano i loro aggiornamenti a un "aggregatore" centrale.

  • L'Assemblaggio: Il sistema prende il Blocco 1, il Blocco 2 e il Blocco 3 e li incastra insieme come mattoncini LEGO.
  • Il Risultato: Anche se nessun singolo computer ha mai detenuto l'intero modello, il modello assemblato è abbastanza intelligente da leggere e scrivere testo. Il documento mostra che, su un test utilizzando testo reale (WikiText), questo modello assemblato è andato quasi bene quanto un modello addestrato in un enorme data center (ottenendo un punteggio di 1.359 contro 1.32 su una specifica scala di errore).

5. Il "Test del Traffico" (Velocità nel Mondo Reale)

I ricercatori non hanno testato questo sistema solo su un computer; lo hanno testato attraverso internet.

  • L'Esperimento: Hanno collegato computer in diverse località (alcuni nello stesso edificio, altri in giro per il paese) per vedere se i "capitoli" potessero essere inviati avanti e indietro senza perdersi o subire ritardi.
  • Il Risultato: Ha funzionato. Hanno trasferito con successo i "capitoli" (dati) sulla rete pubblica, ovvero su connessioni internet standard. Anche con i ritardi di internet e le connessioni più lente, il sistema ha continuato ad apprendere. Ha dimostrato che non è necessario un cavo in fibra ottica privato e super veloce tra i computer; internet regolare è abbastanza veloce se i pezzi sono abbastanza piccoli.

6. La "Consegna in un Solo Viaggio" (Inference)

Di solito, quando si pone una domanda a un'IA decentralizzata, la domanda deve passare attraverso ogni singolo computer uno dopo l'altro, come in un gioco del "telefono senza fili", il che è lento.

  • Il Trucco di BlockTrain: Il documento afferma che il loro sistema è diverso. Una volta assemblato il modello, può generare un'intera frase o un paragrafo in un unico passaggio attraverso la rete.
  • L'Analogia: Invece di passare un biglietto lungo una lunga fila di persone (una parola alla volta), BlockTrain consegna l'intero foglio di carta alla fila, e la fila elabora l'intero foglio in una volta sola. Questo lo rende molto più veloce nell'ottenere una risposta.

Sintesi delle Rivendicazioni

Il documento fa tre affermazioni concrete basate sui loro esperimenti:

  1. Impara: È possibile addestrare una vera IA su testo reale usando questo metodo "blocco per blocco", e ottiene un'intelligenza quasi pari ai grandi modelli centralizzati.
  2. Viaggia: È possibile inviare i dati di addestramento sulla rete pubblica (usando connessioni web standard) e comunque fare progressi.
  3. Serve: È possibile eseguire il modello finito attraverso diversi computer per rispondere a domande, e lo si fa in modo efficiente senza la necessità di un unico computer gigante che contenga tutto.

Cosa il documento NON rivendica:

  • Non afferma che sia pronto per l'uso commerciale oggi.
  • Non afferma che risolva tutti i problemi di sicurezza o di incentivi (come pagare le persone per aiutare).
  • Non afferma che funzioni per la diagnosi medica o altre applicazioni specifiche del mondo reale in questo momento.
  • Si concentra strettamente sulla capacità tecnica di addestrare e servire il modello utilizzando questo specifico metodo a "blocchi".

In breve, BlockTrain è un progetto su come costruire un enorme cervello di IA utilizzando migliaia di piccoli cervelli indipendenti che lavorano insieme, invece di un unico grande cervello in una singola stanza.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →