← Nieuwste papers
💬 NLP

Decoupled DiLoCo for Resilient Distributed Pre-training

Dit paper introduceert Decoupled DiLoCo, een asynchrone distributieframework dat de traditionele SPMD-paradigma doorbreekt om trainingssnelheid en -resilientie te maximaliseren door lokale learners onafhankelijk te laten werken en updates te synchroniseren via een adaptief quorum-mechanisme, zelfs bij hardwarestoringen.

Oorspronkelijke auteurs: Arthur Douillard, Keith Rush, Yani Donchev, Zachary Charles, Nova Fallen, Ayush Dubey, Ionel Gog, Josef Dean, Blake Woodworth, Zachary Garrett, Nate Keating, Jenny Bishop, Henry Prior, Edouard Yvinec
Gepubliceerd 2026-04-24
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Arthur Douillard, Keith Rush, Yani Donchev, Zachary Charles, Nova Fallen, Ayush Dubey, Ionel Gog, Josef Dean, Blake Woodworth, Zachary Garrett, Nate Keating, Jenny Bishop, Henry Prior, Edouard Yvinec, Arthur Szlam, Marc'Aurelio Ranzato, Jeff Dean

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

🚂 De Trein die nooit stopt: Decoupled DiLoCo

Stel je voor dat je een gigantische trein hebt die een heel land moet verkennen om een geheim te vinden (het "trainen" van een slimme AI).

De oude manier (SPMD): De Perfecte Trein
Vroeger werkte alles volgens het principe van de "Perfecte Trein". Alle wagons (de computerchips) waren aan elkaar gelast. Ze reden in perfect ritme: als wagon 1 een stap deed, deden wagon 2, 3 en 4 dat exact op hetzelfde moment.

  • Het probleem: Als er één wiel leegliep of één wagon vastliep in de modder, moest de hele trein stoppen. Niemand kon verder. In een wereld met miljoenen wagons (chips) is het bijna onmogelijk dat er nooit iets misgaat. Dit kostte enorme hoeveelheden tijd en geld.

De nieuwe manier (Decoupled DiLoCo): De Karavaan
De onderzoekers van Google hebben een nieuwe manier bedacht. In plaats van één grote, gelaste trein, hebben ze een karavaan van losse vrachtwagens gemaakt.

  1. Onafhankelijke Chauffeurs (De "Learners"):
    Elke vrachtwagen rijdt zijn eigen route. Ze hebben allemaal een kaart van hetzelfde gebied, maar ze rijden niet in lockstep. Als vrachtwagen A vastzit in de modder (een hardware-storing), rijden vrachtwagen B, C en D gewoon door. Ze stoppen niet. Ze verzamelen hun eigen kennis terwijl ze rijden.

  2. De Regisseur (De "Syncer"):
    Er is één centrale regisseur (een computer op een rustige plek) die niet in de modder staat. Deze regisseur wacht niet tot iedereen terug is. Zodra er genoeg vrachtwagens (bijvoorbeeld 8 van de 10) een update hebben gestuurd, pakt de regisseur die updates, mixt ze samen tot een nieuwe, betere kaart, en stuurt die terug.

    • De magische truc: De vrachtwagens die vastzitten, hoeven niet te wachten. Zodra ze weer rijden, krijgen ze de nieuwe kaart en hollen ze bij. De trein stopt nooit.

🧩 De Puzzelstukjes (Fragmentatie)

Stel je voor dat de "kaart" (het brein van de AI) een enorme puzzel is van 10.000 stukjes.

  • Oude methode: Je moet de hele puzzel uitwisselen tussen de wagons elke seconde. Dat is veel werk en veel files op de weg (bandbreedte).
  • Nieuwe methode: De puzzel is opgedeeld in stukjes. Vrachtwagen A stuurt alleen stukje 1, Vrachtwagen B stuurt stukje 2. Ze wisselen deze stukjes uit terwijl ze rijden. Hierdoor is er veel minder file, en kan de karavaan veel sneller en soepeler bewegen.

🌪️ Chaos als Superkracht

De onderzoekers noemen dit "Chaos Engineering". Ze hebben hun systeem opzettelijk laten crashen in simulaties.

  • Het resultaat: Bij de oude trein zou een crash van één wagon de hele reis vertragen met uren. Bij de nieuwe karavaan? De andere vrachtwagens merken er niets van. De reis gaat gewoon door.
  • De "Quorum" (Kwartier): De regisseur wacht niet op 100% van de vrachtwagens. Hij wacht op een "minimum aantal" (bijvoorbeeld 80%). Als er 20% van de vrachtwagens uitvalt, doet de regisseur gewoon alsof die er niet zijn, maakt de nieuwe kaart en stuurt die door. Zodra de uitvallers terugkomen, sluiten ze gewoon weer aan.

🏗️ Waarom is dit zo belangrijk?

  1. Geen tijdverlies: In de wereld van AI-training is tijd geld. Als je 10.000 computers hebt en er gaat er één stuk, is dat normaal. Met de oude methode verlies je 100% van je tijd. Met deze methode verlies je bijna niets.
  2. Schaalbaarheid: Je kunt nu computers van verschillende merken, verschillende snelheden en zelfs op verschillende plekken in de wereld gebruiken. De snelle vrachtwagens rijden wat sneller, de langzamere wat langzamer, maar de karavaan komt altijd aan op het doel.
  3. De "Scavenging" (Opscharrelen): Je kunt nu tijdelijk extra computers "lenen" van elders (bijvoorbeeld 's nachts als ze niet gebruikt worden). Omdat de systemen losgekoppeld zijn, kun je die extra kracht direct gebruiken zonder de hele trein te hoeven herconfigureren.

🎯 Conclusie in één zin

Decoupled DiLoCo is als het vervangen van een starre, gelaste trein door een flexibele karavaan van vrachtwagens: als er één kapot gaat, rijden de anderen gewoon door, en komt de bestelling (het slimme AI-model) toch op tijd en in perfecte staat aan.

Het is een manier om de "perfecte synchronisatie" op te geven voor ononderbroken voortgang, waardoor we in de toekomst veel grotere en slimmere AI's kunnen bouwen, zelfs als de hardware niet perfect is.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →