← Nieuwste papers
🤖 machine learning

DASH: Faster Shampoo via Batched Block Preconditioning and Efficient Inverse-Root Solvers

Dit artikel introduceert DASH, een aanzienlijk snellere implementatie van de Distributed Shampoo-optimizer die gebruikmaakt van 3D-tensorstacking voor verbeterde GPU-benutting en nieuwe inverse-wortel-solvers (Newton-DB en Chebyshev-benaderingen) om een versnelling van tot wel 5,6x te bereiken terwijl de convergentiekwaliteit gelijk blijft of wordt verbeterd.

Oorspronkelijke auteurs: Ionut-Vlad Modoranu, Philip Zmushko, Erik Schultheis, Mher Safaryan, Dan Alistarh

Gepubliceerd 2026-06-26
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Ionut-Vlad Modoranu, Philip Zmushko, Erik Schultheis, Mher Safaryan, Dan Alistarh

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een reusachtige robot probeert te leren een nieuwe taal te spreken. Om dit te doen, heb je een "optimizer" nodig—een slimme coach die de hersenen van de robot (de parameters) aanpast na elke les om fouten te minimaliseren.

Jarenlang was de meest populaire coach Adam, een methode die snel is maar een beetje "lui". Het kijkt alleen naar hoeveel elke individuele neuron moet veranderen, zonder te kijken naar hoe neuronen samenwerken in teams.

Maak kennis met Shampoo, een veel slimmere coach. In plaats van naar neuronen één voor één te kijken, kijkt Shampoo naar hoe ze in groepen met elkaar interageren. Dit leidt tot beter leren en modellen die later gemakkelijker te comprimeren zijn. Echter, er is een addertje onder het gras: Shampoo is ontzettend traag. Het is alsof je een genie als coach hebt die zoveel tijd besteedt aan het berekenen van de perfecte zet, dat de robot nauwelijks oefening krijgt.

Het paper introduceert DASH (Distributed Accelerated SHampoo), een nieuw systeem dat deze genie-coach op de snelheid van een sprinter laat draaien zonder zijn intelligentie te verliezen. Dit is hoe ze het deden, met behulp van eenvoudige analogieën:

1. De "Stapeling"-truc (Batched Block Preconditioning)

Het Probleem:
Stel je voor dat je een enorme bibliotheek aan boeken (de data) hebt die georganiseerd moeten worden. De oude manier (Distributed Shampoo) was om één boek te pakken, het te organiseren, terug te leggen, het volgende boek te pakken, het te organiseren, enzovoort. Zelfs als je 1.000 werkers (GPU's) had, stonden ze meestal te wachten tot de vorige persoon klaar was. Dit is inefficiënt.

De DASH-oplossing:
DASH verandert de workflow. In plaats van boeken één voor één te behandelen, stapelt het ze in nette, uniforme 3D-torens. Nu kunnen de werkers een hele toren grijpen en alle boeken in die toren tegelijkertijd organiseren.

  • De Analogie: Het is het verschil tussen een kassier die artikelen één voor één scant versus een lopende band die een hele doos met boodschappen direct in een machine scant.
  • Het Resultaat: Deze "stapeling" zorgt ervoor dat de krachtige grafische chips (GPU's) van de computer op volle capaciteit werken, waardoor de optimizer-stappen tot wel 5,6 keer sneller worden.

2. De "Short-cut" Wiskunde (Efficient Inverse-Root Solvers)

Het Probleem:
Om zijn werk te doen, moet Shampoo bij elke stap een zeer moeilijke wiskundige puzzel oplossen: het vinden van de "inverse square root" van een gigantische matrix. De oude manier om dit op te lossen was als het zoeken naar een speld in een hooiberg door elk stukje hooi één voor één te controleren (een methode genaamd Eigen-Value Decomposition). Het is accuraat, maar pijnlijk traag.

De DASH-oplossing:
De auteurs hebben twee nieuwe "shortcuts" geïntroduceerd om deze puzzel op te lossen:

  • Newton-DB: Een slimme iteratieve methode die met elke gok dichter bij het antwoord komt, zoals een GPS die je route herberekent terwijl je rijdt.
  • Chebyshev Polynomials: Een wiskundige benadering die het antwoord zeer snel raadt.
  • De Analogie: In plaats van elke weg in een doolhof af te lopen om de uitgang te vinden (de oude manier), zijn deze nieuwe methoden als het hebben van een kaart die de algemene richting aangeeft, waardoor je in een sprint naar de uitgang kunt rennen.

3. De "Liniaal"-kalibratie (Matrix Scaling)

Het Probleem:
Wanneer je deze shortcuts gebruikt, kan de wiskunde instabiel worden als de getallen te groot of te klein zijn. De oude methode gebruikte een "liniaal" (Frobenius norm) die te lang was, waardoor de getallen werden uitgerekt en de shortcuts veel meer stappen nodig hadden om te convergeren. Het was alsof je een kleine mier probeerde te meten met een meetlint van 30 meter; de precisie gaat verloren.

De DASH-oplossing:
De auteurs realiseerden zich dat ze een betere liniaal nodig hadden. Ze ontwikkelden een techniek genaamd Multi-Power-Iteration.

  • De Analogie: In plaats van de lengte van de mier te raden met een gigantisch meetlint, gebruiken ze een gespecialiseerde, hogeprecisie schuifmaat die perfect bij de mier past. Dit zorgt ervoor dat de wiskunde snel convergeert en niet crasht door numerieke fouten.

4. De Resultaten

Het paper testte DASH op een groot taalmodel (Llama met 953 miljoen parameters).

  • Snelheid: DASH voltooide het "denkgedeelte" van de trainingsstap 5,6 keer sneller dan de vorige beste versie.
  • Kwaliteit: Ondanks dat het veel sneller was, waren de modellen die met DASH getraind werden net zo goed, of zelfs iets beter, in het leren. Sterker nog, de nieuwe "Newton-DB" shortcut produceerde modellen met de laagste foutmarges (perplexity) van alle geteste methoden.

Samenvatting

Beschouw Shampoo als een Ferrari-motor die vastzat in de file omdat de bestuurder de panoramische route koos. DASH is diezelfde Ferrari-motor, maar nu heeft het:

  1. Een bredere snelweg (Stacking blocks) zodat het sneller kan rijden.
  2. Een GPS-shortcut (Newton-DB) om files te vermijden.
  3. Betere navigatietools (Multi-Power-Iteration) om te zorgen dat het niet verdwaalt.

Het resultaat is dat de "slimme" optimizer (Shampoo) niet langer te traag is om te gebruiken, wat het een praktische keuze maakt voor het trainen van de volgende generatie AI-modellen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →