← Neueste Arbeiten
💬 NLP

Can Model Merging Improve Aggregation in DiLoCo?

Diese Arbeit schließt die Lücke zwischen Model Merging und verteiltem Lernen, indem sie zeigt, dass die Anpassung der Iso-C-Merging-Technik mit Nesterov-Momentum (IsoLoCo) bestehende DiLoCo-Methoden beim verteilten Training mit geringer Kommunikationsrate signifikant übertrifft, insbesondere wenn die Anzahl der lokalen Worker steigt.

Ursprüngliche Autoren: Stefan Horoi, Benjamin Thérien, Guy Wolf, Eugene Belilovsky

Veröffentlicht 2026-07-07
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Stefan Horoi, Benjamin Thérien, Guy Wolf, Eugene Belilovsky

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie versuchen, ein riesiges, superintelligentes KI-Gehirn zu trainieren. Um dies zu tun, benötigen Sie eine gewaltige Menge an Rechenleistung. Normalerweise nutzen Unternehmen einen „datenparallelen“ Ansatz: Sie stellen hunderte von Computern nebeneinander auf, die alle exakt die gleiche Aufgabe zur gleichen Zeit ausführen und ständig Updates aneinander weitergeben. Das ist schnell, erfordert aber teure, Hochgeschwindigkeitskabel, die jeden einzelnen Computer miteinander verbinden. Wenn ein Computer langsam ist oder ein Kabel schwach ist, muss die gesamte Reihe warten.

Das Problem: Der „Insel“-Ansatz
Um Geld zu sparen und schwächere Verbindungen nutzen zu können, entwickelten Forscher eine Methode namens DiLoCo. Stellen Sie sich vor, anstatt einer einzigen Linie gibt es viele separate „Inseln“ von Computern.

  1. Jede Insel trainiert eine Zeit lang (sagen wir 30 Schritte) ihre eigene Version des KI-Gehirns unabhängig voneinander.
  2. Sie kommunizieren während dieser 30 Schritte nicht.
  3. Nach 30 Schritten senden sie eine Zusammenfassung dessen, was sie gelernt haben (einen „Pseudo-Gradienten“), an einen zentralen Hub.
  4. Der Hub berechnet den Durchschnitt dieser Zusammenfassungen und aktualisiert das Hauptgehirn.

Der Fehler:
Die Arbeit fand einen Mangel in diesem „Insel“-Ansatz. Wenn man mehr Inseln (Arbeiter) hinzufügt oder sie länger trainieren lässt, bevor sie kommunizieren, beginnt die KI verwirrt zu werden. Es ist wie eine Gruppe von Menschen, die versucht, gemeinsam ein Bild zu zeichnen, ohne miteinander zu sprechen: Wenn sie zu lange alleine arbeiten, fangen sie an, unterschiedliche Dinge zu zeichnen, und wenn sie dann versuchen, ihre Arbeit zu kombinieren, ist das Ergebnis chaotisch. In technischen Begriffen: Die „Updates“ der verschiedenen Inseln beginnen miteinander zu kollidieren, was die Leistung der KI verschlechtert.

Die Inspiration: Das Verschmelzen von Expertenmodellen
Parallel dazu arbeitete eine andere Gruppe von Forschern an Model Merging (Modell-Merging). Stellen Sie sich vor, Sie haben einen Expertenkoch, der gelernt hat, italienisch zu kochen, und einen anderen, der gelernt hat, japanisch zu kochen. Sie wollen einen Koch, der beides kann.

  • Der alte Weg: Man mittelt einfach ihre Rezepte. Das scheitert oft, weil die Zutaten kollidieren (z. B. die Mischung von Sojasauce und Sahne).
  • Der neue Weg (Task Arithmetic): Anstatt das ganze Rezept zu mitteln, betrachtet man stat die Differenz zwischen dem fertigen Rezept des Experten und dem ursprünglichen Basismethode. Dann kombiniert man sorgfältig nur diese Differenzen.

Der große „Aha!“-Moment der Arbeit war die Erkenntnis, dass DiLoCo im Grunde dasselbe macht wie Model Merging, nur in einer Schleife.

  • Das „Basismodell“ ist das KI-Gehirn vom letzten Mal, als alle kommuniziert haben.
  • Die „Inseln“ sind die Experten, die für sich selbst trainiert haben.
  • Die „Updates“, die sie zurücksenden, sind die „Differenzen“ (oder Task-Vektoren).

Die Arbeit argumentiert, dass der Grund, warum DiLoCo bei vielen Inseln chaotisch wird, derselbe Grund ist, warum das Verschmelzen von Rezepten chaotisch wird: Interferenz. Die Updates der verschiedenen Inseln kämpfen gegeneinander.

Die Lösung: IsoLoCo
Die Autoren entschieden sich dafür, das „beste Rezept“ aus der Welt des Model Merging zu entleihen, um DiLoCo zu korrigieren. Sie testeten verschiedene Merging-Techniken und fanden heraus, dass eine Methode namens Iso-C (isotropes Merging) am besten funktionierte.

Stellen Sie sich Iso-C wie einen „Harmonisierer“ für die Updates vor. Wenn die Inseln ihre Updates zurücksenden:

  1. Schaut sich der Harmonisierer die „Form“ der Updates an.
  2. Wenn eine Insel in einer bestimmten Richtung (einer spezifischen mathematischen Richtung) zu laut schreit, regelt der Harmonisierer die Lautstärke herunter, um sie an den Durchschnitt anzupassen.
  3. Dies verhindert, dass eine einzelne Insel die anderen dominiert oder mit ihnen kollidiert, was zu einem glatteren, ausgewogeneren kombinierten Update führt.

Sie nahmen diesen „Harmonisierer“ und fügten eine „Momentum“-Funktion hinzu (wie ein Läufer, der sein Tempo beibehält, auch wenn die Straße holprig wird), um eine neue Methode zu erschaffen, die sie IsoLoCo nennen.

Die Ergebnisse
Die Arbeit testete dies an verschiedenen Größen von KI-Modellen und mit verschiedenen Anzahlen von Inseln (von 1 bis 128).

  • Der Gewinner: IsoLoCo schlug die ursprüngliche DiLoCo-Methode konsequent.
  • Der Vorsprung: Je mehr Inseln man hinzufügte, desto größer war der Vorteil von IsoLoCo. Bei 128 Inseln wurde die ursprüngliche Methode ziemlich chaotisch, aber IsoLoCo blieb sauber und effizient.
  • Die Geschwindigkeit: Sie entwickelten auch einen „Schnellmodus“ für IsoLoCo unter Verwendung eines mathematischen Shortcuts (Newton-Schulz-Iterationen), der den Prozess viel schneller machte, ohne die Qualität zu verlieren.

Zusammenfassend
Die Arbeit zeigt, dass wir, indem wir das verteilte KI-Training wie ein „Verschmelzen von Experten“-Problem behandeln, fortgeschrittene mathematische Tricks nutzen können, um zu verhindern, dass die Computer gegeneinander kämpfen. Dies ermöglicht es uns, massive KI-Modelle über viele schwach verbundene Computer hinweg zu trainieren, ohne die Leistung zu verlieren, was das Training großer KI-Modelle kostengünstiger und skalierbarer macht.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →