← Neueste Arbeiten
🤖 machine learning

Beyond Sunk Costs: Boosting LLM Pre-training Efficiency via Orthogonal Growth of Mixture-of-Experts

Dieser Beitrag stellt eine Strategie der „orthogonalen Erweiterung" vor, die bereits konvergierte Mixture-of-Experts-Checkpoints durch Erweiterung ihrer Tiefe und Breite wiederverwendet und nachweist, dass dieser Ansatz unter identischen Rechenbudgets durch die Nutzung vorheriger „versunkener Kosten" eine deutlich höhere Genauigkeit erzielt als ein Training von Grund auf.

Ursprüngliche Autoren: Ruizhe Wang, Yucheng Ding, Xiao Liu, Yaoxiang Wang, Peng Cheng, Baining Guo, Zhengjun Zha, Yeyun Gong

Veröffentlicht 2026-05-18
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Ruizhe Wang, Yucheng Ding, Xiao Liu, Yaoxiang Wang, Peng Cheng, Baining Guo, Zhengjun Zha, Yeyun Gong

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Das große Problem: Die Falle der "versunkenen Kosten"

Stellen Sie sich vor, Sie haben Jahre und Millionen von Dollar investiert, um eine riesige, hochqualifizierte Bibliothek von Büchern vorzubereiten (ein vortrainiertes KI-Modell). Sie haben es mit einer enormen Datenmenge trainiert, und es ist sehr gut in dem, was es tut. Doch dann stellen Sie fest, dass Sie eine größere Bibliothek benötigen, um noch komplexere Fragen zu beantworten.

Der alte Weg, dies zu tun, besteht darin, Ihre bestehende Bibliothek abzureißen und von vorne mit dem Bau einer neuen, größeren Bibliothek zu beginnen. Dies ist unglaublich teuer und verschwenderisch, da Sie all die bereits geleistete Arbeit wegwerfen. In geschäftlichen Begriffen sind dies "versunkene Kosten" – Geld und Aufwand, die bereits ausgegeben wurden und nicht zurückgewonnen werden können.

Dieses Paper fragt: Können wir diese alte Bibliothek recyceln, anstatt sie wegzuwerfen? Können wir das bestehende, gut trainierte Modell nehmen und es zu einem größeren, besseren Modell "wachsen" lassen, ohne von vorne zu beginnen?

Die Lösung: "Orthogonales Wachstum"

Die Autoren schlagen eine Methode namens Orthogonales Wachstum vor. Denken Sie an "orthogonal" als "im rechten Winkel" oder "unabhängig". Sie haben zwei unterschiedliche Wege gefunden, das Modell zu vergrößern, die sich nicht gegenseitig beeinträchtigen. Sie können in beliebiger Reihenfolge durchgeführt werden, wie das Anziehen von Socken vor Schuhen oder Schuhe vor Socken – das Ergebnis ist dasselbe.

1. Tiefenwachstum: Mehr Etagen hinzufügen (Der "Interpositions"-Trick)

Stellen Sie sich Ihr Modell als ein Wolkenkratzer mit 20 Etagen vor. Um es höher zu machen, könnten Sie einfach ein weiteres 20-stöckiges Gebäude auf das erste stapeln.

  • Der alte Weg (Stapeln): Wenn Sie einfach ein neues Gebäude auf das alte stapeln, muss der Aufzug (der Datenfluss) direkt von der obersten Etage des alten Gebäudes zur untersten Etage des neuen Gebäudes springen. Dies verursacht eine abrupte Unterbrechung. Die "Atmosphäre" des Gebäudes ändert sich schlagartig.
  • Der neue Weg (Interposition): Anstatt zu stapeln, schlagen die Autoren vor, Kopien der bestehenden Etagen zwischen die ursprünglichen einzufügen.
    • Analogie: Stellen Sie sich eine Tonleiter vor. Wenn Sie die Noten C, D, E, F, G... haben und das Lied länger machen wollen, wiederholen Sie nicht einfach das ganze Lied am Ende. Stattdessen fügen Sie ein zweites "C" direkt nach dem ersten "C" ein, ein zweites "D" nach dem ersten "D" und so weiter. Dies hält die Melodie flüssig und kontinuierlich.
    • Warum es funktioniert: Das Paper hat festgestellt, dass gut trainierte Modelle einen spezifischen "Rhythmus" in der Funktionsweise ihrer Schichten haben. Das Einfügen von Kopien bewahrt diesen Rhythmus, während das Stapeln ihn bricht. Diese Methode funktioniert am besten, wenn das Modell bereits vollständig trainiert ist (konvergiert).

2. Breitewachstum: Mehr Experten hinzufügen (Der "Spezialist"-Trick)

Stellen Sie sich nun das Modell als ein Krankenhaus vor. In jedem Raum (Schicht) gibt es ein paar Ärzte (Experten), die sich auf verschiedene Dinge spezialisieren. Das Modell hat einen "Router", der entscheidet, welcher Arzt für einen bestimmten Patienten gerufen wird.

  • Der alte Weg: Wenn Sie die Ärzte einfach exakt kopieren, haben Sie zwei identische Ärzte im Raum. Sie werden genau dasselbe tun, was redundant und verwirrend ist.
  • Der neue Weg: Die Autoren schlagen vor, die Ärzte zu kopieren, aber den neuen eine winzige Menge "Statik" oder "Rauschen" hinzuzufügen.
    • Analogie: Stellen Sie sich vor, Sie haben einen Meisterkoch. Sie stellen einen Klon dieses Kochs ein, geben dem Klon jedoch ein leicht anderes Gewürzbrett oder einen kleinen Kratzer auf der Schürze. Dieser kleine Unterschied zwingt den Klon, seinen eigenen einzigartigen Stil zu entwickeln und sich auf leicht andere Gerichte zu spezialisieren, anstatt den Meister einfach perfekt zu kopieren.
    • Warum es funktioniert: Dieses winzige Rauschen hilft den neuen Experten, zu lernen, verschiedene Aufgaben zu übernehmen (Spezialisierung), ohne das Wissen der ursprünglichen Experten zu zerstören.

Die Ergebnisse: Mehr Leistung für Ihr Geld

Die Forscher haben dies an Modellen im Bereich von 3 Milliarden bis 70 Milliarden Parametern getestet. Hier ist, was sie herausfanden:

  1. Recycling funktioniert: Sie können ein kleineres, vollständig trainiertes Modell nehmen und zu einem massiven Modell heranwachsen lassen.
  2. Besser als Neustart: Als sie das Wachstum eines Modells mit dem Training eines neuen, großen Modells von Grund auf verglichen, wobei sie die gleiche Menge an zusätzlicher Rechenleistung verwendeten, war das "herangewachsene" Modell 10,6 % genauer.
  3. Mehr Investition = Bessere Ergebnisse: Je mehr "versunkene Kosten" (Trainingszeit und Daten) Sie in das ursprüngliche kleine Modell stecken, bevor Sie es wachsen lassen, desto besser performt das finale große Modell. Es ist wie die Investition in ein solides Fundament; je höher Sie darauf bauen, desto besser steht das Gebäude.
  4. Reihenfolge spielt keine Rolle: Sie können zuerst Etagen hinzufügen und dann Experten, oder zuerst Experten hinzufügen und dann Etagen. Das Endergebnis ist dasselbe.

Das Fazit

Dieses Paper liefert einen Bauplan für eine "nachhaltige" KI-Entwicklung. Anstatt ständig Geld zu verbrennen, um neue Modelle von Grund auf zu bauen, können wir die Modelle, die wir bereits haben, unter Verwendung dieser beiden Tricks (Einfügen von Schichten und Hinzufügen verrauschter Experten) sorgfältig erweitern und erhalten ein deutlich intelligenteres, größeres Modell für weniger Geld. Es verwandelt die "Verschwendung" versunkener Kosten in einen wertvollen Vermögenswert.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →