← Neueste Arbeiten
🤖 machine learning

SlimQwen: Exploring the Pruning and Distillation in Large MoE Model Pre-training

Dieser Beitrag untersucht systematisch strukturiertes Pruning und Wissensdistillation zur Komprimierung großskaliger Mixture-of-Experts (MoE)-Modelle während des Pretrainings und zeigt, dass Pruning eine überlegene Initialisierung bietet, schrittweise Komprimierungspläne One-Shot-Methoden übertreffen und die Kombination von Sprachmodellierung mit Multi-Token-Vorhersage-Distillation in einem deutlich kleineren Modell wettbewerbsfähige Leistung erzielt.

Ursprüngliche Autoren: Shengkun Tang, Zekun Wang, Bo Zheng, Liangyu Wang, Rui Men, Siqi Zhang, Xiulong Yuan, Zihan Qiu, Zhiqiang Shen, Dayiheng Liu

Veröffentlicht 2026-05-12
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Shengkun Tang, Zekun Wang, Bo Zheng, Liangyu Wang, Rui Men, Siqi Zhang, Xiulong Yuan, Zihan Qiu, Zhiqiang Shen, Dayiheng Liu

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie besitzen eine massive, extrem intensive Wissensbibliothek (ein riesiges KI-Modell), die unglaublich teuer im Betrieb und langsam beim Abruf ist. Sie möchten sie auf eine taschengroße Version verkleinern, die fast alles weiß, ohne die Bibliothek von Grund auf neu aufbauen zu müssen.

Dieser Artikel mit dem Titel "SlimQwen" ist ein Leitfaden, wie genau das für eine bestimmte Art von KI-Architektur, genannt Mixture-of-Experts (MoE), erreicht werden kann. Denken Sie an ein MoE-Modell nicht als ein einzelnes Gehirn, sondern als ein riesiges Team von Spezialisten. Einige sind Mathe-Genies, einige sind Coding-Zauberer und einige sind Sprachexperten. Normalerweise werden nur wenige Spezialisten hinzugezogen, um jede gegebene Frage zu beantworten.

Die Forscher stellten sich die Frage: Wie verkleinern wir dieses riesige Expertenteam zu einem kleineren, schnelleren Team, ohne ihr kollektives Genie zu verlieren?

Hier ist die Aufschlüsselung ihrer Erkenntnisse mit einfachen Analogien:

1. Die Analogie vom "Gebrauchtwagen" vs. "Neubau"

Die Frage: Ist es besser, einen gebrauchten, leicht modifizierten Wagen zu kaufen (ein großes Modell zu beschneiden) oder ein neues Auto mit demselben Budget von Grund auf zu bauen?
Die Erkenntnis: Der Kauf des "gebrauchten" Autos gewinnt jedes Mal.
Der Artikel zeigt, dass wenn Sie ein riesiges, vortrainiertes Modell nehmen und es auf eine kleinere Größe zuschneiden (beschneiden), dieses kleinere Modell mit einem massiven Vorsprung startet. Es ist, als würde man einem erfahrenen Koch eine kleinere Küche geben; er kann sofort großartige Mahlzeiten zubereiten. Wenn Sie versuchen, einen neuen Koch von Tag eins an in dieser kleinen Küche auszubilden, braucht er viel länger, um zu lernen, und holt den erfahrenen Koch nie ein, selbst wenn Sie ihm die gleiche Übungszeit geben.

2. Die Analogie vom "Aktenschrank" (Expertenkompaktierung)

Die Frage: Wenn Sie das Expertenteam verkleinern, wie entscheiden Sie dann, wen Sie feuern und wen Sie behalten? Sollten Sie einfach diejenigen feuern, die am wenigsten sprechen?
Die Erkenntnis: Es ist nicht zu wichtig, wie Sie die anfänglichen Kürzungen auswählen, solange Sie das Team danach "neu trainieren" lassen.
Die Forscher probierten verschiedene Methoden aus, um zu entscheiden, welche Experten zu behalten sind (wie das Entlassen derjenigen, die am wenigsten sprechen, oder derer mit den niedrigsten Bewertungen). Sie stellten fest, dass das kleinere Team nach viel neuer Übung (kontinuierliches Vortraining) alle fast gleich gut abschneidet.
Das Geheimnis: Allerdings entdeckten sie einen Trick namens "Partielle Erhaltung". Stellen Sie sich vor, Sie haben 100 Experten und müssen 50 behalten. Anstatt einfach die Top-50 auszuwählen und den Rest zu feuern, behielten sie die Top-25 exakt so, wie sie waren, und besetzten die verbleibenden 25 Plätze, indem sie die "entlassenen" Experten mit den "behaltenen" verschmolzen. Das ist, als würden Sie Ihre Star-Spieler intakt lassen, während die Bankspieler ihre Fähigkeiten mit den Startspielern verschmelzen. Diese spezifische Strategie machte das finale Team etwas schlauer, als einfach nur zufällig die Top-50 auszuwählen.

3. Die Analogie vom "Nachhilfelehrer" (Distillation)

Die Frage: Wie bringen wir dem kleinen Team bei, wie das große Team zu denken?
Die Erkenntnis: Sagen Sie ihnen nicht nur die richtige Antwort; lassen Sie sie den "Denkprozess" des großen Teams hören, während sie auch aus dem Lehrbuch lernen.
Normalerweise verwenden Sie beim Verkleinern eines Modells eine Technik namens Wissensdistillation, bei der das kleine Modell versucht, die Antworten des großen Modells zu kopieren. Der Artikel fand heraus, dass die beste Methode ein hybrider Ansatz ist:

  • Das Lehrbuch: Lassen Sie das kleine Modell aus den tatsächlichen korrekten Antworten lernen (Standard-Sprachmodellierung).
  • Der Nachhilfelehrer: Lassen Sie es auch die "weichen" Vermutungen des großen Modells hören (Distillation).
    Beides zusammen zu tun, funktioniert besser als das bloße Kopieren des großen Modells.

Der neue Trick (MTP-Distillation): Sie führten zudem eine neue Lehrmethode namens Multi-Token-Vorhersage ein.

  • Normales Lehren: "Hier ist ein Satz. Was ist das nächste Wort?"
  • MTP-Lehren: "Hier ist ein Satz. Was ist das nächste Wort, UND das danach, UND das danach?"
    Dies hilft dem kleinen Modell, vorauszuplanen, was es beim tatsächlichen Generieren von Text später schneller und genauer macht.

4. Die Analogie von der "Treppe" vs. "der Klippe" (Progressives Beschneiden)

Die Frage: Sollten wir das Modell auf einmal abschneiden (One-Shot) oder langsam in Schritten verkleinern?
Die Erkenntnis: Die Treppe ist besser.
Wenn Sie ein riesiges Modell nehmen und sofort 75 % seiner Größe abschneiden, ist das wie ein Sprung von einer Klippe. Das Modell wird verwirrt und verliert Wissen.
Stattdessen stellten die Forscher fest, dass Progressives Beschneiden am besten funktioniert. Stellen Sie sich vor, Sie gehen eine Treppe hinunter:

  1. Schneiden Sie das Modell ein wenig ab (z. B. entfernen Sie einige Schichten).
  2. Lassen Sie es üben und stabilisieren.
  3. Schneiden Sie es noch ein wenig mehr ab.
  4. Lassen Sie es erneut üben.
    Dieser schrittweise Übergang ermöglicht es dem Modell, sich auf jeder neuen, kleineren Größe "neu zu lernen", was zu einem viel intelligenteren Endergebnis führt als die "Klippen-Methode".

Das Endergebnis: SlimQwen

Durch die Kombination all dieser Tricks – beginnend mit einem beschnittenen Modell, Verwendung einer intelligenten "partiellen Erhaltungs"-Strategie für Experten, Mischung aus Lehrbuchlernen und Nachhilfeanleitung sowie das Verkleinern des Modells über eine Treppe statt einer Klippe – gelang es ihnen, ein massives 80-Milliarden-Parameter-Modell in ein winziges 23-Milliarden-Parameter-Modell zu komprimieren.

Trotzdem, dass es fast viermal kleiner ist, schneidet dieses "SlimQwen"-Modell bei schwierigen Aufgaben wie Mathematik, Programmieren und Allgemeinwissen wettbewerbsfähig ab und beweist, dass man kein riesiges Gehirn braucht, um kluge Dinge zu tun, wenn man weiß, wie man es richtig verkleinert.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →