Pruning and Distilling Mixture-of-Experts into Dense Language Models
Dieser Beitrag stellt ein neuartiges Framework vor, das trainierte Mixture-of-Experts (MoE)-Modelle durch Scoring, Selektion und Gruppierung von Experten gefolgt von Wissensdistillation in Standard-Dense-Architekturen umwandelt und zeigt, dass dieser Ansatz traditionelles Dense-zu-Dense-Pruning in Bezug auf Genauigkeit und Trainingseffizienz deutlich übertrifft.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Das große Problem: Der Engpass „Alle Hände an Deck"
Stellen Sie sich eine riesige, hochmoderne Restaurantküche (das MoE-Modell) vor, die darauf ausgelegt ist, unglaublich komplexe Gerichte zuzubereiten. Diese Küche verfügt über 128 verschiedene Spezialkoch-Experten im Personal. Für jede einzelne Bestellung ruft der Küchenchef (der Router) jedoch nur 8 von ihnen zur Arbeit. Die anderen 120 Köche stehen untätig da und warten auf ihren Einsatz.
Diese Einrichtung ist großartig für Kochgeschwindigkeit und Vielfalt, hat aber ein riesiges Problem: Um die Küche zu eröffnen, müssen Sie alle 128 Köche einstellen und bezahlen. Auch wenn Sie nur gleichzeitig 8 einsetzen, benötigen Sie genügend Platz (Speicher) und Geld (Rechenleistung), um alle 128 auf der Gehaltsliste zu halten. Dies macht es unmöglich, eine kleine Filiale dieses Restaurants in einem winzigen Laden (wie einem Telefon oder einem einzelnen Computer) zu eröffnen, da dort nicht genug Platz für das gesamte Personal ist.
Aktuelle Lösungen versuchen, einige Köche zu entlassen, um die Küche kleiner zu machen, aber Sie müssen die verbleibenden Köche dennoch auf separaten, spezialisierten Stationen behalten. Sie müssen immer noch alle ins Gebäude laden.
Die Lösung: Die „Meisterkoch"-Transformation
Die Autoren dieses Papiers schlagen ein radikales neues Rezept vor. Anstatt nur Köche zu feuern, wollen sie die besten 8 Köche zu einem Super-Koch zusammenführen, der alles kann, was das Team getan hat, aber ohne den zusätzlichen Platzbedarf.
Sie nehmen das trainierte Team aus 128 Spezialisten und verwandeln es in eine standardmäßige, dichte Küche (ein Dichtes Modell), die in einen kleinen Laden passt, aber dennoch wie ein Meister kocht.
Wie sie es taten: Der dreistufige Prozess
Das Papier beschreibt einen dreistufigen Prozess, um die „MoE-Küche" in eine „Dichte Küche" zu verwandeln.
1. Bewertung: Die „Sterne"-Köche finden
Zuerst müssen sie entscheiden, welche Köche sie behalten. Sie können nicht einfach die auswählen, die am häufigsten aufgerufen werden (Häufigkeit), denn diese könnten die „Allrounder" sein, die alles einigermaßen, aber nichts Großartiges machen.
- Der alte Weg: Wählen Sie die Köche aus, die am häufigsten gerufen werden. (Wie die beliebtesten Mitarbeiter auswählen).
- Der neue Weg (Vielfaltsbewusste Bewertung): Die Autoren entwickelten eine neue Metrik namens DO-ACP. Stellen Sie sich vor, Sie wählen eine Sportmannschaft aus. Sie wählen nicht einfach die 8 Spieler aus, die die meisten Spiele spielen; Sie wählen die 8 Spieler aus, die die vielfältigsten Fähigkeiten haben und in diesen spezifischen Fähigkeiten die Besten sind.
- Wenn Koch A großartig im Backen ist und Koch B großartig im Grillen, wollen Sie beide.
- Wenn Koch C und Koch D beide großartig im Grillen sind, brauchen Sie nur einen von ihnen.
- Die neue Methode stellt mathematisch sicher, dass die ausgewählten Köche das breiteste Spektrum an „Geschmacksrichtungen" (Wissen) ohne Redundanz abdecken.
2. Gruppierung & Zusammenführung: Den Super-Koch bauen
Sobald sie die Top-8-Köche ausgewählt haben (oder ein paar mehr, auf Nummer sicher zu gehen), müssen sie sie kombinieren.
- Reines Beschneiden (Der Gewinner): In den meisten Fällen führte das beste Ergebnis dazu, die Top-8-Köche einfach direkt in die neue Küche zu kopieren, ohne ihre Rezepte zu mischen. Es stellt sich heraus, dass 8 verschiedene, hochwertige Spezialisten, die nebeneinander arbeiten, besser sind als der Versuch, ihre Rezepte zu einem durchschnittlichen Rezept zu vermischen.
- Zusammenführung: Wenn sie mehr als 8 auswählen müssten, würden sie die Rezepte ähnlicher Köche gewichtet nach ihrer Leistung miteinander vermischen.
3. Wissensdistillation: Das „Geschmackstest"-Training
Jetzt haben sie eine neue Küche mit 8 Köchen (der Schüler), aber sie ist noch nicht perfekt. Es ist wie ein neues Restaurant mit dem richtigen Personal, das aber noch nicht die geheimen Familienrezepte gelernt hat.
Sie setzen die neue Küche neben die ursprüngliche 128-Köche-Küche (der Lehrer).
- Der Lehrer kocht ein Gericht.
- Der Schüler versucht, genau dasselbe Gericht zu kochen.
- Der Lehrer korrigiert den Schüler: „Nein, Sie haben zu viel Salz hinzugefügt" oder „Sie haben das subtile Gewürz verpasst."
- Der Schüler lernt aus diesen Korrekturen. Dieser Prozess wird Wissensdistillation genannt.
Die Ergebnisse: Warum dies wichtig ist
Die Autoren testeten dies an mehreren massiven KI-Modellen (wie Qwen3, DeepSeek und GPT-OSS). Hier ist, was sie herausfanden:
- Die richtigen Köche auszuwählen ist alles: Die Methode zur Bewertung der Köche war wichtiger als die Art und Weise, wie sie gruppiert wurden. Ihre neue „vielfaltsbewusste" Bewertung war der klare Gewinner und schlug alle bisherigen Methoden mit einem signifikanten Vorsprung.
- Nicht mischen, einfach auswählen: Überraschenderweise war die beste Strategie, genau 8 Köche auszuwählen und sie überhaupt nicht zu mischen. Einfach nur die 8 besten, vielfältigsten Experten zusammenarbeiten zu lassen, war besser, als sie zu mitteln.
- Die Konkurrenz schlagen: Sie verglichen ihre „MoE-zu-Dicht"-Methode mit dem alten Weg, kleine Modelle herzustellen (ein großes dichtes Modell zu nehmen und es zu verkleinern).
- Das Ergebnis: Ihre neue Methode produzierte ein Schülermodell, das bei durchschnittlichen Aufgaben 6,3 % genauer war.
- Geschwindigkeit: Es war auch 1,6-mal schneller zu trainieren, da die ursprüngliche „Lehrer"-Küche während des Trainingsprozesses effizienter zu betreiben war.
Das Fazit
Betrachten Sie dieses Papier als Bauplan für die Verkleinerung eines riesigen Unternehmenshauptsitzes zu einem kleinen, effizienten Startup-Büro, ohne die Intelligenz des Unternehmens zu verlieren.
Anstatt nur Leute zu feuern, um die Miete zu sparen, wählten sie sorgfältig die 8 vielseitigsten und talentiertesten Mitarbeiter aus, gaben ihnen ein neues, kompaktes Büro und ließen sie die Geheimnisse des Unternehmens vom ursprünglichen großen Team lernen. Das Ergebnis? Ein kleines Büro, das genauso gut funktioniert wie das große, aber in viel weniger Platz passt.
Wichtigste Erkenntnis: Sie müssen nicht das gesamte massive Team behalten, um die Ergebnisse zu erzielen; Sie müssen nur die richtigen 8 auswählen, sie getrennt halten und sie gut unterrichten.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.