← Nieuwste papers
🤖 machine learning

SlimQwen: Exploring the Pruning and Distillation in Large MoE Model Pre-training

Dit artikel onderzoekt systematisch gestructureerde pruning en kennisdistillatie voor het comprimeren van grootschalige Mixture-of-Experts (MoE)-modellen tijdens het vooraf trainen, en toont aan dat pruning een superieure initialisatie biedt, dat geleidelijke compressieschema's beter presteren dan one-shot-methoden, en dat het combineren van taalkundige modellering met multi-token-predictiedistillatie concurrerende prestaties oplevert in een aanzienlijk kleiner model.

Oorspronkelijke auteurs: Shengkun Tang, Zekun Wang, Bo Zheng, Liangyu Wang, Rui Men, Siqi Zhang, Xiulong Yuan, Zihan Qiu, Zhiqiang Shen, Dayiheng Liu

Gepubliceerd 2026-05-12
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Shengkun Tang, Zekun Wang, Bo Zheng, Liangyu Wang, Rui Men, Siqi Zhang, Xiulong Yuan, Zihan Qiu, Zhiqiang Shen, Dayiheng Liu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een enorme, superintense bibliotheek van kennis hebt (een enorm AI-model) die ontzettend duur is om te draaien en traag is om te lezen. Je wilt deze verkleinen tot een zakformaat-versie die nog bijna alles weet, zonder de bibliotheek van nul af opnieuw te hoeven bouwen.

Dit artikel, getiteld "SlimQwen", is een handleiding over hoe je dat precies doet voor een specifiek type AI-architectuur genaamd Mixture-of-Experts (MoE). Denk aan een MoE-model niet als één enkel brein, maar als een gigantisch team van specialisten. Sommigen zijn wiskundige genieën, anderen zijn programmeerwijzen en weer anderen zijn taalexperts. Meestal worden slechts een paar specialisten ingeroepen om een bepaalde vraag te beantwoorden.

De onderzoekers vroegen zich af: Hoe verkleinen we dit gigantische team van experts tot een kleiner, sneller team zonder hun collectieve genialiteit te verliezen?

Hier is de uiteenzetting van hun bevindingen met eenvoudige analogieën:

1. De "Tweedehandsauto" vs. "Van Nieuw Af Bouwen" Analogie

De Vraag: Is het beter om een gebruikte, licht aangepaste auto te kopen (een groot model inperken) of een nieuwe auto te bouwen vanaf de grond af met hetzelfde budget?
De Bevinding: De "tweedehands" auto wint elke keer.
Het artikel toont aan dat als je een enorm, vooraf getraind model neemt en het inperkt (prunt) tot een kleinere omvang, dat kleinere model begint met een enorme voorsprong. Het is alsof je een ervaren chef-kok een kleinere keuken geeft; ze kunnen direct geweldige maaltijden bereiden. Als je probeert een nieuwe chef-kok vanaf dag één in die kleine keuken op te leiden, duurt het veel langer voordat ze leren en halen ze de ervaren chef nooit in, zelfs niet als je hen evenveel oefentijd geeft.

2. De "Archiefkast" Analogie (Expertcompressie)

De Vraag: Wanneer je het team van experts verkleint, hoe bepaal je dan wie je ontslaat en wie je behoudt? Moet je gewoon degenen ontslaan die het minst praten?
De Bevinding: Het maakt niet te veel uit hoe je de eerste selectie maakt, zolang je het team daarna maar laat "hertrainen".
De onderzoekers probeerden verschillende manieren om te kiezen welke experts ze behielden (zoals het ontslaan van degenen die het minst spreken, of degenen met de laagste scores). Ze ontdekten dat nadat het kleinere team veel nieuwe oefening krijgt (voortdurend vooraf trainen), ze uiteindelijk allemaal bijna even goed presteren.
Het Geheime Ingrediënt: Ze ontdekten echter een truc genaamd "Gedeeltelijke Behoud". Stel je voor dat je 100 experts hebt en er 50 moet behouden. In plaats van gewoon de top 50 te kiezen en de rest te ontslaan, hielden ze de top 25 exact zoals ze waren, en vulden ze de resterende 25 plekken door de "ontslagen" experts te samenvoegen met de "behouden" experts. Dit is alsof je je sterrenspelers intact houdt terwijl de bankspelers hun vaardigheden samenvoegen met de starters. Deze specifieke strategie maakte het uiteindelijke team iets slimmer dan gewoon willekeurig de top 50 te kiezen.

3. De "Tutor" Analogie (Distillatie)

Het Vraag: Hoe leren we het kleine team om te denken zoals het grote team?
De Bevinding: Vertel ze niet alleen het juiste antwoord; laat ze luisteren naar het "denkproces" van het grote team terwijl ze ook uit het leerboek leren.
Meestal gebruik je bij het verkleinen van een model een techniek genaamd Kennisdistillatie, waarbij het kleine model probeert de antwoorden van het grote model te kopiëren. Het artikel vond dat de beste methode een hybride aanpak is:

  • Het Leerboek: Laat het kleine model leren van de daadwerkelijke correcte antwoorden (Standaard Taalmodellering).
  • De Tutor: Laat het ook luisteren naar de "zachte" gissingen van het grote model (Distillatie).
    Beide samen doen werkt beter dan alleen het grote model kopiëren.

De Nieuwe Truc (MTP Distillatie): Ze introduceerden ook een nieuwe manier van lesgeven genaamd Multi-Token Predictie.

  • Normaal lesgeven: "Hier is een zin. Wat is het volgende woord?"
  • MTP-lesgeven: "Hier is een zin. Wat is het volgende woord, EN het woord daarna, EN het woord daarna?"
    Dit helpt het kleine model om vooruit te plannen, waardoor het sneller en accurater wordt wanneer het later daadwerkelijk tekst genereert.

4. De "Trap" vs. "De Klif" Analogie (Progressieve Inperking)

De Vraag: Moeten we het model in één keer inperken (one-shot), of moeten we het langzaam in stappen inperken?
De Bevinding: De trap is beter.
Als je een enorm model neemt en direct 75% van zijn omvang afsnijdt, is het alsof je van een klif springt. Het model raakt in de war en verliest kennis.
In plaats daarvan ontdekten de onderzoekers dat Progressieve Inperking het beste werkt. Stel je voor dat je een trap afdaalt:

  1. Inperken van het model een beetje (bijvoorbeeld enkele lagen verwijderen).
  2. Laat het oefenen en stabiliseren.
  3. Inperken van het model nog een beetje.
  4. Laat het opnieuw oefenen.
    Deze geleidelijke overgang stelt het model in staat om op elke nieuwe, kleinere omvang te "herleren" hoe het moet functioneren, wat resulteert in een veel slimmere eindproduct dan de "klif-sprong" methode.

Het Eindresultaat: SlimQwen

Door al deze trucs te combineren – beginnen met een ingekort model, een slimme "gedeeltelijke behoud"-strategie voor experts gebruiken, leerboekleren mixen met tutorbegeleiding, en het model verkleinen via een trap in plaats van een klif – slaagden ze erin een enorm 80-miljard-parameter model te comprimeren tot een klein 23-miljard-parameter model.

Ondanks dat het bijna 4 keer kleiner is, presteert dit "SlimQwen"-model nog steeds concurrerend op moeilijke taken zoals wiskunde, programmeren en algemene kennis, wat bewijst dat je geen gigantisch brein nodig hebt om slimme dingen te doen als je weet hoe je het goed moet verkleinen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →