← Nieuwste papers
💬 NLP

Pruning and Distilling Mixture-of-Experts into Dense Language Models

Dit artikel introduceert een nieuw raamwerk dat getrainde Mixture-of-Experts (MoE)-modellen omzet in standaard dichte architecturen door experts te scoren, selecteren en groeperen, gevolgd door kennisdistillatie, en toont aan dat deze aanpak aanzienlijk beter presteert dan traditionele dichte-naar-dichte pruning qua nauwkeurigheid en trainingsefficiëntie.

Oorspronkelijke auteurs: Junhyuck Kim, Jihun Yun, Haechan Kim, Gyeongman Kim, Joonghyun Bae, Jaewoong Cho

Gepubliceerd 2026-05-28
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Junhyuck Kim, Jihun Yun, Haechan Kim, Gyeongman Kim, Joonghyun Bae, Jaewoong Cho

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Probleem: De "Alle-Handen-op-het-Deck"-Bottleneck

Stel je een enorme, high-end restaurantkeuken voor (het MoE-model) die ontworpen is om ongelooflijk complexe maaltijden te bereiden. Deze keuken heeft 128 verschillende specialistische chefs (experts) in dienst. Voor elke enkele bestelling roept de hoofdkok (de router) echter slechts 8 van hen om te werken. De andere 120 chefs staan inactief, wachtend op hun beurt.

Deze opzet is geweldig voor kooksnelheid en variatie, maar kent een enorm probleem: Om de keuken te openen, moet je alle 128 chefs aannemen en betalen. Zelfs als je er maar 8 tegelijk gebruikt, heb je voldoende ruimte (geheugen) en geld (rekenkracht) nodig om alle 128 op de loonlijst te houden. Dit maakt het onmogelijk om een klein filiaal van dit restaurant te openen in een piepklein winkeltje (zoals een telefoon of een enkele computer), omdat er niet genoeg ruimte is voor al het personeel.

Huidige oplossingen proberen sommige chefs te ontslaan om de keuken kleiner te maken, maar je moet de overgebleven chefs nog steeds op aparte, gespecialiseerde stations houden. Je moet nog steeds iedereen in het gebouw laden.

De Oplossing: De "Meesterkok"-Transformatie

De auteurs van dit paper stellen een radicaal nieuw recept voor. In plaats van alleen maar chefs te ontslaan, willen ze de beste 8 chefs samenvoegen tot één superkok die alles kan doen wat het team deed, maar zonder de extra ruimte te nodig hebben.

Ze nemen het getrainde team van 128 specialisten en veranderen dit in een standaard, dichte keuken (een Dense-model) die in een kleine winkel past, maar nog steeds kookt als een meester.

Hoe Ze Het Deden: Het Drie-Stappenproces

Het paper schetst een drie-stappenproces om de "MoE-keuken" om te vormen tot een "Dense-keuken".

1. Scoren: Het Vinden van de "Ster"-Chefs

Eerst moeten ze beslissen welke chefs ze houden. Ze kunnen niet gewoon degenen kiezen die het vaakst verschijnen (frequentie), omdat dat misschien de "generalisten" zijn die alles redelijk doen maar niets geweldig.

  • De Oude Manier: Kies de chefs die het vaakst worden geroepen. (Zoals het kiezen van de populairste werknemers).
  • De Nieuwe Manier (Diversiteitsbewust Scoren): De auteurs bedachten een nieuwe maatstaf genaamd DO-ACP. Stel je voor dat je een sportteam kiest. Je kiest niet gewoon de 8 spelers die het vaakst spelen; je kiest de 8 spelers met de meest verschillende vaardigheden die ook de beste zijn in die specifieke vaardigheden.
    • Als Chef A geweldig is in bakken en Chef B geweldig is in grillen, wil je beiden.
    • Als Chef C en Chef D allebei geweldig zijn in grillen, heb je er maar één van nodig.
    • De nieuwe methode zorgt wiskundig ervoor dat de geselecteerde chefs het breedste scala aan "smaken" (kennis) dekken zonder redundantie.

2. Groeperen & Samenvoegen: Het Bouwen van de Superkok

Zodra ze de top 8 chefs hebben gekozen (of een paar meer om veilig te zijn), moeten ze ze combineren.

  • Pure Pruning (De Winnaar): In de meeste gevallen kwam het beste resultaat voort uit het simpelweg kopiëren van de top 8 chefs direct naar de nieuwe keuken, zonder hun recepten te mengen. Het blijkt dat het hebben van 8 onderscheiden, hoogwaardige specialisten die naast elkaar werken, beter is dan het proberen te mengen van hun recepten tot één gemiddeld recept.
  • Samenvoegen: Als ze meer dan 8 hadden moeten kiezen, zouden ze de recepten van vergelijkbare chefs mengen, gewogen op basis van hoe goed ze waren.

3. Kennisdistillatie: De "Proefkeuring"-Training

Nu hebben ze een nieuwe keuken met 8 chefs (de Student), maar het is nog niet perfect. Het is als een nieuw restaurant met het juiste personeel, maar dat de geheime familie-recepten nog niet heeft geleerd.

Ze zetten de nieuwe keuken aan het werk naast de originele 128-chef keuken (de Leraar).

  • De Leraar bereidt een gerecht.
  • De Student probeert exact hetzelfde gerecht te bereiden.
  • De Leraar corrigeert de Student: "Nee, je hebt te veel zout toegevoegd," of "Je hebt de subtiele kruiden gemist."
  • De Student leert van deze correcties. Dit proces heet Kennisdistillatie.

De Resultaten: Waarom Dit Belangrijk Is

De auteurs testten dit op verschillende enorme AI-modellen (zoals Qwen3, DeepSeek en GPT-OSS). Hier is wat ze vonden:

  1. Het Kiezen van de Juiste Chefs Is Alles: De methode die werd gebruikt om de chefs te scoren, was belangrijker dan hoe ze werden gegroepeerd. Hun nieuwe "Diversiteitsbewuste" scoren was de duidelijke winnaar, en sloeg alle eerdere methoden met een aanzienlijke marge.
  2. Niet Mengen, Gewoon Selecteren: Verrassend genoeg was de beste strategie om precies 8 chefs te kiezen en ze helemaal niet te mengen. Gewoon het hebben van de 8 beste, meest diverse experts die samenwerken, was beter dan het middelen van hen.
  3. De Wedstrijd Verslaan: Ze vergeleken hun "MoE-naar-Dense"-methode met de oude manier om kleine modellen te maken (een groot dicht model nemen en het verkleinen).
    • Het Resultaat: Hun nieuwe methode produceerde een studentenmodel dat 6,3% nauwkeuriger was op gemiddelde taken.
    • Snelheid: Het was ook 1,6 keer sneller om te trainen omdat de originele "Leraar"-keuken efficiënter was om te draaien tijdens het trainingsproces.

De Conclusie

Zie dit paper als een blauwdruk voor het verkleinen van een enorm corporate hoofdkantoor tot een klein, efficiënt startup-kantoor zonder enig van het breinvermogen van het bedrijf te verliezen.

In plaats van gewoon mensen te ontslaan om huur te besparen, selecteerden ze zorgvuldig de meest diverse en getalenteerde 8 werknemers, gaven ze een nieuw, compact kantoor, en lieten ze de geheimen van het bedrijf leren van het originele grote team. Het resultaat? Een klein kantoor dat net zo goed presteert als het grote, maar dat in veel minder ruimte past.

Belangrijkste Inzicht: Je hoeft niet het hele enorme team te houden om de resultaten te krijgen; je moet gewoon de juiste 8 kiezen, ze onderscheiden houden en ze goed leren.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →