← Nieuwste papers
🤖 AI

DTop-p MoE: Sparsity-Controlled Dynamic Top-p MoE for Foundation Model Pre-training

Dit artikel introduceert DTop-p, een op schaarste controleerbaar dynamisch routeringsmechanisme dat adaptief Top-p drempelwaarden leert en globale schaarstebeperkingen afdwingt om standaard Top-k en vaste Top-p MoE-baselines te overtreffen, terwijl de computationele efficiëntie behouden blijft tijdens de pre-training van foundation modellen.

Oorspronkelijke auteurs: Can Jin, Hongwu Peng, Mingcan Xiang, Qixin Zhang, Xiangchi Yuan, Amit Hasan, Ohiremen Dibua, Yifan Gong, Yan Kang, Dimitris N. Metaxas

Gepubliceerd 2026-06-01
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Can Jin, Hongwu Peng, Mingcan Xiang, Qixin Zhang, Xiangchi Yuan, Amit Hasan, Ohiremen Dibua, Yifan Gong, Yan Kang, Dimitris N. Metaxas

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een enorm, hightech callcenter runt (het AI-model) dat ontworpen is om miljoenen vragen te beantwoorden. Om de werkdruk aan te kunnen, heb je duizenden gespecialiseerde medewerkers aangenomen (genaamd "experts").

De oude manier van werken (Top-k) hanteerde een strikte regel: Elke beller krijgt exact 3 medewerkers, ongeacht wat ze vragen.

  • Als iemand vraagt: "Wat is 2+2?", stuur je nog steeds 3 medewerkers. Dat is een verspilling van energie.
  • Als iemand een ongelooflijk complexe, gelaagde juridische vraag stelt, stuur je nog steeds slechts 3 medewerkers. Ze kunnen overweldigd raken en een slecht antwoord geven.

De onderzoekers probeerden een nieuw idee genaamd Top-p. Dit was alsof je zei: "Stuur medewerkers totdat je het gevoel hebt dat je genoeg hulp hebt."

  • Voor "2+2" zou het systeem kunnen zeggen: "Ik ben voor 99% zeker, dus ik stuur slechts 1 medewerker."
  • Voor de moeilijke juridische vraag zou het kunnen zeggen: "Ik ben nog niet zeker, dus ik blijf medewerkers toevoegen totdat ik er zeker van ben."

Het Probleem: De oude "Top-p"-methode was als een bestuurder met een kapot gaspedaal. Het was te gevoelig. Soms stuurde het 1 medewerker, en een seconde later raakte het in paniek en stuurde het 20 medewerkers. Dit maakte de energierekening van het callcenter (rekenkracht) onvoorspelbaar en chaotisch. Je kon er geen budget voor maken.

De Oplossing: DTOP-p (De Slimme Cruise Control)

De auteurs van dit paper hebben DTOP-p gebouwd, wat fungeert als een slim cruise control-systeem voor je callcenter. Het combineert twee hoofdinstrumenten om de chaos op te lossen:

1. De "Snelheidsmeter" (PI Controller)

Stel je voor dat je wilt dat je callcenter gemiddeld precies 8 medewerkers per oproep gebruikt.

  • De PI Controller is een slim manager die constant de snelheidsmeter controleert.
  • Als het team te veel medewerkers gebruikt (te hard rijdt), drukt de manager de "waarschijnlijkheidsdrempel" voorzichtig omlaag, met de boodschap: "Je bent zeker genoeg, stop met het toevoegen van meer medewerkers."
  • Als het team te weinig gebruikt (te langzaam rijdt), drukt de manager de drempel omhoog: "Deze vraag is lastig, roep meer hulp in."
  • Het Resultaat: Het systeem past zichzelf automatisch aan om precies op het doelbudget te blijven, ongeacht hoe moeilijk of makkelijk de vragen ook zijn. Het raakt nooit zonder brandstof (geheugen) en verspilt geen brandstof.

2. De "Floor Manager" (Dynamic Routing Normalization)

In een groot callcenter hebben de receptie (vroege lagen) en de juridische afdeling (diepe lagen) verschillende behoeften.

  • De receptie handelt eenvoudige begroetingen af (heeft minder medewerkers nodig).
  • De juridische afdeling handelt complexe zaken af (heeft meer medewerkers nodig).
  • De oude methoden behandelden elke verdieping hetzelfde.
  • DTOP-p geeft elke verdieping zijn eigen "volumeknop". Het stelt de receptie in staat om rustig en efficiënt te blijven, terwijl de juridische afdeling het volume kan opschroeven en meer experts kan oproepen, terwijl het totale energieverbruik van het gebouw binnen de limiet blijft.

Wat Ze Hebben Gevonden (De Resultaten)

De onderzoekers hebben dit getest op twee soorten AI: één die tekst leest en schrijft (NLP) en één die afbeeldingen begrijpt (Computer Vision).

  • Betere Antwoorden: DTOP-p gaf consequent betere antwoorden dan de oude "vaste 3 medewerkers"-regel en de chaotische "Top-p"-regel. Het was slimmer in het weten wanneer er hulp moest worden ingeroepen.
  • Stabiel Budget: In tegen tegenstelling tot de oude Top-p-methode, die willekeurig pieken in kosten veroorzaakte, hield DTOP-p zich perfect aan het budget. Het gebruikte evenveel rekenkracht als de oude methode, maar behaalde betere resultaten.
  • Schaalt Op: Ze hebben dit getest op kleine modellen en enorme modellen, en met kleine datasets en enorme datasets. In elk geval werkte de "slimme cruise control" beter dan de oude rigide regels.

De Kernboodschap

Dit paper introduceert een manier om AI-modellen slimmer en efficiënter te maken. In plaats van elke taak te dwingen om dezelfde hoeveelheid hersencapaciteit te gebruiken, laat DTOP-p de AI dynamisch beslissen hoeveel hulp het nodig heeft, terwijl een slimme controller ervoor zorgt dat het nooit middelen verspilt of over het budget gaat. Het is als de upgrade van een star lopende band naar een flexibel, zelfregulerend team dat precies weet hoeveel inspanning het in elke taak moet steken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →