← Nieuwste papers
🤖 machine learning

Beyond Sunk Costs: Boosting LLM Pre-training Efficiency via Orthogonal Growth of Mixture-of-Experts

Dit artikel introduceert een strategie voor "orthogonale groei" die bestaande geconvergeerde Mixture-of-Experts-checkpoints hergebruikt door hun diepte en breedte uit te breiden, en toont aan dat deze aanpak aanzienlijk beter presteert dan training vanaf nul onder identieke rekenbudgetten door gebruik te maken van eerdere "verzonken kosten" om een hogere nauwkeurigheid te bereiken.

Oorspronkelijke auteurs: Ruizhe Wang, Yucheng Ding, Xiao Liu, Yaoxiang Wang, Peng Cheng, Baining Guo, Zhengjun Zha, Yeyun Gong

Gepubliceerd 2026-05-18
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Ruizhe Wang, Yucheng Ding, Xiao Liu, Yaoxiang Wang, Peng Cheng, Baining Guo, Zhengjun Zha, Yeyun Gong

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Probleem: De "Zonk Kosten"-Valstrik

Stel je voor dat je jaren en miljoenen dollars hebt besteed aan het bouwen van een enorme, hoogopgeleide bibliotheek van boeken (een voorgetraind AI-model). Je hebt het getraind op een enorme hoeveelheid data en het is uitstekend in wat het doet. Maar dan realiseer je je dat je een grotere bibliotheek nodig hebt om nog complexere vragen te kunnen beantwoorden.

De oude manier om dit te doen, is je bestaande bibliotheek af te breken en een nieuwe, grotere vanaf nul te bouwen. Dit is ongelooflijk duur en verspillend, omdat je al het werk dat je al hebt verzet, weggooit. In zakelijke termen is dit een "zonk kosten" (sunk cost) – geld en moeite die al zijn besteed en die je niet terug kunt krijgen.

Dit artikel vraagt: Kunnen we die oude bibliotheek recyclen in plaats van hem weg te gooien? Kunnen we het bestaande, goed getrainde model nemen en het laten "groeien" tot een groter, beter model zonder opnieuw te beginnen?

De Oplossing: "Orthogonale Groei"

De auteurs stellen een methode voor die Orthogonale Groei heet. Denk aan "orthogonaal" als "rechthoekig" of "onafhankelijk". Ze vonden twee verschillende manieren om het model groter te maken die elkaar niet beïnvloeden. Ze kunnen in elke volgorde worden uitgevoerd, zoals sokken aan doen voor schoenen of schoenen voor sokken – het resultaat is hetzelfde.

1. Dieptegroei: Meer Verdiepingen Toevoegen (De "Interpositie"-Truc)

Stel je voor dat je model een wolkenkrabber is met 20 verdiepingen. Om het hoger te maken, kun je gewoon een ander gebouw van 20 verdiepingen bovenop het eerste stapelen.

  • De Oude Manier (Stapelen): Als je gewoon een nieuw gebouw bovenop stapelt, moet de lift (de dataflow) springen van de bovenste verdieping van het oude gebouw direct naar de onderste verdieping van het nieuwe gebouw. Dit veroorzaakt een storende onderbreking. De "sfeer" van het gebouw verandert abrupt.
  • De Nieuwe Manier (Interpositie): In plaats van te stapelen, suggereren de auteurs het invoegen van kopieën van de bestaande verdiepingen tussen de originele verdiepingen.
    • Analogie: Stel je een muzikale toonladder voor. Als je de noten C, D, E, F, G... hebt en je wilt het liedje langer maken, herhaal je niet het hele liedje aan het einde. In plaats daarvan voeg je een tweede "C" direct na de eerste "C" in, een tweede "D" na de eerste "D", en zo verder. Dit houdt het melodie glad en continu.
    • Waarom het werkt: Het artikel vond dat goed getrainde modellen een specifiek "ritme" hebben in hoe hun lagen werken. Het invoegen van kopieën behoudt dit ritme, terwijl stapelen het verstoort. Deze methode werkt het beste wanneer het model al volledig getraind is (geconvergeerd).

2. Breedtegroei: Meer Experts Toevoegen (De "Specialist"-Truc)

Stel je nu voor dat het model een ziekenhuis is. In elke kamer (laag) zitten een paar artsen (experts) die gespecialiseerd zijn in verschillende dingen. Het model heeft een "router" die beslist welke arts er moet worden geroepen voor een specifieke patiënt.

  • De Oude Manier: Als je de artsen gewoon exact kopieert, heb je twee identieke artsen in de kamer. Ze zullen precies hetzelfde doen, wat overbodig en verwarrend is.
  • De Nieuwe Manier: De auteurs suggereren de artsen te kopiëren, maar een klein beetje "statische storing" of "ruis" aan de nieuwe toe te voegen.
    • Analogie: Stel je voor dat je een meesterkok hebt. Je huurt een kloon van die kok in, maar je geeft de kloon een iets ander kruidenrek of een kleine kras op zijn schort. Dit kleine verschil dwingt de kloon zijn eigen unieke stijl te ontwikkelen en zich te specialiseren in iets andere gerechten, in plaats van de meester perfect te kopiëren.
    • Waarom het werkt: Dit kleine beetje ruis helpt de nieuwe experts om te leren verschillende taken te doen (specialisatie) zonder de kennis die de oorspronkelijke experts al hebben, te vernietigen.

De Resultaten: Meer Buit voor je Geld

De onderzoekers testten dit op modellen variërend van 3 miljard tot 70 miljard parameters. Hier is wat ze vonden:

  1. Recyclen Werkt: Je kunt een kleiner, volledig getraind model nemen en het laten uitgroeien tot een enorm model.
  2. Beter dan Van Nieuws Beginnen: Toen ze het laten groeien van een model vergeleken met het trainen van een nieuw, groot model vanaf nul met dezelfde hoeveelheid extra rekenkracht, was het "groeimodel" 10,6% nauwkeuriger.
  3. Meer Investering = Betere Resultaten: Hoe meer "zonk kosten" (trainingsduur en data) je in het oorspronkelijke kleine model steekt voordat je het laat groeien, hoe beter het uiteindelijke grote model presteert. Het is als investeren in een sterke fundering; hoe hoger je erop bouwt, hoe beter het gebouw staat.
  4. Volgorde Maakt Niet Uit: Je kunt eerst verdiepingen toevoegen en dan experts, of eerst experts en dan verdiepingen. Het uiteindelijke resultaat is hetzelfde.

De Conclusie

Dit artikel biedt een blauwdruk voor "duurzame" AI-ontwikkeling. In plaats van constant geld te verbranden om nieuwe modellen vanaf nul te bouwen, kunnen we de modellen die we al hebben, voorzichtig uitbreiden met deze twee trucs (lagen invoegen en ruis toevoegen aan experts), en zo een aanzienlijk slimmer, groter model krijgen voor minder geld. Het verandert de "afval" van zonk kosten in een waardevol bezit.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →