← Nieuwste papers
🤖 machine learning

How to Allocate Your Tokens? Scaling Laws with Training Steps and Batch Size

Dit artikel stelt een "drie-term" schaalwet voor die trainingsdata expliciet opsplitst in stappen en batchgrootte, wat het robuuste herstel van optimale batchgrootte-schaling mogelijk maakt en de afleiding van wetten voor suboptimale instellingen mogelijk maakt met aanzienlijk minder trainingsruns.

Oorspronkelijke auteurs: Fabian Schaipp

Gepubliceerd 2026-07-03
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Fabian Schaipp

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je het perfecte brood probeert te bakken (wat in dit artikel een krachtig AI-model vertegenwoordigt). Om het beste resultaat te krijgen, moet je drie belangrijke ingrediënten balanceren:

  1. De Grootte van de Oven (Modelgrootte): Hoe groot en complex je machine is.
  2. De Hoeveelheid Deeg (Trainingsdata): Hoeveel informatie je het voert.
  3. De Bakstrategie (Stappen versus Batch Size): Dit is het lastige deel. Je kunt ofwel veel kleine batches deeg één voor één bakken (veel stappen, kleine batch), of minder grote batches tegelijk bakken (minder stappen, grote batch).

Lange tijd hadden wetenschappers een goed recept om de Oven en het Deeg met elkaar in balans te brengen. Ze wisten precies hoeveel van elk ze moesten gebruiken om het beste brood te krijgen. Maar ze waren vaag over de Bakstrategie. Ze zouden alleen zeggen: "Gebruik een goede batchgrootte," zonder uit te leggen hoe de grootte van die batch precies de uitkomst verandert of hoe je de perfecte grootte kunt vinden zonder duizenden broden te bakken om te testen.

Dit artikel stelt een nieuw, gedetailleerder recept voor genaamd de "Three-Term Law" (Drie-termenwet).

Het Nieuwe Recept: Het Tellen van de Stappen

De auteurs suggereren dat we, in plaats van alleen naar de totale hoeveelheid deeg te kijken, moeten kijken naar hoe dat deeg wordt verdeeld in Stappen (hoe vaak we deeg in de oven leggen) en Batch Size (hoeveel deeg er tegelijk in gaat).

Denk hierover na als:

  • Oude manier: "Ik heb 100 kg bloem. Ik ga een groot model bakken."
  • Nieuwe manier: "Ik heb 100 kg bloem. Ik kan 100 kleine batches van 1 kg bakken, of 10 grote batches van 10 kg per stuk. Welke mix geeft mij het beste brood?"

De nieuwe formule (de Three-Term Law) behandelt de Batch Size en het Aantal Stappen als afzonderlijke ingrediënten die beide de uiteindelijke smaak (de prestaties van het model) beïnvloeden.

Waarom is dit een Big Deal?

1. Het Bespaart Enorme Hoeveelheden Tijd (De "Sampling" Truc)
Normaal gesproken moet je om de perfecte batchgrootte te vinden, een heel scala aan broden bakken: eentje met een piepkleine batch, eentje met een gemiddelde, eentje met een enorme, enzovoort. Dit is ongelooflijk duur en traag (zoals het nodig hebben van miljoenen GPU-uren).

De auteurs ontdekten dat hun nieuwe formule zo slim is dat deze slechts twee of drie verschillende batchgroottes kan bekijken en de perfecte grootte nauwkeurig kan voorspellen.

  • Analogie: Stel je voor dat je de perfecte temperatuur voor je oven wilt vinden. In plaats van 100 verschillende temperaturen te testen, test je er slechts drie. Omdat je de natuurkunde van hitte begrijpt (de formule), kun je de exacte perfecte temperatuur wiskundig berekenen zonder ooit de knop naar de andere 97 instellingen te draaien.
  • Resultaat: Dit vermindert het aantal benodigde trainingsruns met ongeveer 72%. Je krijgt hetzelfde antwoord met een fractie van het werk.

2. Het Kan Omgaan met "Imperfecte" Batches
In de echte wereld heb je misschien niet de hardware om een perfecte batchgrootte te gebruiken. Misschien is je oven te klein, of heb je alleen tijd voor een gemiddelde batch.
De oude recepten vertelden je alleen wat er gebeurt als je de perfecte instellingen gebruikt. Dit nieuwe recept vertelt je wat er gebeurt als je een suboptimale (imperfecte) batchgrootte gebruikt. Het kan precies voorspellen hoeveel "slechter" je brood zal smaken als je gedwongen bent een kleinere batch te gebruiken, wat je helpt de beste beslissing te nemen gezien je beperkingen.

3. Het Lost een Mysterie Op Over de "Critical Batch Size"
Wetenschappers hebben een fenomeen opgemerkt dat de "Critical Batch Size" wordt genoemd. Het is als een snelheidslimiet. Als je je batches te groot maakt, krijg je geen snellere resultaten meer; je verspilt alleen maar energie.

  • Oude Theorieën: Sommige oude theorieën suggereerden dat de beste batchgrootte minuscuul zou moeten zijn (grootte van 1), wat in strijd is met wat we in het echte leven zien.
  • Bevinding van dit Papier: De nieuwe formule laat correct zien dat de "snelheidslimiet" (critical batch size) afhankelijk is van de hoeveelheid data, maar verrassend genoeg niet veel verandert op basis van hoe groot je model is. Het komt overeen met wat we in echte experimenten zien.

De Addertjes onder het Gras (Beperkingen)

De auteurs zijn eerlijk over waar hun recept nog niet perfect is:

  • Het is een beetje ruw aan de randen: Hoewel het de beste batchgrootte heel goed voorspelt, is het niet perfect in het voorspellen van de exacte smaak als je een batchgrootte gebruikt die veel te klein of veel te groot is.
  • Het heeft wat hulp nodig: Om de meest precieze details over "imperfecte" batches te krijgen, moesten ze een tweestaps-proces (een "two-stage fit") gebruiken, wat iets complexer is dan gewoon getallen in één vergelijking invoeren.
  • Het is specifiek voor de huidige tools: De resultaten zijn gebaseerd op specifieke soorten AI-training (met gebruik van een optimizer genaamd AdamW). Als je de tools verandert (zoals het gebruiken van een andere optimizer), moet het recept misschien worden aangepast.

Samenvatting

Dit artikel geeft ons een betere kaart om door de complexe wereld van AI-training te navigeren. Het vertelt ons dat hoe we onze data verdelen (stappen versus batchgrootte) net zo belangrijk is als hoeveel data we hebben. Het belangrijkste is dat het ons een afkorting geeft: we hoeven niet langer elke enkele mogelijkheid te testen om de beste strategie te vinden. We kunnen een paar dingen testen, deze nieuwe wiskunde gebruiken, en met vertrouwen de winnaar voorspellen, wat een enorme hoeveelheid tijd en rekenkracht bespaart.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →