← Nieuwste papers
🤖 AI

Scaling Domain Data Repetition in LLM Pretraining

Dit artikel onderzoekt de afweging tussen datarepetitie en overfitting bij het voortrainen van grote taalmodellen, waarbij wordt onthuld dat optimale repetitiegroottes voor hoogwaardige domeindata licht toenemen met de modelgrootte bij een vaste ratio van tokens per parameter en sterk negatief gecorreleerd zijn met de validatieverlies van een domein, wat suggereert dat afstemmen op kleinere proxy-modellen effectief kan dienen als gids voor schaalstrategieën voor grotere modellen.

Oorspronkelijke auteurs: Jingwei Li, Xinran Gu, Rui Dai, Xintong Hao, Chengyin Xu, Yan Wu, Shuran Zheng, Jingzhao Zhang

Gepubliceerd 2026-08-17
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Jingwei Li, Xinran Gu, Rui Dai, Xintong Hao, Chengyin Xu, Yan Wu, Shuran Zheng, Jingzhao Zhang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een superintelligente robot probeert te leren praten, schrijven en denken. Om dit te doen, voer je het een enorme bibliotheek aan tekst, een proces dat "pretraining" wordt genoemd. Maar hier is de crux: de robot wordt groter en slimmer naarmate je meer "hersencellen" (parameters) toevoegt, en om te voorkomen dat hij in de war raakt of ondermaats presteert, moet je hem zelfs nog meer woorden voeren. Dit is de wereld van Large Language Models (LLM's). Het probleem is dat, hoewel je gemakkelijk eindeloze hoeveelheden generieke internettekst kunt vinden (zoals willekeurige forumberichten of nieuwsartikelen), het vinden van echt hoogwaardige, gespecialiseerde kennis (zoals geavanceerde wiskunde, programmeren of medische feiten) is als het zoeken naar een speld in een hooiberg. Er is simpelweg niet genoeg van dat goede materiaal om een gigantische robot te voeden.

Dus wat doe je als je door het goede spul heen bent? Je begint het te herhalen. Je neemt dat kostbare wiskundeboek en voert het de robot keer op keer. Maar dit is een delicaat evenwicht. Als je het goede spul te veel herhaalt, kan de robot het boek misschien woord voor woord uit het hoofd leren en de werkelijke concepten niet begrijpen, een probleem dat "overfitting" wordt genoemd. Als je het niet genoeg herhaalt, wordt de robot overspoeld door de zee van generieke internetruis en leert hij de moeilijke dingen nooit echt. De grote vraag is: hoe vaak moet je de goede data herhalen voordat de robot in de war raakt?

Dit artikel, getiteld "Scaling Domain Data Repetition in LLM Pretraining," duikt diep in precies die vraag. De onderzoekers van Tsinghua University en ByteDance Seed wilden uitzoeken wat het perfecte recept is voor het mengen van hoogwaardige data met algemene data naarmate robots groter worden. Ze testten dit op vier speciale "smaken" data: Code, Wiskunde, Wikipedia en medische dossiers.

Dit is wat ze ontdekten, en het is een beetje een plot twist. Lange tijd dachten mensen dat naarmate robots groter werden, ze kwetsbaarder werden en sneller data zouden overfitten (memoriseren). Het oude advies was: "Herhaal het goede spul niet te veel, anders gaat de grote robot kapot." Maar de auteurs ontdekten iets verrassends toen ze de trainingsbudget proportioneel hielden aan de grootte van de robot (een regel die een vaste "tokens-per-parameter"-ratio wordt genoemd). Ze ontdekten dat grotere robots eigenlijk meer herhaling kunnen verdragen dan kleinere robots. Het is alsof een enorme atleet meer rondjes kan rennen zonder moe te worden vergeleken met een kleinere, mits ze beiden met dezelfde intensiteit trainen.

De belangrijkste regel die ze vonden gaat echter niet over de grootte van de robot, maar over de kwaliteit van de data zelf. Ze ontdekten een sterke link tussen hoe goed een robot een specifiek onderwerp leert en hoeveel hij dat onderwerp kan herhalen. Als een robot een domein (zoals Wiskunde) heel goed leert en een lage "foutscore" (validatieverlies) heeft, kan hij die data veel keren herhalen zonder kapot te gaan. Maar als een robot moeite heeft met een onderwerp en een hoge foutscore heeft, zal hij heel snel overfitten, dus moet je die data slechts een paar keer herhalen.

Interessant genoeg lijkt de hoeveelheid unieke data waarmee je begint er niet veel toe te doen voor het beslissen hoeveel keer je het moet herhalen. Of je nu een kleine stapel unieke wiskundeproblemen hebt of een enorme, de "sweet spot" voor herhaling blijft ongeveer hetzelfde. De onderzoekers suggereren dat als je een enorme robot wilt trainen, je niet hoeft te gokken. Je kunt eerst een kleinere "proxy"-robot trainen, kijken hoe goed hij wiskunde of code leert, en die resultaten gebruiken om veilig in te schatten hoeveel keer je de data voor de gigantische robot moet herhalen.

Ze testten ook wat er gebeurt als je unieke data vervangt door herhaalde data terwijl je de totale hoeveelheid "goed spul" gelijk houdt. Ze ontdekten dat voor sommige onderwerpen, zoals Wiskunde, het herhalen van de data bijna net zo goed is als het hebben van meer unieke data. Maar voor andere, zoals Wikipedia, is het herhalen van de data een slecht idee; de robot leert veel slechter als hij steeds weer dezelfde Wikipedia-zinnen hoort in plaats van nieuwe dingen te lezen.

Ten slotte keken ze naar hoe de "leersnelheid" (learning rate) van de robot verandert tijdens de training. Ze ontdekten dat als je de robot vroeg in de training vertraagt, hij gevoeliger wordt voor herhaling en eerder overfit. Maar als je de leersnelheid langer hoog houdt, kan de robot meer herhaling verdragen voordat hij begint te memoriseren in plaats van te leren.

Kortom, dit artikel suggereert dat er geen enkel magisch getal is voor hoe vaak je data moet herhalen. In plaats daarvan hangt de beste strategie af van hoe goed de robot dat specifieke onderwerp al leert. Als het een snelle leerling is, herhaal de data dan vaker. Als het een langzame leerling is, stop dan eerder met het herhalen van de data. En verrassend genoeg zijn grotere robots eigenlijk robuuster tegen herhaling dan we dachten, zolang we ze maar de juiste hoeveelheid data geven voor hun omvang.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →