Data Augmentations for Data-Constrained Language Model Pretraining
Dit artikel stelt voor dat het combineren van token-niveau ruis, sequentiepermutaties en doel-offsetvoorspelling als dataaugmentatietechnieken effectief overfitting tegengaat bij de pretraining van autoregressieve taalmodellen, wat productieve multi-epoch training op vaste, beperkte corpora mogelijk maakt.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een briljante maar zeer hongerige student (het AI-model) leert om verhalen te schrijven. In het verleden was de beste manier om deze student te onderwijzen het geven van een enorme bibliotheek met boeken om te lezen. Hoe meer boeken de student las, hoe slimmer hij werd.
Maar nu zijn we tegen een muur aangelopen. We zijn de hoogwaardige boeken op het internet kwijtgeraakt. Ondertussen worden onze computers (de leraren) ongelooflijk krachtig en snel. We bevinden ons in een situatie waarin we te veel rekenkracht hebben maar niet genoeg nieuwe data.
Het Probleem: De "Overgelezen" Student
Omdat we geen nieuwe boeken hebben, moeten we onze student dezelfde 75 miljoen woorden keer op keer laten lezen.
In de oude manier van trainen (genoemd "Autoregressief" of AR), als je een student dezelfde tekst te vaak laat lezen, stopt hij met het leren van het verhaal en begint hij de exacte woorden te memoriseren.
- De Analogie: Stel je voor dat je een enkele pagina van een boek 100 keer leest. Uiteindelijk ken je niet alleen het verhaal; je weet precies waar elke komma staat. Maar als je wordt getest op een nieuwe pagina die je nog niet hebt gezien, faal je omdat je alleen de oude hebt uit je hoofd geleerd.
- Het Resultaat: De AI wordt erg goed in de trainingsdata, maar de prestaties op nieuwe, ongeziene data worden steeds slechter naarmate hij langer traint. Hij "overfit".
De Oplossing: Data Augmentatie (De "Twist"-methode)
De auteurs van dit artikel vroegen zich af: Hoe kunnen we de student hetzelfde boek 100 keer laten lezen zonder dat hij het simpelweg uit zijn hoofd leert?
Hun antwoord is Data Augmentatie. In plaats van de student telkens exact dezelfde tekst te geven, "verdraaien" of "door elkaar husselen" ze de tekst lichtjes voordat de student deze leest. Dit dwingt de student om daadwerkelijk de betekenis en context te begrijpen, in plaats van alleen de volgorde van woorden te memoriseren.
Ze probeerden drie belangrijke manieren om de tekst te verdraaien:
1. Het "Blinddoek" en "Verkeerd Woord" Spel (Token-Level Ruis)
- Maskeren (De Blinddoek): Ze dekken sommige woorden af met een zwart blokje (een `` token). De student moet het ontbrekende woord raden op basis van de rest van de zin.
- Willekeurige Vervanging (Het Verkeerde Woord): In plaats van een zwart blokje, vervangen ze een woord door een ander woord dat grammaticaal wel klopt, maar feitelijk onjuist is.
- Voorbeeld: Het veranderen van "De kat zat op de mat" naar "De kat zat op de hoed."
- De Bevinding: Verrassend genoeg werkte het "Verkeerde Woord" spel beter dan de "Blinddoek". Waarom? Omdat het raden van een ontbrekend woord makkelijk is als je een leegte ziet. Maar het opmerken dat "hoed" het verkeerde woord is wanneer de zin er nog steeds correct uitziet, is een veel zwaardere mentale workout. Het dwingt de student om veel beter op te letten.
2. Het "Terugspoelen" en "Invullen van de Leegte" Spel (Sequentie Permutaties)
- Rechts-naar-links (Terugspoelen): Ze laten de student de zin achterstevoren lezen, van het laatste woord naar het eerste.
- Invullen van het Midden: Ze nemen een zin, halen het middelste deel eruit, en vragen de student om het midden te voorspellen op basis van het begin en het einde.
- De Bevinding: Achterstevoren lezen werkte geweldig als een regularisator (het stopte het memoriseren). Echter, het "Invullen van het Midden" spel maakte de zaken voor algemene teksten juist slechter. De auteurs suggereren dat dit komt omdat het "Invullen"-formaat zo anders is dan hoe we normaal lezen (van links naar rechts), dat het de student eerder in de war bracht dan dat het hielp.
3. Het "Glazen Bol" Spel (Target Offset Predictie)
- In plaats van te vragen "Wat is het volgende woord?", vragen ze "Wat is het woord drie stappen verderop?"
- De Bevinding: Dit werkt goed, maar alleen als ze het zorgvuldig doen. Als ze te vaak vragen naar woorden in de verre toekomst, raakt de student in de war. Als ze meestal het volgende woord vragen, maar af en toe een woord verderop in de toekomst, fungeert het als een perfect leercurriculum.
De Winningsstrategie: De "Perfecte Storm"
De auteurs kozen niet zomaar één spel; ze combineerden ze. Echter, ze ontdekten dat sommige spellen met elkaar botsen.
- De Botsing: Als je woorden afdekt (Maskeren) én vraagt naar woorden ver in de toekomst, raakt de student overweldigd. De context is te versnipperd om een goede gok te doen.
- De Harmonie: Als je Willekeurige Vervanging (woorden wisselen) + Terugwaarts Lezen + Af en toe vooruitkijken gebruikt, blijft de student scherp.
Het Resultaat:
Door deze specifieke combinatie van "twists" te gebruiken, was de AI in staat om 100 epochs te trainen (het lezen van de data 100 keer) zonder zijn vermogen om te generaliseren te verliezen.
- Zonder de trucjes: De AI bereikte zijn piek bij epoch 16 en werd daarna slechter.
- Met de trucjes: De AI bleef verbeteren en bereikte een veel lagere foutmarge (betere prestaties) dan welke enkele methode alleen al had kunnen bereiken.
De Kernboodschap
Het artikel bewijst dat wanneer we door een tekort aan nieuwe data komen, we de training niet hoeven te stoppen. We moeten alleen veranderen hoe we de data presenteren. Door kleine, slimme "vervormingen" aan de tekst toe te voegen, kunnen we krachtige computers veel langer effectief laten leren, waardoor voorkomen wordt dat ze simpelweg de trainingsset uit hun hoofd leren.
Belangrijkste les: Het willekeurig wisselen van woorden (de tekst een klein beetje "fout" maken) was de meest effectieve enkele truc, en het combineren hiervan met achterstevoren lezen en vooruitkijken creëerde de beste algehele prestatie.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.