The Limits of Training Data Size in Foundation Models: An Empirical Analysis of Quality Filtering under a Fixed Token Pool
Door middel van empirische experimenten op een vaste pool van 24 miljoen tokens toont dit artikel aan dat agressieve kwaliteitsfiltering onder een vastgesteld rekenbudget vaak de modelprestaties schaadt door excessieve datarepetitie af te dwingen, terwijl het behouden van kwalitatief minderwaardige data en het oversamplen van hoogwaardige subsets superieure of gelijkwaardige resultaten oplevert voor diverse doelstellingen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een superintelligente robot probeert te leren menselijke taal te spreken. Om dit te doen, moet je het de robot voeren met een enorme bibliotheek aan tekst—boeken, websites, artikelen en meer. Een lange tijd dachten wetenschappers dat het enige dat ertoe deed hoe veel tekst je de robot kon voeren. Hoe groter de bibliotheek, hoe slimmer de robot zou worden. Dit idee wordt "scaling" genoemd, en dit is de reden waarom onze AI-assistenten vandaag de dag zo goed zijn.
Maar er is een addertje onder het gras. Niet alle tekst is gelijkwaardig. Sommige pagina's staan vol met onzin, spam of wartaal, terwijl andere geschreven zijn door experts en vol zitten met nuttige informatie. Dus begonnen onderzoekers zich af te vragen: "Moeten we de slechte spullen weggooien en alleen de beste boeken aan de robot voeren?" Dit wordt "quality filtering" genoemd. Echter, er is een tweede regel in het spel: de robot leert het best wanneer hij verse informatie ziet. Als je hem dezelfde paar pagina's keer op keer laat lezen, stopt hij met leren en begint hij alleen maar te memoriseren. Dit artikel onderzoekt een lastige balans: als je de slechte tekst weggooit, heb je minder pagina's om te lezen, wat betekent dat de robot de goede pagina's vaker moet lezen. Helpt het om minder, betere pagina's te hebben, of raakt de robot verveeld en in de war door te vaak hetzelfde te lezen?
Het Grote Bibliotheek Experiment
In deze studie zette een onderzoeker genaamd Alexander Memming een slim experiment op om dit puzzelstukje op te lossen. Hij gebruikte niet het hele internet (dat is te groot om gemakkelijk te testen). In plaats daarvan bouwde hij een "vaste pool" van ongeveer 24 miljoen woorden—een kleine, beheersbare hap uit het web. Vervolgens gaf hij deze zelfde pool van woorden aan verschillende kleine AI-modellen, maar hij veranderde de regels voor elk van hen.
Voor sommige modellen hield hij alle woorden. Voor anderen gedroeg hij zich als een strenge bibliothecaris en gooide hij de onderste helft, het kwart, de achtste of zelfs slechts de bovenste zestiende van de woorden weg, waarbij hij alleen de woorden hield die de computer als "hoge kwaliteit" beschouwde. Hij probeerde ook een derde aanpak: in plaats van iets weg te gooien, hield hij de hele bibliotheek, maar vertelde hij de robot om de "beste" pagina's veel vaker te lezen dan de "gemiddelde" pagina's.
Hij testte deze robots vervolgens op drie verschillende dingen:
- Het Ruwe Web: Een mix van alles, net als de bibliotheek waarop ze getraind zijn.
- De "Edu" Tekst: Teksten van hoge kwaliteit, educatieve pagina's (het soort waar de robot van houdt).
- WikiText: Een compleet andere set encyclopedische artikelen die de robot nog nooit eerder had gezien.
De Verrassende Bevindingen
De resultaten waren een beetje als een achtbaan, en ze veranderden de regels van het spel op drie grote manieren.
1. Het hangt ervan af met wie je praat
De grootste verrassing was dat "quality filtering" de robot niet altijd slimmer maakt. Het hangt er volledig van af wat je van de robot wilt dat hij doet.
- Als je wilt dat de robot het rommelige, echte internet begrijpt: Het weggooien van de "slechte" tekst hielp de robot juist een handje uit de handen. Hoe strenger de onderzoeker filterde, hoe slechter de robot presteerde. Het is alsof je probeert te leren autorijden in een stad door alleen te oefenen op een perfect, leeg racecircuit. Wanneer je eindelijk de echte straten met kuilen en verkeer tegenkomt, crasht je. De robot die getraind is op gefilterde data, kon de rommelige realiteit van het web niet aan.
- Als je wilt dat de robot een expert is op hoogwaardige onderwerpen: Filtering hielp een beetje. Als het doel was om te klinken als een geleerde of een encyclopedie, maakte het behouden van alleen de beste pagina's de robot iets beter.
2. Hoe meer je traint, hoe minder je moet filteren
Dit is de belangrijkste les: De grootte van je budget verandert de beste strategie.
Stel je voor dat je een klein zakgeld hebt (een klein trainingsbudget). Je zou geneigd kunnen zijn om alleen de duurste, hoogwaardige speeltjes te kopen. Maar als je een enorm zakgeld hebt (een enorm budget), betekent het kopen van alleen de dure speeltjes dat je heel snel door je nieuwe speeltjes heen bent. Je eindigt met het spelen met hetzelfde dure speeltje keer op keer totdat je je verveelt.
De studie vond dat naarmate het trainingsbudget groeide, de "beste" strategie veranderde. In het begin leek het houden van alleen de bovenste 1/16e deel van de data oké. Maar naarmate de robot langer werd getraind (hij las de data 8,2 keer in plaats van 4,1 keer), werd die kleine, gefilterde bibliotheek een ramp. De robot werd verveeld en begon fouten te maken. De beste strategie voor een groot budget bleek het zijn om meer van de data te houden, zelfs de rommelige delen, zodat de robot steeds weer nieuwe dingen kon zien.
3. Gooi het niet weg, laat het gewoon vaker lezen
De onderzoeker vergeleken ook "het weggooien" van de slechte tekst versus "het vaker lezen van de goede tekst."
- De "Weggooi"-methode: Je verwijdert de kwalitatief minder goede pagina's.
- De "Lees Meer"-methode: Je houdt alle pagina's, maar je zegt tegen de robot: "Hé, lees deze top-pagina's 16 keer, maar lees de onderste pagina's slechts één keer."
Toen de onderzoeker heel agressief probeerde te zijn (door alleen de bovenste 1/16e te houden), won de "Lees Meer"-methode met een enorme marge. Het was tot wel 0,39 nats (een eenheid van meting voor hoe goed de robot het volgende woord voorspelt) beter dan de "Weggooi"-methode.
Denk er zo over na: Als je een lievelingsnummer hebt, kun je ofwel alle andere nummers uit je afspeellijst verwijderen en dat ene nummer 16 keer beluisteren (Weggooi), of je kunt je hele afspeellijst behouden maar ervoor zorgen dat dat favoriete nummer 16 keer vaker wordt afgespeeld dan de rest (Lees Meer). De tweede manier is beter omdat je de andere nummers nog steeds op de achtergrond hebt om het interessant te houden, en je de unieke variëteit van de volledige bibliotheek niet verliest.
De Kern van het Verhaal
Dit artikel zegt niet dat we moeten stoppen met proberen AI slimmer te maken. In plaats daarvan waarschuwt het ons dat we niet blindelings "slechte" data kunnen weggooien.
- Filter niet als je de echte wereld wilt begrijpen: Als je een AI wilt die het rommelige internet begrijpt, houd dan de rommelige data aan.
- Filter niet te veel als je een groot budget hebt: Als je veel rekenkracht hebt, heb je een enorme variëteit aan data nodig. Als je te strikt filtert, dwing je de AI om zichzelf te herhalen, en dat stopt het leren.
- Repetitie is beter dan deletie: Als je echt wilt focussen op de beste data, gooi de rest dan niet weg. Zorg er alleen voor dat de AI de goede dingen vaker ziet dan de slechte dingen.
De studie werd uitgevoerd op kleine modellen en een klein deel van de data, dus we kunnen niet met zekerheid zeggen wat er precies zal gebeuren met de gigantische AI-modellen van de toekomst. Maar de les is duidelijk: de data van kwaliteit en de data van kwantiteit als aparte zaken behandelen is een fout. Ze zijn aan elkaar gelinkt, en de beste manier om een AI te trainen verandert afhankelijk van hoeveel tijd en geld je hebt om uit te geven.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.