← Nieuwste papers
💬 NLP

Register Always Matters: Analysis of LLM Pretraining Data Through the Lens of Language Variation

Deze studie toont aan dat het taalkundige register van voortrainingsdata de prestaties van grote taalmodellen aanzienlijk beïnvloedt, en onthult dat hoewel nieuwsteksten suboptimaal zijn, het opnemen van de registers van meningen, handleidingen en informatieve beschrijvingen leidt tot aanzienlijke verbeteringen in de modelcapaciteiten.

Oorspronkelijke auteurs: Amanda Myntti, Erik Henriksson, Veronika Laippala, Sampo Pyysalo

Gepubliceerd 2026-05-25
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Amanda Myntti, Erik Henriksson, Veronika Laippala, Sampo Pyysalo

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je probeert een jong kind te leren spreken en de wereld te begrijpen. Je hebt een enorme bibliotheek met boeken, maar in plaats van ze zomaar als een willekeurige stapel te geven, besluit je de boeken te sorteren op genre: sommige zijn kookboeken, sommige zijn nieuwsberichten, sommige zijn songteksten, sommige zijn opiniestukken in blogposts, en sommige zijn wetenschappelijke leerboeken.

Dit artikel stelt een eenvoudige maar diepzinnige vraag: Maakt het uit welke boeken je gebruikt om het kind te leren?

De meeste mensen die AI bouwen (Grote Taalmodellen) gaan ervan uit dat "meer data beter is" en dat als je gewoon het "slechte" materiaal filtert (zoals spam of haatzaaiende taal), de rest allemaal even goed is. Deze studie zegt: Nee, de "smaak" van de tekst maakt enorm veel uit.

Hier is de uiteenzetting van hun bevindingen met behulp van alledaagse analogieën:

1. Het "Eén-Genre"-Experiment

De onderzoekers bouwden verschillende kleine AI-modellen. Elk model kreeg slechts één type tekst (één "register") gedurende zijn hele trainingsleven.

  • Het "Kookboek"-Model: Getraind alleen op "Hoe-doe-je-dat"-instructies.
  • Het "Nieuws"-Model: Getraind alleen op nieuwsartikelen.
  • Het "Tekst"-Model: Getraind alleen op songteksten.
  • Het "Mening"-Model: Getraind alleen op recensies en blogposts.

De Verrassing:

  • Het "Nieuws"-Model was een teleurstelling. Je zou denken dat het lezen van het nieuws je slim maakt, maar het model dat alleen op nieuws was getraind, presteerde vrij slecht. Het was als een student die alleen de dagelijkse koppen leest, maar nooit leert hoe je problemen oplost of diepe concepten begrijpt.
  • Het "Mening"-Model was een ster. Dit was de grootste schok. Teksten vol meningen, recensies en argumenten (zoals Yelp-recensies of politieke blogs) zorgden ervoor dat het model ongelooflijk goed presteerde. Het lijkt erop dat leren argumenteren, overtuigen en een standpunt uitdragen een geheime superkracht is voor AI.
  • Het "Tekst"-Model had moeite. Omdat de tests die ze gebruikten draaiden om logica en feiten, wist een model dat alleen op poëzie en liedjes was getraind niet hoe het die vragen moest beantwoorden. (De auteurs merken op dat dit niet betekent dat poëzie nutteloos is, alleen dat het niet hielp bij deze specifieke tests).

2. De "Mix-en-Kies"-Doorbraak

Vervolgens probeerden de onderzoekers de best presterende genres te mengen. Ze gooiden niet zomaar alles in een blender; ze selecteerden zorgvuldig de winnaars.

  • Het Winnaarsrecept: Ze ontdekten dat het combineren van Hoe-doe-je-dat-instructies, Informatieve Beschrijvingen (zoals Wikipedia) en Meningen een model opleverde dat slimmer was dan het model dat was getraind op het hele, rommelige internet.
  • De "Nieuws"- en "Chat"-Valstrik: Toen ze Nieuws of "Interactieve Discussie" (zoals forumchats) aan de mix toevoegden, werd het model op deze tests eigenlijk dommer. Het is alsof je te veel water aan soep toevoegt; het verdunt de smaak die werkte.

3. Gespecialiseerde Superkrachten

De studie toonde ook aan dat verschillende genres de AI verschillende "spieren" leren:

  • Hoe-doe-je-dat-instructies maakten de AI geweldig in fysiek redeneren (bijvoorbeeld: "Als ik een glas laat vallen, breekt het dan?"), maar slecht in algemene trivia.
  • Narratief/Verhaalvertelling maakte de AI beter in het begrijpen van sociale situaties, maar slechter in het beantwoorden van wetenschappelijke vragen.
  • Meningen versterkten het vermogen van de AI om gezond verstand en sociale interacties te begrijpen.

De Grote Les

De auteurs concluderen dat Register Altijd Uitmaakt.

Denk aan pretrainingsdata als een dieet. Je kunt niet zomaar "eten" in het algemeen eten; je hebt een specifieke mix van voedingsstoffen nodig.

  • Als je alleen "Nieuws" eet, wordt je AI een beetje saai en oncreatief.
  • Als je alleen "Tekst" eet, wordt je AI poëtisch, maar kan hij geen wiskunde.
  • Als je Instructies (hoe dingen werken), Beschrijvingen (wat dingen zijn) en Meningen (hoe mensen over dingen denken) mixt, krijg je een evenwichtige, hoogpresterende AI.

Wat dit betekent voor de toekomst (volgens het artikel):
In plaats van gewoon te proberen meer data van het internet te scrapen, zouden we zorgvuldiger moeten zijn over welk type data we kiezen. Door de "genre" van de tekst te begrijpen, kunnen we betere AI-modellen bouwen met minder verspilling, in plaats van er gewoon op te hopen dat een grotere stapel willekeurige tekst uiteindelijk wel zal werken.

Opmerking: De auteurs benadrukken dat deze studie is uitgevoerd op kleine modellen om deze theorieën te testen. Ze hebben deze modellen niet getest op echt medisch advies, juridisch advies of andere toepassingen met hoge risico's, dus we weten niet hoe deze specifieke "diëten" zouden presteren in die complexe, real-world scenario's.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →