Characterizing Narrative Content in Web-scale LLM Pretraining Data
Dit artikel introduceert een nieuw kader en een dataset, NarraDolma, om de fijnmazige narratieve structuur van web-schaal LLM-pretrainingdata te karakteriseren, waarbij wordt onthuld dat narratieve kwaliteiten meetbaar aanwezig zijn maar ongelijk verdeeld zijn over bronnen en onderwerpen op manieren die huidige curatiepraktijken over het hoofd zien.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een gigantische taart bakt voor een enorm feest. Het recept vraagt om "bloem", maar je weet niet welke soort bloem je hebt. Is het fijne, zijdezachte cakebloem? Grove volkoren? Zit er zand doorheen gemengd?
Lama een tijdje hebben wetenschappers die "Large Language Models" (LLM's bouwden) — de superintelligente AI-hersenen achter tools zoals chatbots — hun "bloem" (de internettekst waarop ze worden getraind) gemengd zonder echt te weten wat de specifieke ingrediënten waren. Ze wisten wel dat sommige delen "toxisch" waren of "over wiskunde gingen", maar ze wisten niet veel over de verhalen die in de mix zaten.
Dit paper is als een team voedingswetenschappers dat besloot een microscoop op die enorme berg bloem te richten. Ze wilden de vraag beantwoorden: Hoeveel storytelling zit er eigenlijk in, en hoe ziet dat eruit?
Hier is de uitsplitsing van hun onderzoek:
1. Het Receptenboek (Het Framework)
De onderzoekers vroegen niet alleen: "Is dit een verhaal?" (Ja/Nee). In plaats daarvan creëerden ze een gedetiel smaakprofiel gebaseerd op hoe mensen verhalen vertellen. Ze braken "storytelling" af in drie hoofdingrediënten:
- De Acteur (Agency): Wie voert de actie uit? Kijken we door hun ogen naar de wereld? Voelen we hun emoties of horen we hun gedachten? (Denk hierbij aan het "hart" van het verhaal).
- Het Podium (Setting): Waar en wanneer vindt dit plaats? Is het een vaag "ergens", of een specifieke, stoffige kamer in het Parijs van de jaren 1920? (Denk hierbij aan de "achtergrond").
- De Plot (Events): Wat gebeurt er eigenlijk? Veranderen er dingen? Is er een keten van oorzaak en gevolg, of is het slechts een lijst met zaken? (Denk hierbij aan de "actie").
Ze hebben deze omgezet in 11 specifieke "knoppen" of schuifregelaars die gerateerd kunnen worden op een schaal van 1 tot 5.
2. De Proeverij (De Data)
Ze namen een enorme bibliotheek van internettekst genaamd DOLMA (die is enorm groot — 3 biljoen woorden, zoals een bibliotheek waar je een leven lang over zou doen om te lezen).
- Stap 1: Ze konden het niet allemaal lezen. Dus bouwden ze een robotassistent (een model genaamd NARRABERT) om hen te helpen.
- Stap 2: Eerst huurden ze menselijke experts in om 400 willekeurige fragmenten te lezen en te beoordelen op die 11 knoppen. Dit was de "gouden standaard".
- Stap 3: Ze leerden de robotassistent om de mensen na te bootsen.
- Stap 4: De robot ging door 3 miljoen fragmenten en beoordeelde ze allemaal. Ze creëerden een nieuwe kaart genaamd NARRADOLMA.
3. De Verrassende Bevindingen
Toen ze naar de kaart keken, ontdekten ze drie grote dingen:
A. Verhalen zijn niet simpelweg "aan" of "uit".
Het is niet zoals een lichtschakelaar waarbij een tekst wel of geen verhaal is. Het is meer als een dimmer. Sommige teksten zijn heel zwak (saaie feiten), sommige zijn fel (dramatische romans), en de meeste zitten ergens tussenin. De onderzoekers ontdekten dat "storytelling" op het internet een continu, multidimensionaal landschap is, en geen eenvoudige categorie.
B. De "bloem" is ongelijkmatig gemengd.
Als je denkt dat "Reddit" vol zit met verhalen en "Wikipedia" vol zit met feiten, heb je grotendeels gelijk, maar het is complexer.
- Reddit en Boeken zijn als een kruidenrek vol met "innerlijke gevoelens" en "gedachten van personages". Ze scoren hoog op de "Acteur"-knoppen.
- Wikipedia en Nieuws zijn als een kaart. Ze scoren hoog op "Events" en "Tijd/Plaats", maar laag op "Gevoelens".
- Reis- en Foodblogs zijn als een schilderij. Ze scoren hoog op "Zintuiglijke details" (geuren, zicht) maar laag op "Conflict".
C. Je kunt niet zomaar "meer verhalen toevoegen" door meer boeken toe te voegen.
De onderzoekers ontdekten dat zelfs binnen één enkele bron (zoals Reddit) de "storytelling" enorm varieert. Sommige Reddit-posts zijn pure drama; andere zijn slechts technische vragen.
- De Metafoor: Stel je voor dat je een taart luchtiger wilt maken. Je denkt misschien: "Ik voeg gewoon meer cakebloem toe!" Maar als die zak bloem in werkelijkheid een mix is van cakebloem, zand en grind, dan garandeert het toevoegen van meer van die zak niet dat de taart luchtiger wordt. Je moet weten welk specifiek deel van de zak de goede bloem is.
4. Waarom dit ertoe doet
Het paper concludeert dat de mensen die AI-modellen bouwen, hun databronnen (zoals "Reddit" of "Nieuws") hebben behandeld alsof ze allemaal hetzelfde soort verhalenverteller zijn. Dat zijn ze niet.
Als een AI vooral getraind wordt op "Nieuws" (hoge events, lage gevoelens), kan hij goed worden in het rapporteren van feiten, maar slecht in het begrijpen van menselijke emoties. Als hij vooral getraind wordt op "Reddit" (hoge gevoelens, lage structuur), kan hij goed worden in empathie, maar slecht in logische oorzaak en gevolg.
De Kernboodschap:
Dit paper heeft geen nieuw AI-model uitgevonden of een kapot model gerepareerd. In plaats daarvan hebben ze een meetlint gemaakt voor de verhalen op het internet. Het heeft ons laten zien dat het "verhaal"-gedeelte van onze data rommelig, gevarieerd en ongelijk verdeeld is. Voordat we AI kunnen leren om betere verhalen te vertellen, moeten we eerst precies begrijpen wat voor soort verhalen er momenteel in de mix zitten.
De onderzoekers hebben hun meetlint (het model) en hun kaart (de dataset) vrijgegeven, zodat iedereen ze kan gebruiken, zodat we in de toekomst allemaal betere taarten kunnen bakken.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.