← Nieuwste papers
💬 NLP

Vectors from Larger Language Models Predict Human Reading Time and fMRI Data More Poorly when Dimensionality Expansion is Controlled

Deze studie toont aan dat wanneer gecontroleerd wordt voor dimensionaliteitsexpansie met behulp van ongetrainde grote taalmodellen, het voorspellend vermogen van getrainde LLM-vectoren voor menselijke leestijd en fMRI-data een inverse schaling vertoont, waarbij de toegevoegde waarde van training afneemt tot nul bij slechts enkele miljarden parameters.

Oorspronkelijke auteurs: Yi-Chien Lin, Hongao Zhu, William Schuler

Gepubliceerd 2026-09-01
📖 7 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yi-Chien Lin, Hongao Zhu, William Schuler

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Decennialang hebben wetenschappers geobserveerd hoe computers leren lezen en schrijven met een snelheid die bijna biologisch aanvoelt. Deze machines, bekend als grote taalmodellen, worden getraind op enorme bibliotheken van menselijke tekst totdat ze de volgende woorden in een zin met verbazingwekkende nauwkeurigheid kunnen voorspellen. Omdat ze de taal zo goed beheersen, begonnen onderzoekers zich af te vragen of deze machines ons niet alleen imiteren, maar ook daadwerelijk de manier waarop onze eigen hersenen taal verwerken, weerspiegelen. De heersende hoop was dat naarmate deze modellen groter en complexer werden, ze steeds beter zouden worden in het voorspellen van hoe lang een mens nodig heeft om een woord te lezen, of hoe onze hersenen oplichten wanneer we een verhaal horen. Dit idee suggereerde dat de architectuur van deze digitale geesten een kaart kon zijn van de architectuur van het menselijk denken, wat impliceerde dat elke mislukking om menselijke data te evenaren simpelweg een kwestie was van de noodzaak voor meer rekenkracht.

Een nieuwe studie van onderzoekers van The Ohio State University en de University of California, San Diego, daagt dit optimistische beeld echter uit. Ze ontdekten dat wanneer zij zorgvuldig controleerden voor de enorme omvang van de data die deze modellen produceerden, de relatie tussen modelgrootte en mensachtige prestaties op een specifieke manier veranderde: het extra voordeel van training verdween. In plaats van dat het trainingsproces grotere modellen aanzienlijk beter maakte dan hun ongetrainde tegenhangers, presteerden de grootste modellen niet beter dan de ongetrainde versies van dezelfde grootte. De studie suggereert dat het schijnbare succes van deze massieve systemen grotendeels een illusie was, gecreëerd door de enorme hoeveelheid informatie die ze konden ontsluiten, in plaats van een werkelijk begrip van taal. Wanneer de onderzoekers dit voordeel wegnamen, leek de training die deze modellen zo krachtig maakte geen enkel extra voordeel te bieden boven een volledig ongetrainde versie van dezelfde machine.

Om te begrijpen hoe zij tot deze conclusie kwamen, moet men eerst kijken naar hoe deze modellen doorgaans worden getest. Onderzoekers voeden vaak een verhaal aan een taalmodel en vergelijken de interne staat van het model met menselijke data, zoals hoe lang een persoon pauzeert bij een specifiek woord of hoe de hersenen reageren op een zin. In eerdere studies leek het erop dat grotere modellen, die over meer interne variabelen beschikken, menselijk gedrag consequent beter voorspelden. Dit leidde tot een theorie genaamd de "kwaliteit-kracht"-hypothese: hoe groter het model, hoe meer het de menselijke geest benadert. Maar de onderzoekers vermoedden een verborgen fout in deze logica. Wanneer een model groter wordt, wordt het niet alleen slimmer; het produceert ook een veel groter aantal interne signalen, of vectoren, om te analyseren. Het is als het geven van een toets aan een student met twee keer zoveel vragen; zelfs als de student niets weet, geeft het hebben van meer vragen hem meer kansen om door geluk het juiste antwoord te raden. De onderzoekers realiseerden zich dat eerdere studies wellicht het voordeel van het hebben van meer vragen hadden gemeten, in plaats van het voordeel van een beter brein te hebben.

Om dit puzzelstuk op te lossen, ontwierp het team een reeks experimenten die het effect van grootte scheidde van het effect van intelligentie. Ze verzamelden data van vijf verschillende families van taalmodellen, variërend van kleine modellen met een paar honderd miljoen parameters tot massieve modellen met 66 miljard parameters. Ze testten deze modellen tegen echte menselijke data, waaronder leestijden van mensen die natuurlijke verhalen lezen en hersenscans van mensen die naar diezelfde verhalen luisteren. In hun eerste experiment reproduceerden ze de eerdere bevindingen: naarmate de modellen groter werden, leken hun voorspellingen van menselijk gedrag inderdaad te verbeteren. Dit bevestigde dat het "kwaliteit-kracht"-effect aan de oppervlakte zichtbaar was.

Maar toen introduceerden ze een cruciale controle. Ze namen dezelfde modellen en bekeken ze voordat ze überhaupt op enige tekst waren getraind. Deze ongetrainde modellen hebben exact dezelfde grootte en structuur als de getrainde modellen, maar ze zijn in essentie willekeurige ruis, zonder kennis van taal. Door de getrainde modellen te vergelijken met hun ongetrainde tweelingen, konden de onderzoekers zien hoeveel van de verbetering voortkwam uit daadwerkelijk leren en hoeveel simpelweg voortkwam uit het hebben van een groter aantal interne signalen om mee te werken. Ze gebruikten een methode die vergelijkbaar is met een reservoir, waarbij een groot, ongetraind netwerk fungeert als een bron van grondstof die gevormd kan worden door een eenvoudige classifier. Als de training het model werkelijk menselijker had gemaakt, zou de getrainde versie de ongetrainde versie aanzienlijk beter moeten hebben gepresteerd, vooral naarmate de modellen groter werden.

De resultaten waren verrassend. Toen de onderzoekers controleerden voor de grootte van de interne signalen, verdween het extra voordeel van training. Sterker nog, voor modellen groter dan een paar miljard parameters presteerden de getrainde versies niet beter dan de ongetrainde versies. Op verschillende datasets viel het extra voordeel van training terug naar nul. Dit betekent dat de enorme verbeteringen die in eerdere studies werden gezien, niet kwamen doordat de grotere modellen een dieper begrip van taal hadden geleerd, maar simpelweg omdat ze meer interne dimensies hadden om de data in te passen. De onderzoekers ontdekten dat naarmate modellen groter werden dan een bepaald punt, de bijdrage van training aan de fit van het model ten opzichte van een ongetrainde baseline afnam naar nul, in plaats van toe te nemen. Hoe groter het model werd, hoe minder de trainingsprocedure aan de voorspellende kracht van de grootte van het model alleen toevoegde.

De studie keek ook naar verschillende lagen binnen de modellen, om te controleren of de middelste secties van het netwerk, die volgens eerder werk belangrijker waren, anders gedroegen. Ze vonden hetzelfde patroon: de bijdrage van training daalde naar nul over alle lagen naarmate de modellen groeiden. Zelfs toen ze hun statistische methoden aanpasten om rekening te houden met de mogelijkheid dat de modellen simpelweg een limiet bereikten in hoe goed ze menselijke data konden voorspellen, bleef de trend standhouden. De onderzoekers concludeerden dat het succes van deze grote modellen bij het voorspellen van menselijk gedrag grotendeels te wijten is aan een statistisch effect waarbij het hebben van meer variabelen zorgt voor een betere fit, in plaats van een werkelijke reflectie van menselijke cognitie.

Deze bevinding suggereert een significante mismatch tussen de manier waarop deze kunstmatige systemen zijn gebouwd en de manier waarop menselijke hersenen werken. Het trainingsproces dat deze modellen zo goed maakt in het genereren van tekst, maakt hen niet noodzakelijkerwijs betere modellen van menselijk lezen of hersenactiviteit. Sterker nog, de studie stelt dat de ongetrainde versies van deze massieve netwerken, die fungeren als complexe reservoirs van willekeurige verbindingen, net zo effectief kunnen zijn in het voorspellen van menselijke data als de dure, volledig getrainde versies. De onderzoekers stellen voor dat toekomstige studies deze ongetrainde modellen als een standaard baseline moeten gebruiken om ervoor te zorgen dat eventuele verbeteringen die aan training worden toegeschreven, echt zijn en niet slechts een bijproduct zijn van de omvang van het model. Hoewel het idee dat "groter beter is" het veld jarenlang heeft voortgestuwd, suggereert dit werk dat in het domein van menselijke taalverwerking er een punt is waarop het toevoegen van meer omvang en training ons niet dichter bij het begrijpen van de menselijke geest brengt, maar ons er juist verder vandaan leidt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →