← Nieuwste papers
💬 NLP

Counting as a minimal probe of language model reliability

Dit artikel toont aan dat, ondanks sterke prestaties op standaard benchmarks, grote taalmodellen ontberen aan algemene logische competentie voor betrouwbaar regels volgen, zoals blijkt uit hun onvermogen om te tellen voorbij een beperkte set interne staten die vinger-tellen nabootst in plaats van ware procedurele uitvoering.

Oorspronkelijke auteurs: Tianxiang Dai, Jonathan Fan

Gepubliceerd 2026-05-05
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Tianxiang Dai, Jonathan Fan

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Idee: De "Vingers Tellen"-Test

Stel je een zeer slimme robot voor die gedichten kan schrijven, complexe code kan debuggen en moeilijke wetenschapsvragen kan beantwoorden. Je vraagt het: "Hoeveel appels zitten er in deze mand?" en het antwoordt correct. Je vraagt het opnieuw met een grotere mand, en het heeft nog steeds gelijk.

Maar wat als je het vraagt om 10.000 appels te tellen? Of 100.000?

Dit artikel stelt een zeer eenvoudige vraag: Weten deze AI-modellen daadwerkelijk "hoe ze moeten tellen", of raden ze gewoon op basis van patronen die ze eerder hebben gezien?

Om dit uit te vinden, creëerden de onderzoekers een test genaamd Stable Counting Capacity (SCC). Ze haalden alle "slimme" dingen weg (zoals wiskunde, geschiedenis of programmeren) en vroegen de modellen gewoon om identieke items (zoals de letter "a") in een lange lijst te tellen.

De Hoofdontdekking: De "Vinger"-Limiet

De onderzoekers ontdekten dat elk AI-model dat ze testten faalt bij het tellen van lange lijsten, zelfs al worden ze geadverteerd als modellen die enorme hoeveelheden tekst kunnen verwerken.

Hier is de analogie voor wat er binnenin de AI gebeurt:

  • De "Vingers"-Analogie: Stel je voor dat de AI probeert te tellen door zijn vingers op te steken. Het heeft een eindig aantal vingers (interne toestanden). Zolang het aantal items kleiner is dan het aantal vingers, telt het perfect.
  • De Ineenstorting: Zodra de lijst langer wordt dan zijn "vingers", maakt het model niet alleen een kleine fout (zoals 101 zeggen in plaats van 100). In plaats daarvan geeft het volledig op. Het stopt met tellen en begint willekeurige, ronde getallen te raden zoals 500, 1.000 of 2.000. Het is alsof het model zijn vingers heeft opgebruikt, het telstokje heeft laten vallen en begint met het gooien van darten naar een getallenbord.

Belangrijkste Bevindingen in Gewone Taal

1. Het "Magische" Contextvenster is een Leugen
AI-bedrijven zeggen dat hun modellen "lange contexten" (enorme documenten) kunnen lezen. Het artikel toont aan dat hoewel het model een lang document kan lezen, het geen toegang heeft tot eenvoudige regels daarin.

  • Analogie: Het is als een student die een 500-pagina's tellend boek kan lezen, maar wanneer er wordt gevraagd "Hoe vaak kwam het woord 'de' voor?", ze geen idee hebben. Ze kunnen de tekst verwerken, maar ze kunnen geen eenvoudige variabele in hun hoofd vasthouden.

2. Meer Denktime Helpt Niet
De onderzoekers probeerden de modellen meer tijd te geven om na te denken (rekenkracht tijdens het testen) of hen te vragen om "stap voor stap na te denken" (Chain of Thought).

  • Resultaat: Het werkte niet. Als de interne "vingers" van het model op waren, maakte het harder denken het alleen maar mogelijk dat het meer zelfverzekerd klinkende onzin genereerde. Het kon de verloren telling niet reconstrueren.

3. De "Vingers" zijn Specifiek voor de Uiterlijke Vorm van de Tekst
De onderzoekers veranderden de items die geteld werden (bijvoorbeeld van de letter "a" naar de letter "b" of verschillende symbolen).

  • Resultaat: De telgrens van het model veranderde. Dit bewijst dat het model geen universeel "wiskundig brein" gebruikt. In plaats daarvan gebruikt het specifieke, geleerde paden voor specifieke symbolen. Als je het symbool verandert, raken de "vingers" in de war.

4. De "Plotselinge Daling"
Het falen is niet geleidelijk. Het model telt perfect tot een bepaald punt (zeg maar 72 items), en stort dan direct in.

  • Analogie: Het is niet als een auto die zonder benzine valt en vertraagt. Het is als een gloeilamp die perfect werkt tot op het exacte moment dat de gloeidraad breekt, en dan volledig donker wordt.

5. Waarom Huidige Tests Dit Missen
Standaardtests (zoals wiskundetoetsen of programmeeruitdagingen) zijn te complex.

  • Analogie: Als je wilt weten of een motormotor betrouwbaar is, rijd je hem niet alleen op een racecircuit (waar aerodynamica en snelheid een gebroken zuiger kunnen verbergen). Je moet een simpele, saaie test doen, zoals het laten draaien van de wielen op een lift. Het artikel betoogt dat huidige AI-benchmarks het "racecircuit" zijn, wat het feit verbergt dat de "motor" (het vermogen om eenvoudige regels te volgen) kapot is.

Wat Dit Betekent voor de Toekomst (Volgens het Artikel)

Het artikel concludeert dat huidige AI-modellen bros zijn. Ze kunnen een tijdje het volgen van regels nabootsen, maar ze hebben geen betrouwbaar, intern mechanisme om variabelen over lange periodes bij te houden.

  • Het Probleem: Als je een AI vraagt om een complex project met 50 stappen te plannen, kan het de eerste 10 stappen goed doen, maar tegen stap 50 heeft het waarschijnlijk de "telling" van de beperkingen "kwijtgeraakt" en raadt het gewoon wat er goed klinkt.
  • De Oplossing: De auteurs suggereren dat we, om dit op te lossen, de modellen niet alleen groter kunnen maken of hen meer tijd kunnen geven om na te denken. We moeten hun architectuur veranderen om dingen op te nemen zoals expliciet geheugen of persistent variabelen (zoals een echt notitieboek of een teller) die niet afhankelijk zijn van de fragiele interne "vingers" van het model.

Samenvatting

Het artikel onthult dat, ondanks hun indrukwekkende prestaties op complexe taken, Large Language Models fundamenteel slecht zijn in eenvoudige, exacte telling. Ze vertrouwen op een beperkt aantal interne "toestanden" (zoals vingers) om informatie bij te houden. Zodra die limiet is bereikt, stoppen ze met het volgen van regels en beginnen ze te raden. Dit suggereert dat hun huidige "intelligentie" een fragiele illusie is die instort wanneer er wordt gevraagd om eenvoudige regels over lange periodes vast te houden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →