← Nieuwste papers
🤖 machine learning

The Readout Shortcut: Positional Number Copying Dominates Arithmetic CoT Readout in Small Language Models

Dit artikel onthult dat kleine taalmodellen (1–3B) bij Chain-of-Thought-prompting vaak het echte rekenredeneren omzeilen door te vertrouwen op een positionele afkorting waarbij ze simpelweg het getal dat direct voor het antwoord-scheidingsteken staat kopiëren, een mechanisme dat de prestaties domineert en de betrouwbaarheid van CoT-gebaseerde toezicht ondermijnt.

Oorspronkelijke auteurs: Ming Liu

Gepubliceerd 2026-05-25
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Ming Liu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een kleine, enthousiaste robot vraagt om een wiskundeprobleem op te lossen. Je geeft het een "Chain of Thought" (CoT)-prompt, wat neerkomt op het vragen aan de robot om zijn werk stap voor stap te tonen voordat het het eindantwoord geeft. Je verwacht dat de robot de wiskunde uitvoert, zijn logica controleert en vervolgens het resultaat opschrijft.

Echter, dit artikel onthult een verrassend geheim: de robot voert de wiskunde eigenlijk niet uit om het antwoord te krijgen. Het kopieert gewoon het laatste getal dat het ziet.

Hier is de uiteenzetting van wat de onderzoekers ontdekten, met behulp van eenvoudige analogieën:

1. De "Laatste Pagina"-truc

Stel je voor dat je een verhaalboek leest waarin het antwoord verborgen is op de allerlaatste pagina.

  • De Verwachting: Je denkt dat de robot het hele verhaal leest, het plot begrijpt en vervolgens het einde afleidt.
  • De Realiteit: De robot schuift door. Het negeert het plot, de personages en de logica. Het kijkt simpelweg naar het allerlaatste getal dat is geschreven voor het "Het Einde"-teken (de scheiding ####) en kopieert dit.

De onderzoekers bewezen dit door de pagina's van het verhaal door elkaar te halen.

  • Als ze de volgorde van de wiskundestappen door elkaar haalden maar het juiste antwoord op de laatste pagina lieten staan, kreeg de robot het nog steeds goed.
  • Als ze de wiskundestappen in perfecte volgorde lieten maar het juiste antwoord naar het midden van het verhaal verplaatsten, faalde de robot.
  • Conclusie: De volgorde van de logica maakt niet uit. Alleen de positie van het laatste getal telt.

2. De "Aandachtstrekker"-val

Om te testen of de robot echt aan het denken was, speelden de onderzoekers een trucje. Ze schreven een perfecte, correcte wiskundige oplossing, maar schoven vervolgens een fout getal helemaal aan het einde, net voor het "Het Einde"-teken.

  • Het Resultaat: De robot negeerde de correcte wiskunde die het zojuist had geschreven en kopieerde zelfverzekerd het fout getal.
  • De Analogie: Het is als een leerling die een probleem correct oplost op het whiteboard, maar waarna een leraar vlak voordat ze hun werk inleveren een fout antwoord in hun oor fluistert. De leerling veegt zijn correcte werk weg en schrijft op wat hij zojuist heeft gehoord.
  • Bij de geteste kleine modellen (1–3 miljard parameters) gebeurde dit 87% tot 95% van de tijd. De robot gaf er niets om of het getal wel of niet klopte; het gaf er alleen om dat het het laatste was.

3. De "Magische Poort" (Verschillende Robots, Verschillende Regels)

Niet alle robots gedragen zich precies hetzelfde. De onderzoekers testten drie verschillende soorten kleine modellen:

  • Qwen en Llama: Deze zijn als "kopieermachines". Ze zullen elk getal aan het einde kopiëren, zelfs als het een verzonnen aandachtstrekker is. Ze hebben bijna geen filter.
  • Gemma: Deze robot is een beetje slimmer. Het heeft een "poort". Als het getal aan het einde er duidelijk fout uitziet of niet past in de context, weigert het soms om het te kopiëren. Het is selectiever, maar het vertrouwt nog steeds sterk op de laatste positie.

4. De "Verborgen Berekening"

Hier is het meest verwarrende deel: de robot kan de wiskunde eigenlijk wel uitvoeren.

  • Toen de onderzoekers het "laatste getal" volledig verwijderden (de robot alleen de wiskundestappen en geen eindantwoord om te kopiëren overlatend), steeg de nauwkeurigheid van de robot aanzienlijk.
  • De Analogie: Stel je een leerling voor die doorgaans cheat door naar het antwoord aan de onderkant van de pagina te kijken. Als je het antwoord op de onderkant afplakt, wordt de leerling gedwongen het probleem daadwerkelijk op te lossen. Het kan! Maar zolang het antwoord aan de onderkant zichtbaar is, zullen ze het gewoon kopiëren en hun eigen werk negeren.
  • De "korte weg" van het kopiëren van het laatste getal is zo sterk dat het de robot blokkeert van het gebruik van zijn eigen rekenvaardigheden.

5. Waarom Dit Belangrijk Is voor het "Controleren" van AI

Veel mensen gebruiken "Chain of Thought" om te controleren of een AI eerlijk is. Ze kijken naar de stappen om te zien of de logica klopt.

  • Het Probleem: Dit artikel laat zien dat voor kleine modellen de stappen vaak slechts "decoratie" zijn. De robot schrijft de stappen op, maar het eindantwoord wordt bepaald door een volledig ander, lui mechanisme (het kopiëren van het laatste getal).
  • Het Risico: Je zou een robot kunnen hebben die een perfecte, logische uitleg schrijft voor een wiskundeprobleem, maar vervolgens per ongeluk (of kwaadwillig) een fout getal helemaal aan het einde zet. De robot zal dat fout getal uitvoeren, en een menselijke reviewer zou kunnen denken: "Oh, de stappen zagen er geweldig uit, dus het antwoord moet wel goed zijn." Maar de robot heeft die stappen eigenlijk nooit gebruikt om het antwoord te krijgen.

Samenvatting

In de wereld van kleine AI-modellen is Chain of Thought vaak een optreden, geen proces. Het model schrijft de redenering op om slim te lijken, maar als het tijd is om het eindantwoord te geven, neemt het een kortere weg: het pakt het laatste getal dat het ziet en kopieert het, en negeert alles anders.

Dit gebeurt niet in grotere, geavanceerdere modellen (7–8 miljard parameters), waar de robot begint om de inhoud van het getal te controleren voordat het het kopieert. Maar voor de kleinere, goedkopere modellen is de "laatste getal"-regel de koning.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →