← Nieuwste papers
💬 NLP

Less Is More: Cognitive Load and the Single-Prompt Ceiling in LLM Mathematical Reasoning

Dit artikel presenteert een systematische empirische studie naar prompt engineering voor formeel wiskundig redeneren in de SAIR-wedstrijd, waarbij wordt vastgesteld dat ondanks uitgebreide optimalisatie een 'single-prompt ceiling' van ongeveer 60–79% nauwkeurigheid bestaat, veroorzaakt door de wiskundige onbeslisbaarheid van het probleem en de kwetsbaarheid van complexe prompts voor model-attentie.

Oorspronkelijke auteurs: Manuel Israel Cazares

Gepubliceerd 2026-04-22
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Manuel Israel Cazares

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

🧠 Minder is Meer: Waarom een korte instructie beter werkt dan een dikke handleiding

Stel je voor dat je een zeer slimme, maar soms verwarde robot (een AI) hebt. Je wilt dat deze robot een heel moeilijk wiskundig raadsel oplost: "Geldt deze regel altijd voor elke denkbare situatie, of bestaat er minstens één uitzondering?"

De auteurs van dit paper hebben geprobeerd de robot te helpen door hem een "cheatsheet" (een lijst met tips en voorbeelden) te geven. Ze dachten: "Hoe meer tips we geven, hoe slimmer de robot wordt."

Maar wat ze ontdekten, is verrassend: Hoe meer je schrijft, hoe slechter de robot presteert.

Hier is wat ze ontdekten, vertaald naar alledaagse situaties:

1. De "Overvolle Reiziger" (Cognitieve Overbelasting)

Stel je voor dat je een reiziger (de AI) een kaart geeft om een stad te vinden.

  • De korte route: Je zegt: "Kijk eerst of de weg recht is. Zo ja, ga dan rechtsaf."
  • De lange route: Je geeft hem een boek van 500 pagina's vol met elke mogelijke steeg, elke verkeersregel en 100 voorbeelden van verkeersborden.

Het onderzoek toont aan dat de robot met het dikke boek in de war raakt. Hij probeert alles tegelijk te onthouden, vergeet de belangrijkste regel en maakt fouten. Met de korte, duidelijke instructie (de "Trivial Magma Check") werkt hij veel beter.

  • De les: Een AI kan niet alles in één keer "leren" door een lange tekst te lezen. Hij moet de instructies in de juiste volgorde krijgen, anders blokkeert hij.

2. De "Twee Kanten van een Munt" (Het Dilemma van Waar vs. Onwaar)

De taak van de robot was tweeledig:

  1. Bewijzen dat iets altijd waar is (een onmogelijke taak, want je moet alle mogelijke werelden controleren).
  2. Bewijzen dat iets niet waar is (makkelijker: je hoeft maar één uitzondering te vinden).

De robot had van nature de neiging om alles "Waar" te zeggen (alsof hij bang is om een fout te maken).

  • De onderzoekers probeerden de robot te helpen door een lijst met "uithoudingsvoorbeelden" (waar iets fout gaat) toe te voegen.
  • Het probleem: Als je de lijst met fouten te groot maakt, vergeet de robot hoe hij "Waar" moet zeggen. Als je de instructie voor "Waar" te sterk maakt, vergeet hij hoe hij "Onwaar" moet zeggen.
  • De metafoor: Het is alsof je een schakelaar probeert te bouwen die zowel naar links als naar rechts springt, maar de schakelaar zit vast in het midden. Je kunt niet alles in één tekstbestand stoppen; de robot moet kiezen, maar hij weet niet wanneer hij moet kiezen.

3. De "Gouden Middenweg" (Het plafond)

De onderzoekers probeerden meer dan 40 verschillende versies van hun instructies. Ze hoopten dat ze de robot tot 100% nauwkeurigheid zouden kunnen brengen.

  • Het resultaat: Ze botsten tegen een muur. De beste resultaten lagen ergens tussen de 70% en 80%.
  • Waarom? Omdat de robot de wiskunde niet echt "begrijpt" zoals een mens. Hij herkent alleen patronen. Je kunt hem niet dwingen om iets te begrijpen dat hij niet in zijn training heeft. Je kunt hem alleen helpen om zijn bestaande kennis beter toe te passen.
  • De analogie: Je kunt een hond niet leren om te vliegen door hem een handleiding over aerodynamica te geven. Je kunt hem wel leren om een bal te vangen als je de bal op de juiste manier gooit.

4. De Valstrik van de "Specifieke Oefening"

Een van de belangrijkste ontdekkingen was dat een instructie die perfect werkt op oefening A, faalt op oefening B.

  • Vergelijking: Stel je voor dat je een sleutel maakt die perfect past in een deur in Amsterdam. Als je diezelfde sleutel probeert te gebruiken in een deur in Rotterdam, werkt hij niet.
  • De onderzoekers maakten een instructie (genaamd AN45c) die lokaal fantastisch presteerde (79% goed). Maar toen ze hem op de officiële test (een andere "deur") probeerden, viel hij terug naar 55% (slechter dan zonder instructie!).
  • De les: Als je te specifiek traint op één type probleem, wordt de robot "overgefit" (te specifiek) en faalt hij bij variatie.

5. De Grootste Overwinning: De Volgorde

De grootste verbetering kwam niet door nieuwe informatie toe te voegen, maar door de volgorde te veranderen.

  • De oude volgorde: Eerst de lijst met fouten, dan de regel voor "Waar".
  • De nieuwe volgorde: Eerst de simpele regel voor "Waar", dan pas de lijst met fouten.
  • Het resultaat: Door de simpele regel eerst te laten zien, "ontwaakte" de robot en was hij veel accurater. Het was alsof je eerst zegt: "Kijk eerst of de deur open is," voordat je begint met zoeken naar een sleutel.

Conclusie: Waarom "Minder" eigenlijk "Meer" is

De kernboodschap van dit onderzoek is simpel: Bij complexe taken helpt een lange, ingewikkelde handleiding vaak niet.

In plaats van de robot te overladen met informatie, werkt het beter om:

  1. De instructies kort en krachtig te houden.
  2. De volgorde zorgvuldig te plannen (wat moet de robot eerst doen?).
  3. Te accepteren dat de robot bepaalde dingen niet "kan leren" door alleen maar tekst te lezen, en dat je moet werken met wat hij al weet.

Zoals de auteurs zeggen: "In formele redenering, net als in engineering: minder, maar goed gestructureerd, wint het van meer."

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →