When LLMs Stop Following Steps: A Diagnostic Study of Procedural Execution in Language Models
Dit artikel introduceert een diagnostische benchmark die aantoont dat, hoewel grote taalmodellen hoge nauwkeurigheid behalen op korte procedurale taken, hun vermogen om stapsgewijze algoritmen getrouw uit te voeren aanzienlijk verslechtert naarmate de complexiteit toeneemt, wat blootlegt dat sterke benchmarkprestaties vaak aanzienlijke zwaktes in het volgen van instructies maskeren.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Het Grote Idee: De "Recept"-test
Stel je voor dat je een chef een heel specifiek, stap-voor-stap recept geeft om een cake te bakken. Het recept zegt: "Meng bloem en suiker. Voeg dan eieren toe. Roer vervolgens 10 seconden. Bak daarna."
Je zou misschien verwachten dat de chef elke instructie in de juiste volgorde volgt. Maar wat als de chef, in plaats van de stappen te volgen, gewoon raadt hoe een cake er normaal gesproken uitziet en je een resultaat geeft? Of wat als ze halverwege komen, de laatste drie stappen vergeten en gewoon zeggen: "Hier is de cake"?
Dit artikel is als een gigantische proefkeuken waar onderzoekers 14 verschillende "chef"-AI-modellen (Grote Taalmodellen) duizenden van deze specifieke recepten gaven. De recepten waren simpele wiskundige problemen, maar ze waren ontworpen om lang en lastig te zijn. Het doel was niet om te zien of de AI moeilijke wiskunde kon doen, maar om te zien of het de instructies trouw kon volgen van begin tot eind.
De Opzet: De "Eindeloze Trap"
De onderzoekers bouwden een speciale test met twee hoofdwijzen om de taak moeilijker te maken:
- De Lengte van de Trap: Ze gaven de AI recepten met tussen de 5 en 95 stappen. Stel je een trap voor. Een trap van 5 stappen is makkelijk te beklimmen. Een trap van 95 stappen is vermoeiend.
- De "Terugkijk"-regel: Bij sommige recepten gebruikte stap 10 niet alleen het resultaat van stap 9. Het kon bijvoorbeeld zeggen: "Ga terug en gebruik het resultaat van stap 3." Dit is als een wandelaar vertellen: "Zet een stap vooruit, ga dan terug naar de derde boom die je passeerde en pak daar een steen op." Dit dwingt de AI om dingen te onthouden die lang geleden zijn gebeurd.
Wat Ze Vonden: De "Geheugenverlies"
De resultaten waren verrassend. Hoewel de wiskunde simpel was (alleen optellen, aftrekken, vermenigvuldigen of delen), werden de AI's steeds slechter naarmate de recepten langer werden.
- De Daling: Bij een kort recept van 5 stappen kregen de AI's ongeveer 61% van de tijd het juiste antwoord. Maar bij een lang recept van 95 stappen daalde hun succespercentage tot slechts 20%.
- De "Terugkijk"-Problemen: Wanneer de AI stappen moest onthouden die lang geleden waren (zoals stap 3), daalde hun prestatie nog verder. Het is alsof de AI in de war raakte over waar ze zich bevonden in het verhaal.
Hoe de AI's Faalden: De "Valserij"-chefs
De onderzoekers keken niet alleen naar het eindantwoord; ze keken ook hoe de AI probeerde het probleem op te lossen. Ze ontdekten dat de AI's vaak niet echt het werk deden. In plaats daarvan probeerden ze op verschillende grappige manieren te "valseren" of "af te snijden":
- De "Vroege Exit" (Onder-executie): Dit was de meest voorkomende fout. De AI zou het recept beginnen, een paar stappen doen, zich vervelen of in de war raken, en dan rechtstreeks naar het einde springen, alsof ze alles hadden voltooid. Het is als een student die de eerste zin van een opstel schrijft, dan overslaat naar de conclusie zonder het midden te schrijven.
- De "Hallucinerende" Stappen: Soms verzon de AI extra stappen die helemaal niet in het recept stonden. Het is alsof een chef "strooi met eenhoornstof" toevoegt, terwijl het recept nooit zei dat je dat moest doen.
- De "Zelfcorrectie"-valstrik: Soms kreeg de AI het antwoord verkeerd, besefte het, en probeerde het later in de tekst te herstellen. Maar tegen de tijd dat het het herstelde, had het het eindresultaat al verpest.
- De "Patroonzoeker": In plaats van de wiskunde te doen, leken sommige AI's het antwoord te raden op basis van hoe de getallen eruit zagen, in plaats van daadwerkelijk de stappen te volgen.
De Belangrijkste Conclusie
Het artikel concludeert dat het feit dat een AI je een "plausibel" eindantwoord geeft, niet betekent dat het het werk daadwerkelijk heeft gedaan.
Denk eraan als een student die een toets maakt. Als ze het juiste antwoord krijgen, denk je misschien dat ze hebben gestudeerd. Maar dit artikel laat zien dat ze soms gewoon gokken of het antwoord onthouden van een vorige toets, in plaats van het probleem stap voor stap op te lossen.
Kortom: Huidige AI-modellen zijn geweldig in slim klinken en een eindresultaat geven, maar ze worstelen om te fungeren als een betrouwbare robot die een lange, saaie lijst met instructies exact volgt zoals geschreven. Wanneer de instructies te lang worden of te veel herinnering uit het verleden vereisen, raakt de AI de draad kwijt en stopt met het volgen van de regels.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.