CoRE: A Fine-Grained Code Reasoning Benchmark Beyond Output Prediction
Het artikel introduceert CoRE, een fijnmazige benchmark voor code-redenering die grote taalmodellen evalueert op implementatie-invariantie en procestransparantie, en blootlegt dat huidige modellen vaak gebrek hebben aan robuustheid over equivalente code-implementaties heen en vertrouwen op oppervlakkige uitvoering in plaats van op echt redeneren over tussenliggende toestanden.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Het Grote Idee: Denken AI-coders eigenlijk echt "na"?
Stel je voor dat je een briljante student huurt om een wiskundig probleem op te lossen. Ze schrijven het eindantwoord op en het is goed. Je geeft ze een gouden ster.
Maar dan vraag je hen om uit te leggen hoe ze daar zijn gekomen. Ze beginnen getallen te verzinnen, stappen door elkaar te halen en raken in de war over het midden van het proces. Toch komen ze op de juiste eindgetallen uit.
Het Probleem: Huidige tests voor AI (Grote Taalmodellen of LLM's) zijn als die gouden ster. Ze controleren alleen het eindantwoord. Als de AI de juiste output levert, gaan we ervan uit dat het de code "begrepen" heeft. De auteurs van dit artikel betogen dat dit een valstrik is. De AI zou kunnen gokken of kortsluitingen (heuristieken) gebruiken in plaats van daadwerkelijk te simuleren hoe de code in zijn "hoofd" werkt.
De Oplossing: CoRE (De "Eerlijkheidstest" voor Code)
De auteurs hebben een nieuwe benchmark bedacht genaamd CoRE (Code Reasoning). In plaats van alleen te vragen: "Wat is het antwoord?", stelt CoRE twee veel moeilijkere vragen:
- Maakt het uit hoe je het vraagt? (Implementatie-invariantie)
- Weet je wat er in het midden is gebeurd? (Proces-transparantie)
Analogie 1: "Hetzelfde Cake, Verschillende Recepten" (Implementatie-invariantie)
Stel je voor dat je een chef vraagt om een chocoladecake te bakken.
- Standaardtest: Je geeft ze één specifiek recept (Recept A). Ze bakken het. Het smaakt goed. Geslaagd.
- CoRE-test: Je geeft ze vier verschillende recepten voor exact dezelfde chocoladecake.
- Recept 1: Gebruikt cacaopoeder.
- Recept 2: Gebruikt gesmolten chocoladerepen.
- Recept 3: Gebruikt een andere volgorde van mengschalen.
- Recept 4: Gebruikt een andere oventemperatuur.
Als de chef echt een meester is, zou hij een perfecte cake moeten kunnen bakken, ongeacht welk recept hij gebruikt.
De bevinding van het artikel: De AI-modellen faalden hierin. Ze waren geweldig in het bakken van de cake wanneer ze een recept gebruikten dat leek op hetgeen zij normaal schrijven (hun eigen "stijl"). Maar wanneer ze een recept kregen dat door een andere AI was geschreven (een andere "stijl"), maakten ze vaak fouten, zelfs als de wiskunde identiek was. Ze waren "stijl-beseten" in plaats van logisch-beseten.
Analogie 2: De "Filmregisseur" versus de "Spoiler" (Proces-transparantie)
Stel je voor dat je een film bekijkt.
- Standaardtest: De AI wordt gevraagd: "Wie wint de film?" Het antwoordt: "De held wint." Goed!
- CoRE-test: De AI wordt gevraagd: "Op minuut 45, wanneer de held zich verstopt in de kast, wat houdt de schurk vast? En op minuut 60, wat is de score van de held?"
Dit controleert de tussenliggende toestanden.
De bevinding van het artikel: De AI-modellen kregen vaak de vraag "Wie wint?" goed, maar ze hallucineerden de details in het midden. Ze gokten het einde op basis van patronen, maar ze keken de film niet echt stap-voor-stap mee. Ze voerden de code oppervlakkig uit zonder de reis echt te begrijpen.
Hoe ze CoRE hebben gebouwd
Om deze test eerlijk en moeilijk te maken, deden de onderzoekers twee belangrijke dingen:
- Veel Versies gegenereerd: Ze gebruikten verschillende AI-modellen om code te schrijven voor dezelfde 60 problemen. Dit creëerde een bibliotheek van 255 verschillende code-versies. Sommige waren lang en rommelig; sommige kort en slim. Maar ze deden allemaal exact hetzelfde.
- "Pop Quiz"-vragen gecreëerd: Voor elk stukje code genereerden ze vragen over het midden van het proces.
- Rekenen: "Wat is het exacte getal in deze variabele op dit moment?"
- Logica: "Is deze voorwaarde waar of onwaar?"
- Toestand: "Hoe vaak is deze lus tot nu toe uitgevoerd?"
- Grens: "Wat gebeurt er precies wanneer de lus stopt?"
Wat ze vonden (De Resultaten)
Ze testten 8 van de slimste beschikbare AI-modellen (zoals GPT-5, Claude, DeepSeek, enz.) met deze nieuwe benchmark. De resultaten waren verrassend:
- De "Stijl-bias" KLOP: De modellen waren veel beter in het begrijpen van code die door hun eigen "familie" was geschreven (bijvoorbeeld: OpenAI-modellen begrepen OpenAI-code het beste) dan code die door anderen was geschreven. Dit suggereert dat ze stijlen memoriseren, in plaats van universele logica te leren.
- De "Oppervlakkige Uitvoering" KLOP: Veel modellen kregen het eindantwoord goed, maar faalden in de "pop quiz" over de tussenstappen. Ze gokten de bestemming zonder het pad te kennen.
- De "RCS"-score: De auteurs creëerden een nieuwe score genaamd Reasoning Consistency Score (RCS). Deze score straft modellen die het juiste antwoord krijgen om de verkeerde redenen. Als je het antwoord goed hebt maar faalt in de tussenstappen, daalt je score naar nul.
De Conclusie
Het artikel concludeert dat het krijgen van het juiste antwoord niet genoeg is. Het feit dat een AI de uiteindelijke output van een codefragment kan voorspellen, betekent niet dat het begrijpt hoe de code werkt.
Huidige AI-modellen zijn als acteurs die de laatste zin van een toneelstuk uit hun hoofd hebben geleerd, maar het dialoog er tussenin vergeten. CoRE is de nieuwe test die hen dwingt om hun werk te tonen, bewijzend dat ze daadwerkelijk "nadenken" door de code, in plaats van alleen het einde te gokken.
Kortom: CoRE blootlegt dat de slimste code-schrijvende AI's van vandaag vaak "faken" door te vertrouwen op patronen en stijlen in plaats van op echte, stap-voor-stap redenering.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.