← Nieuwste papers
🤖 AI

Are Large Language Models Robust in Understanding Code Against Semantics-Preserving Mutations?

Dit artikel onthult dat, hoewel state-of-the-art Large Language Models hoge voorspellende nauwkeurigheid bereiken op code-taken, ze vaak gebrekkige redenering hanteren en aanzienlijke fragiliteit vertonen, waarbij ze hun voorspellingen vaak wijzigen wanneer ze geconfronteerd worden met semantisch behoudende code-mutaties.

Oorspronkelijke auteurs: Pedro Orvalho, Marta Kwiatkowska

Gepubliceerd 2026-05-08
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Pedro Orvalho, Marta Kwiatkowska

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een zeer getalenteerde student voor die complexe wiskundeproblemen kan oplossen en essays schrijft die ongelooflijk slim klinken. Je vraagt hen om uit te leggen hoe ze een probleem hebben opgelost, en ze geven je een perfect, stap-voor-stap verhaal. Je bent er dan van overtuigd dat ze het materiaal werkelijk begrijpen.

Maar wat als je diezelfde student zegt: "Oké, los nu exact hetzelfde probleem op, maar gebruik in plaats van het woord 'appel' het woord 'fruit', en zeg in plaats van 'optellen' 'samenrekenen'?"

Als de student plotseling in de war raakt, zijn antwoord verandert, of een volledig ander (en fout) verhaal geeft, besef je dat ze de logica van de wiskunde niet echt begrepen. Ze hadden alleen de specifieke woorden en patronen die je eerder gebruikte, uit het hoofd geleerd.

Dit is precies wat de onderzoekers van de Universiteit van Oxford ontdekten over Large Language Models (LLM's) toen ze hen vroeg om computercode te begrijpen.

De "Vibe Coding" Valstrik

Vandaag de dag gebruiken veel mensen AI-tools om code te schrijven, een trend die "vibe coding" wordt genoemd. We vertrouwen deze AI-modellen om bugs op te lossen en programma's te schrijven. Maar de onderzoekers stelden een angstaanjagende vraag: Begrijpen deze AI-modellen echt hoe code werkt, of zijn ze gewoon heel goed in gokken op basis van patronen?

Om dit uit te vinden, behandelden ze de AI als een student die een toets maakt, maar dan met een draai.

De "Vormveranderende" Toets

De onderzoekers namen een aantal computerprogramma's en voerden vijf specifieke "magische trucs" op uit. Deze trucs veranderden hoe de code eruitzag (de syntaxis), maar behielden exact dezelfde betekenis en uitkomst (de semantiek). Het is alsof je een zin, "De kat zat op het tapijt," herschrijft als "Op het tapijt rustte het katten." De betekenis is identiek, maar de woorden zijn anders.

De vijf trucs die ze gebruikten waren:

  1. Hernoemen van Variabelen: mijn_lijst veranderen in x9z2.
  2. Spiegelen van Vergelijkingen: if x > 5 veranderen in if 5 < x.
  3. Omvangen van Logica: Het "if"- en "else"-deel van een beslissing omwisselen.
  4. Lus-conversie: Een "for"-lus veranderen in een "while"-lus.
  5. Lus-ontvouwen: De laatste paar stappen van een lus handmatig uitschrijven in plaats van de computer ze te laten herhalen.

De Resultaten: Slimme Gokkers, Geen Echte Denkers

Toen de onderzoekers deze tests uitvoerden op negen verschillende AI-modellen (inclusief de bekendste zoals GPT-5.2 en Gemini-3), vonden ze enkele verontrustende patronen:

  • Het "Gebrekkig Redeneren"-Probleem: Zelfs wanneer de AI het juiste antwoord gaf, deed ze dit vaak om de verkeerde redenen. In feite gaf de AI tussen 10% en 50% van de tijd een correct antwoord op basis van een volledig gebroken of onzinnige uitleg. Het was alsof een student het juiste antwoord op een wiskundetoets gokt, maar een verzonnen formule opschrijft om het te rechtvaardigen.
  • Het "Fragiele" Probleem: Wanneer de code "vormveranderend" werd gemaakt met de bovenstaande trucs, crashte de prestatie van de AI. Sommige modellen zagen hun nauwkeurigheid met wel 70% dalen.
    • Analogie: Stel je een chef-kok voor die perfect een biefstuk kan bereiden als je zegt "kook het rundvlees". Maar als je zegt "kook de koe", raakt hij in paniek en verbrandt hij de keuken. De AI-modellen zijn als die chef-kok; ze raken in de war door simpele veranderingen in woordkeuze, zelfs al is de "maaltijd" (het resultaat van het programma) exact hetzelfde.
  • De "Variabele Naam"-Gevoeligheid: De modellen waren verrassend gevoelig voor variabele namen. Het veranderen van een naam van totaal in som_totaal liet ze vaak falen, hoewel de code-logica identiek was. Interessant genoeg raken ook mensen lichtelijk in de war door slechte naamgeving, maar de reactie van de AI was veel extremer.

De "Topstudenten" Zijn Ook Niet Perfect

De onderzoekers testten zowel gratis, open-source modellen als dure, private modellen (zoals GPT-5.2 en Gemini-3).

  • De dure modellen waren het beste in het krijgen van het juiste antwoord en het geven van goede uitleg op de originele code.
  • Echter, toen de code lichtelijk werd veranderd, struikelden zelfs deze "topstudenten" zwaar. Hun prestaties daalden aanzienlijk, wat bewijst dat een hoge nauwkeurigheid op een standaardtoets niet betekent dat ze de onderliggende logica werkelijk begrijpen.

De Conclusie

Het paper concludeert dat huidige AI-modellen bros zijn. Ze zijn uitstekend in het herkennen van patronen en het nabootsen van menselijk redeneren, maar ze missen een "formele" understanding van hoe code eigenlijk werkt.

Als je hen vraagt een probleem op één manier op te lossen, krijgen ze het misschien goed. Maar als je dezelfde vraag op een iets andere manier stelt (zelfs als de betekenis identiek is), kunnen ze volledig falen. Dit suggereert dat we voor nu deze modellen niet blindelings moeten vertrouwen om code diep te begrijpen; ze zijn meer als zeer geavanceerde papegaaien die de juiste antwoorden kunnen opdreunen, maar niet altijd weten waarom die antwoorden juist zijn.

De onderzoekers suggereren dat we, om AI echt betrouwbaar te maken voor coderen, hun leervermogen moeten combineren met strikte, formele regels (zoals een wiskundeleraar die het werk controleert, niet alleen het antwoord) om ervoor te zorgen dat ze niet alleen maar gokken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →