← Nieuwste papers
💬 NLP

Sense and Sensitivity: Examining the Influence of Semantic Recall on Long Context Code Reasoning

Deze studie onthult dat hoewel grote taalmodellen lange codecontexten lexicaal perfect kunnen terugroepen, hun vermogen om operationele semantics te begrijpen ernstig verslechtert wanneer relevante code in het midden van de context staat, wat aantoont dat bestaande benchmarks de afhankelijkheid van patronen in plaats van werkelijke semantisch inzicht overschatten.

Oorspronkelijke auteurs: Adam Štorek, Mukur Gupta, Samira Hajizadeh, Prashast Srivastava, Suman Jana

Gepubliceerd 2026-04-21
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Adam Štorek, Mukur Gupta, Samira Hajizadeh, Prashast Srivastava, Suman Jana

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Samenvatting: "Gevoel en Gevoeligheid: Waarom AI code soms 'in het midden' vergeet"

Stel je voor dat je een gigantische bibliotheek hebt, vol met miljoenen boeken (code). Je vraagt aan een slimme robot (een Large Language Model of LLM): "Lees dit ene specifieke hoofdstuk in boek 500 en vertel me wat er gebeurt als je het uitvoert."

Deze studie van onderzoekers van de Columbia University onderzoekt of die robot echt begrijpt wat er in dat hoofdstuk staat, of dat hij gewoon raadt op basis van patronen die hij eerder heeft gezien.

Hier is de kern van hun ontdekking, vertaald in begrijpelijke taal:

1. Twee soorten geheugen: Het Fototoestel vs. De Chef-kok

De onderzoekers maken een belangrijk onderscheid tussen twee vaardigheden:

  • Lexisch Herinneren (Het Fototoestel): Dit is het vermogen om tekst letterlijk terug te vinden. Als je vraagt: "Kopieer die zin uit het boek," doet de robot dit perfect, ongeacht of het boek aan het begin, het einde of precies in het midden van de bibliotheek staat. Het is alsof de robot een fototoestel heeft dat elke pagina perfect kan scannen.
  • Semantisch Herinneren (De Chef-kok): Dit is het vermogen om te begrijpen wat de code doet. Als je vraagt: "Wat is het resultaat als je deze code uitvoert?" moet de robot de logica volgen, net als een chef-kok die een recept volgt om een gerecht te maken.

De verrassende ontdekking: De robot is een perfecte fotograaf, maar een slechte kok als het recept in het midden van de bibliotheek staat.

2. Het "Verloren in het Midden"-effect

De onderzoekers ontdekten iets raars:

  • Als de relevante code aan het begin of einde van de tekst staat, begrijpt de robot het redelijk goed.
  • Maar als diezelfde code precies in het midden van een lange tekst staat, gaat het begrip dramatisch stuk.

Het is alsof de robot een lange lijst met instructies krijgt. Als de belangrijkste stap (bijvoorbeeld: "voeg suiker toe") in het midden staat, vergeet de robot die stap en maakt hij een onsmakelijke taart. Als die stap aan het begin of einde staat, vergeet hij het niet.

3. Waarom bestaande tests misleidend zijn

Tot nu toe hebben we tests gebruikt (zoals CRUXEval) om te kijken of AI goed code begrijpt. De onderzoekers zeggen: "Die tests zijn te makkelijk!"

De analogie:
Stel je voor dat je een student test op wiskunde.

  • De oude test: Geef een vraag over "2 + 2". De student kan dit uit zijn hoofd weten (geheugen) zonder na te denken. Hij scoort 100%.
  • De nieuwe test (SemTrace): Geef een vraag over een heel rare, nieuwe berekening die niemand kent. Nu moet de student echt nadenken en de regels toepassen.

De oude tests lieten zien dat AI's heel slim waren. Maar de nieuwe tests (die de onderzoekers hebben bedacht) tonen aan dat AI's vaak alleen maar patronen raden in plaats van echt te rekenen. Als de "rare berekening" in het midden van een lange tekst staat, zakken de scores van de slimste AI's van 100% naar bijna 0%.

4. De nieuwe test: SemTrace

Om dit te bewijzen, bedachten de onderzoekers een nieuwe test genaamd SemTrace.

  • Ze maken code die zo gek is, dat je niet kunt gokken wat het antwoord is. Je moet elke regel letterlijk lezen en begrijpen.
  • Ze stopten deze code in het midden van lange documenten.
  • Resultaat: De beste AI's (zoals GPT-4.1 en andere topmodellen) haalden een gemiddelde score van 92% lager dan normaal. Ze konden de code niet meer "smaken" als hij in het midden zat.

5. Waarom is dit belangrijk?

Vandaag de dag gebruiken bedrijven AI om nieuwe software te bouwen of fouten te vinden in bestaande code.

  • Als een AI alleen maar patronen giet (zoals een student die antwoorden uit zijn hoofd leert), kan hij gevaarlijke fouten maken. Hij ziet misschien niet dat er een klein foutje in de code zit, omdat hij denkt: "Ah, dit lijkt op een ander programma dat ik ken."
  • De studie waarschuwt: Onze huidige tests laten ons denken dat AI's veel slimmer zijn dan ze echt zijn. Ze kunnen tekst vinden, maar ze begrijpen de logica vaak niet als die ergens in het midden van een groot project staat.

Conclusie

Deze studie zegt eigenlijk: "We moeten stoppen met denken dat AI's alles begrijpen." Ze zijn uitstekend in het vinden van informatie (zoals een zoekmachine), maar ze hebben nog steeds moeite om de betekenis van die informatie te begrijpen als het te veel informatie is of als het ergens "verdwijnt" in het midden van de tekst.

Voor de toekomst betekent dit dat we nieuwe, strengere tests nodig hebben om te zien of AI's echt kunnen "nadenken" over code, of dat ze alleen maar slimme gokkers zijn.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →