← Nieuwste papers
🤖 AI

LibEvoBench: Probing Temporal Knowledge Stratification in Code Generation Models

Het artikel introduceert LibEvoBench, een multi-task benchmark en de Software Evolution Understanding Score (SEUS) metriek om het vermogen van Large Language Models om evoluerende library API's te hanteren te evalueren, waarbij wordt onthuld dat huidige modellen grotendeels versie-onwetend zijn en vatbaar zijn voor anachronistische fouten ondanks expliciete versiespecificaties.

Oorspronkelijke auteurs: Daniele Cipollone, Sergey Titov, Maliheh Izadi, Egor Bogomolov, Arie van Deursen

Gepubliceerd 2026-06-25
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Daniele Cipollone, Sergey Titov, Maliheh Izadi, Egor Bogomolov, Arie van Deursen

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een briljante nieuwe software engineer aanneemt die elk boek, elke handleiding en elk stukje code heeft gelezen dat ooit geschreven is over een populaire tool genaamd "PyTorch". Ze zijn ongelooflijk slim en kunnen sneller code schrijven dan wie dan ook.

Er is echter een addertje onder het gras: ze hebben geen besef van tijd.

Dit is de kern van het probleem dat onderzoeker Daniele Cipollone en zijn team onderzochten in hun paper, "LibEvoBench." Ze ontdekten dat zelfs de slimste AI-code-assistenten van vandaag als die tijdblinde engineer zijn: ze worstelen met het weten welke versie van een softwarebibliotheek ze moeten gebruiken, waarbij ze oude regels met nieuwe regels door elkaar halen.

Hier is een overzicht van hun bevindingen met behulp van eenvoudige analogieën.

1. Het Probleem: De "Tijdblinde" Chef

Stel je voor dat een bibliotheek (zoals PyTorch of NumPy) een enorme kookboek is. Elke paar maanden brengt de uitgever een nieuwe editie uit.

  • Oude Editie: Zegt "Voeg zout toe naar smaak."
  • Nieuwe Editie: Zegt "Voeg zout en peper toe, maar alleen als het gerecht pittig is."

Softwareprojecten in de echte wereld zijn als restaurants die vaak vasthouden aan een oude editie van het kookboek, omdat het veranderen van het hele menu te duur en riskant is.

De onderzoekers ontdekten dat huidige AI-modellen getraind zijn op een "smoothie" van al deze kookboeken die door elkaar zijn gemengd. Ze hebben geen mechanisme om te zeggen: "Wacht even, dit specifieke restaurant gebruikt de 2021-editie, dus ik moet de 2021-regels gebruiken." In plaats daarvan gokken ze op basis van de meest voorkomende of de nieuwste regels, wat leidt tot anachronistische fouten — het gebruik van een commando dat in de oude versie niet bestond of het negeren van een regel die is verwijderd.

2. De Oplossing: LibEvoBench (De "Tijdreis-test")

Om dit te bewijzen, bouwde het team een nieuwe test genaamd LibEvoBench. Zie dit als een rigoureus examen voor AI-chefs.

  • De Opzet: Ze creëerden duizenden testvragen gebaseerd op echte code van echte projecten die specifieke versies van populaire bibliotheken (PyTorch, NumPy, SciPy) gebruiken.
  • De Drie Taken:
    1. API Calling: "Hier is een half afgemaakt recept. Vul het ontbrekende ingrediënt aan." (Kan de AI het juiste instrument kiezen voor deze specifieke versie?)
    2. API Identification: "Hier is een beschrijving van een tool. Wat is de naam ervan?" (Kan de AI het juiste instrument identificeren zonder de code te zien?)
    3. Signature Recall: "Wat zijn de exacte ingrediënten en afmetingen voor dit instrument?" (Kan de AI de specifieke details onthouden die tussen versies veranderen?)

3. De Resultaten: De AI is "Versie-onwetend"

De resultaten waren verrassend en consistent over de slimste modellen heen (zoals GPT-4/5, Claude en Gemini):

  • De "Stabiele" vs. "Evoluerende" Kloof: Wanneer de AI werd gevraagd naar tools die nooit veranderen (Stabiele API's), deed het het erg goed. Maar wanneer het werd gevraagd naar tools die wel veranderen tussen versies (Evoluerende API's), daalde de prestatie aanzienlijk. Het is alsof de AI geweldig is in koken met een mes, maar slecht is in het koken met een specif으로 nieuw gadget die vorig jaar is uitgebracht.
  • De "Versie-tag" Illusie: De onderzoekers probeerden de AI te helpen door expliciet te zeggen: "Gebruik versie 2.0." Het hielp helemaal niet. Het is alsof je een tijdblinde persoon vertelt: "Je bent in 1990," maar diegene probeert nog steeds een smartphone te gebruiken die toen nog niet bestond. De AI ziet het woord "versie 2.0", maar weet niet echt wat die versie bevat.
  • De "Handleiding" Boost: Echter, wanneer de onderzoekers de AI de daadwerkelijke documentatie (het kookboek) direct naast de vraag gaven, steeg de prestatie van de AI met 10–20 punten. Dit bewijst dat de AI de regels kan leren als je het het boek aanreikt, maar dat het die regels niet in zijn eigen brein heeft opgeslagen.

4. De Nieuwe Scorekaart: SEUS

Het team creëerde een nieuwe score genaamd SEUS (Software Evolution Understanding Score). In plaats van alleen te vragen "Hoeveel antwoorden waren juist?", vraagt deze score:

  • "Kreeg het model de juiste antwoorden voor zowel oude als nieuwe versies?"
  • "Is het in de war geraakt en de tijdperken door elkaar gehaald?"

Met behulp van deze score ontdekten ze dat zelfs de beste modellen grotendeels "versie-onwetend" zijn. Ze zijn slim, maar ze missen een specifieke soort "temporeel bewustzijn" die nodig is om te navigeren door software die in de loop van de tijd verandert.

Samenvatting

Het paper concludeert dat huidige AI-codemodellen als briljante studenten zijn die elk tekstboek hebben gelezen, maar vergeten zijn te noteren wanneer ze zijn gepubliceerd. Ze kunnen code schrijven, maar ze gebruiken per ongeluk vaak "toekomstige" functies in "verleden" projecten of "verleden" functies in "toekomstige" projecten.

De onderzoekers betogen dat we om dit op te lossen niet simpelweg de modellen groter of slimmer moeten maken; we moeten ze leren hoe ze hun kennis kunnen organiseren op basis van tijd, zodat ze precies weten welke regels van toepassing zijn op welke versie van de software.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →