← Nieuwste papers
🤖 AI

Beyond Pass Rate: A Multilingual, Execution-Grounded Evaluation of Open Code LLMs

Dit artikel presenteert een grootschalige, meertalige, op uitvoering gebaseerde evaluatie van negen open code LLM's op meer dan 2.700 LeetCode-problemen, wat onthult dat huidige modellen aanzienlijk achterblijven bij menselijke prestaties en dat hun rangschikkingen en foutmodi aanzienlijk variëren tussen talen en probleemniveaus, waardoor de beperkingen van single-metric leaderboards worden benadrukt.

Oorspronkelijke auteurs: Sayed Erfan Arefin

Gepubliceerd 2026-06-09
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Sayed Erfan Arefin

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je de hoofdcoach van een programmeerteam bent en je moet een nieuwe assistent-programmeur aannemen. De standaardmanier om kandidaten te interviewen is door ze één korte puzzel te geven en te kijken of ze deze oplossen. Als ze het goed doen, krijgen ze een "pass". Als ze het fout doen, krijgen ze een "fail".

Dit artikel betoogt dat deze "pass/fail"-methode is als het beoordelen van een chef-kok enkel op basis van of hij een ei kan koken. Het vertelt je heel weinig over of hij een complexe maaltijd kan bereiden, met pittige ingrediënten kan omgaan of zijn keuken schoon kan houden.

Hier is wat de onderzoekers hebben gedaan, eenvoudig uitgelegd:

Het Grote Experiment: Een Massale Coding Olympics

In plaats van één enkele puzzel, organiseerden de onderzoekers een enorme "Coding Olympics".

  • De Deelnemers: Ze nodigden 9 verschillende open-source AI-modellen uit (de "assistenten") om te strijden.
  • De Arena: Ze gebruikten 2.707 gratis programmeerproblemen van LeetCode (een populaire site voor programmeeroefeningen).
  • De Talen: Ze gebruikten niet alleen één taal (zoals Engels); ze testten de AI's in 12 verschillende programmeertalen (zoals Python, Java, C++, etc.).
  • De Schaal: In totaal voerden ze meer dan 325.000 pogingen uit. Dat is alsof elke deelnemer elke puzzel in elke taal probeert te oplossen.

De Bevindingen: Het is Complicatie

De onderzoekers ontdekten dat er niet één "beste" AI is. Wie wint, hangt er volledig vanaf waar je naar op zoek bent.

1. De "Generalist" versus de "Specialist"

  • Yi-Coder-9B-Chat was de meest consistente "gemiddelde" presteerder. Als je het vroeg om een willekeurige mix van problemen op te lossen, kreeg deze het hoogste aantal correct opgelost.
  • Qwen2.5-Coder-14B-Instruct was de specialist voor de "hard mode". Deze AI loste niet de meeste makkelijke problemen op, maar wanneer de puzzels echt moeilijk werden, was dit de AI die je moest verslaan. Het slaagde er ook in om de breedste variëteit aan verschillende problemen op te lossen, zelfs als het niet elk enkel probleem perfect kreeg.
  • Gemma-2-27B-IT was de "netheidsfanaat". Hoewel deze niet de meeste problemen oploste, was de code die het schreef het schoonst en volgde het de meeste regels.

2. De Menselijke Kloof
Zelfs de beste AI uit de studie loste gemiddeld slechts ongeveer 23% van de problemen correct op. Ter vergelijking: een menselijke programmeur zou ongeveer 5et 57% van deze problemen oplossen. Dit betekent dat de AI's nog lang niet betrouwbaar genoeg zijn om zelfstandig te werken; ze zijn meer als junior stagiairs die veel toezicht nodig hebben.

3. De "Compile Error" Muur
De onderzoekers keken naar waarom de AI's faalden. Ze vonden een verrassend patroon: 63% van de fouten gebeurde voordat de code überhaupt kon draaien.
Denk aan een auto die niet start omdat het motorblok gebarsten is. Je kunt niet eens testen hoe snel de auto rijdt of langzaam rijdt, omdat hij niet eens aangaat. De meeste AI's faalden omdat ze code schreven met basis syntactische fouten (typefouten, ontbrekende haakjes) in plaats van logische fouten. Ze faalden om te "compileren" (te veranderen in een werkend programma) lang voordat ze op juistheid getest konden worden.

4. De "Clean Code" Paradox
Hier komt de twist: de AI die de schoonste code schreef (Gemma) was niet de AI die de meeste problemen oploste. Omgekeerd schreef de AI die de meeste problemen oploste (Qwen) code die "slordiger" was en meer waarschuwingen gaf van een code-reinigingstool.

  • Analogie: Stel je twee studenten voor die een toets maken. Student A schrijft een zeer nette, perfect geformatteerde essay, maar geeft het foute antwoord. Student B schrijft een slordige, gekrabbelde essay met doorgehaalde woorden, maar geeft het juiste antwoord.
  • Het papier laat zien dat "functioneel succes" (het juiste antwoord krijgen) en "statische kwaliteit" (nette code schrijven) twee verschillende dingen zijn. Je kunt er niet van uitgaan dat een model dat schone code schrijft ook jouw probleem zal oplossen, en je kunt er niet van uitgaan dat een model dat jouw probleem oplost, ook nette code schrijft.

5. Taal Maakt Verschil
Een AI die geweldig is in het schrijven van Python, kan verschrikkelijk zijn in het schrijven van C++. De ranglijsten veranderden afhankelijk van welke taal de AI werd gevraagd te gebruiken. Dit bewijst dat je niet simpelweg kunt zeggen: "Model X is de beste." Je moet zeggen: "Model X is de beste voor Python, maar Model Y is beter voor Java."

De Kern van het Verhaal

Het paper concludeert dat we moeten stoppen met het gebruiken van een enkele "score" om programmeer-AI's te beoordelen. Net zoals je een arts niet alleen zou beoordelen op zijn vermogen om een wond te hechten (terwijl je zijn vermogen om een ziekte te diagnosticeren negeert), moeten we programmeer-AI's niet alleen beoordelen op een "pass rate".

Om deze tools echt te begrijpen, moeten we kijken naar:

  • Welke talen ze goed spreken.
  • Hoe ze met moeilijke problemen omgaan.
  • Of ze falen door typefouten of door slechte logica.
  • Of de code die ze schrijven schoon genoeg is om te onderhouden.

De onderzoekers hebben een enorme, gedetailleerde database van deze resultaten gebouwd zodat anderen precies kunnen zien hoe en waarom deze modellen slagen of falen, in plaats van alleen een enkel getal op een leaderboard te zien.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →