SWE-MERA: A Dynamic Benchmark for Agenticly Evaluating Large Language Models on Software Engineering Tasks
Om kritieke datacontaminatie en ontoereikende testgevallen in bestaande benchmarks zoals SWE-bench aan te pakken, introduceert het artikel SWE-MERA, een dynamische en continu bijgewerkte benchmark die een geautomatiseerde pijplijn gebruikt om real-world GitHub-issues te cureren, waarmee een rigoureus en betrouwbaar evaluatiekader wordt geboden voor Large Language Models op software engineering-taken.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een robot probeert te leren hoe hij een kapotte videogame moet repareren. Een lange tijd was de beste manier om de robot te testen het geven van een specifieke lijst met kapotte levels die iedereen al had gezien. Maar hier is het probleem: de robot was de antwoorden gewoon aan het memoriseren in plaats van echt te leren hoe hij dingen moet repareren. Het was alsof een student het antwoordblad van vorig jaar voor wiskunde uit zijn hoofd had geleerd, maar faalt voor een nieuwe toets omdat de getallen zijn veranderd.
Dit is precies wat er gebeurde met de beroemde SWE-bench, een populaire test voor AI-codeervaardigheden. Het artikel onthult dat deze oude test antwoorden lekte. Ongeveer 32,67% van de "succesvolle" reparaties bestonden er simpelweg uit dat de AI oplossingen kopieerde die hij al eerder had gezien, en een ander 31,08% slaagde omdat de tests te zwak waren om echte fouten te ontdekken. Het was een gebroken liniaal.
Maak kennis met SWE-MERA, de nieuwe, dynamische uitdager. Zie SWE-MERA niet als een statisch tekstboek, maar als een levende, ademende videogame-server die elke maand wordt bijgewerkt. In plaats van oude, uit het hoofd geleerde puzzels, jaagt het constant op gloednieuwe, echte problemen op het internet (specifiek op GitHub, waar miljoenen mensen code delen).
Hoe de Nieuwe Test Werkt
De auteurs hebben een supergeorganiseerde robot-pipeline gebouwd om deze verse problemen te vinden. Het is als een technologisch hoogstaande speurtocht met zeven strikte regels om te zorgen dat de aanwijzingen echt zijn:
- Kies de juiste speeltuin: Het kijkt alleen naar populaire, actieve Python-projecten (met minstens 10 stars en 10 forks).
- Combineer de aanwijzingen: Het vindt een specifiek probleem (een "issue") en de exacte oplossing (een "pull request") die het oploste, waarbij wordt gecontroleerd of ze een perfecte één-op-één combinatie vormen.
- Controleer de grootte: Het negeert kleine aantekeningen en enorme, rommelige projecten, en houdt alleen de projecten over die precies goed zijn.
- Verifieer de fix: Het controleert of de oplossing daadwerkelijk de code verandert en een test toevoegt om te bewijzen dat het werkt.
- Bouw het lab: Het probeert het project te bouwen in een veilige, geïsoleerde container (zoals een digitale zandbak) om te zien of de tests slagen.
- Voer de volledige missie uit: Het voert de hele taak van begin tot eind uit om te controleren of het reproduceerbaar is.
- De AI-rechter: Tot slot fungeert een andere AI (een Qwen3-32B model) als een strenge leraar die de taak beoordeelt op een schaal van 1 tot 10 voor juistheid en volledigheid. Als een taak te makkelijk, te moeilijk of slecht uitgelegd is, wordt deze weggegooid.
Het resultaat? Een enorme collectie van ongeveer 10.000 potentiële taken, waarvan er 728 hoogwaardige monsters direct klaar zijn voor gebruik.
De Resultaten: Wie Wint Er Eigenlijk?
De onderzoekers hebben een dozijn van de slimste coderende AI's getest op deze verse problemen. Ze vroegen de AI niet alleen om het probleem één keer op te lossen; ze gaven het zes pogingen om de bug te repareren, met kansen om na te denken en het werk te controleren.
De resultaten waren oogverblindend:
- De Toppresteerder: Het DeepSeek-R1-0528 model was de kampioen; het loste ongeveer 27,8% van de problemen op de eerste poging op en 40,2% binnen zes pogingen.
- De Runner-up: Devstral-Small-2505 kwam op de tweede plaats met 17,2% op de eerste poging en 28,2% in totaal.
- De Strijders: Zelfs de grote, krachtige modellen zoals Llama-3.3-70B (die geweldig zijn in chatten maar niet specif specifiek zijn gebouwd voor code) haalden slechts 8,7% op de eerste poging. Het kleinste model, Qwen2.5-Coder-7B, kon slechts 2,7% op de eerste poging repareren.
Het artikel suggereert dat deze nieuwe, dynamische tests veel beter zijn in het onderscheid maken tussen een slimme AI en een memoriserende AI. Bijvoorbeeld: sommige modellen die goed presteerden op oude tests, deden het juist slechter op de nieuwe 2025-taken, wat suggereert dat ze alleen de oude antwoorden aan het memoriseren waren.
Wat Deze Test Niet Doet
Het is belangrijk om te weten wat deze nieuwe benchmark weglaat. Het artikel stelt expliciet dat deze test niet meet hoe leesbaar, onderhoudbaar of veilig de code is. Het test ook niet teamwork of hoe goed een mens en een robot samenwerken. Het gaat strikt over: "Kan de robot de bug repareren en de tests laten slagen?"
Daarnaast waarschuwen de auteurs dat omdat deze problemen automatisch worden verzameld, sommige misschien een beetje vreemd zijn of een gebrek aan creatieve nuance van een door mensen geschreven puzzel hebben. Er is ook een klein risico dat de AI een vergelijkbaar probleem heeft gezien in zijn trainingsdata, ook al probeert het systeem dat te voorkomen.
Het Grote Plaatje
De auteurs zijn er zeker van dat SWE-MERA een veel eerlijkere manier is om vooruitgang te meten. Door de test constant te verversen met nieuwe, ongeziene uitdagingen, voorkomt het dat de AI vals speelt door antwoorden te memoriseren. Ze hebben zelfs een publieke leaderboard gebouwd waar iedereen kan zien hoe hun coderende robot staat tegenover de beste in de wereld, met een schuifregelaar waarmee je kunt zien hoe de prestaties in de loop van de tijd veranderen.
Kortom, SWE-MERA is de "frisse lucht" die het vakgebied nodig had. Het beweegt weg van stoffige, uit het hoofd geleerde tekstboeken en naar een dynamische, voortdurend veranderende arena waar alleen de echt aanpasbare coderende agenten kunnen overleven.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.