← Nieuwste papers
💻 computer science

What's in a Benchmark? The Case of SWE-Bench in Automated Program Repair

Dit artikel presenteert de eerste uitgebreide analyse van de SWE-Bench Lite en Verified leaderboards, die onthult dat inzendingen uit de industrie die gebruikmaken van propriëtaire LLM's, in het bijzonder de Claude-familie, momenteel de benchmark domineren, terwijl academische bijdragen competitief blijven.

Oorspronkelijke auteurs: Matias Martinez, Xavier Franch

Gepubliceerd 2026-02-05
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Matias Martinez, Xavier Franch

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je de wereld van het repareren van computercode voor als een enorme, prestigieuze Olympische Spelen voor software engineers. Jarenlang hebben onderzoekers geprobeerd om robots (AI) te bouwen die automatisch bugs in code kunnen vinden en oplossen. Om te zien wie er aan het winnen is, hebben ze een standaard circuit nodig om op te racen.

Dit artikel duikt diep in de twee belangrijkste circuits die momenteel worden gebruikt voor deze race: SWE-Bench Lite en SWE-Bench Verified. De auteurs, Matias Martinez en Xavier Franch, traden op als sportanalisten; ze bekeken de scoreborden, de atleten en de uitrusting die zij gebruikten om te zien wat er werkelijk aan de hand is in dit vakgebied.

Hier is wat zij vonden, eenvoudig uitgelegd:

1. Het Racecircuit (De Benchmarks)

Beschouw SWE-Bench als een gigantische sportschool vol met 2.294 kapotte stukjes software (bugs) afkomstig van echte projecten.

  • SWE-Bench Lite: Dit is de "kwalificatieronde". Het bevat 300 van de meest voorkomende bugs. Het bestaat al langer en heeft veel inzendingen.
  • SWE-Bench Verified: Dit is de "kampioensronde". Het bevat 500 bugs die zorgvuldig zijn gecontroleerd en opgeschoond door een groot AI-bedrijf (OpenAI) om er zeker van te zijn dat ze oplosbaar zijn. Het is nieuwer, en de competitie hier is heviger.

2. Wie loopt de race? (De Submitters)

De auteurs keken naar wie de oplossingen indient. Ze ontdekten dat de industrie het circuit domineert.

  • De Bedrijfs-sprinters: De meeste topscorers zijn bedrijven. Het zijn niet alleen de reuzen zoals Google of IBM; er zijn ook veel kleine startups en "moeder en dochter" tech-winkels.
  • De Academische Lopers: Universiteiten en onderzoekslabs doen nog steeds mee, maar ze zijn minder talrijk in vergelijking met de bedrijfs-teams.
  • De Solo-atleten: Een enkeling loopt de race op eigen kracht, wat indrukwekkend is gezien hoe krachtig de tools zijn.

De Analogie: Stel je een marathon voor waarbij de winnaars vroeger voornamelijk universiteitslopers waren. Nu is het podium vooral bezet door professionele teams van grote bedrijven en kleine startups, met enkele universiteitslopers die nog net het tempo bijhouden.

3. De Uitrusting (De AI-modellen)

Dit is wellicht de meest verrassende bevinding. Om snel te lopen, heb je goede schoenen nodig. In deze race zijn de "schoenen" Large Language Models (LLM's) — de AI-hersenen achter de reparatierobots.

  • De "Super-schoenen": De snelste lopers gebruiken bijna uitsluitend propriëtaire (gesloten bron) modellen, specifiek de Claude-familie (gemaakt door een bedrijf genaamd Anthropic). De huidige kampioen, Claude 4 Sonnet, is als een paar superlichtgewicht, high-tech hardloopspikes die niemand anders kan kopen of waarvan het ontwerp niet te zien is.
  • De Open-Source Sneakers: Er zijn lopers die open-source modellen gebruiken (modellen die iedereen kan downloaden en bestuderen), maar zij winnen de gouden medailles vooralsnog meestal niet. Ze zijn competitief, maar ze vestigen nog geen wereldrecords.
  • De Mix: Sommige teams combineren verschillende modellen (zoals het dragen van twee verschillende schoenen), maar de beste enkele "schoen" is nog steeds het propriëtaire Claude-model.

4. De Resultaten (Wie wint er?)

  • Het Scorebord: Het "Verified"-scorebord heeft veel hogere scores dan het "Lite"-scorebord. De beste oplossingen lossen ongeveer 76% tot 77% van de bugs op.
  • De Trend: In het begin liepen universiteiten voorop. Maar naarmate de race vorderde, trokken kleine en grote bedrijven er vanaf, waarbij ze vaak de hoogste scores behaalden.
  • Het "Black Box"-probleem: Veel van de topoplossingen zijn "closed source". Dit betekent dat we weten dat ze werken, maar we weten niet precies hoe ze het doen, omdat de bedrijven hun code geheim houden. Het is alsoer dat je een loper ziet winnen, maar niet wordt toegestaan om zijn trainingsregime te zien.

5. De Valkuilen (Waar op te letten)

De auteurs waarschuwen dat het scorebord een beetje misleidend kan zijn, zoals een race waarbij de finishlijn verschuift.

  • Het "Spiekbriefje"-effect: Soms "leert" de AI de bug niet echt op te lossen; hij heeft het antwoord gewoon onthouden omdat hij de bug eerder in zijn trainingsdata heeft gezien. Dit wordt data contaminatie genoemd.
  • Het "Fake Fix"-effect: Soms schrijft de AI een oplossing die weliswa door de geautomatiseerde test komt (zoals een student die het juiste antwoord raadt bij een meerkeuzetoets), maar het werkelijke probleem niet oplost. Dit wordt overfitting genoemd.
  • De Kosten: De beste "schoenen" (de top AI-modellen) kosten geld om te gebruiken. Dit betekent dat alleen teams met grote budgetten het zich kunnen veroorloven om het snelst te rennen, wat kleinere onderzoekers of de open-source gemeenschap achter kan laten.

De Kernboodschap

Het artikel concludeert dat het veld van automatische programma-reparatie ongelooflijk snel beweegt, maar dat het een bedrijfsgedomineerde sport aan het worden is. De beste resultaten worden gedreven door grote bedrijven die dure, geheime AI-modellen gebruiken. Hoewel dit geweldig is voor de snelheid, suggereren de auteurs dat we voorzichtig moeten zijn: we moeten ervoor zorgen dat de oplossingen echte oplossingen zijn, en niet slechts onthouden antwoorden, en we moeten de race open genoeg houden zodat iedereen kan deelnemen, niet alleen de teams met de grootste budgetten.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →