← Nieuwste papers
💬 NLP

Evaluating LLMs on Real-World Software Performance Optimization

Dit artikel introduceert SWE-Pro, een rigoureuze benchmark op repository-niveau afgeleid van 102 expert-optimalisaties die onthult dat huidige Large Language Models er aanzienlijk in falen om menselijk prestatieniveau te evenaren bij real-world software-optimalisatie, waarbij ze verwaarloosbare winsten behalen vergeleken met de substantiële versnellingen en geheugenreducties die door expert-engineers worden geleverd.

Oorspronkelijke auteurs: Ezgi Sarıkayak, Wenchao Gu, Hesham Ghonim, Chunyang Chen

Gepubliceerd 2026-06-25
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Ezgi Sarıkayak, Wenchao Gu, Hesham Ghonim, Chunyang Chen

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Plaatje: De "Snelle Kok" versus de "Meesterkok"

Stel je voor dat je een enorme, drukke restaurantkeuken hebt (een echte software-codebase). Je huurt een team van AI-Chefs in (Large Language Models of LLM's) om de Meesterkoks (menselijke experts) te helpen sneller te koken en minder energie te verbruiken.

De Meesterkoks weten precies hoe ze efficiënt groenten moeten snijden, de voorraadkast moeten organiseren om stappen te besparen en de temperatuur van het fornuis moeten aanpassen om brandstof te besparen. Ze hebben jarenlange ervaring.

De AI-Chefs zijn ongelooflijk slim. Ze kunnen het recept lezen, de ingrediënten begrijpen en zelfs nieuwe recepten schrijven die op papier perfect lijken. Maar de grote vraag die dit paper stelt is: Kunnen deze AI-Chefs de keuken in de echte wereld ook daadwerkelijk sneller laten draaien en minder energie laten verbruiken, of zorgen ze er alleen voor dat het er goed uitziet zonder de snelheid echt te verbeteren?

Het Probleem: De Oude Tests Waren Te Simpel

Voorheen testten onderzoekers AI-Chefs door ze één kleine, minieme taak te geven: "Snijd deze ene wortel."

  • De Fout: In een echte keuken snijd je niet één wortel. Je snijdt er 10, 1.000 of 100.000. Soms zijn de wortels nat; soms zijn ze bevroren.
  • Het Resultaat: De oude tests waren alsof je een chef beoordeelt op hoe goed hij één enkele wortel snijdt in een stille kamer. Ze testten niet of de chef een spitsuur met 1.000 bestellingen kon aan, of dat de chef per ongelage te veel water (geheugen) gebruikte terwijl hij probeerde snel te zijn.

Het paper betoogt dat deze oude tests te makkelijk waren en het "lawaai" (willekeurige fluctuaties) dat in echte computers voorkomt, niet opvingen.

De Oplossing: SWE-Pro (De "Echte Keuken" Simulator)

De auteurs hebben een nieuwe, veel moeilijkere test gebouwd genaamd SWE-Pro. Zie dit als een hoogtechnologische simulatie van een chaotische, echte keuken.

  1. Echte Recepten: Ze hebben geen nep-taken bedacht. Ze hebben gekeken naar 102 echte voorbeelden waarbij menselijke experts succesvol code hebben geoptimaliseerd in beroemde open-source projecten (zoals pandas, scikit-learn en xarray). Dit zijn de "Gold Standard" recepten.
  2. De Stress-test: In plaats van de AI op slechts één input te testen, test SWE-Pro ze op veel verschillende scenario's.
    • Analogie: Het is niet alleen "snijd 10 wortels". Het is "snijd 10 wortels", dan "snijd 100", dan "snijd 10.000", en doe dit met natte wortels, bevroren wortels en wortels van verschillende groottes.
  3. De Lawaaifilter: Computers zijn rommelig. Soms draait een programma traag omdat de computer ergens anders aan het nadenken was (zoals een ober die een dienblad laat vallen). SWE-Pro voert de tests herhaaldelijk uit, gebruikmakend van een speciale statistische "lawaaifilter" om er zeker van te zijn dat als de AI zegt "Ik ben sneller", dit ook echt waar is en niet gewoon een gelukkige toevalstreffer.
  4. Twee Metrieken: Ze meten twee dingen:
    • Snelheid: Hoe snel het eten wordt geserveerd (Runtime).
    • Geheugen: Hoeveel werkblad en opslag de chef gebruikt (Peak Memory en Time-Weighted Memory Usage).

De Resultaten: De AI-Chefs Hebben Moeite

Toen ze de beste AI-modellen (zoals GPT-5.2, Claude Sonnet 4.6, etc.) door deze rigoureuze "Echte Keuken"-test haalden, waren de resultaten verrassend en teleurstellend.

  • De Menselijke Experts (Gold Standard): Wanneer mensen de code optimaliseerden, bereikten ze enorme verbeteringen.
    • Analogie: De Meesterkok verkortte de kooktijd met 15 keer en verminderde de benodigde werkruimte met 171 keer. Ze vonden slimme manieren om de keuken te herorganiseren die enorme hoeveelheden middelen bespaarden.
  • De AI-Chefs:
    • Snelheid: De AI-modellen maakten nauwelijks een verschil. In de meeste gevallen waren hun "verbeteringen" zo klein dat ze niet te onderscheiden waren van willekeurig lawaai.
    • Geheugen: De AI-modellen slaagden er bijna nooit in om geheugen te besparen. Ze waren vrijwel afwezig op dit gebied.
    • Het "Geen Signaal" Probleem: Zelfs wanneer de AI code schreef die de basis-tests doorstond (het eten smaakte goed), produceerde het zelden een meetbare versnelling. Het was als een chef die de wortels netjes snijdt, maar precies even lang doet als voorheen.
    • De Regressie: Soms maakte de AI de boel zelfs trager. Eén model (GPT-5.2) maakte de code gemiddeld zelfs 30% trager!

De Belangrijkste Conclusie

Het paper concludeert dat hoewel AI geweldig is in het schrijven van code die er correct uitziet en de regels volgt, het momenteel erg slecht is in de diepe, complexe engineering die nodig is om software in real-world scenario's aanzienlijk sneller te laten draaien of minder geheugen te laten gebruiken.

  • De Kloof: Er is een enorme kloof tussen wat AI vandaag de dag kan en wat expert menselijke engineers kunnen doen.
  • De Bottleneck: Het probleem is niet dat de AI geen grote verbetering kan maken als het een gelukje heeft (dat kan in zeldzame gevallen wel). Het probleem is dat de AI niet betrouwbaar de kansen kan vinden om die verbeteringen door te voeren.

Kortom: Als je een AI vraagt om "deze software sneller te maken", schrijft hij misschien een mooi ogende patch, maar verwacht niet dat het daadwerkelijk je computer versnelt of je geheugen bespaart. Voor nu is die taak nog steeds voorbehouden aan de menselijke experts.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →