Evaluating Agentic Optimization on Large Codebases
Dit paper introduceert FormulaCode, een benchmark met bijna duizend prestatieknelpunten uit echte Python-repositories om de complexiteit van multi-objectieve code-optimalisatie door LLM-agenten te evalueren, waarbij de resultaten aantonen dat dit voor geavanceerde modellen nog steeds een grote uitdaging blijft.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
FORMULACODE: De Formule 1 van de Code-Optimalisatie
Stel je voor dat je een enorm, oud en complex race-team hebt. De auto's (de software) werken prima, maar ze zijn niet snel genoeg om de wereldtitel te winnen. Jij hebt een nieuwe, super slimme robot (een AI-agent) die de baan moet analyseren en de auto moet tunen om sneller te zijn.
Maar hier is het probleem: tot nu toe testten we deze robots op simpele, kleine onderdelen, zoals "maak deze ene bout strakker" of "verander deze ene schroef". In de echte wereld werkt het echter anders. Je moet de hele auto optimaliseren: de motor, de aerodynamica, het gewicht en de banden, allemaal tegelijk, zonder dat de auto uit elkaar valt.
Dat is precies wat FORMULACODE doet. Het is een nieuwe "racebaan" om te testen hoe goed AI-agenten zijn in het verbeteren van hele, grote software-projecten.
Hier is hoe het werkt, vertaald naar alledaags taal:
1. Het Probleem: De "Simpele Test" vs. De "Echte Wereld"
Vroeger testten we AI op code alsof het een quiz was met ja/nee-antwoorden.
- De oude manier: "Schrijf een functie die twee getallen optelt." (Ja/Nee).
- Het probleem: In de echte wereld gaat het niet om "werkt het wel of niet?", maar om "hoe snel is het?". En als je één ding sneller maakt, kan het zijn dat een ander ding langzamer wordt. Het is een balansoefening.
2. De Oplossing: FORMULACODE (De Grote Race)
De onderzoekers hebben FORMULACODE bedacht. De naam is een knipoog naar Formule 1. In F1 bouwen teams niet alleen een sneller wiel; ze optimaliseren het hele systeem om de snelste ronde te rijden.
- De Auto's: De benchmark gebruikt 957 echte "snelheidsproblemen" uit grote, bekende Python-projecten (zoals Pandas, Scikit-learn en SciPy). Dit zijn de "racewagens" die getuned moeten worden.
- De Werkplaats: Elke taak heeft een "werkplaats" met honderden meetinstrumenten (werklasten). Stel je voor dat je niet alleen kijkt of de auto sneller is op de rechte stukken, maar ook op de bochten, in de regen, en bij het remmen.
- De Regels: De AI mag de auto niet kapot maken. Als de code sneller is, maar de auto crasht (de software stopt met werken), dan is het een mislukte poging. De AI moet correctheid en snelheid tegelijk bewaken.
3. Wat hebben ze ontdekt? (De Uitslag van de Race)
De onderzoekers hebben de beste AI-agenten van dit moment (zoals GPT-5, Claude, en Gemini) op deze racebaan gegooid. Hier zijn de resultaten, vertaald:
- De AI is een goede monteur, maar nog geen Formule 1-team: De AI kan zeker snelheidswinst boeken, maar ze zijn nog niet zo goed als de menselijke experts die de originele verbeteringen hebben bedacht. De AI maakt vaak kleine foutjes of lost het verkeerde probleem op.
- Lokaal vs. Globaal: De AI is goed in het polijsten van één klein onderdeel (een "boutje strakker zetten"), maar faalt vaak als ze het hele systeem moeten herschrijven. Ze zien de grote lijn niet altijd.
- De "Populaire" Baan: De AI doet het het beste op populaire projecten (waar veel mensen aan werken) en het slechtste op obscure projecten. Dit komt waarschijnlijk omdat de AI meer heeft geoefend op de populaire projecten.
- De Kosten: Soms is een duurdere, slimmere AI in het totaal goedkoper omdat hij minder vaak fouten maakt en minder "proefrijden" nodig heeft dan een goedkopere, slimmere AI die veel rondjes moet draaien.
4. Waarom is dit belangrijk?
Voorheen dachten we: "AI kan code schrijven, dus AI kan ook code optimaliseren." FORMULACODE toont aan dat het veel moeilijker is dan gedacht. Het is alsof je iemand vraagt niet alleen een auto te bouwen, maar ook de motor te tunen, de banden te kiezen en de strategie te bedenken, terwijl je in de auto zit.
De conclusie:
FORMULACODE is als een nieuwe, eerlijke competitie voor AI. Het zegt tegen de ontwikkelaars: "Stop met het testen van kleine trucjes. Laten we kijken of jullie AI echt complexe, grote systemen kan verbeteren zonder ze kapot te maken."
Het is een hulpmiddel om ervoor te zorgen dat de AI van de toekomst niet alleen een "snelle schrijver" is, maar een echte "systeem-architect" die onze digitale wereld sneller en efficiënter maakt.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.