Comparing AI Coding Agents: A Task-Stratified Analysis of Pull Request Acceptance
Deze empirische studie analyseert 7.156 pull requests om aan te tonen dat, hoewel Devin een uniek positief tijdelijk trend in acceptatie vertoont, het taaktype de dominante factor is die succespercentages beïnvloedt, waarbij OpenAI Codex de meest consistente hoge prestaties laat zien over diverse categorieën, ondanks dat geen enkele agent uitblinkt in alle taaktypen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je de manager bent van een drukke bouwplaats. In plaats van menselijke arbeiders heb je vijf verschillende AI-robots (OpenAI Codex, GitHub Copilot, Devin, Cursor en Claude Code) die code kunnen schrijven, bugs kunnen oplossen en documentatie kunnen schrijven. Je doel is om te zien welke robot het beste zijn werk goedgekeurd krijgt door de inspecteurs van de bouwplaats (de "Pull Request Acceptance Rate").
Dit artikel is als een gedetailleerd rapport dat deze vijf robots over een periode van enkele maanden vergelijkt. Hier is wat ze hebben gevonden, eenvoudig uitgelegd:
1. Het "Soort Werk" Is Belangrijker Dan De Robot
De grootste verrassing was niet welke robot het snelst was, maar wat voor soort werk ze deden.
- De Analogie: Stel je voor dat je een robot vraagt om "een gedicht te schrijven" versus "een brug te bouwen". Het schrijven van een gedicht is meestal makkelijker om goedgekeurd te krijgen dan het bouwen van een brug.
- De Bevinding: Het artikel vond dat het type taak de belangrijkste factor is.
- Wanneer de robots werden gevraagd om documentatie te doen (zoals het schrijven van handleidingen of commentaar), kregen ze 82% van de tijd goedkeuring.
- Wanneer ze werden gevraagd om nieuwe functies te bouwen (zoals het toevoegen van een nieuwe kamer aan een huis), kregen ze slechts 66% van de tijd goedkeuring.
- De Les: Als je een robot alleen beoordeelt op basis van zijn algemene score, kun je misleid worden. Een robot die voornamelijk makkelijke "gedichtschrijf"-taken doet, zal eruitzien als een ster, zelfs als hij slecht is in "brugbouwen".
2. Er Is Geen Enkele Robot Die Elke Categorie Wint
Er is geen "beste robot" voor alles. Elke robot heeft een specifieke superkracht.
- OpenAI Codex: Dit is de betrouwbare allrounder. Het presteerde consistent goed bij bijna elk type werk en zakte nooit onder een fatsoenlijke score.
- Claude Code: Dit is de Documentatiespecialist. Het was het beste in het schrijven van handleidingen en het creëren van nieuwe functies, maar we moeten voorzichtig zijn omdat het in deze studie niet veel andere taken uitvoerde.
- Cursor: Dit is de Bugfixer. Als het aankwam op het repareren van kapotte dingen, was het de beste presteerder.
- Devin: Deze robot begon traag maar werd na verloop van tijd beter. Het was de enige die een duidelijke trend van verbetering per week liet zien, opklimmend van ongeveer 60% goedkeuring naar 80%.
3. Tijd Verandert Dingen (Maar Niet Voor Iedereen)
De onderzoekers observeerden deze robots maandenlang om te zien of ze leerden of verbeterden.
- De Analogie: Denk eraan als een student die elke week een toets maakt.
- Devin is als de student die hard studeert en elke week hogere scores behaalt.
- De anderen zijn als studenten die al slim zijn; ze beginnen hoog en blijven hoog, maar ze tonen niet veel verbetering na verloop van tijd. Ze blijven gewoon consistent.
4. Waarom De "Wereldwijde Score" Misleidend Is
Het artikel waarschuwt voor het kijken naar één enkele "gemiddelde score" voor een robot.
- De Analogie: Stel je twee chefs voor. Chef A kookt alleen simpele salades (die iedereen leuk vindt). Chef B kookt alleen complexe, pittige stoofpotjes (die moeilijker goed te krijgen zijn). Als je alleen kijkt naar de "gemiddelde klantbeoordeling", ziet Chef A misschien beter uit. Maar dat betekent niet dat Chef A een betere chef is; het betekent gewoon dat ze makkelijker ingrediënten kregen.
- De Bevinding: De onderzoekers moesten de robots scheiden op basis van het type werk dat ze deden om een eerlijke vergelijking te krijgen. Zodra ze dat deden, ontdekten ze dat de "beste" robot veranderde, afhankelijk van of het werk ging over het oplossen van een bug, het schrijven van een test of het updaten van een document.
Samenvatting
Als je een AI-programmeerassistent wilt aannemen, vraag dan niet alleen: "Wie is de beste?"
- Als je bugfixes nodig hebt, kijk dan naar Cursor of OpenAI Codex.
- Als je nieuwe functies of documentatie nodig hebt, zijn Claude Code of OpenAI Codex misschien je beste opties.
- Als je een robot wilt die lijkt te leren en verbeteren na verloop van tijd, is Devin degene om in de gaten te houden.
De belangrijkste les is dat context koning is. Je kunt een tool niet beoordelen zonder precies te weten welk werk er van hem wordt gevraagd.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.