On the Use of Agentic Coding: An Empirical Study of Pull Requests on GitHub
Deze empirische studie van 567 door de Claude Code-agent gegenereerde GitHub pull requests over 157 open-source projecten onthult dat hoewel 83,8% van de door agents ondersteunde bijdragen wordt geaccepteerd — vaak zonder wijziging — ze nog steeds regelmatig menselijk toezicht vereisen voor bugfixes, documentatie en naleving van projectstandaarden.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je softwareontwikkeling voor als een enorme, drukke bouwplaats waar duizenden teams digitale wolkenkrabbers bouwen (open-source projecten). Jarenlang hebben de arbeiders (ontwikkelaars) het zware werk gedaan, de blauwdrukken getekend en de stenen gelegd.
Onlangs is er een nieuw type superintelligent robotassistent genaamd "Agentic Coding" (specifiek een tool genaamd Claude Code) op de bouwplaats gearriveerd. In tegenstelling tot een simpele rekenmachine die alleen vragen beantwoordt, kan deze robot een moersleutel pakken, naar de blauwdrukken kijken, een lekkende pijp repareren, zelfs een nieuwe handleiding schrijven en zelfs de papierwinkel regelen om het werk te laten goedkeuren — allemaal zelfstandig.
Dit artikel is een rapportcijfer over hoe goed deze robots hun werk eigenlijk doen in de echte wereld. De onderzoekers keken naar 567 bouwprojecten (Pull Requests) waarbij deze robot het werk deed, vergeleken met projecten die door mensen zijn uitgevoerd, en stelden vier grote vragen.
Hier is wat ze vonden, uitgelegd met eenvoudige analogieën:
1. Wat voor soort werk doen de robots? (RQ1)
De bevinding: Mensen en robots repareren beide kapotte dingen (bugs) en bouwen nieuwe kamers (features). Echter, de robots hebben een bijzonder talent voor renovaties en opruimen.
- De analogie: Als een menselijke arbeider de opdracht krijgt om "het huis te repareren", kan hij het dak repareren of een nieuwe garage bouwen. Als je de robot vraagt om "het huis te repareren", houdt hij ervan om meubels te herorganiseren (refactoring), betere labels op de kastjes te plakken (documentatie) en meer beveiligingscamera's toe te voegen (testen).
- Het resultaat: Robots zijn verrassend goed in het saaie, op regels gebaseerde opruimwerk dat mensen vaak saai vinden. Ze schrijven ook veel langere, gedetailleerdere "werkorders" (PR-beschrijvingen) waarin precies wordt uitgelegd wat ze hebben gedaan.
2. Accepteren de bazen (maintainers) het werk van de robots? (RQ2)
De bevinding: Ja, meestal wel! Maar niet zo vaak als ze het werk van mensen accepteren.
- De statistieken: Ongeveer 84% van het werk van de robot wordt goedgekeurd en samengevoegd (merged). Ter vergelijking: ongeveer 91% van het werk van mensen wordt goedgekeurd.
- Waarom worden ze afgewezen? Het komt zelden doordat de robot een "slechte muur" heeft gebouwd. Meestal wordt het werk afgewezen omdat:
- Timing: Een ander teamlid heeft het probleem al op een andere manier opgelost.
- Omvang: De robot probeerde het hele huis in één keer te repareren, waardoor de blauwdruk te groot werd om te beoordelen.
- Veroudering: Het project is van richting veranderd terwijl de robot aan het werk was.
- De les: De robots zijn over het algemeen betrouwbaar, maar ze missen soms de context van het "grote plaatje" van wat het team op dit moment echt wil.
3. Hebben de robots hulp nodig om de klus te klaren? (RQ3)
De bevinding: Verrassend genoeg hebben robots en mensen ongeveer evenveel "afwerking" nodig voordat hun werk perfect is.
- De analogie: Stel je voor dat je een custom taart bestelt. Soms krijgt de bakker (robot) het de eerste keer 100% goed. Soms krijgt hij het voor 90% goed en moet je alleen nog even de glazuur aanpassen.
- De statistieken: Ongeveer 55% van de robot-taarten is direct perfect. Dit is bijna hetzelfde als de menselijke bakkers (58,5%).
- De inspanning: Wanneer de taart wel aangepast moet worden, is de hoeveelheid werk die nodig is om de taart van een robot te repareren statistisch gezien hetzelfde als het repareren van de taart van een mens. De robots maken niet meer fouten die meer werk vereisen; ze maken gewoon andere soorten kleine fouten.
4. Wat moeten mensen precies repareren? (RQ4)
De bevinding: Wanneer mensen wel moeten ingrijpen om het werk van de robot te repareren, gaan ze meestal over veiligheidscontroles, instructies en stijl.
- Bugfixes (48%): Soms is de robot te optimistisch. Hij gaat ervan uit dat een deur nooit zal breken, dus bouwt hij geen back-up plan. Mensen moeten dat back-up plan toevoegen.
- Documentatie (29%): De robot kan een geweldige nieuwe kamer bouwen, maar vergeet dan de kaart van het huis bij te werken. Mensen moeten de "README" (de handleiding) bijwerken.
- Refactoring (27%): De robot kan een muur bouwen die werkt, maar die staat op een vreemde plek waardoor het de rest van het huis moeilijk begaanbaar maakt. Mensen moeten deze verplaatsen zodat het bij de stijl van het huis past.
- Stijl (23%): De robot gebruikt misschien de verkeerde kleur verf of het verkeerde lettertype. Mensen moeten ervoor zorgen dat het bij de rest van het gebouw past.
Het Grote Plaatje
Beschouw Agentic Coding als een zeer getalenteerde, snelle en enthousiaste leerling-gezel.
- Pluspunten: Het kan een enorme hoeveelheid van het zware werk doen, vooral de saaie opruim- en testtaken. Het produceert werk dat vaak goed genoeg is om direct te gebruiken.
- Minpunten: Het mist soms de "vibe" van het project, schrijft instructies die te lang of te kort zijn, en heeft af en toe een menselijk toezicht nodig om de veiligheid en stijl te controlen.
De Conclusie: De robot vervangt de menselijke voorman nog niet. In plaats daarvan is het een krachtig hulpmiddel dat het grove werk doet, waardoor de mens kan ingrijpen, de plannen kan beoordelen en de uiteindelijke beslissing kan nemen om ervoor te zorgen dat alles veilig, stijlvol is en perfect bij het project past. Het artikel suggereert dat hoewel de robot een goed startpunt is, menselijk toezicht essentieel blijft om een "goede conceptversie" te veranderen in een "afgewerkt meesterwerk".
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.