← Nieuwste papers
💻 computer science

Why Agentic-PRs Get Rejected: A Comparative Study of Coding Agents

Dit artikel analyseert 654 afgewezen pull requests over vijf coderingsagenten en een menselijke baseline om unieke en agent-specifieke afwijzingspatronen te identificeren, terwijl het heuristieken voorstelt om de uitdaging van ontbrekende reviewer-feedback in 67,9% van de gevallen aan te pakken.

Oorspronkelijke auteurs: Sota Nakashima, Yuta Ishimoto, Masanari Kondo, Shane Mclntosh, Yasutaka Kamei

Gepubliceerd 2026-02-05
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Sota Nakashima, Yuta Ishimoto, Masanari Kondo, Shane Mclntosh, Yasutaka Kamei

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je softwareontwikkeling voor als een enorme, bruisende bouwplaats. Normaal gesproken, wanneer een arbeider (een menselijke ontwikkelaar) een nieuwe kamer heeft voltooid of een lek heeft gerepareerd, overhandigt deze een "Wijzigingsverzoek" (een Pull Request) aan de bouwplaatsmanager. De manager bekijkt het en zegt: "Geweldig, laten we dit bouwen," of "Nee, dit gaat niet werken."

Onlangs is er een nieuw type arbeider gearriveerd: AI-agenten. Dit zijn robots die kunnen plannen, bouwen en hun eigen wijzigingsverzoeken kunnen indienen zonder dat een mens hen de hand vasthoudt. Dit artikel onderzoekt wat er gebeurt wanneer deze AI-arbeiders hun werk inleveren in vergelijking met menselijke arbeiders.

Hier is de uitsplitsing van de studie, gebruikmakend van eenvoudige analogieën:

1. Het Grote Probleem: De "Stille Afwijzing"

De onderzoekers keken naar 654 afgewezen wijzigingsverzoeken van vijf verschillende AI-robots (zoals Devin, Claude Code en GitHub Copilot) en vergeleken deze met verzoeken gedaan door mensen.

De meest schokkende bevinding? Twee van de drie afwijzingen waren stil.

  • De Analogie: Stel je voor dat je een tekening indient voor een wedstrijd en deze wordt in de prullenbak gegooid. Je vraagt: "Waarom?" en de rechter haalt alleen maar zijn schouders op en loopt weg.
  • De Realiteit: 6^7,9% van de afgewezen AI-verzoeken had geen uitleg van de beoordelaar. Het verzoek werd gewoon gesloten. Dit maakt het voor de onderzoekers erg moeilijk om te weten waarom de AI faalde, omdat de "rechter" de reden niet heeft opgeschreven.

2. De "AI-alleen" Fouten

Wanneer de onderzoekers wel redenen voor afwijzing vonden, ontdekten ze dat AI-robots fouten maken die mensen bijna nooit maken. Ze vonden zeven specifieke afwijzingsredenen die alleen bij AI voorkwamen:

  • De "Te Grote" Doos: Mensen dienen soms grote projecten in, maar AI-robots hebben de neiging om enorme, overweldigende wijzigingen in één keer in te dienen. Het is also't een AI die probeert een hele wolkenkrabber in één dag te bouwen. De managers wezen deze af omdat ze te groot waren om goed te beoordelen.
  • Het "Wantrouwen" Badge: Sommige managers vertrouwden het code simpelweg niet omdat het door een robot was gemaakt. Ze wezen het af puur omdat het door AI was gegenereerd, uit angst dat het onbetrouwbaar zou zijn of "gehallucineerd" (verzonnen) zou zijn.
  • Het "Slop" Label: In één geval wees een projecteigenaar een AI-verzoek af en bestempelde het als "SLOP" (een term voor content van lage kwaliteit die massaal wordt geproduceerd), wat in feite betekende: "Dit is troep gegenereerd door een machine."
  • De "Experiment" Mislukking: Sommige AI-verzoeken werden ingediend enkel om te zien of de robot het kon, niet omdat iemand daadwerkelijk de code wilde gebruiken. Deze werden afgewezen omdat ze niet bedoeld waren voor echt gebruik.

3. De "Robot-specifieke" Kuren

Verschillende AI-robots hebben verschillende persoonlijkheden en instellingen, wat leidt tot unieke afwijzingspatronen:

  • Het "Devin" Effect: Eén specifieke robot, genaamd Devin, heeft een instelling die zijn eigen verzoeken automatisch sluit als ze te lang ongebruikt blijven. De studie vond dat veel van de afwijzingen van Devin niet kwamen omdat de code slecht was, maar omdat de robot zelf zei: "Ik verveel me, ik sluit dit," na 7 dagen stilte.
  • De "Context" Valstrik: Sommige AI-robots werden afgewezen omdat ze geen toegang hadden tot "privé" bestanden of gegevens die ze nodig hadden om de klus te klaren. Het is alsof een robot probeert een slot te repareren, maar buiten de kamer wordt gehouden waar de sleutel ligt.

4. De Oplossing: Een "Vuilnisfilter"

Omdat zoveel afwijzingen geen aantekeningen bevatten (het "Stille Afwijzing"-probleem), realiseerden de onderzoekers zich dat ze een manier nodig hadden om de data op te schonen voordat ze deze konden bestuderen. Ze creëerden een eenvoudig filter (een set regels) om te raden welke afwijzingen echt "stil" waren en welke mogelijk verborgen aanwijzingen bevatten.

  • De Filterregels: Ze zochten naar verzoeken die:
    1. Werden gesloten door de persoon die ze schreef (Zelf gesloten).
    2. Zeer snel werden gesloten (bijv. binnen 7 dagen).
    3. Werden gesloten zonder dat iemand een reactie achterliet.
  • Het Resultaat: Door deze regels te gebruiken, konden ze de "ruis" (de stille, onbehulpzame afwijzingen) wegfilteren en zich concentreren op de gevallen waarbij de managers daadwerkelijk uitlegden waarom ze "Nee" zeiden. Dit helpt toekomstige onderzoekers om een duidelijker beeld te krijgen van wat er precies misgaat.

Samenvatting

Het artikel concludeert dat hoewel AI-agenten sneller dan ooit code bouwen, ze vaker worden afgewezen dan mensen. Dit komt niet alleen omdat hun code buggy is; het komt omdat ze:

  1. Dingen indienen die te groot of te complex zijn.
  2. Wantrouwen bij menselijke managers triggeren.
  3. Unieke "robotgedragingen" hebben (zoals auto-sluiten) die mensen niet hebben.
  4. Vaak worden afgewezen zonder dat iemand uitlegt waarom, wat het moeilijk maakt om van fouten te leren.

De studie biedt een "filter" om deze data op te schonen, zodat we beter kunnen begrijpen hoe we deze AI-arbeiders in de toekomst betrouwbaarder kunnen maken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →