← Nieuwste papers
💻 computer science

Why Are Agentic Pull Requests Merged or Rejected? An Empirical Study

Deze empirische studie van meer dan 11.000 agentische pull requests onthult dat het uitsluitend vertrouwen op samenvoegings- of afkeuringsuitkomsten voor het evalueren van AI-coderingsagenten misleidend is, aangezien een aanzienlijk deel van de afkeuringen voortkomt uit workflowbeperkingen in plaats van agentfouten en veel samenvoegingen aanzienlijke menselijke tussenkomst vereisen, waardoor interactiebewuste evaluatiemetrics die zijn gebaseerd op reviewgedrag noodzakelijk zijn.

Oorspronkelijke auteurs: Sien Reeve O. Peralta, Fumika Hoshi, Hironori Washizaki, Naoyasu Ubayashi, Inase Kondo, Yoshiki Higo, Hiroki Mukai, Norihiro Yoshida, Kazuki Kusama, Hidetake Tanaka, Youmei Fan

Gepubliceerd 2026-05-22
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Sien Reeve O. Peralta, Fumika Hoshi, Hironori Washizaki, Naoyasu Ubayashi, Inase Kondo, Yoshiki Higo, Hiroki Mukai, Norihiro Yoshida, Kazuki Kusama, Hidetake Tanaka, Youmei Fan

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een drukke, high-tech keuken voor waar robots (AI-coderingsagenten) voortdurend nieuwe gerechten (code-wijzigingen) proberen te bereiden en deze aan de chef-kok (de menselijke reviewer) voorleggen voor goedkeuring. Het doel is om deze gerechten aan het restaurantmenu toe te voegen (samengevoegd in de software).

Lange tijd hebben mensen beoordeeld hoe goed deze robotchefs zijn door simpelweg naar het eindresultaat te kijken: Is het gerecht geserveerd (Samengevoegd) of naar de prullenbak teruggestuurd (Afgekeurd)?

Deze nieuwe studie stelt dat het kijken naar het eindresultaat vergelijkbaar is met het beoordelen van een chef alleen op basis van of het bord de keuken heeft verlaten, zonder te vragen waarom. De onderzoekers ontdekten dat het label "Ja/Nee" een zeer onvolledig verhaal vertelt.

Hier is wat ze ontdekten, opgesplitst in eenvoudige analogieën:

1. De "Prullenbak" Is Niet Altijd De Schuld Van De Chef

Wanneer het gerecht van een robot wordt afgewezen, gaan we er vaak van uit dat de robot iets oneetbaars heeft bereid (een coderingsfout). De studie vond echter dat slechts ongeveer 36% van de afkeuringen echt kwam doordat de robot het recept verpestte.

De andere twee derde werd afgewezen om redenen die niets te maken hadden met de kookkunsten van de robot:

  • Het "Verkeerde Avond" Probleem (31%): Het gerecht was perfect, maar de keuken was al gesloten, of de chef had al een ander gerecht voor die avond besteld. In technische termen was de code in orde, maar het projectworkflow had het niet nodig, of het was een duplicaat.
  • De "Stille Behandeling" (33%): Het gerecht werd teruggestuurd, maar de chef zei niets. Er stond geen notitie op het bord dat uitlegde waarom. Het is onmogelijk om te zeggen of de robot faalde of dat de chef het gewoon negeerde.

De Conclusie: Als je afkeuringen alleen telt als "mislukkingen", beschuldig je de robot onterecht van dingen die eigenlijk gewoon slechte timing of stilte waren.

2. Het "Geserveerde" Gerecht Is Niet Altijd Alleen Van De Robot

Wanneer een gerecht wordt geserveerd (samengevoegd), gaan we ervan uit dat de robot het perfect van begin tot eind heeft bereid. Maar de studie vond dat ongeveer 15% van deze "successen" eigenlijk vereiste dat de menselijke chef ingreep en dingen repareerde voordat het gerecht naar buiten kon gaan.

  • De "Proeverij" (Feedbackloops): De robot bereidde het hoofdgerecht, maar de chef proefde het, zei: "Meer zout nodig", en de robot repareerde het.
  • De "Presentatie" (Menselijke Interventie): De robot bereidde het eten, maar de chef moest de garnering herschikken of de presentatie repareren voordat het geserveerd werd.

Voor sommige robots (zoals Copilot en Devin) was de menselijke chef veel vaker betrokken bij het proces dan voor anderen (zoals Codex en Cursor), die leken hun gerechten te laten serveren met bijna geen interactie.

De Conclusie: Een label "Samengevoegd" betekent niet altijd dat de robot het hele werk alleen heeft gedaan. Soms heeft de mens het zware werk aan het einde gedaan om het werkend te maken.

3. Verschillende Robots, Verschillende Keukens

De studie merkte op dat verschillende robots zich verschillend gedroegen, afhankelijk van welke "keuken" (softwareproject) ze in zaten.

  • Sommige robots werden naar keukens gestuurd met strenge regels en drukke chefs die voortdurend feedback gaven. Deze robots hadden meer afkeuringen en meer menselijke hulp.
  • Andere robots werden naar keukens gestuurd waar de chefs meer hands-off waren, wat leidde tot meer "stille" goedkeuringen of afkeuringen.

De Grote Conclusie

Het paper concludeert dat we de vaardigheid van een robotchef niet kunnen beoordelen door alleen te kijken naar de stempel "Geserveerd" of "Afgekeurd" op het bonnetje.

  • Afkeuringen zijn vaak gewoon workflowproblemen of stilte, geen slechte kookkunsten.
  • Samenvoegingen houden vaak in dat menselijke chefs het bord repareren voordat het wordt geserveerd.

Om echt te begrijpen hoe goed deze AI-agenten zijn, moeten we kijken naar het gesprek tussen de robot en de mens—de opmerkingen, de reparaties en de redenen achter de beslissingen—en niet alleen naar het eindresultaat. Als we dat niet doen, beoordelen we de chef op basis van een menu dat niet het hele verhaal vertelt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →