A Unified Issue Resolution Benchmark for Requirement Clarification, Planning, and Code Generation for Coding Agents
Dit artikel introduceert SWE-RPG, een uniforme benchmark voor programmeeragenten die niet alleen het succes van de uiteindelijke patch evalueert, maar ook tussenliggende redeneerstappen zoals het verduidelijken van vereisten en de implementatieplanning, wat onthult dat impliciete vereistenherstel de primaire flessenhals is die de prestaties van huidige agenten bij taken op repository-niveau beperkt.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je een wereld voor waarin je een super-slimme robotassistent hebt die computercode kan schrijven. Je geeft het een eenvoudige instructie zoals: "Los de bug in dit spel op," of "Voeg een nieuw level toe," en het gaat aan de slag. Dit is de droom van AI-coderingsagenten. Lange tijd hebben wetenschappers deze robots getest door ze een taak te geven en te kijken of het eindresultaat werkt. Als het spel draait zonder vast te lopen, krijgt de robot een gouden ster. Als het vastloopt, krijgt de robot een rood kruis.
Maar hier is het probleem: een rood kruis vertelt je niet waarom de robot faalde. Begreep de robot je instructies verkeerd? Bedacht het een slecht plan? Of typte het gewoon de verkeerde code? Het is alsof een leerling een wiskundetoets maakt en alleen een score van "0/10" krijgt zonder de aantekeningen van de leraar te zien over waar het precies misging. Om deze robots echt beter te maken, moeten we hun denkproces zien, niet alleen het eindantwoord. Dit is de grote vraag die het paper aanpakt: Hoe stoppen we met alleen de uiteindelijke patch te beoordelen en beginnen we met het diagnosticeren van het brein van de robot?
Maak kennis met SWE-RPG, een nieuwe, supergedetailleerde test die ontworpen is om in de geest van de robot te kijken. De onderzoekers bouwden een benchmark (een gestandaardiseerde test) bestaande uit 163 echte programmeertaken uit 31 verschillende softwareprojecten. In plaats van alleen te controleren of de code aan het einde werkt, hebben ze voor elke stap in de reis van de robot "Gold Truth"-referenties gemaakt. Denk aan het hebben van het receptenboek van een meesterkok dat niet alleen het uiteindelijke gerecht laat zien, maar ook elke verborgen ingrediënt opsomt die de kok moest raden, elk stap in het kookplan, en het exacte moment waarop de robot van het pad kon zijn afgeweken.
De onderzoekers zetten drie populaire coderingsagenten (genoemd Claude Code, Codex en OpenCode) op de proef, gekoppeld aan zes verschillende "brein"-modellen (LLM's). De resultaten waren een beetje een reality check. Zelfs de beste robots losten slechts ongeveer 31,5% van de taken op. Dat betekent dat ze bijna twee derde van de tijd faalden! Maar de echte magie van SWE-RPG was het achterhalen van waar ze faalden. De studie vond dat de grootste flessenhals niet het schrijven van de code zelf was, maar het begrijpen van de verborgen regels. Ongeveer 24,5% tot 46,0% van de fouten gebeurde omdat de robots de "impliciete vereisten" niet konden begrijpen — de dingen die je niet zei, maar die de robot wel moest weten om de klus goed te klaren.
Als je bijvoorbeeld een robot zou vragen om "de TSV-import te repareren," zou hij de code misschien repareren, maar per ongeluk de CSV-import breken omdat hij niet besefte dat de twee met elkaar verband hielden. De studie suggereert dat om deze agenten echt nuttig te maken, we moeten stoppen met alleen focussen op het sneller laten schrijven van code en moeten beginnen met het leren van de robots hoe ze betere detectives kunnen zijn, in staat om tussen de regels door te lezen van een gebruikersverzoek. Het paper concludeert dat hoewel deze agenten indrukwekkend zijn, ze nog steeds worstelen met de rommelige, menselijke kant van softwareontwikkeling, en SWE-RPG is de nieuwe kaart die we nodig hebben om hen door die lastige verborgen vereisten te laten navigeren.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.