Asuka-Bench: Benchmarking Code Agents on Underspecified User Intent and Multi-Round Refinement
Het artikel introduceert Asuka-Bench, een nieuwe benchmark die is ontworpen om code-agenten te evalueren op webontwikkelingstaken door realistische multi-round verfijningscycli te simuleren waarbij agenten ondergespecificeerde projecten iteratief verbeteren op basis van geautomatiseerde UI-testen en natuurlijke taalfeedback, wat aanzienlijke prestatiekloven tussen huidige modellen aan het licht brengt.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een briljante maar enigszins letterlijke architect inhuurt om een huis te bouwen.
De Oude Manier (Bestaande Benchmarks)
In het verleden was het testen van deze architecten alsof je ze een perfect, 50 pagina's tellend blauwdruk gaf waarin elke spijker, draad en verfkleur werd vermeld. Je vroeg: "Bouw dit," en zij overhandigden je een afgebouwd huis. Als het huis overeenkwam met de blauwdruk, kregen ze een A. Als dat niet zo was, kregen ze een F.
Het probleem is dat het echte leven niet zo werkt. Echte klanten hebben zelden een perfecte blauwdruk van 50 pagina's. Meestal zeggen ze: "Ik wil een huis met een keuken en een plek om te slapen," en dan, zodra ze de eerste versie zien, beseffen ze: "Oh, ik wilde eigenlijk dat de keuken groter was," of "Wacht, de deur gaat de verkeerde kant op."
De Nieuwe Manier (Asuka-Bench)
Het paper introduceert Asuka-Bench, een nieuwe manier om "Code Agents" (AI-programma's die software schrijven) te testen. In plaats van de AI een perfecte blauwdruk te geven, geeft het onderzoek de AI een vage, rommelige opdracht, zoals: "Maak een webshop met een lijst van producten en een winkelwagentje."
Vervolgens beoordelen ze niet alleen het eerste resultaat. Ze zetten een team van drie personen op die een echte ontwikkelcyclus uitspelen:
- De Bouwer (Code Agent): Dit is de AI die probeert de website te bouwen op basis van de vage opdracht.
- De Inspecteur (UI Agent): Dit is een robot die de website daadwerkelijk bezoekt in een webbrowser. Het leest de code niet; het gedraagt zich als een menselijke gebruiker. Het klikt op knoppen, probeert dingen te kopen en controleert of de pagina's laden. Het is als een kwaliteitscontroleur die door het huis loopt om te zien of de deuren wel opengaan.
- De Cliënt (User LLM): Dit is een andere AI die de Inspecteur observeert. Als de Inspecteur een probleem vindt (bijv. "De 'Koop'-knop werkt niet"), vertaalt de Cliënt dit naar een beleefde notitie voor de Bouwer: "Hé, de knop is kapot. Los dit even op."
De Bouwer repareert vervolgens de website, en de cyclus herhaalt zich. Dit gebeurt tot maximaal drie rondes.
De "DAG"-analogie
De onderzoekers hebben ook een slimme manier uitgevonden om feedback te geven, genaamd een DAG (Directed Acyclic Graph). Denk aan dit als een recept.
- Als je een taart wilt bakken, kun je hem niet glaceren voordat je hem hebt gebakken.
- In de oude testmethoden, als de taart was aangebrand, kon de inspecteur ook klagen dat de glazuur ontbrak, ook al kon je een aangebrande taart niet glaceren.
- In Asuka-Bench kent het systeem de volgorde. Als de stap "bakken" mislukt, voorkomt het dat de inspecteur de stap "glaceren" controleert. Het vertelt de Bouwer alleen: "Je hebt de taart niet gebakken." Dit voorkomt dat de Bouwer in de war raakt door klachten over dingen die nog niet eens hebben plaatsgevonden.
Wat ze vonden
De onderzoekers hebben 8 verschillende AI-modellen getest met deze methode. Dit is wat ze ontdekten:
- Sommige AI's zijn beter in het oplossen van fouten dan andere: Alleen omdat een AI goed is in het bouwen van de eerste versie, betekent dat niet dat hij goed is in het herstellen van fouten. Sommige modellen bouwden een geweldige eerste versie, maar konden de noten van de "Cliënt" niet begrijpen om de fouten te herstellen. Anderen begonnen rommelig, maar werden beter met elke ronde aan feedback.
- Het gat is enorm: De beste modellen konden ongeveer 52% van de projecten perfect voltooien na drie rondes van herstelwerk. De slechtste modellen voltooiden slechts 8%. Dat is een enorm verschil.
- Het blijft moeilijk: Zelfs de slimste AI kon niet elk project perfect voltooien. Dit laat zien dat hoewel AI steeds beter wordt, het nog steeds moeite heeft met de rommelige, heen-en-weer gaande aard van echte menselijke verzoeken.
In het kort
Asuka-Bench is een nieuwe "rijexamen" voor AI-programmeurs. In plaats van hen te vragen om in een auto te rijden op een perfect recht, leeg circuit (een perfecte blauwdruk), wordt er van hen gevraagd om in het stadsverkeer te rijden, aanwijzingen te krijgen van een passagier wanneer ze een verkeerde afslag nemen, en hun koers te corrigeren. Het blijkt dat het vermogen om te luisteren en fouten te herstellen een compleet andere vaardigheid is dan alleen maar weten hoe je rechtuit rijdt.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.