← Nieuwste papers
💻 computer science

ClawForge: Generating Executable Interactive Benchmarks for Command-Line Agents

Dit artikel introduceert ClawForge, een door een generator ondersteund benchmarkkader dat commandoregelagenten evalueert op uitvoerbare workflows met persistente statenconflicten, en blootlegt dat huidige state-of-the-art-modellen aanzienlijk moeite hebben met het inspecteren van bestaande staten en het verwerken van reeds bestaande artefacten, met een maximale strikte nauwkeurigheid van 45,3%.

Oorspronkelijke auteurs: Yuxiang Lai, Peng Xia, Haonian Ji, Kaiwen Xiong, Kaide Zeng, Jiaqi Liu, Fang Wu, Jike Zhong, Zeyu Zheng, Cihang Xie, Huaxiu Yao

Gepubliceerd 2026-05-15
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yuxiang Lai, Peng Xia, Haonian Ji, Kaiwen Xiong, Kaide Zeng, Jiaqi Liu, Fang Wu, Jike Zhong, Zeyu Zheng, Cihang Xie, Huaxiu Yao

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Plaatje: Het "Rommelige Bureau"-Probleem

Stel je voor dat je een zeer slimme robotassistent inhuurt om je leven te organiseren. De meeste tests die we aan deze robots geven, zijn als hen een brandnieuw, leeg bureau geven en zeggen: "Schrijf alsjeblieft een takenlijst." De robot schrijft de lijst, en we controleren of de woorden correct zijn.

Maar in de echte wereld is je bureau nooit leeg. Het is bedekt met halffinished projecten, oude post-it nota's, tegenstrijdige instructies en bestanden die verouderd zijn. Een echte test van de intelligentie van een robot is niet alleen "Kan het een lijst schrijven?", maar "Kan het naar dit rommelige bureau kijken, uitzoeken wat er kapot is, de oude dingen repareren zonder de goede dingen te verwijderen, en de klus klaren?"

Dit papier introduceert ClawForge, een nieuwe manier om AI-agenten (robots) te testen die zich volledig richt op dit "rommelige bureau"-scenario.


Wat is ClawForge? (De "Scenariofabriek")

De auteurs realiseerden zich dat het maken van deze "rommelige bureau"-tests met de hand te moeilijk en te langzaam is. Als je 100 verschillende rommelige scenario's wilt testen, moet je handmatig 100 verschillende rommels bouwen.

ClawForge is een geautomatiseerde fabriek.
In plaats dat mensen elke test schrijven, hebben de onderzoekers een systeem gebouwd dat de tests gegenereert. Het neemt een sjabloon (zoals "Repareer een gebroken release-schema") en vult automatisch de details in (verschillende steden, verschillende data, verschillende fouten).

  • De Output: Het creëert een complete "uitvoerbare taak". Dit is niet zomaar een vraag; het is een mini-simulatie met een starttoestand (het rommelige bureau), een reeks regels en een manier om het resultaat te beoordelen.
  • Het Doel: Om te zien of de AI Staatconflicten aankan. Dit betekent omgaan met dingen die al aanwezig zijn, waarvan sommige misschien verkeerd, verouderd of dubbel zijn.

Hoe de Test Werkt (De "Spelcyclus")

Denk aan de test als een videospelleniveau waar de AI de speler is:

  1. De Setup: Het spel laadt een "opslagbestand" dat al items op het bord heeft. Misschien staat er een taak genaamd "Repareer de Server" die al aanwezig is, maar gemarkeerd als "Lage Prioriteit" (wat verkeerd is).
  2. De Instructie: De AI krijgt een opdracht: "De serverreparatie is verkeerd. Repareer het, maar verwijder de andere geldige taken niet."
  3. De Actie: De AI typt commando's één voor één in (zoals een mens die een commandoregel gebruikt).
  4. De Beoordeling: Dit is het belangrijkste deel. Het systeem controleert niet of de AI exact dezelfde woorden heeft getypt als een mens zou hebben gedaan. In plaats daarvan controleert het de eindtoestand van het bureau.
    • Is de oude, verkeerde taak verwijderd?
    • Staat de nieuwe, correcte taak er?
    • Heeft de AI per ongeluk een dubbel van de taak gemaakt?
    • Heeft het de geldige dingen met rust gelaten?

Als het eindbureau er perfect uitziet, slaagt de AI. Als het er rommelig uitziet, faalt het.

De Resultaten: De Robots Leren Nog Steeds

De auteurs testten zeven van de slimste beschikbare AI-modellen (van bedrijven zoals OpenAI, Anthropic en Kimi) op deze nieuwe benchmark. De resultaten waren verrassend en nederig:

  • De "Perfecte Score" is Zeldzaam: Zelfs het beste AI-model kreeg ongeveer 45% van de taken perfect goed. Dit betekent dat de benchmark moeilijk is en nog niet "opgelost" is.
  • Het "Verkeerde Reparatie"-Probleem: Een specifiek type falen kwam zeer vaak voor. Als ze werden gevraagd een verkeerd item te vervangen, bleven de modellen vaak steken. Ze verwijderden misschien het verkeerde item, maar vergaten het nieuwe toe te voegen, of ze voegden het nieuwe toe maar lieten het oude, kapotte item daar staan.
    • Analogie: Stel je voor dat je wordt gevraagd een platte band te vervangen. De AI haalt de platte band eraf, maar vergeet de reservewiel erop te zetten. Of, het zet de reservewiel erop, maar laat de platte band op de grond rollen.
  • Het "Raak Het Niet Aan"-Probleem: Een ander veelvoorkomend falen was wanneer het bureau al grotendeels klaar was. De AI zou een taak zien die al correct was en in plaats van het gewoon met rust te laten, zou het proberen het opnieuw te "repareren", waardoor een dubbel ontstond.
    • Analogie: Je vertelt de robot: "De koffie is al gezet." De robot zegt: "Oké," en zet direct een tweede pot koffie, waardoor er rommel ontstaat.
  • Efficiëntie Maakt Uit: Sommige modellen deden veel te veel stappen om simpele problemen op te lossen, terwijl anderen snel waren maar fouten maakten. De beste presteerders waren diegenen die eerst de bestaande toestand controleerden voordat ze handelden.

De Twee Zwaarste Uitdagingen

Het papier benadrukt twee specifieke soorten "rommelige bureau"-scenario's die bijna alle modellen op hol deden slaan:

  1. Verkeerde-Toestand Vervanging: De AI moet iets identificeren dat verkeerd is en het vervangen door iets juists, terwijl alles andere veilig blijft. Dit was de moeilijkste taak; het beste model kreeg het maar 17% van de tijd goed.
  2. Hervatten van Onderbroken Werkstroom: De AI moet een kamer binnenlopen waar iemand anders een project is gestart, de ontbrekende stukken afmaken en de delen die al klaar waren niet opnieuw doen. De kloof tussen de beste en slechtste modellen was hier enorm (van 17% tot 90%), wat laat zien dat sommige modellen veel beter zijn in "de kamer lezen" voordat ze erin springen.

Waarom Dit Belangrijk Is

De auteurs betogen dat we AI niet langer alleen op "schone" taken kunnen testen. Echt werk houdt in omgaan met geschiedenis, fouten en gedeeltelijke vooruitgang. ClawForge is een hulpmiddel om te meten of een AI echt klaar is om in een echt kantoor te werken, waar dingen zelden perfect zijn en het opnieuw beginnen zelden een optie is.

Kortom: ClawForge is een sportschool voor AI-agenten om te leren hoe ze een rommelige kamer schoonmaken zonder de meubels kapot te maken die al werken. Op dit moment struikelen zelfs de sterkste AI-agenten nog over hun eigen voeten in deze sportschool.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →