Copy-on-Write Scoring: Application-Specific Agent Evaluations
Dit artikel introduceert CoW-Scoring, een framework dat gebruikmaakt van isolatie op PostgreSQL-niveau om op LLM-gebaseerde agents gebaseerde agents direct binnen applicatieomgevingen te evalueren, wat een granulaire, kosteneffectieve identificatie van database-schrijffouten en iteratieve verbeteringen aan de tool-oppervlakken van agents mogelijk maakt.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je net een super-slimme robotassistent hebt gebouwd die met je favoriete apps kan praten, zoals een projectmanagementtool of een agenda. Je wilt dat hij je helpt je leven te organiseren, maar je bent doodsbang dat hij per ongeluk je hele takenlijst verwijdert of de status van je baas verandert naar "op vakantie" terwijl hij eigenlijk in een vergadering zit. Dit is de wereld van AI-agenten: computerprogramma's die niet alleen chatten, maar ook daadwerkelijk dingen doen in softwaresystemen. Het grote probleem op dit moment is uitzoeken hoe je deze robots veilig kunt testen. Meestal testen wetenschappers ze in nep, verzonnen werelden (zoals een videogame-simulatie), maar die simulaties wijken vaak af van de realiteit, of ze zijn zo duur om te bouwen dat niemand het zich kan veroorloven om ze elke keer dat de echte app verandert, bij te werken. We hebben een manier nodig om de robot in de echte app te laten werken zonder dat hij ooit echt iets kapot maakt, zodat we precies kunnen zien waar hij in de war raakt en het kunnen oplossen.
Maak kennis met een nieuw idee genaamd Copy-on-Write (CoW) Scoring, voorgesteld door onderzoekers Joanna Roy en Sven Hölzel. Denk aan hun methode als een "magische glazen wand" die rechtstreeks in een database is gebouwd (de digitale archiefkast waar apps hun gegevens opslaan). Normaal gesproken, als je een robot vertelt om "dit bestand te wijzigen", gaat dat rechtstreeks naar het echte bestand en schrijft de robot eroverheen. Met CoW wordt de robot verteld om op een speciale, onzichtbare glasplaat te schrijven die bovenop het echte bestand ligt. De robot denkt dat hij op het echte ding schrijft, maar hij schrijft eigenlijk alleen op het glas. Het originele bestand eronder blijft perfect veilig en onaangetast.
Het slimme deel is dit: het systeem houdt een "ground truth"-versie bij van wat er zou moeten gebeuren (zoals een perfecte mens die de taak uitvoert) en vergelijkt dit met wat de robot op het glas heeft geschreven. Omdat de robot op een aparte laag schrijft, kunnen de onderzoekers direct zien: "Oei, de robot probeerde de verkeerde rij te verwijderen," of "Hij voegde een opmerking toe aan de verkeerde taak." Ze kunnen de prestaties van de robot scoren op basis van hoe dicht de schrijfactie op het glas bij de perfecte menselijke versie lag. Als de robot faalt, vegen de onderzoekers simpelweg het glas schoon en proberen ze het opnieuw, zonder ooit een back-up te hoeven herstellen of zich zorgen te hoeven maken over het beschadigen van de echte gegevens.
In hun studie testte het team dit op Plane, een open-source projectmanagementplatform. Ze zetten 20 verschillende real-world taken op, zoals "verplaats alle onvoltooide bugs naar de 'In Progress'-lijst" of "ken nieuwe taken toe aan specifieke teamleden." Ze lieten vijf verschillende AI-modellen deze klussen proberen terwijl het CoW-systeem toekeek. De resultaten waren onthullend. De onderzoekers ontdekten dat veel robots niet faalden omdat ze "dom" waren, maar door vocabulaire-mismatches. Bijvoorbeeld, de app noemde dingen "work items", maar de robots zochten naar "issues". De robots liepen vast, gaven op of begonnen te hallucineren (nepcommando's verzinnen) omdat ze de juiste woorden niet konden vinden.
Door gebruik te maken van CoW Scoring konden het team deze exacte fouten aanwijzen. Ze realiseerden zich: "Ah, de robot faalt hier omdat hij niet weet dat 'issue' hetzelfde betekent als 'work item'." Dus ze werkten de tools die de robot gebruikt bij door beide woorden toe te voegen. Toen ze de tests opnieuw uitvoerden, werden de robots veel beter. Zo verbeterde een model genaamd Gemini-2.5-Pro zijn score met 54%, en een ander genaamd GPT-4.1 sprong met 47% omhoog. De studie suggereert dat deze "glazen wand"-methode een krachtige, goedkope manier is om AI-agenten te debuggen in echte applicaties, waardoor ontwikkelaars de specifieke tools en prompts kunnen repareren die de robots in verwarring brengen, in plaats van alleen maar te gissen naar wat er misging. Het is een manier om de robots in de echte wereld te laten oefenen zonder het risico op een ramp in de echte wereld.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.