← Nieuwste papers
💬 NLP

VeRO: An Evaluation Harness for Agents to Optimize Agents

Dit paper introduceert VeRO, een reproduceerbaar evaluatieharnas en benchmarksuite die de systematische analyse en optimalisatie van coderingsagenten mogelijk maakt door hun unieke combinatie van deterministische code en stochastische LLM-completies te adresseren.

Oorspronkelijke auteurs: Varun Ursekar, Apaar Shanker, Veronica Chatrath, Yuan, Xue, Sam Denton

Gepubliceerd 2026-02-27
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Varun Ursekar, Apaar Shanker, Veronica Chatrath, Yuan, Xue, Sam Denton

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer slimme, maar soms wat onhandige robot hebt. Deze robot kan taken uitvoeren, zoals wiskundeproblemen oplossen of online winkelen, maar hij maakt nogal eens fouten. Normaal gesproken zou jij als mens moeten ingrijpen: "Oh, je hebt dit verkeerd gedaan, probeer het zo..." en dan pas hij zijn instructies aan.

Dit proces is echter traag, saai en kost veel tijd. De vraag is: kunnen we een andere, nog slimmere robot bouwen die deze eerste robot automatisch verbetert?

Dat is precies wat dit paper, getiteld VeRO, onderzoekt. Hier is de uitleg in simpele taal, met een paar leuke vergelijkingen.

1. Het Probleem: De "Zelfverbeterende" Robot

In de wereld van AI bouwen we "agenten" (robots) die code schrijven en taken uitvoeren. Tot nu toe was het verbeteren van deze robots een handmatig klusje. Een mens moest kijken waar het misging en de code aanpassen.

De auteurs zeggen: "Waarom laten we een AI dat niet voor ons doen?" Ze willen een Optimizer (een AI-robot) die een Target Agent (de robot die de taak uitvoert) continu verbetert door de code te herschrijven, uit te voeren en te testen.

2. De Uitdaging: Een Chaos zonder Regels

Het probleem is dat dit soort robot-verbeteren erg chaotisch is.

  • Vergelijking: Stel je voor dat je een kok (de Optimizer) vraagt om een recept (de Target Agent) te verbeteren. Maar je geeft de kok geen keuken, geen weegschaal, en geen manier om te proeven of het eten nu lekkerder is. De kok kan dan zomaar zout in het dessert gooien, of de oven kapotmaken, en je weet nooit of het echt beter werd of slechter.

Tot nu toe miste de wetenschappelijke wereld een gestructureerde manier om dit te testen. Optimizers konden soms "cheaten" (bijvoorbeeld door een dure computer te gebruiken die niet toegestaan was) of gaven onbetrouwbare resultaten.

3. De Oplossing: VeRO (De "Superkeuken")

De auteurs introduceren VeRO (Versioning, Rewards, and Observations). Dit is een speciaal platform dat fungeert als een veilige, gestructureerde testomgeving.

Je kunt VeRO zien als een slimme keuken met regels:

  • Versiebeheer (Versioning): Elke keer dat de Optimizer het recept aanpast, wordt er een foto gemaakt van de nieuwe versie. Als het nieuwe recept slechter smaakt, kan je direct teruggaan naar de oude versie. Je bent nooit je originele recept kwijt.
  • Budgetbeheer (Rewards): De Optimizer krijgt een beperkt aantal "proefbeurten" (bijvoorbeeld 8 keer). Hij kan niet eindeloos blijven proberen. Dit zorgt ervoor dat hij slim moet plannen en niet gewoon alles uitprobeert tot hij toevallig raakt.
  • Observaties (Observations): De Optimizer krijgt niet alleen te horen "het was goed" of "het was slecht". Hij krijgt een gedetailleerd verslag: "Je hebt 3 minuten te lang gekookt" of "Je vergat de suiker". Dit helpt hem om de volgende keer beter te doen.

4. Wat hebben ze ontdekt? (De Resultaten)

De auteurs hebben VeRO gebruikt om verschillende AI-robots te laten proberen om andere robots te verbeteren. Hier zijn de belangrijkste bevindingen:

  • Niet alle robots zijn even goed: Sommige Optimizers waren heel goed in het verbeteren van robots die "gereedschap" gebruiken (zoals zoeken op internet of winkelen), maar faalden bij robots die puur moeten nadenken (zoals wiskunde).
    • Analogie: Het is alsof een chef-kok heel goed is in het verbeteren van een snijmes (gereedschap), maar totaal faalt als hij moet proberen een ingewikkeld dessert te maken (nadenken).
  • De instructies zijn cruciaal: Hoe je de Optimizer vertelt wat hij moet doen, maakt enorm veel uit.
    • Als je een simpele robot (de "Pion") hebt, helpt het om de Optimizer heel gedetailleerde instructies te geven ("Gebruik dit recept, doe dit en dat").
    • Maar als je al een zeer slimme robot hebt (de "Ridder"), werkt het juist beter om de Optimizer vrijheid te geven. Als je een Ridder te veel regels geeft, wordt hij juist minder creatief en minder goed.
  • Soms is "minder is meer": De Optimizers neigden vaak alleen maar de tekstuele instructies (de prompt) aan te passen, in plaats van de onderliggende code of de tools te veranderen. Ze waren bang om grote veranderingen te maken.

5. Waarom is dit belangrijk?

Dit paper is een grote stap voorwaarts omdat het een standaard creëert.

  • Vroeger was het verbeteren van AI-robots een "zwarte doos": niemand wist precies hoe het werkte of of het eerlijk was.
  • Met VeRO hebben we nu een meetlat. Wetenschappers kunnen nu eerlijk vergelijken welke AI het beste is in het verbeteren van andere AI's.

Conclusie

Kort samengevat: De auteurs hebben een veilig testlab (VeRO) gebouwd waar AI's kunnen leren hoe ze andere AI's moeten verbeteren. Ze ontdekten dat dit werkt, maar dat het veel afhangt van hoe je de AI instrueert en wat voor soort robot je probeert te verbeteren. Het is de eerste stap naar een toekomst waarin AI-systemen zichzelf continu verbeteren, net als een sporter die elke dag een beetje sneller wordt door een slimme trainer.

De boodschap is: We hebben de gereedschapskist nu, maar we moeten nog leren hoe we hem het beste gebruiken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →