← Nieuwste papers
🤖 AI

HarnessOpt-Bench: Evaluating LLMs at Harness Optimization

Dit artikel introduceert HarnessOpt-Bench, een nieuwe benchmark die is ontworpen om het vermogen van frontier LLM's om iteratief agentische harnesses (inclusief prompts, tools en orchestratiecode) te optimaliseren onder beperkingen van middelen te evalueren, waarmee wordt aangetoond dat deze optimalisatiecapaciteit een onderscheidende en meetbare vaardigheid is met aanzienlijke ruimte voor verbetering.

Oorspronkelijke auteurs: Varun Ursekar, Apaar Shanker, Yash Maurya, Shehab Yasser, Vijay S. Kalmath, Veronica Chatrath, Yuan Xue

Gepubliceerd 2026-08-07
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Varun Ursekar, Apaar Shanker, Yash Maurya, Shehab Yasser, Vijay S. Kalmath, Veronica Chatrath, Yuan Xue

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een briljant, superintelligent robotbrein hebt. Het kan code schrijven, wiskundige problemen oplossen en vragen beantwoorden. Maar dit brein werkt niet in een vacuüm; het heeft een "harnas" nodig. Denk aan het harnas als het harnas van de robot, zijn instructiehandleiding en zijn bedieningspaneel, allemaal in één. Het is de code die het brein vertelt hoe het zijn gereedschap moet gebruiken, wat het moet onthouden en hoe het met de buitenwereld moet communiceren. Net zoals een racewagen een geweldige coureur en een goed afgestelde motor nodig heeft om te winnen, heeft een slimme AI een slim brein en een geweldig harnas nodig om goed te presteren. Soms kan hetzelfde brein een genie zijn in het ene pak en een onhandige beginner in een ander.

Dit is de grote vraag: kunnen we een AI leren om haar eigen pak te repareren? Kan een AI naar haar eigen harnas kijken, beseffen dat het onhandig is, en de code herschrijven om zichzelf slimmer te maken? Dit wordt "harness optimization" genoemd. Het is een beetje alsof je een chef vraagt om niet alleen een maaltijd te koken, maar ook de keuken te herontwerpen, de messen te slijpen en het receptenboek te herschrijven terwijl hij aan het koken is, zonder precies te weten hoe de jury de uiteindelijke gerechten zal proeven tot het allerlaatste moment. Dit is een enorme uitdaging omdat het repareren van het pak duur en lastig is; je moet raden wat werkt zonder de uiteindelijke score te zien, en je moet het doen voordat je "energie" (of in dit geval computertijd en geld) opraakt.

Dit is precies waar de onderzoekers bij Scale AI het op probeerden te nemen met een nieuw experiment genaamd HarnessOpt-Bench. Ze bouwden een speciale, beveiligde speeltuin waarin verschillende top-tier AI-modellen als "optimizers" optreden. Hun taak? Om een basis, ietwat onhandige AI-agent (de "seed") te nemen, de code ervan te lezen en te proberen deze te verbeteren. De crux is dat de optimizer een strikt budget heeft: hij mag slechts een beperkt aantal tests uitvoend doen om te zien of zijn wijzigingen werken. Hij krijgt hints van sommige testruns (ontwikkeling en validatie), maar de definitieve, echte score is verborgen tot hij zijn allerbeste versie indient.

De onderzoekers wilden zien of deze AI-modellen daadwerkelijk beter konden worden in deze taak. Ze voerden 111 verschillende experimenten uit met vijf van de slimste AI-modellen van vandaag, waarbij ze twee manieren testten: één keer met behulp van een standaard, gedeelde "toolkit" (een gemeenschappelijk coderingsharnas) en één keer met hun eigen, ingebouwde toolkits. Ze maten het succes aan de hand van hoeveel de AI de prestaties van de agent verbeterde ten opzichte van de oorspronkelijke, onhandige versie.

Dit is wat ze vonden, en het is een beetje verrassend. Ten eerste doen de AI-modellen zelf veel meer toe dan de toolkit die ze gebruiken. Het verschil in prestaties tussen de slimste AI en de minst slimme AI was enorm—bijna twee keer zo groot als het verschil dat werd veroorzaakt door de toolkit te veranderen. Dit suggereert dat het "brein" de echte ster is, en niet alleen het "pak" dat het draagt.

Ten tweede betekende het hebben van een fancy, native toolkit niet automatisch een overwinning. Je zou denken dat een AI het beste presteert met zijn eigen op maat gemaakte tools, maar de resultaten waren gemengd. Soms hielp de native toolkit, soms deed het dat niet, en soms was de standaard toolkit eigenlijk beter. Er was geen consistent "thuisvoordeel".

Ten derde maakte de manier waarop de AI's naar oplossingen zochten uit. De modellen die probeerden te knutselen aan meer onderdelen van de code (zoals de prompts, het geheugen, de retry-regels en de tools) hadden de neiging om betere resultaten te behalen. Echter, de AI's besteedden niet veel tijd aan het lezen van de gedetailleerde "foutrapportages" (traces) van wat er misging. Ze keken vooral naar de eindscores. Dit suggereert dat voor deze taken kijken naar het grote plaatje nuttiger was dan het obsessief analyseren van elke kleine fout.

Ten slotte waren de AI's vaak te optimistisch. De scores die ze zagen tijdens het zoeken (op de "oefentests") waren meestal hoger dan de scores die ze behaalden op de definitieve, verborgen test. Dit betekent dat de AI's soms dachten dat ze een perfecte oplossing hadden gevonden, maar wanneer de echte jury de versie beoordeelde, was het niet zo goed als gedacht.

Kortom, dit paper laat zien dat harness optimization een echte, meetbare vaardigheid is die frontier AI-modellen bezitten, maar ze zijn nog steeds aan het leren om dit consistent te doen. De beste modellen kunnen de prestaties van een agent aanzienlijk verbeteren, maar ze zijn nog niet perfect. Ze moeten leren minder overmoedig te zijn en misschien de foutrapportages wat nauwkeuriger te lezen. De les? We bewegen ons naar een toekomst waarin AI niet alleen taken uitvoert, maar ook leert om betere versies van zichzelf te bouwen, maar we hebben nog een lange weg te gaan voordat ze dit betrouwbaar kunnen doen zonder menselijke hulp.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →