How Well Do Agentic Skills Work in the Wild: Benchmarking LLM Skill Usage in Realistic Settings
Deze studie toont aan dat hoewel agente vaardigheden veelbelovend zijn, hun prestaties in realistische scenario's met grote verzamelingen vaardigheden aanzienlijk afnemen, maar dat deze achterstand aanzienlijk kan worden verholpen door specifieke query-gebaseerde verfijning.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
De Kernvraag: Helpt een gereedschapskist als je niet weet welke sleutel je moet gebruiken?
Stel je voor dat je een LLM-agent (een slimme computerprogramma) bent die een taak moet uitvoeren, zoals het bouwen van een huis of het repareren van een auto. Om dit te doen, heeft de computer "vaardigheden" (skills) nodig: digitale handleidingen, code-snippets of instructies die zeggen hoe je bepaalde dingen doet.
In het verleden hebben onderzoekers getest of deze vaardigheden werken, maar ze deden het op een onrealistische manier. Het was alsof ze de computer een gereedschapskist gaven waarin alleen de perfecte sleutel voor de specifieke schroef zat die je moest draaien, en ze zeiden: "Gebruik deze sleutel." Natuurlijk werkt dat goed.
Dit nieuwe onderzoek vraagt zich af: Wat gebeurt er in de echte wereld?
In de echte wereld krijg je geen perfecte sleutel. Je krijgt een enorme schuur vol met 34.000 gereedschappen (van hamers tot schroevendraaiers, van oude sleutels tot moderne tools). Je moet zelf zoeken welke tool je nodig hebt, en misschien is de beste tool wel een beetje beschadigd of niet helemaal geschikt voor jouw specifieke schroef.
Wat hebben ze ontdekt? (De "Wilde" Realiteit)
De onderzoekers hebben gekeken hoe goed deze slimme computers werken in drie steeds moeilijker wordende situaties:
- De "Ideale" Situatie: De perfecte vaardigheden worden direct aan de computer gegeven.
- Resultaat: De computer werkt uitstekend.
- De "Verwarrende" Situatie: De perfecte vaardigheden zijn er nog steeds, maar er staan ook 1000 andere, nutteloze vaardigheden bij (verwarring). De computer moet zelf kiezen welke hij gebruikt.
- Resultaat: De prestaties zakken. De computer raakt in de war en pakt soms de verkeerde tool.
- De "Wilde" Situatie: Er zijn geen perfecte vaardigheden. De computer moet zelf zoeken in de hele schuur van 34.000 vaardigheden om iets te vinden dat misschien helpt.
- Resultaat: De prestaties zakken dramatisch. De computer doet nauwelijks beter dan als hij helemaal geen vaardigheden had. Soms maakt hij zelfs meer fouten omdat hij een slechte instructie volgt die hij zelf heeft gevonden.
De conclusie: Vaardigheden zijn kwetsbaar. Ze werken alleen goed als je ze perfect kunt vinden en als ze perfect op de taak zijn afgestemd. In de chaos van de echte wereld verliezen ze hun kracht.
De Oplossing: De "Slimme Werkplek" (Refinement)
De onderzoekers vroegen zich af: "Kunnen we de computer helpen om deze vaardigheden beter te gebruiken?" Ze testten twee methoden om de gevonden vaardigheden te verbeteren:
De "Vooraf" Methode (Query-agnostic):
- Vergelijking: Je neemt een oude, rommelige handleiding en laat iemand die er niets van afweet de tekst opschonen, zonder te weten voor welk project je de handleiding gaat gebruiken.
- Resultaat: De tekst wordt netter, maar het helpt niet echt als de inhoud niet past bij jouw specifieke probleem. Het is een beetje nuttig, maar niet geweldig.
De "Specifieke" Methode (Query-specific):
- Vergelijking: Je geeft de computer de taak, laat hem kijken naar de gevonden vaardigheden, en vraagt hem: "Probeer dit eens. Wat werkt? Wat werkt niet? Maak nu een nieuwe, perfecte handleiding die specifiek voor deze taak is."
- Resultaat: Dit werkt wonderbaarlijk goed! De computer pakt de nuttige stukjes uit verschillende gevonden vaardigheden, gooit de rommel weg, en maakt een nieuwe, perfecte handleiding.
- Voorbeeld: Stel je zoekt naar een recept voor een taart. Je vindt een recept voor een cake en een recept voor glazuur. De "specifieke" methode laat de computer zien dat hij de cake moet bakken en het glazuur moet gebruiken, en maakt er één perfect taart-recept van.
De Grootte van de Schuur (TERMINAL-BENCH)
Om te bewijzen dat dit niet alleen werkt op hun eigen testcases, hebben ze het ook getest op een heel andere, bekende test (TERMINAL-BENCH 2.0), waar geen speciale vaardigheden voor waren gemaakt.
- Zonder hulp: De computer haalde 57,7% van de taken goed.
- Met zoeken en "specifieke" verbetering: De computer haalde 65,5% goed.
Samenvatting in één zin
Vaardigheden voor slimme computers zijn als gereedschap in een enorme schuur: als je ze niet zelf kunt vinden en aanpassen aan je specifieke probleem, zijn ze bijna nutteloos; maar als je de computer laat "nadenken" over hoe hij die gereedschappen moet combineren voor zijn specifieke taak, wordt hij plotseling veel slimmer.
De les voor de toekomst: We moeten niet alleen meer vaardigheden verzamelen, maar ook systemen bouwen die deze vaardigheden slim kunnen aanpassen aan de vraag die we stellen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.