Skill-Use: Can LLMs Actually Use Skills in Agentic Harnesses?
Het artikel introduceert Skill-Use, een benchmark die evalueert of LLM-agenten onafhankelijk gestructureerde vaardigheden kunnen herkennen en correct kunnen toepassen in geïsoleerde omgevingen, wat onthult dat betrouwbaar vaardigheidsgebruik een aanzienlijke uitdaging blijft die sterk afhankelijk is van de specifieke agent-harness in plaats van een inherente modelcapaciteit te zijn.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een superintelligente, hypercreatieve stagiair aanneemt die code kan schrijven, data kan analyseren en e-mails kan opstellen. Je geeft ze een enorme bibliotheek aan "Skill Books" (vaardigheidsboeken). Elk boek is een recept voor een specifieke taak, zoals "Hoe repareer je een kapotte server" of "Hoe schrijf je een juridisch contract". De crux is dat je ze niet het hele boek in één keer geeft. In plaats daarvan laat je alleen de titel en een klein tekstje op de achterflap zien. Als ze denken dat het boek relevant is, moeten ze erom vragen, de volleday instructies opzoeken en vervolgens die instructies precies volgen zonder stappen over te slaan of dingen te doen die verboden zijn. Dit is de wereld van AI-"agents" die proberen "skills" te gebruiken. Voor een tijdje hoopten mensen dat als je deze AI-stagiairs gewoon de juiste boeken zou geven, ze direct perfecte werknemers zouden worden. Maar niemand wist echt of de AI daadwerkelijk zou kunnen uitzoeken welk boek hij moest pakken, of dat hij gewoon zou gokken en hopen op het beste.
Een team onderzoekers van Tencent Hunyuan en verschillende topuniversiteiten besloten dit idee op de proef te stellen. Ze bouwden een enorme speeltuin genaamd SKILL-USE, een benchmark die ontworpen is om te zien of AI-agents echt "de kamer kunnen lezen" en deze vaardigheidsboeken correct kunnen gebruiken. Ze vroegen niet alleen: "Heeft de AI de taak voltooid?" Ze stelden drie veel moeilijkere vragen: Trigger (Wist de AI überhaupt dat hij het juiste boek moest pakken?), Compliance (Volgde het de instructies stap voor stap?) en Boundary (Vermeed het de verboden handelingen die in het boek stonden?). Ze testten 177 verschillende real-world taken, van het oplossen van softwarebugs tot het schrijven van zakelijke rapporten, met behulp van 79 echte vaardigheidsdocumenten en acht van de slimste AI-modellen die vandaag de dag beschikbaar zijn.
De resultaten waren een flinke reality check. De onderzoekers ontdekten dat zelfs de beste AI-opstellingen slechts een "Skill-Use" score van ongeveer 0,613 behaalden (op een schaal van 0 tot 1). Dat betekent dat betrouwbaar gebruik van vaardigheden nog steeds onbereikbaar is. Het grootste probleem was niet dat de AI niet in staat was de regels te volgen zodra hij het boek had; het was dat de AI vaak niet eens wist dat hij het boek moest oppakken. Het is alsoals een geniale chef-kok hebben die een recept perfect kan volgen, maar die steeds vergeet de koelkast open te doen om de ingrediënten te pakken. Bovendien ontdekten de onderzoekers dat de prestaties van een AI niet alleen afhingen van hoe "slim" het model was; het hing sterk af van de "harness" of de softwarematige wrapper eromheen. Het veranderen van de wrapper was als het veranderen van de keukenindeling: soms werd dezelfde chef een ster, en op andere momenten struikelde hij.
Kortom, het artikel suggereert dat het geven van een bibliotheek met vaardigheden aan AI-agents hen niet automatisch betere werknemers maakt. De kloof tussen "een vaardigheid hebben" en "een vaardigheid gebruiken" is enorm. De AI faalt vaak in het herkennen wanneer een vaardigheid van toepassing is, of raakt afgeleid door de verkeerde vaardigheden wanneer er te veel keuzes zijn. Hoewel de AI beter wordt in het vermijden van verboden zetten, heeft het nog steeds moeite met het trouw volgen van complexe procedures. De auteurs concluderen dat we niet zomaar kunnen aannemen dat deze agents magisch zullen leren om hun hulpmiddelen te gebruiken; we moeten systemen boueren die hen helpen te herkennen wanneer ze een vaardigheid moeten gebruiken en hoe ze zich aan het plan moeten houden, want op dit moment is dat het moeilijkste deel van de puzzel.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.