Skill Coverage: A Test Adequacy Metric for Agent Skills
Dit artikel introduceert "skill coverage", een metriek voor testadequaatheid die evalueert hoe grondig de vaardigheden van een agent worden uitgeoefend door te meten in welke mate gedocumenteerde gedragsbeperkingen worden waargenomen in trajecten van de agent, waarbij wordt onthuld dat huidige benchmarks minder dan 44% van deze beperkingen dekken ondanks taaksucces.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een zeer bekwame chef (de AI-agent) inhuurt om een complex gerecht te bereiden met behulp van een specifieke, herbruikbare receptenkaart (de Agent Skill).
In het verleden keken we alleen naar het eindgerecht om te zien of de chef goed was. Als het gerecht heerlijk smaakte en de klant tevreden was, namen we aan dat de chef het recept perfect had gevolgd. We dachten: "Goed gedaan! Het recept werkte!"
Maar dit nieuwe artikel stelt een andere vraag: Is het omdat het gerecht goed was, dat de chef daadwerkelijk elke instructie op de receptenkaart heeft gebruikt?
Misschien zei het recept: "Snijd uien altijd met een scherp mes," maar gebruikte de chef een bot mes en maakte nog steeds een smakelijk gerecht. Of misschien zei het recept: "Laat de saus 20 minuten sudderen," maar liet de chef de saus slechts 5 minuten sudderen en smaakte het nog steeds prima. We zouden dit niet weten door alleen het eten te proeven.
Het Probleem: De "Goede Maaltijd"-valstrik
De auteurs stellen dat huidige tests voor AI-agenten er alleen op lijken of we het eindgerecht proeven. Ze vertellen ons of de taak succesvol is voltooid, maar ze vertellen ons niet welke delen van de vaardigheid daadwerkelijk zijn getest en welke zijn genegeerd.
Als een AI-agent een taak succesvol voltooit, betekent dat niet dat hij elke regel, waarschuwing of stap heeft uitgevoerd die in zijn skill-document staat geschreven. Hij heeft misschien gewoon geluk gehad of een kortere weg gevonden.
De Oplossing: "Skill Coverage"
Het artikel introduceert een nieuwe manier om testen te meten, genaamd Skill Coverage. In plaats van alleen het eindresultaat te controleren, behandelen ze de receptenkaart zelf als het object dat getest wordt.
Zo doen ze het, met behulp van een eenvoudige analogie:
Het recept opdelen in regels: Eerst nemen ze de rommelige, lange receptenkaart en breken deze af in specifieke, controleerbare regels.
- Voorbeeld: In plaats van de hele paragraaf over "pasta koken", extraheren ze een specifieke regel: "Wanneer het water kookt, moet de agent zout toevoegen vóór de pasta."
- Ze noemen dit Skill Behavior Constraints. Ze negeren de franje (zoals "Dit recept is geschreven door Chef John in 2026") en focussen alleen op de feitelijke instructies die de agent moet volgen.
De "Covered" vs. "Uncovered" controle: Vervolgens kijken ze hoe de agent de taak uitvoert. Ze stellen voor elke regel twee vragen:
- Vond de situatie plaats? (bijv. Heeft de agent daadwerkelijk geprobeerd water te koken?)
- Is er bewijs voor? (bijv. Liet de log van de agent zien dat er zout werd toegevoegd, of zei de agent alleen "Ik heb zout toegevoegd" zonder bewijs?)
Als het antwoord op beide vragen "Ja" is, is de regel Covered. Als de agent nooit met die situatie te maken kreeg, of als hij er wel mee te maken had maar geen traceerbaar bewijs achterliet, is de regel Uncovered.
Cruciaal: Een regel kan Covered zijn, zelfs als de agent het fout heeft gedaan. Het punt is niet om te zien of ze slaagden; het punt is om te zien of ze de specifieke instructie hebben geprobeerd op een manier die we kunnen verifiëren.
Wat ze vonden
De onderzoekers testten dit op een populaire set AI-taken genaamd SkillsBench. Ze keken hoe goed verschillende AI-modellen (zoals Gemini, Claude en Codex) hun receptkaarten volgden.
De resultaten waren verrassend:
- Zelfs wanneer de AI de taak succesvol voltooide, "activeerde" of "dekte" het slechts ongeveer 40% van de regels op de receptenkaart.
- Dit betekent dat 60% van de instructies niet getest is. De AI heeft ze mogelijk overgeslagen, of de taak dwong de AI niet om ze te gebruiken, of de AI heeft ze uitgevoerd maar liet niet genoeg bewijs achter zodat wij het konden zien.
De Belangrijkste Conclusie
Het artikel concludeert dat Succes Grondige Testen.
Alleen omdat een AI-agent een klus succesvol heeft geklaard, betekent niet dat hij grondig is getest op alle vaardigheden die hij claimt te hebben. Het is als een chauffeur die op tijd op het werk aankomt, maar tijdens de rit nooit zijn richtingaanwijzer heeft gebruikt of in zijn dode hoek heeft gekeken. We weten dat hij is aangekomen, maar we weten niet of hij alle veiligheidsregels heeft gevolgd.
Skill Coverage is een nieuw instrument dat ons precies vertelt hoeveel van het "recept" daadwerkelijk is gebruikt en geverifieerd, wat ons een veel duidelijker beeld geeft van hoe goed een AI-agent echt getraind is, in plaats van alleen of hij de klus heeft geklaard.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.