← Nieuwste papers
💬 NLP

A Framework for Evaluating Agentic Skills at Scale

Dit artikel introduceert een schaalbaar evaluatiekader voor het beoordelen van agentische vaardigheden door realistische taken en beoordelingsrubrieken te genereren, wat werd toegepast op 500 real-world vaardigheden over 19 modellen om aan te tonen dat hoewel vaardigheden het gedrag van agenten significant veranderen, de naleving van modelinstructies sterk varieert, wat de algehele prestatiewinst beïnvloedt.

Oorspronkelijke auteurs: Maksim Shaposhnikov, Nicolas Fortuin, Simon Stipcich, Maria I. Gorinova, Amy Heineike, Rob Willoughby

Gepubliceerd 2026-06-17
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Maksim Shaposhnikov, Nicolas Fortuin, Simon Stipcich, Maria I. Gorinova, Amy Heineike, Rob Willoughby

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer slimme, maar enigszins generieke robotassistent hebt. De robot weet veel over de wereld omdat hij het internet heeft gelezen, maar hij kent jouw specifieke manier van werken niet. Misschien heb je een heel eigen stijl voor het schrijven van code, of een specifieke checklist voor beveiliging, of een unieke manier om bestanden te organiseren.

In de wereld van AI worden deze specifieke instructies "Skills" genoemd. Ze zijn als kleine spiekbriefjes of regelboeken die je de robot geeft om hem te helpen een taak precies zo uit te voeren als jij wilt.

Dit artikel gaat over een nieuwe manier om te testen of deze "Skills" daadwerkelijk werken. De auteurs hebben een enorme testomgeving gebouwd om te zien:

  1. Leest de robot het regelboek wel echt?
  2. Zorgt het volgen van het regelboek ervoor dat hij een beter werk levert?
  3. Wordt een goedkopere, kleinere robot net zo goed als een dure, superintelligente robot als hij het juiste regelboek heeft?

Hier is hoe ze het hebben aangepakt, simpel uitgelegd:

1. De "Magische Recepten" Generator

In plaats van mensen in te huren om duizenden testvragen te schrijven, hebben de auteurs AI gebruikt om ze te schrijven.

  • De Analogie: Stel je voor dat je een kookboek hebt (de Skill). De auteurs hebben een robotkok gebouwd die het kookboek leest en automatisch 1.000 verschillende dinerfeesten (taken) bedenkt waarbij dat kookboek de enige manier is om het gerecht correct te bereiden.
  • Het Proces: Het systeem bekijkt een Skill, bepaalt welke gereedschappen nodig zijn (zoals een specifieke oven of een speciaal mes), creëert een fictieve keukenomgeving en vraagt de AI vervolgens om het maaltijd te bereiden.

2. De Tweeledige Test

Voor elke enkele taak hebben ze de AI door twee rondes gehaald:

  • Ronde A (Zonder Skill): De AI probeert de maaltijd te bereiden met alleen zijn eigen brein.
  • Ronde B (Met Skill): De AI probeert het opnieuw, maar dit keer heeft hij de "Skill" (het regelboek) open op de toonbank liggen.

Vervolgens heeft een "Rechter" (een andere AI) beide pogingen beoordeeld. De Rechter keek niet alleen naar of het eten was bereid (Taakvoltooiing); ze keken ook naar hoe het eten was bereid. Gebruikte de AI de juiste ingrediënten? Werd er ook de specifieke stappen uit het regelboek gevolgd? (Instructie-opvolging).

3. De Grote Bevindingen

Na het testen van 500 echte "Skills" en 19 verschillende AI-modellen (van piekleine, goedkope tot enorme, dure modellen), kwamen ze enkele verrassende dingen tegen:

  • Het "Regelboek"-effect: Wanneer een AI een Skill kreeg, volgde hij instructies veel beter op. Het is also wordt een student een specifieke studiegids gegeven; ze stoppen met gokken en beginnen het exacte pad te volgen dat jij wilt.
  • Niet alle robots zijn gelijk: Sommige AI-modellen waren erg goed in het lezen van het regelboek (zoals de dure "Opus"-modellen). Anderen, zoals sommige open-source modellen, leken het boek echter te negeren en gewoon te doen wat ze zelf wilden.
  • De Grote Gelijkmaker: Dit is het meest opwindende deel. Meestal zijn de dure, superintelligente AI-modellen veel beter dan de goedkope, kleine modellen. Maar, wanneer je de goedkope modellen een goede Skill geeft, worden ze plotseling bijna even goed als de dure modellen.
    • De Metafoor: Het is alsof je een gewone fiets een turbocharger geeft. Plotseling kan de goedkope fiets de Ferrari bijhouden. De auteurs ontdekten dat een klein, goedkoop model met een Skill hetzelfde werk kan doen als een topmodel, maar voor een fractie van de kosten.

4. Waar Skills het Beste Werken

De auteurs vonden dat Skills het beste werken wanneer ze lijken op strikte assemblage-instructies (bijv. "Stap 1: Doe X, Stap 2: Doe Y").

  • Hoge Impact: Skills voor zaken als videobewerking, beveiligingschecklists of bestandverwerking lieten enorme verbeteringen zien. Dit zijn taken met duidelijke, rigide stappen.
  • Lage Impact: Skills die slechts algemeen advies waren (bijv. "Schrijf goede code" of "Wees creatief") hielpen minder. De AI kende het algemene advies al; het had specifieke stappen nodig om het gedrag te veranderen.

5. Waarom Dit Belangrijk Is

De auteurs zeggen niet alleen dat "AI beter wordt". Ze zeggen: "We hebben eindelijk een manier om te meten of een specifieke AI-tool daadwerkelijk helpt."

Vóór dit moment, als iemand een nieuwe Skill maakte, hadden ze geen goede manier om te bewijzen dat het werkte. Nu kunnen ze een test genereren, deze uitvoeren en precies zien waar de AI faalt in het opvolgen van de regels. Dit helpt makers om hun Skills te verbeteren en helpt bedrijven bij de beslissing: "Heb ik de dure AI nodig, of kan ik gewoon de goedkope AI een beter regelboek geven?"

Kortom: Het paper beschrijft de bouw van een fabriek die AI-"regelboeken" test. Ze ontdekten dat het juiste regelboek een goedkope AI bijna net zo goed kan laten werken als een rijke, maar alleen als het regelboek duidelijke, stapsgewijze instructies geeft in plaats van vaag advies.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →