← Nieuwste papers
🤖 AI

SkillCoach: Self-Evolving Rubrics for Evaluating and Enhancing Agentic Skill-Use

SkillCoach is een zelfevoluerend rubric-framework dat de evaluatie en training van LLM-agenten verbetert door procesgeoriënteerde criteria af te leiden uit werkelijke rollouts om het selecteren, opvolgen, componeren en reflecteren van vaardigheden te beoordelen, waardoor echt proceskwaliteit wordt onderscheiden van toevallig taaksucces.

Oorspronkelijke auteurs: Jiayin Zhu, Kelong Mao, Yudong Guo, Dengbo He, Sulong Xu, Simiu Gu, Yutao Yue

Gepubliceerd 2026-07-03
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Jiayin Zhu, Kelong Mao, Yudong Guo, Dengbo He, Sulong Xu, Simiu Gu, Yutao Yue

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een nieuwe werknemer inhuurt om een complexe machine in een fabriek te bedienen. Je hebt een enorme bibliotheek aan instructiehandleidingen (de "vaardigheden") voor elke mogelijke taak. Sommige handleidingen zijn de Gouden Standaard (de juiste manier om de taak uit te voeren), terwijl andere Afleiders zijn (lijkt op de juiste, maar zijn fout of bedoeld voor andere machines).

Het probleem is dat zelfs als de werknemer de taak voltooit en de machine werkt, hij het misschien op de verkeerde manier heeft gedaan: misschien heeft hij de verkeerde handleiding gepakt, een veiligheidstap overgeslagen, of hij heeft zich een weg door het proces gegokt totdat het toevallig wel werkte. Als je alleen controleert of de machine werkt, huur je misschien iemand in die eigenlijk gevaarlijk of inefficiënt is.

SkillCoach is een nieuw systeem dat dit probleem oplost. In plaats van alleen naar het eindresultaat te kijken, fungeert het als een zelfverbeterende supervisor die het hele proces van de werknemer stap voor stap volgt.

Hier is hoe het werkt, onderverdeeld in eenvoudige concepten:

1. Het Probleem: "Geluk" vs. "Vaardigheid"

In het verleden werden AI-agenten beoordeeld op basis van het feit of ze het juiste antwoord hadden gevonden.

  • De Fout: Een agent kan het verkeerde gereedschap kiezen, drie veiligheidscontroles overslaan en vervolgens per ongeluk het juiste antwoord raden.
  • De Analogie: Stel je een student voor die een wiskundetoets maakt. Hij krijgt het juiste antwoord, maar hij heeft de verkeerde formule doorgestreept, de juiste formule uitgegumd en daarna het getal geraden. Als je alleen naar het eindantwoord kij kijkt, denk je dat hij een genie is. Als je naar zijn kladwerk (het proces) kijkt, zie je dat hij eigenlijk in de war is.

2. De Oplossing: De "Zelfevoluerende Rubriek"

SkillCoach creëert een Rubriek (een gedetailleerde beoordelingschecklist) die niet alleen naar het antwoord kijkt. Het breekt de taak af in vier specifieke gewoonten:

  1. Selectie: Heeft hij de juiste handleiding uit de bibliotheek gepakt, of heeft hij een vergelijkbare afleider gegrepen?
  2. Opvolging: Heeft hij de stappen in de handleiding exact gevolgd, of heeft hij delen overgeslagen?
  3. Compositie: Als hij twee handleidingen gebruikte, heeft hij ze dan in de juiste volgorde samengevoegd?
  4. Reflectie: Controleerde hij zijn werk tegen de regels voordat hij op "verzenden" drukte?

Het "Zelfevoluerende" Deel:
In het begin is de checklist van het systeem slechts een concept. Terwijl de AI taken probeert uit te voeren, observeert SkillCoach waar de AI fouten maakt. Vervolgens actualiseert het systeem zijn eigen checklist om die specifieke fouten de volgende keer beter te vangen.

  • Analogie: Denk aan een docent die een toets maakt. Na het nakijken van de eerste groep studenten realiseert de docent zich: "O, de helft van de klas heeft deze specifieke regel gemist." De docent herschrijft dan de beoordelingsrubriek om die regel de volgende keer duidelijker te maken. Het systeem wordt slimmer in het beoordelen van zichzelf.

3. De "Afleider"-Uitdaging

Echte fabrieken (of enterprise software) zijn niet overzichtelijk. Ze hebben duizenden handleidingen, waarvan er veel op elkaar lijken.

  • SkillCoach test de AI in een "ruisende" omgeving waar de juiste handleiding wordt gemengd met twee ongerelateerde handleidingen en drie zeer vergelijkbare, maar onjuiste handleidingen.
  • De Bevinding: Zelfs zeer slimme AI-modellen pakken vaak de verkeerde handleiding wanneer de bibliotheek groot wordt. Ze krijgen de taak uiteindelijk wel voltooid, maar ze verspillen tijd of nemen risico's. SkillCoach vangt dit "slechte gedrag" op, zelfs als het eindresultaat er goed uitziet.

4. Waarom dit Belangrijk is: Betere Training

Het paper laat zien dat als je SkillCoach gebruikt om trainingsdata te filteren, je een veel betere AI krijgt.

  • De Oude Manier: Train de AI op elke poging die tot het juiste antwoord leidde. (Resultaat: De AI leert te gokken en stappen over te slaan).
  • De SkillCoach Manier: Train de AI alleen op pogingen die tot het juiste antwoord leidden én waarbij het perfecte proces werd gevolgd.
  • Het Resultaat: De AI leert een betrouwbare werker te zijn die de regels volgt, en niet alleen een gelukkige gokker.

Samenvatting

SkillCoach is een systeem dat stopt met het beoordelen van AI-agenten enkel op basis van "Heb je gewonnen?" en begint te vragen: "Heb je eerlijk gespeeld en de regels gevolgd?" Het bouwt een slimmer beoordelingssysteem dat evolueert naarmate het leert, waardoor het ervoor zorgt dat AI-agenten niet alleen geluk hebben, maar ook daadwerkelijk leren hun hulpmiddelen correct te gebruiken, zelfs wanneer de bibliotheek met hulpmiddelen rommelig is en vol met vallen zit.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →