SkillRevise: Improving LLM-Authored Agent Skills via Trace-Conditioned Skill Revision
SkillRevise is een op uitvoering gebaseerd framework dat imperfecte initiële agent-vaardigheden iteratief verfijnt door defecten te diagnosticeren uit uitvoeringssporen, herstelprincipes op te halen en optimaal versies empirisch te selecteren, waardoor de succesratio's van agents en de cross-model overdraagbaarheid aanzienlijk worden verbeterd in vergelijking met one-shot generatiemethoden.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Het Grote Plaatje: Een Robot Leren van zijn Fouten te Leren
Stel je voor dat je een zeer intelligente maar onervaren stagiair (de AI-agent) inhuurt om een complexe taak uit te voeren, zoals het organiseren van een enorm magazijn of het debuggen van een computerprogramma.
Meestal geef je de stagiair een handleiding (een "Skill" genoemd).
- Het Probleem: Als de handleiding door een menselijke expert is geschreven, is dat duur en past het misschien niet bij hoe de stagiair daadwerkelijk denkt. Als je de stagiair vraagt om in één keer zijn eigen handleiding te schrijven, schrijft hij misschien iets dat op papier perfect lijkt, maar dat in de praktijk volledig instort wanneer hij het werk probeert te doen.
- De Oude Manier: Eerdere methoden probeerden de handleiding te verbeteren door de stagiair heel veel te laten oefenen en de instructies langzaam te laten "evolueren". Maar dit duurt eeuwig en werkt niet goed als je begint met een slechte handleiding (het "cold start"-probleem).
SKILLREVISE is een nieuw systeem dat fungeert als een strenge maar behulpzame coach. In plaats van te wachten tot de stagiair maandenlang leert, neemt het systeem een ruwe versie van een handleiding, laat de stagiair het proberen, kijkt precies waar hij faalt, en bewerkt de handleiding direct op basis van die specifieke fout.
Hoe het Werkt: De "Coach-Loop"
Het papier beschrijft een vierstaps-cyclus die herhaaldelijk gebeurt (meestal drie keer) om de handleiding te perfectioneren:
1. De Proefloop (Executie)
De stagiair probeert de taak uit te voeren met de huidige versie van de handleiding.
- Analogie: De stagiair probeert een boekenkast te bouwen. Hij volgt de instructies, maar de kast wankelt en valt om.
2. De Autopsie (Diagnose)
Het systeem zegt niet alleen "Je bent gefaald." Het gedraagt zich als een detective. Het bekijkt het bewijs (de wankele kast) en vraagt zich af:
- Wat ging er mis? (Hebben we de verkeerde schroeven gebruikt?)
- Wat ging er goed? (Het hout is perfect gezaagd, dus verander dat deel niet.)
- Analogie: De coach zegt: "Je hebt het hout niet verkeerd gemeten, maar je bent vergeten de stap te zetten om te controleren of de vloer waterpas is. Houd ook het deel over het schuren van het hout aan; dat was goed."
3. De Bibliotheek van Wijsheid (Principle Memory)
Het systeem controleert een "bibliotheek" met algemene reparatieregels. Het zoekt niet naar het antwoord op deze specifieke boekenkast; het zoekt naar een regel over hoe je in het algemeen wankele planken repareert.
- Analogie: De coach pakt een kaart uit een stapel die zegt: "Regel #4: Controleer altijd de fundering voordat je het frame bouwt."
4. Het Herschrijven (Revisie)
Het systeem combineert het rapport van de detective en de algemene regel om de handleiding te herschrijven. Cruciaal hierbij is het toevoegen van "Ankers" (Anchors).
- Wat zijn Ankers? Dit zijn specifieke controlepunten. In plaats van te zeggen "Bouw het voorzichtig", zegt de nieuwe handleiding: "Pauzeer hier, controleer of de vloer waterpas is, en als deze niet recht is, stop dan."
- Analogie: De nieuwe handleiding heeft nu een rode plaknotitie: "STOP EN CONTROLEER OF DE VLOER WATERPAS IS VOORDAT JE NAGELT."
5. De Definitieve Beslissing (Utility Gate)
De stagiair probeert de nieuwe handleiding uit.
- Als de nieuwe handleiding beter werkt, houdt het systeem deze erbij.
- Als de nieuwe handleiding de situatie verslechtert, gooit het systeem deze weg en gaat terug naar de vorige versie.
- Analogie: De coach probeert de nieuwe instructies uit. Als de kast nog steeds wankelt, zegt de coach: "Oké, dat nieuwe idee was slecht. Laten we teruggaan naar de oude instructies en de volgende keer een andere oplossing proberen."
Waarom is dit bijzonder?
Het papier benadrukt drie belangrijke redenen waarom deze aanpak beter is dan wat we tot nu toe hadden:
- Het Begint Klein (Cold-Start Friendly): Je hebt geen bibliotheek van 1.000 perfecte handleidingen nodig om te beginnen. Je hebt slechts één imperfecte handleiding nodig, en SKILLREVISE kan deze snel repareren.
- Het is Niet Gewoon "Meer Oefenen": Oude methoden lieten de AI duizenden keren oefenen om te leren. SKILLREVISE is als een gerichte operatie. Het vindt het specifieke defect in de instructies en repareert het, in plaats van te hopen dat de AI het per ongeluk ontdekt.
- Het Leert Algemene Regels, Niet Alleen Trucjes: Het systeem is voorzichtig om de AI niet te leren om te "cheaten" voor deze specifieke test. Het leert de AI hoe het met typen problemen moet omgaan.
- Slechte Skill: "Als de test vraagt om een rode knop, druk dan op de rode knop." (Dit werkt alleen voor die ene test).
- Goede Skill (SKILLREVISE): "Verifieer altijd de kleur van de knop aan de hand van het diagram voordat je drukt." (Dit werkt voor elke test).
De Resultaten: Werkt het?
De auteurs hebben dit getest in drie verschillende "examenkamers" (benchmarks) met verschillende AI-modellen (zoals GPT-5.5, Qwen en DeepSeek).
- De Score: Zonder hulp kreeg de AI ongeveer 36% van de taken goed. Met een "one-shot" handleiding (één keer geschreven en nooit aangepast) kreeg hij ongeveer 39% goed.
- De SKILLREVISE Score: Na slechts drie rondes van deze "Coach-loop" kreeg de AI 61% van de taken goed.
- De Conclusie: Het systeem veranderde een matige handleiding in een zeer effectieve handleiding in zeer korte tijd. Het toonde ook aan dat deze verbeterde handleidingen gebruikt konden worden door andere AI-modellen, niet alleen door de een die ze geschreven had, wat bewees dat de aangeleerde vaardigheden echt algemene kennis waren en geen specifieke trucjes.
Samenvattend
SKILLREVISE is een framework dat AI-"skills" niet behandelt als statische instructies, maar als levende documenten. Het gebruikt een cyclus van Proberen Diagnostiseren Algemene Regels Ophalen Herschrijven Testen om een slechte set instructies te veranderen in een geweldige, waarbij wordt gewaarborgd dat de AI niet alleen antwoorden uit het hoofd leert, maar echt leert hoe het werk correct uitgevoerd moet worden.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.