SkillAudit: Ground-Truth-Free Skill Evolution via Paired Trajectory Auditing
SkillAudit is een ground-truth-vrij framework dat de vaardigheden van agenten evolueert door iteratief gepaarde trajecten met en zonder kandidaat-vaardigheden te auditeren, met behulp van Process-Aligned Contrastive Evaluation om gedragsdivergenties te diagnosticeren en een structurele verifieerder om vaardigheidsdocumenten veilig te verfijnen of te repareren zonder afhankelijk te zijn van externe beloningen of verborgen testuitkomsten.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een zeer slimme, maar in de tijd bevroren robotassistent hebt. Je kunt de hersenen van de robot niet herprogrammeren (de "weights" zijn vergrendeld), maar je kunt hem een instructiehandleiding (een "skill") geven om hem te helpen specifieke taken op te lossen, zoals het oplossen van een computerbug of het analyseren van financiële gegevens.
Het probleem is dat deze handleidingen vaak verouderd raken. Misschien is een tool veranderd, of is er een nieuw type fout opgetreden. Normaal gesproken heb je om een handleiding te repareren een "leraar" nodig (een expert of een verborgen antwoordsleutel) die zegt: "Nee, die stap is fout." Maar wat als je geen leraar hebt? Wat als je alleen de taakbeschrijving en een rommelige werkruimte hebt?
Dit artikel introduceert SKILLAUDIT, een systeem dat deze instructiehandleidingen kan repareren zonder een leraar of een antwoordsleutel nodig te hebben.
Zo werkt het, met behulp van eenvoudige analogieën:
1. De "Proefsmaak" (Paired Trajectory Auditing)
Stel je voor dat je een recept voor een taart probeert te verbeteren. Je hebt geen voedselcriticus om te proeven. In plaats daarvan bak je twee taarten op exact hetzelfde moment:
- Taart A: Gemaakt met je huidige recept (de "Skill").
- Taart B: Gemaakt met dezelfde ingrediënten maar zonder dat specifieke recept (alleen op basis van het instinct van de bakker).
Je vergelijkt de twee taarten vervolgens zij aan zij:
- Als Taart A beter is, dan helpt het recept.
- Als Taart A aangebrand of plat is terwijl Taart B prima is, dan schuurt het recept (het is schadelijk).
- Als ze identiek zijn, is het recept inert (het doet niets).
SKILLAUDIT doet precies dit met een robot. Het voert de taak twee keer uit: één keer met de skill en één keer zonder. Door de twee "traces" (sporen) van wat de robot deed te vergelijken, isoleert het precies waar de skill de robot hielp of in de war bracht.
2. De "Detective Squad" (PACE)
Zodra de twee runs voltooid zijn, moet het systeem uitzoeken welke specifieke zin in de handleiding het probleem heeft veroorzaakt. Het gebruikt een team van AI-detectives genaamd PACE.
In plaats van alleen te zeggen "De taart is slecht", kijkt PACE naar de twee taarten en wijst naar een specifieke regel in het recept:
- "Omdat Paragraaf 3 aanwezig was, probeerde de robot een gereedschap te gebruiken dat niet meer bestaat."
- "Omdat Paragraaf 7 aanwezig was, sloeg de robot een veiligheidscontrole over die de 'no-skill' versie wel deed."
Dit verandelt een vage fout in een specifieke bewerkingsinstructie.
3. Het "Regelboek" (The Anchor Verifier)
Soms kunnen de AI-detectives in de war raken of hallucineren. Om te voorkomen dat het systeem wilde wijzigingen aanbrengt die de taak breken, is er een Regelboek.
Dit is een strikte, onveranderlijke checklist die vóór het proces wordt samengesteld op basis van de taakbeschrijving. Het controleert harde feiten:
- "Heeft de robot het vereiste bestand aangemaakt?"
- "Is het bestandsformaat correct?"
- "Is het systeem gecrasht?"
Als de nieuwe versie van de handleiding dit Regelboek niet doorstaat, zet het systeem de wijzigingen onmiddellijk terug (rollback), ongeacht wat de detectives zeiden. Het fungeert als een vangnet.
4. Twee manieren om te repareren (Refine vs. Repair)
Afhankelijk van wat de "Proefsmaak" onthult, gebruikt het systeem een van de twee strategieën:
- Refine (De Redacteur): Als de handleiding grotendeels goed is maar te veel onzin bevat, verwarrende instructies of verouderde tips, werkt het systeem als een strikte redacteur. Het verwijdert de ruis en verheldert de goede delen.
- Repair (De Chirurg): Als de handleiding de robot geheel verkeerde instructies geeft (zoals het vertellen om een tool te gebruiken die niet meer bestaat), werkt het systeem als een chirurg. Het snijdt de slechte paragraaf eruit en vervangt deze door de juiste stappen, waarbij vaak de juiste stappen worden geleend van de "no-skill" run.
De Resultaten
De onderzoekers hebben dit getest op 89 verschillende professionele taken (zoals coderen, data-analyse en cybersecurity).
- Geen handleiding: De robot voerde ongeveer 41% van de taken correct uit.
- Statische handleiding (de oude, onbewerkte versie): De robot voerde ongeveer 57% correct uit.
- SKILLAUDIT (de geëvolueerde handleding): De robot voerde 74% correct uit.
De Belangrijkste Les:
SKILLAUDIT bewijst dat je geen menselijke expert of een verborgen antwoordsleutel nodig hebt om de instructiehandleiding van een AI te verbeteren. Door simpelweg de "met skill" vs. "zonder skill" runs te vergelijken, kan het systeem zichzelf corrigeren, slecht advies verwijderen en goed advies behouden, waardoor de robot aanzienlijk slimmer en betrouwbaarder wordt.
De Limiet:
Het systeem werkt het beste wanneer de taak een duidelijk "voetafdruk" achterlaat (zoals het aanmaken van een bestand of het berekenen van een getal). Als een taak puur gaat over "goed oordeelsvermogen" of "creatief denken", waarbij er geen duidelijk goed/fout antwoord is om tegen te controleren, heeft het systeem moeite om te weten of het de handleiding heeft verbeterd of niet.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.