MUSE-Autoskill: Self-Evolving Agents via Skill Creation, Memory, Management, and Evaluation
Het artikel introduceert MUSE-Autoskill, een zelfevoluerend agentframework dat de taakoplossende capaciteiten verbetert door vaardigheden te beheren via een geünificeerde levenscyclus van creatie, geheugen, beheer, evaluatie en verfijning, waarbij deze worden behandeld als langlevende, ervaringsbewuste activa om herbruikbaarheid, betrouwbaarheid en overdracht tussen taken te verbeteren.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een briljante maar zeer vergeetachtige assistent hebt (de AI-agent). Wanneer je hen vraagt een complex probleem op te lossen, zoals een lekkende kraan repareren of een enorme spreadsheet te organiseren, proberen ze dit meestal elke keer opnieuw van nul af aan uit te werken. Ze lezen misschien de handleiding, proberen een paar dingen, falen, lezen de handleiding opnieuw en proberen iets anders. Dit is traag, duur en ze maken vaak dezelfde fouten keer op keer.
Het artikel introduceert MUSE-Autoskill, een nieuwe manier om deze assistent te helpen leren en groeien. In plaats van alleen maar een "slim brein" te zijn, verandert MUSE de assistent in een meesterhandwerker met een persoonlijke werkplaats.
Hier is hoe het werkt, opgesplitst in eenvoudige concepten:
1. Het Probleem: De "Eenmalige" Aanpak
Momenteel behandelen de meeste AI-assistenten elke taak als een gloednieuw avontuur. Als ze uitvinden hoe ze een specifiek type computerfout kunnen oplossen, "bewaren" ze die kennis niet echt. De volgende keer dat je het vraagt, moeten ze het opnieuw leren. Het is alsof een kok een perfecte lasagne kookt, deze opeet en vervolgens het recept volledig vergeet, waardoor hij voor de volgende klant weer de ingrediënten moet raden.
2. De Oplossing: De "Vaardigheids-Werkplaats"
MUSE verandert het spel door de assistent een Werkplaats te geven waar ze Vaardigheden kunnen bouwen, opslaan en verfijnen.
Denk aan een Vaardigheid niet als een magische spreuk, maar als een volledige, voorverpakte gereedschapskist.
- Het Recept (SKILL.md): Een duidelijke set instructies over wat het gereedschap doet.
- De Gereedschappen (Scripts): De daadwerkelijke code of stappen die nodig zijn om de klus te klaren.
- De Kwaliteitscontrole (Tests): Een ingebouwde inspecteur die ervoor zorgt dat het gereedschap werkt voordat het op de plank wordt gezet.
- Het Notitieboek (.memory.md): Een persoonlijk logboek waarin de assistent opschrijft: "Hé, dit gereedschap werkt geweldig, maar als het bestand te groot is, crasht het. Dat heb ik op de harde manier geleerd."
3. De Vijf-Stappen Levenscyclus (De "Handwerkman-Routine")
Het artikel beschrijft een doorlopende lus die MUSE gebruikt om deze vaardigheden te beheren, vergelijkbaar met hoe een meester-timmerman zijn gereedschappen beheert:
- Creatie (Het Gereedschap Bouwen): Wanneer de assistent een probleem tegenkomt dat ze niet kunnen oplossen met bestaande gereedschappen, gokken ze niet zomaar. Ze pauzeren en zeggen: "Ik heb een nieuw gereedschap nodig." Ze bouwen dan en daar een nieuw vaardigheidspakket.
- Geheugen (Het Persoonlijke Logboek): Elke keer dat een vaardigheid wordt gebruikt, schrijft de assistent een notitie in het specifieke notitieboek. Werkte het? Faalde het? Was het traag? Dit is Vaardigheids-niveau Geheugen. Het is alsof een monteur "Deze moersleutel verwringt bouten als je te snel draait" op de steel van de moersleutel zelf schrijft.
- Beheer (De Plank Organiseren): De assistent houdt de werkplaats netjes. Als twee gereedschappen hetzelfde doen, voegen ze ze samen. Als een gereedschap kapot is en nooit werkt, gooien ze het weg. Ze houden de "beste" gereedschappen klaar om te grijpen.
- Evaluatie (De Veiligheidsinspecteur): Voordat een nieuw gereedschap op de plank mag, moet het een strenge test doorstaan. De assistent voert het gereedschap uit in een veilige, geïsoleerde zandbak. Als het de test niet haalt, wordt het gereedschap teruggestuurd naar de werkplaats om gerepareerd te worden. Het komt nooit op de plank voordat het perfect is.
- Verfijning (Het Gereedschap Polijsten): Als een gereedschap een test of een echte klus niet haalt, geeft de assistent niet op. Ze kijken naar de fout, repareren de code en proberen het opnieuw. Het gereedschap wordt na verloop van tijd beter.
4. De "Lange-Horizon" Truc
Een van de grootste problemen voor AI is dat ze een beperkte "aandachtsspanne" (contextvenster) hebben. Als een taak 50 stappen vereist, vergeet de AI wat ze bij stap 1 hebben gedaan tegen de tijd dat ze bij stap 50 aankomen.
MUSE lost dit op met Adaptieve Compressie. Stel je voor dat je een lang verhaal schrijft. In plaats van elk enkel woord dat je hebt geschreven te bewaren, vat je de middelste hoofdstukken samen tot een korte paragraaf terwijl je het begin en het eind gedetailleerd houdt. MUSE doet dit automatisch. Het houdt de belangrijkste delen van het gesprek bij en vat het midden samen, zodat de AI nooit zijn plaats verliest, zelfs niet bij zeer lange taken.
5. De Resultaten: Wat Gebeurde er in het Lab?
De onderzoekers testten dit op SkillsBench, een set van 51 real-world taken (zoals data analyseren, code repareren of operaties plannen).
- De "Menselijke" Baseline: Zelfs toen ze de AI gereedschappen gaven die door mensen waren gemaakt, presteerde de MUSE-assistent het beste. Het was beter in het lezen van instructies en het gebruiken van gereedschappen dan de andere AI's.
- Het "Zelf-Opgeleide" Mirakel: Het meest spannende deel? De MUSE-assistent was in staat om zichzelf te leren.
- Het probeerde een taak zonder enige gereedschappen.
- Toen het slaagde, bouwde het een vaardigheid op basis van dat succes.
- Vervolgens gebruikte het die zelfgemaakte vaardigheid om de taak opnieuw te doen.
- Resultaat: Bij de taken waar het een vaardigheid kon bouwen, steeg de nauwkeurigheid van ongeveer 53% tot bijna 88%. Het werd daadwerkelijk beter dan de mensen die de oorspronkelijke gereedschappen hadden geschreven.
- Delen is Zorgen: Het beste deel is dat deze vaardigheden niet opgesloten zitten in één AI. De onderzoekers namen een vaardigheid die door MUSE was gebouwd en gaven deze aan een andere AI (genaamd Hermes). Hermes werd direct veel beter in de taak, wat bewijst dat de vaardigheden zijn als universele gereedschappen die elke slimme werknemer kan oppakken en gebruiken.
Samenvattende Analogie
Stel je een Junior Intern (een standaard AI) versus een Meesterhandwerker (MUSE-Autoskill) voor.
- De Intern probeert elke kapotte machine te repareren door elke keer de handleiding vanaf pagina één te lezen. Ze zijn traag, maken fouten en vergeten wat ze gisteren hebben geleerd.
- De Meesterhandwerker heeft een Werkplaats.
- Wanneer ze een nieuw probleem tegenkomen, bouwen ze een aangepast gereedschap ervoor.
- Ze testen het gereedschap om ervoor te zorgen dat het werkt.
- Ze schrijven notities op het gereedschap over hoe je het het beste kunt gebruiken.
- Ze organiseren hun plank zodat ze de volgende keer direct het juiste gereedschap kunnen vinden.
- Als een gereedschap kapot gaat, repareren ze het en maken ze het sterker.
Het artikel laat zien dat door AI deze "Werkplaats" te geven en de mogelijkheid om zijn eigen gereedschappen te bouwen, het aanzienlijk sneller, nauwkeuriger wordt en in staat is om veel moeilijkere problemen op te lossen dan daarvoor.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.