← Nieuwste papers
💻 computer science

SkillMentor: LLM Agent Self-Evolution via Learning Blind-Spot Diagnosis

SkillMentor is een nieuw framework dat LLM-agenten in staat stelt om zichzelf te evolueren door een aparte diagnostische capaciteit te leren om blinde vlekken te identificeren en te cureren tot herbruikbare vaardigheden, waardoor de prestaties van de uitvoerder met 44,2% worden verbeterd zonder de gewichten van de uitvoerder bij te werken of te vertrouwen op menselijk toezicht.

Oorspronkelijke auteurs: Xiaoyi Bao, Yuanzhen Xie, Yunzhi Tan, Jinghang Gu, Zhongqing Wang, Chu-Ren Huang, Bo Hu, Zang Li

Gepubliceerd 2026-07-31
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Xiaoyi Bao, Yuanzhen Xie, Yunzhi Tan, Jinghang Gu, Zhongqing Wang, Chu-Ren Huang, Bo Hu, Zang Li

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een wereld voor waarin computers lijken op ongelooflijk snelle, superintelligente leerlingen. Al een lange tijd proberen wetenschappers deze leerlingen te leren hoe ze dingen beter kunnen doen door constant hun hersenen te herschrijven—nieuwe lagen neuronen toevoegen, hun interne bedrading aanpassen en ze eindeloos voorbeelden voeren van hoe ze moeten handelen. Dit is de wereld van "agent self-evolution", waar het doel meestal is om de leerling sneller en sterker te maken in het uitvoeren van de taak. Maar er is een addertje onder het gras: wat als de leerling niet alleen moet weten hoe hij moet handelen, maar ook moet beseffen wat hij niet weet? Het is als een student die steeds faalt voor een wiskundetoets omdat hij niet weet dat hij vergeten is een getal te onthouden, in plaats van omdat hij de vermenigvuldiging niet kan. De grote vraag die dit artikel stelt is: Kunnen we een leerling leren om een detective te worden voor zijn eigen fouten, waarbij hij de verborgen hiaten in zijn kennis opspoort zonder dat daar een menselijke leraar voor nodig is om hem erop te wijzen?

Maak kennis met SkillMentor, een slim nieuw systeem dat het script omdraait van hoe we AI gewoonlijk trainen. In plaats van te proberen het brein van de leerling direct te upgraden, hebben de onderzoekers een kleine, gespecialiseerde "Mentor"-agent gecreëerd. Zie de hoofd-AI (de "Executor") als een robot die probeert te navigeren door een enorme, complexe videogame-wereld vol apps en tools. De Executor staat vast; zijn brein kan niet worden veranderd of bijgewerkt. Normaal gesproken, als de robot faalt, zou een mens ingrijpen en zeggen: "Hé, je bent vergeten in te loggen," en de code repareren. Maar in dit experiment zijn mensen verboden in de kamer. Geen labels, geen hints, geen hulp.

Dus, hoe wordt de robot beter? Kom de Mentor tegemoet. Deze kleine detective probeert niet zelf het spel te spelen. In plaats daarvan kijkt de Mentor naar de worsteling van de Executor en zegt dan: "Aha! Ik zie wat er mis is." De taak van de Mentor is om uit te zoeken waarom de robot faalde (diagnose) en vervolgens een klein, herbruikbaar "spiekbriefje" (een skill) te schrijven om de robot te helpen die specifieke fout de volgende keer te vermijden. Het is alsof de Mentor merkt dat de robot steeds over een kleed struikelt, dus schrijft een briefje met: "Let op het kleed!" en plakt dat op de muur van de robot. De robot krijgt geen nieuw brein; hij krijgt alleen een betere set instructies gebaseerd op wat hij heeft geleerd van zijn eigen fouten.

De onderzoekers testten deze opstelling in twee uitdagende digitale werelden: AppWorld, waar de robot complexe taken moet beheren over verschillende apps heen (zoals een vlucht boeken of bestanden organiseren), en BFCLv3, een test voor hoe goed de robot specifieke computerfuncties correct kan aanroepen. Ze zetten hun nieuwe SkillMentor af tegen andere methoden die vertrouwen op enorme, krachtige modellen die simpelweg het juiste antwoord raden of gebruikmaken van vaste regels. De resultaten waren verrassend. Ondanks dat de Mentor een veel kleiner en eenvoudiger model was dan de gigantische modellen die door andere methoden worden gebruikt, hielp het de bevroren Executor om zijn prestaties met gemiddeld 44,2% te verbeteren.

Hier zit de truc: De Mentor gokte niet alleen; de Mentor leerde hoe hij moest diagnosticeren. De Mentor ontdekte dat de beste manier om beter te worden niet was om harder te werken, maar om de "blinde vlekken" te vinden—de specifieke, terugkerende dingen die de robot niet wist te doen. Het artikel suggereert dat dit vermogen om te diagnosticeren een vaardigheid op zich is, één die getraind kan worden. De Mentor leerde om lastige testgevallen te genereren om de zwaktes van de robot bloot te leggen, te evalueren hoe ernstig die zwaktes waren, en vervolgens de perfecte "oplossing" te selecteren om aan de toolkit van de robot toe te voegen.

Een van de coolste bevindingen is dat dit systeem een positieve feedbackloop creëert. Terwijl de Mentor één blinde vlek herstelt, wordt de robot beter, wat betekent dat de oude trucjes niet meer werken en er nieuwe blinde vlekken verschijnen. De Mentor ziet vervolgens deze nieuwe gaten en herstelt die ook. Het is een zelfverbeterende cyclus waarbij de robot slimmer wordt, niet door zijn brein te veranderen, maar door voortdurend zijn externe "spiekbriefjes" bij te werken op basis van wat hij leert van zijn eigen fouten.

Het artikel laat ook zien dat deze "spiekbriefjes" overdraagbaar zijn. Als je de Mentor traint op een zwakkere robot, kunnen de vaardigheden die hij leert ook een sterkere robot helpen, omdat de zwakkere robot meer fouten blootlegt om van te leren. Omgekeerd helpen de vaardigheden die geleerd zijn van een superintelligente robot een zwakkere robot minder, omdat de slimme robot niet genoeg fouten maakte om de basis te onderwijzen. Dit bewijst dat de verkregen kennis gaat over het proces van het oplossen van fouten, en niet alleen over het onthouden van antwoorden.

Kortom, SkillMentor suggereert dat we AI niet altijd groter of duurder hoeven te maken om het slimmer te maken. We moeten het misschien gewoon leren hoe het een betere detective van zijn eigen blinde vlekken kan zijn. Door het proces van "doen" te scheiden van het proces van "uitzoeken wat er misging", hebben de onderzoekers een manier gevonden om AI op eigen kracht te laten evolueren, waarbij de machine haar eigen beperkingen ontdekt en haar eigen oplossingen bouwt, zonder dat er een enkele menselijke hand bij komt kijken. Het is een stap naar machines die niet alleen bevelen opvolgen, maar leren begrijpen waar ze tekortschieten en hoe ze dat kunnen oplossen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →