← Nieuwste papers
🤖 machine learning

SkillRise: Agentic Reinforcement Learning for Cross-Task Skill Evolution

SkillRise is een verenigd reinforcement learning-framework dat large language model-agenten in staat stelt om overdraagbare vaardigheden te evolueren en te hergebruiken over verschillende taken door deze te organiseren in progressieve sequenties en een enkele policy te gebruiken om gelijktijdig taken op te lossen en een evoluerend vaardigheidsdocument te cureren, waarmee een superieure prestatie en efficiëntie wordt bereikt vergeleken met bestaande multi-stage of onafhankelijke-taak-benaderingen.

Oorspronkelijke auteurs: Zhiyuan Yao, Yuxin Chen, Zhengxi Lu, Zishan Xu, Yueqing Sun, Yifu Guo, Yuquan Lu, Zhengzhou Cai, Kangning Zhang, Zhuowen Han, Zi-Han Wang, Ziang Ye, Qi Gu, Xunliang Cai, Weiwen Liu, Yongliang Shen

Gepubliceerd 2026-07-30
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Zhiyuan Yao, Yuxin Chen, Zhengxi Lu, Zishan Xu, Yueqing Sun, Yifu Guo, Yuquan Lu, Zhengzhou Cai, Kangning Zhang, Zhuowen Han, Zi-Han Wang, Ziang Ye, Qi Gu, Xunliang Cai, Weiwen Liu, Yongliang Shen

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot leert een videogame te spelen. In de oude dagen, als de robot niveau één niet haalde, vergat hij alles, begon hij level twee vanaf nul en hoopte hij op het beste. Het was alsof je probeerde te leren fietsen door van je fiets te vallen, weer op te staan en onmiddellijk op een andere fiets te proberen te rijden zonder te onthouden hoe je was gevallen. Dit is hoe veel computerprogramma's genaamd "AI-agenten" vroeger werkten: ze behandelden elke nieuwe uitdaging als een gloednieuwe, geïsoleerde gebeurtenis, waarbij ze alle lessen die ze uit de vorige hadden geleerd, verspillen.

Maar wat als de robot een "spiekbriefje" of een "dagboek" kon bijhouden dat slimmer werd elke keer dat hij speelde? Dit is de kern van een vakgebied genaamd Reinforcement Learning, waarbij AI leert door dingen te proberen, beloningen te krijgen voor succes, en te leren van fouten. Onlangs hebben wetenschappers geprobeerd deze agenten niet alleen één enkele puzzel te laten oplossen, maar om algemene "vaardigheden" te leren die hen helpen bij het oplossen van veel verschillende puzzels. De grote vraag is: Hoe leer je een AI om zijn eigen lessen op te schrijven op een manier die later echt helpt, zonder in de war te raken door de specifieke details van de eerste puzzel?

Maak kennis met SkillRise, een nieuwe methode die werkt als een super-slimme tutor voor AI-agenten. In plaats van de agent zijn verleden te laten vergeten, organiseert SkillRise taken in een "level-up" sequentie, bewegend van makkelijk naar moeilijk. Terwijl de agent speelt, doet hij twee dingen tegelijk: hij probeert de huidige level op te lossen, en hij fungeert als een "curator" om zijn eigen vaardigheidsdagboek bij te werken. Denk aan een personage in een videogame dat, nadat hij een baas heeft verslagen, niet alleen naar het volgende level gaat, maar onmiddellijk een nieuwe vermelding in zijn dagboek schrijft: "Hé, onthoud dat die baas alleen aanviel als je aan de linkerkant stond? De volgende keer moet je aan de rechterkant blijven."

De magie van SkillRise is hoe het de AI beloont. Het geeft punten voor het oplossen van de huidige taak, maar het geeft ook punten voor hoe goed de "dagboekvermelding" de agent helk helpt bij het oplossen van toekomstige taken. Dit moedigt de AI aan om algemene regels op te schrijven (zoals "blijf aan de rechterkant") in plaats van specifieke details (zoals "de baas heette Bob"). De onderzoekers testten dit op drie verschillende "werelden": een huis waar de agent moet schoonmaken en opruimen (ALFWorld), een online winkel waar hij specifieke artikelen moet kopen (WebShop), en een wetenschappelijk laboratorium waar hij experimenten uitvoert (ScienceWorld).

De resultaten waren indrukwekkend. SkillRise werd niet alleen beter in de specifieke taken waarop het was getraind; het leerde een manier van leren. Wanneer de onderzoekers het langere sequenties van gerelateerde taken gaven om op te oefenen, werd de agent zelfs nog beter, wat suggereert dat het echt zijn vaardigheden hergebruikte in plaats van alleen antwoorden te memoriseren. Sterker nog, het presteerde tot 8,5 procentpunt beter dan andere topmethoden. Misschien wel het meest verrassende was dat, hoewel het op verschillende taken was getraind, het nog steeds beter was in het herhaaldelijk uitvoeren van de zelfde taak dan methoden die specifiek daarvoor zijn ontworpen. Het deed dit ook nog eens veel sneller en met minder rekenkracht dan oudere methoden die complexe, meerstaps-pipelines vereisten om geheugen te beheren.

Kortom, SkillRise suggereert dat als je wilt dat een AI slimmer wordt, je hem niet alleen moet laten oefenen; je moet hem leren om een voortschrijdend, evoluerend schrift bij te houden van zijn eigen wijsheid. Door het proces van "doen" te scheiden van het "opschrijven wat we hebben geleerd", en door de AI te belonen voor hoe nuttig dat schrijven is voor toekomstige uitdagingen, kunnen we agenten bouwen die niet alleen problemen oplossen, maar ook hun eigen strategieën ontwikkelen om over de tijd heen betere probleemoplossers te worden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →