← Nieuwste papers
🤖 machine learning

Learning While Acting: A Skill-Enhanced Test-Time Co-Evolution Framework for Online Lifelong Learning Agents

Dit artikel stelt LifeSkill voor, een tweestaps reinforcement learning-framework dat online lifelong learning-agenten in staat stelt om continu test-time feedback te internaliseren in hun parameters via verifier-gestuurde skill extractie en online skill internalisatie, waardoor de beperkingen van statische retrieval-gebaseerde benaderingen worden overwonnen en de prestaties op long-horizon taken aanzienlijk worden verbeterd.

Oorspronkelijke auteurs: Bo Mao, Jie Zhou, Yutao Yang, Xin Li, Xian Wei, Qin Chen, Xingjiao Wu, Liang He

Gepubliceerd 2026-06-04
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Bo Mao, Jie Zhou, Yutao Yang, Xin Li, Xian Wei, Qin Chen, Xingjiao Wu, Liang He

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot leert om een complex computerspel te spelen. In de oude manier van doen, als de robot een level niet haalde, schreef hij gewoon een notitie in een schriftje: "Hier niet springen," en probeerde hij die notitie de volgende keer te onthouden. De hersenen van de robot (zijn interne code) veranderden nooit echt; hij vertrouwde er alleen op om door zijn schriftje te bladeren om fouten te vermijden.

Het paper LifeSkill stelt een nieuwe manier voor om deze AI-agenten te trainen, zodat ze niet alleen fouten onthouden, maar er ook echt van leren door de werking van hun hersenen te veranderen.

Zo werkt het systeem, opgedeeld in eenvoudige stappen:

1. Het Probleem: De beperking van het "Schriftje"

Huidige AI-agenten zijn als studenten die verboden is om de leerstof te bestuderen; ze mogen tijdens de toets alleen een spiekbriefje (een geheugenbank) gebruiken.

  • Het probleem: Als de AI een taak niet volbrengt, kan hij een reflectie schrijven zoals: "Ik had voorzichtiger moeten zijn." Maar deze reflectie blijft als tekst in een schriftje staan. De eigenlijke "hersenen" van de AI (de parameters) veranderen niet. De AI moet het schriftje elke keer opnieuw lezen, wat rommelig en traag wordt naarmate het schriftje enorm groot wordt.

2. De Oplossing: "Leren tijdens het Handelen"

De auteurs hebben een tweestaps-proces ontwikkeld genaamd LifeSkill. Denk aan een coach en een student die in realtime samenwerken.

Stap A: De Coach vindt de juiste les (Verifier-Guided Skill Learning)

Wanneer de AI (de student) een taak niet volbrengt, moet hij uitzoeken waarom.

  • De oude manier: De AI zou misschien een reden verzinnen die slim klinkt, zoals "Ik moet beleefder zijn," zelfs als dat niet helpt bij het oplossen van de wiskundevraag.
  • De LifeSkill-manier: De AI genereert verschillende mogelijke "lessen" (vaardigheden). Vervolgens test een strikte Verifier (zoals een scheidsrechter) elke les.
    • Analogie: Stel je voor dat de AI probeert een kapotte auto te repareren. Hij stelt drie gereedschappen voor: een hamer, een moersleutel en een schroevendraaier. De scheidsrechter probeert elk gereedschap op de auto uit. Als de moersleutel de motor daadwerkelijk repareert, krijgt de AI een beloning voor het voorstellen van de moersleutel. Als de hamer alleen maar lawaai maakt, krijgt hij geen beloning.
    • Resultaat: De AI leert om nuttige vaardigheden te extraheren (zoals "gebruik een moersleutel") in plaats van alleen plausibel klinkende tekst.

Stap B: De Student internaliseert de Les (Online Skill Internalization)

Zodra de AI een vaardigheid heeft gevonden die werkt (bijv. "Gebruik de moersleutel"), moet hij deze niet alleen voor de volgende keer in het schriftje schrijven. Hij moet het onthouden.

  • De magie: Het systeem neemt de succesvolle poging waarbij de AI de "moersleutel"-vaardigheid gebruikte, verwijdert de instructie om de "moersleutel" te gebruiken, en traint de hersenen van de AI om het probleem op te lossen zonder de instructie.
  • Analogie: Stel je een chef-kok voor die leert een taart te bakken. In het begin hebben ze een receptkaart nodig waarop staat: "Voeg suiker toe." Zodra ze de vaardigheid beheersen, neem je de kaart weg. Als ze nog steeds perfect de taart kunnen bakken zonder de kaart, hebben ze de vaardigheid echt geleerd.
  • Resultaat: De hersenen van de AI worden bijgewerkt. De AI hoeft de les niet langer op te zoeken in een schriftje; de kennis is nu onderdeel geworden van zijn DNA.

3. De Resultaten: Een Slimmere, Snellere Leerling

De onderzoekers hebben dit getest op een benchmark genaamd LifelongAgentBench, die taken omvat zoals het beheren van databases, besturingssystemen en kennisgrafen.

  • De score: LifeSkill versloeg alle andere methoden met een aanzienlijke marge (een verbetering van gemiddeld 7 punten in prestaties).
  • Waarom het won:
    • Training-vrije methoden (alleen een schriftje gebruiken) liepen vast omdat ze hun hersenen niet konden veranderen.
    • Andere trainingsmethoden probeerden wel te leren, maar hadden geen goede manier om te achterhalen wat ze precies van fouten moesten leren.
    • LifeSkill slaagde omdat het het vinden van de juiste les (via de Verifier) combineerde met het onthouden van die les (via Internalization).

Samenvatting

Kortom, LifeSkill verandert een AI-agent van een student die afhankelijk is van een groeiende stapel spiekbriefjes in een meester die daadwerkelijk leert en zich aanpast terwijl hij aan het werk is. Het zorgt ervoor dat de AI niet alleen ervaringen "opvraagt", maar ze "internaliseert", waardoor de agent slimmer en efficiënter wordt zonder een enorme bibliotheek aan tekst mee te hoeven dragen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →