← Nieuwste papers
🤖 machine learning

SEAR: Sample Efficient Action Chunking Reinforcement Learning

Het artikel introduceert SEAR, een efficiënt sample-efficiënt off-policy reinforcement learning-algoritme dat een causale transformer-critic met multi-horizon targets en een receding horizon replanning-strategie benut om effectief online leren met actiechunks mogelijk te maken, waarmee het state-of-the-art methoden op uitdagende manipulatietaken overtreft.

Oorspronkelijke auteurs: C. F. Maximilian Nagy, Onur Celik, Emiliyan Gospodinov, Florian Seligmann, Weiran Liao, Aryan Kaushik, Gerhard Neumann

Gepubliceerd 2026-08-14
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: C. F. Maximilian Nagy, Onur Celik, Emiliyan Gospodinov, Florian Seligmann, Weiran Liao, Aryan Kaushik, Gerhard Neumann

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot leert een complex computerspel te spelen, zoals een doolhof waarin hij sleutels moet oppakken, deuren moet openen en puzzels moet oplossen. In de wereld van kunstmatige intelligentie wordt dit Reinforcement Learning genoemd. Denk aan het trainen van een hond: je geeft het een traktatie (een beloning) wanneer het iets goed doet, en het leert dat gedrag te herhalen. Maar hier komt het lastige deel bij: als het spel erg lang is, kan de hond vergeten dat de traktatie aan het einde kwam door de allereerste actie die hij uitvoerde. Hij moet de verbanden leggen tussen het begin en het einde.

Om de robot sneller te laten leren, gebruiken wetenschappers een truc genaamd Action Chunking. In plaats van tegen de robot te zeggen: "Beweeg je arm naar links," dan "Beweeg je arm omhoog," en dan "Pak de beker," één kleine stap tegelijk, zeggen ze: "Hier is een hele reeks: Beweeg links, omhoog, en pak." Het is alsof je een pianist een hele maat muziek tegelijk leert, in plaats van één noot per keer. Dit helpt de robot om het grotere plaatje te zien en beter te plannen. Er is echter een addertje onder het gras. Als je de robot alleen maar een hele reeks muziek laat spelen zonder hem tussendoor te laten luisteren, kan hij de draad kwijtraken als hij een verkeerde noot raakt. Hij moet in staat zijn om te stoppen, te luisteren en zijn plan constant aan te passen. Dit artikel behandelt het probleem van hoe je robots deze grote "chunks" van acties kunt leren zonder dat ze te traag of onhandig worden om te reageren wanneer er iets misgaat.


Maak kennis met SEAR (Sample Efficient Action Chunking Reinforcement Learning), een nieuwe methode ontworpen om robots te leren vooruit te plannen zonder hun kalmte te verliezen. De onderzoekers ontdekten dat hoewel het aansturen van een robot om een hele reeks bewegingen tegelijk uit te voeren (een "chunk") geweldig is voor het leerproces, het op de ouderwetse manier doen vaak tot een ramp leidt. Als je de robot simpelweg een lijst van 10 bewegingen geeft en zegt "gaan", en hij maakt een fout bij beweging 3, dan gaat hij blindelings door tot de lijst af is. Tegen de tijd dat hij beseft dat hij van het pad af is, is het te laat.

De auteurs ontdekten dat de belangrijkste reden waarom eerdere methoden faalden, was dat ze de robot niet genoeg "oefening" gaven op de kleine stukjes van het plan. Stel je voor dat je een dansroutine probeert te leren door slechts één keer per dag de volledige 2 minuten durende song te oefenen. Je zou de individuele stappen nooit goed krijgen. SEAR lost dit op door een speciaal soort leraar te gebruiken, een Causal Transformer Critic. In plaats van de robot alleen te beoordelen op het eindresultaat van de hele dans, beoordeelt deze leraar de robot op elke afzonderlijke stap van de reeks terwijl deze plaatsvindt. Het is als een dansinstructeur die de muziek na elke beweging stopt om te zeggen: "Goede voetbeweging!" of "Let op je elleboog!" Dit geeft de robot een enorme hoeveelheid feedback bij elke poging, waardoor hij veel sneller en efficiënter leert.

Maar het leren van de grote chunks is slechts de helft van de strijd. De robot moet ook snel kunnen reageren. Om dit op te lossen, gebruikt SEAR een slimme strategie genaamd Random Replanning. In plaats van de robot te dwingen de hele lijst met bewegingen uit te voeren die hij heeft gepland, vertelt SEAR hem om slechts een willekeurig deel van de lijst uit te voeren—misschien alleen de eerste drie bewegingen—voordat hij stopt en vraagt: "Oké, wat is nu het plan?" gebaseerd op waar hij zich daadwerkelijk bevindt. Dit is als een GPS die niet alleen een route voor de hele reis geeft en zegt "rij maar", maar ook elke paar blokken de route herberekenen om files te vermijden. Dit houdt de "state-action coverage" van de robot hoog, wat betekent dat hij leert om met allerlei situaties om te gaan, niet alleen met de situaties waar hij perfect voor heeft gepland.

De resultaten zijn indrukwekkend. Bij het testen op de Metaworld benchmark, een verzameling van 20 zeer moeilijke robotmanipulatietaken (zoals het oppakken van objecten of het indrukken van knoppen), behaalde SEAR een succespercentage van meer dan 80%. Dit is een enorme sprong vergeleken met eerdere methoden, die slechts rond de 60% haalden. Nog interessanter is dat de onderzoekers ontdekten dat SEAR deze grote chunks kan gebruiken tijdens de training, maar vervolgens kan overschakelen naar beslissingen met één enkele stap tijdens de eigenlijke test, waardoor het effectief een supersnelle, single-step leerder wordt die getraind is door in grote chunks te denken.

Het onderzoek heeft SEAR ook getest in een "offline-to-online" setting, waarbij de robot eerst leert van een enorme dataset van eerdere video's (offline) en vervolgens probeert te verbeteren door de taak daadwerkelijk uit te voeren (online). Door SEAR's technieken toe te passen op een bestaande methode genaamd QC, zagen de onderzoekers een aanzienlijke prestatieverbetering op de OGBench cube-triple taken, wat bewijst dat deze ideeën werken zelfs wanneer de robot een voorsprong heeft door eerdere data.

De auteurs merken echter voorzichtig op dat dit geen wondermiddel is voor elke robot. Ze wijzen erop dat SEAR het beste werkt voor taken die enige tijd in beslag nemen en geen razendsnelle reacties vereisen, zoals het assembleren van meubels of het verplaatsen van objecten. Het zou niet goed werken voor zaken die directe reflexen vereisen, zoals een robot hond die door een bos rent, omdat de "chunking"-aanpak de kwaliteit van de data kan doen dalen als de robot te snel moet reageren. Maar voor de trage, doelgerichte en complexe taken van robotmanipulatie, suggereert SEAR een krachtige nieuwe manier om machines te leren vooruit te denken, sneller te leren en alert te blijven.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →