← Nieuwste papers
🤖 machine learning

Residual Reward Models: Leveraging Prior Knowledge for Efficient Preference-based Reinforcement Learning in Robotics

Dit artikel introduceert Residual Reward Models (RRM), een methode die de beloningsfunctie ontbindt in een component van voorkennis en een leerbare residuele offset om de sample-efficiëntie en de toepasbaarheid in de echte wereld van voorkeursgebaseerd reinforcement learning in de robotica aanzienlijk te verbeteren.

Oorspronkelijke auteurs: Chenyang Cao, Miguel Rogel-García, Mohamed Nabail, Xueqian Wang, Nicholas Rhinehart

Gepubliceerd 2026-08-28
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Chenyang Cao, Miguel Rogel-García, Mohamed Nabail, Xueqian Wang, Nicholas Rhinehart

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het aanleren van een complexe fysieke taak aan een robot, zoals het indrukken van een knop of het oppakken van een kwetsbaar object, is een moeilijke puzzel voor ingenieurs. In de wereld van de robotica heeft de machine een set instructies nodig die vertelt wat hij goed doet en wat hij slecht doet. Deze set instructies wordt een beloningsfunctie genoemd. Als de instructies vaag of fout zijn, kan de robot leren om het systeem te omzeilen door een manier te vinden om een hoge score te halen zonder de taak daadwerkelijk te voltooien, of hij kan simpelweg opgeven omdat hij niet begrijpt wat er van hem wordt verwacht. Traditioneel moeten mensen deze instructies met de hand schrijven, waarbij ze gokken welke bewegingen tot succes zullen leiden. Dit proces is traag, duur en faalt vaak wanneer de robot een situatie tegenkomt die de mens niet had voorzien.

Een nieuwere aanpak, bekend als preferentie-gebaseerd leren, probeert dit op te lossen door mensen simpelweg te laten zeggen welke van twee robotbewegingen er beter uitziet, in plaats van complexe regels te schrijven. Hoewel dit eenvoudiger klinkt, creëert het een nieuw probleem: de robot moet duizenden van deze vergelijkingen zien om iets nuttigs te leren. In een echte omgeving is het vragen aan een mens om herhaaldelijk een robot te observeren en te beoordelen onpraktisch en kostbaar. De robot leert te langzaam, en de kosten van menselijke aandacht vormen een flessenhals die voorkomt dat deze machines bruikbaar zijn buiten een gecontroleerd laboratorium.

Onderzoekers aan de Universiteit van Toronto en de Tsinghua Universiteit hebben een methode ontwikkeld om dit proces aanzienlijk te versnellen. Ze noemen hun aanpak het Residual Reward Model (Residuele Beloningsmodel). In plaats van vanaf nul te beginnen en de robot alles vanaf nul te laten leren door een mens, stelt deze methode de robot in staat om te starten met een "best guess" (een beste gok) over hoe de taak uitgevoerd moet worden. Deze gok kan afkomstig zijn van een simpele regel geschreven door een ingenieur, een beschrijving gegenereerd door een groot taalmodel, of zelfs een beloningsfunctie die is geleerd door een mens één keer een taak te laten uitvoeren. De robot gebruikt deze initiële gok vervolgens als fundament. Wanneer een mens een voorkeur aangeeft door te zeggen: "deze beweging was beter dan die," probeert de robot niet de hele regelset te herschrijven. In plaats daarvan leert de robot alleen het kleine verschil, of de "residue", dat nodig is om de initiële gok te corrigeren.

Denk aan een student die al de basisregels van een sport kent, maar een coach nodig heeft om specifieke nuances in de techniek aan te wijzen. De student hoeft niet opnieuw te leren hoe hij moet rennen of gooien; hij hoeft alleen zijn vorm licht aan te passen op basis van de feedback van de coach. Op dezelfde manier gebruikt de robot de menselijke feedback om kleine, precieze aanpassingen te maken aan zijn bestaande begrip van de taak. Deze structuur houdt het leerproces stabiel. Als de initiële gok imperfect is, kan de robot nog steeds leren, omdat hij alleen de fouten hoeft te corrigeren in plaats van het hele concept vanuit het niets te ontdekken.

De onderzoekers testten dit idee in een verscheidenheid aan gesimuleerde omgevingen, waaronder taken waarbij een robotarm knoppen moest indrukken, objecten in een bak moest vegen of deuren moest openen. Ze testten het ook op een echte fysieke robot, een Franka Panda-arm, in een laboratoriumsetting. In elk geval was de methode die de "best guess" plus de kleine correcties gebruikte, veel sneller dan methoden die probeerden alles alleen uit menselijke voorkeuren te leren. In de simulaties bereikte de robot die deze nieuwe methode gebruikte in veel taken een perfect succespercentage, terwijl hij veel minder menselijke oordelen vereiste. Bijvoorbeeld, in een taak waarbij een robot een knop moest indrukken, bleef een standaardmethode die vanaf nul probeerde te leren steken op een succespercentage van twintig procent, terwijl de nieuwe methode honderd procent bereikte.

De studie toonde ook aan dat deze aanpak robuust is tegen fouten. Als de initiële "best guess" iets fout was, of als de menselijke feedback af en toe ruis bevat of inconsistent was, kon de robot nog steeds het juiste gedrag aanleren. De initiële gok fungeerde als een vangnet, waardoor de robot niet in nutteloze gedragingen verviel, terwijl de correcties ervoor zorgden dat hij uiteindelijk het juiste pad vond. Dit was bijzonder belangrijk toen de onderzoekers het systeem testten met zeer beperkte menselijke feedback. Zelfs toen de mens slechts een klein aantal oordelen moest geven, bleef de robot die de residuele methode gebruikte verbeteren, terwijl de standaardmethode niets nuttigs leerde.

Misschien wel het belangrijkste is dat de onderzoekers hebben aangetoond dat dit leren direct kan worden overgedragen van een computersimulatie naar een echte fysieke robot zonder extra afstemming. Ze trainden de robot in een virtuele omgeving en plaatsten de geleerde strategie vervolgens op een echte Franka Panda-arm om taken uit te voeren zoals het reiken naar een object, het duwen van een blok of het oppakken en verplaatsen van iets. De robot die met de residuele methode werd getraind, slaagde in deze real-world taken veel sneller dan de baseline-methode. In een moeilijke taak waarbij een object moest worden geduwd, slaagde de standaardmethode slechts de helft van de tijd na uitgebreide training, terwijl de nieuwe methode met dezelfde hoeveelheid trainingstijd een succespercentage van vijfentastig procent behaalde.

De bevindingen suggereren dat door voorkennis te combineren met menselijke feedback, robots complexe fysieke vaardigheden kunnen leren met veel minder menselijk toezicht dan voorheen mogelijk werd geacht. Dit betekent niet dat de robot vooraf alles weet, maar hij gebruikt wat hij al weet als startpunt om het meeste te halen uit elk stukje menselijke feedback dat hij ontvangt. Deze efficiëntie zou een cruciale stap kunnen zijn naar het praktisch inzetbaar maken van robot-assistenten voor echte banen, waar tijd en menselijke aandacht beperkte middelen zijn. Het werk bevestigt dat het geven van een voorsprong aan een robot, zelfs een ruwe voorsprong, ervoor zorgt dat hij uit menselijke voorkeuren kan leren op een manier die zowel sneller als betrouwbaarder is dan beginnen met een leeg blad.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →