← Nieuwste papers
💻 computer science

SARM: Stage-Aware Reward Modeling for Long Horizon Robot Manipulation

Het artikel stelt SARM voor, een fasebewust, op video gebaseerd beloningsmodelleringkader dat natuurlijke taalannotaties benut om consistente supervisie te genereren voor taken met een lange horizon en veel contact, zoals het vouwen van een T-shirt, wat de training van downstream-beleid aanzienlijk verbetert via een nieuwe methode genaamd Reward-Aligned Behavior Cloning (RA-BC).

Oorspronkelijke auteurs: Qianzhong Chen, Justin Yu, Mac Schwager, Pieter Abbeel, Yide Shentu, Philipp Wu

Gepubliceerd 2026-04-28
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Qianzhong Chen, Justin Yu, Mac Schwager, Pieter Abbeel, Yide Shentu, Philipp Wu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je probeert een robot een T-shirt te laten vouwen. Dit is niet zomaar een simpele "pak op en leg neer"-taak; het is een lang, ingewikkeld dansje waarbij je moet grijpen, kreukels gladstrijken, mouwen vouwen en het shirt in een hoekje vouwen. Als het shirt gekreukt is, wordt het nog moeilijker.

Het probleem waar de auteurs van dit artikel mee te maken kregen, is dat het leren van robots lijkt op het leren van een kind door hen video's te laten zien, maar sommige van die video's zijn slecht.

Het probleem: Slechte video's en verwarrende timers

In het verleden verzamelden onderzoekers, om een robot te leren, uren aan video's van mensen die de taak uitvoerden. Ze vertelden de robot: "Doe precies wat je in de video ziet." Dit heet Imitatielearning.

Er zijn echter twee grote problemen:

  1. De video's zijn rommelig: Sommige menselijke demonstraties zijn perfect. Anderen zijn onhandig, duren te lang of mislukken zelfs halverwege. Als je de robot met alle video's evenveel leert, raakt hij in de war. Hij leert de slechte gewoonten net zo goed als de goede.
  2. De "timer"-valstrik: Om de robot te leren, zeiden onderzoekers vroeger: "Op 10 seconden moet je hier zijn; op 20 seconden moet je daar zijn." Maar mensen werken niet volgens een strikte timer. De ene persoon strijkt het shirt in 5 seconden glad; de andere doet er 20 over. Als je alleen seconden telt, krijgt de robot een verwarde kaart. Hij kan denken dat een shirt "halfgevouwen" is, alleen maar omdat er 10 seconden voorbij zijn, zelfs als het shirt nog steeds een gekreukt bal is.

De oplossing: SARM (de "Stadium-bewuste" coach)

De auteurs hebben een nieuw systeem bedacht dat SARM (Stage-Aware Reward Modeling) heet. Denk aan SARM als een slimme coach die de video van de robot bekijkt en het verhaal van de taak begrijpt, niet alleen de klok.

In plaats van te vragen: "Hoeveel seconden zijn er voorbijgegaan?", vraagt SARM: "In welk stadium van de taak zitten we?"

  • De analogie: Stel je een filmscript voor. Een slechte coach zegt: "Op minuut 5 moet de held vechten." Een goede coach (SARM) zegt: "De held zit momenteel in de 'Vechten'-scene. Wint hij? Verliest hij? Zijn ze net begonnen met vechten?"
  • Hoe het werkt: SARM kijkt naar de video en de tekstbeschrijving (bijvoorbeeld: "Grijp het shirt", "Vlak het shirt"). Het splitst de lange taak op in kleinere "scenes" (stadia). Vervolgens beoordeelt het de voortgang van de robot binnen die scene. Heeft de robot het shirt succesvol gegrepen? Is het nu aan het gladstrijken?
  • Het resultaat: SARM kan naar een rommelige video kijken waar de robot een fout maakt, beseffen: "Oh, je zit vast in het 'Gladstrijken'-stadium", en een score geven die die realiteit weerspiegelt, in plaats van alleen te zeggen: "Je bent te laat, dus je krijgt een slechte score."

De tweede stap: RA-BC (de "Slimme filter")

Zodra SARM is getraind om een goede rechter te zijn, hebben de auteurs het gebruikt om RA-BC (Reward-Aligned Behavior Cloning) te bouwen.

  • De analogie: Stel je voor dat je een student bent die zich voorbereidt op een toets. Je hebt een stapel van 100 oefentoetsen.
    • Oude methode (Vanilla BC): Je bestudeert elke toets evenveel, inclusief die waarbij de leraar een fout maakte of de student bedroog. Je verspill tijd aan slechte voorbeelden.
    • RA-BC-methode: Je gebruikt je "Slimme coach" (SARM) om eerst de oefentoetsen te beoordelen. De coach zegt: "Deze toets is perfect, bestudeer hem goed! Deze is rommelig, sla hem over. Deze is oké, bestudeer hem een beetje."
  • Hoe het werkt: RA-BC bekijkt alle menselijke video's, gebruikt SARM om ze te scoren en herweegt vervolgens de training. Het vertelt de robot: "Besteed extra aandacht aan de perfecte video's en negeer de rommelige."

De resultaten: T-shirts vouwen

Het team testte dit op een echte robot die T-shirts probeerde te vouwen, inclusief de zeer moeilijke taak om te beginnen met een gekreukt shirt.

  • De oude manier: Zonder hun nieuwe systeem slaagde de robot slechts 8% van de keren met een plat shirt en 0% met een gekreukt shirt. Het was volledig verdwaald.
  • De nieuwe manier (SARM + RA-BC):
    • Met een plat shirt: 83% succes.
    • Met een gekreukt shirt: 67% succes.

Waarom dit belangrijk is

Het artikel toont aan dat voor robots om complexe, lange taken uit te voeren (zoals wasgoed vouwen of borden uitladen), kwaliteit van de data belangrijker is dan kwantiteit van de data. Je hebt niet alleen meer video's nodig; je hebt een manier nodig om te begrijpen welke video's goed zijn en waar de robot zich in het proces bevindt.

Door een "Stadium-bewuste" coach te gebruiken om het verhaal van de taak te begrijpen en een "Slimme filter" om de beste voorbeelden te kiezen, leerden ze een robot iets te doen dat daarvoor bijna onmogelijk voor hem was.

Kortom: Ze leerden de robot om te stoppen met het tellen van seconden en te beginnen met het begrijpen van het verhaal van de taak, waardoor het kon leren van de beste voorbeelden en de fouten kon negeren.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →