← Nieuwste papers
🤖 machine learning

Robometer: Scaling General-Purpose Robotic Reward Models via Trajectory Comparisons

Het artikel introduceert Robometer, een schaalbaar beloningsmodelleringkader dat supervisie op frame-niveau combineert met voorkeurslering op basis van trajectvergelijking, getraind op het grootschalige RBM-1M-dataset om effectief generaliseerbare beloningsfuncties te leren uit diverse expert- en suboptimale trajecten.

Oorspronkelijke auteurs: Anthony Liang, Yigit Korkmaz, Jiahui Zhang, Minyoung Hwang, Abrar Anwar, Sidhant Kaushik, Aditya Shah, Alex S. Huang, Luke Zettlemoyer, Dieter Fox, Yu Xiang, Anqi Li, Andreea Bobu, Abhishek Gupta, Ste
Gepubliceerd 2026-05-15
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Anthony Liang, Yigit Korkmaz, Jiahui Zhang, Minyoung Hwang, Abrar Anwar, Sidhant Kaushik, Aditya Shah, Alex S. Huang, Luke Zettlemoyer, Dieter Fox, Yu Xiang, Anqi Li, Andreea Bobu, Abhishek Gupta, Stephen Tu, Erdem Biyik, Jesse Zhang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot leert koken. In het verleden moest je, om de robot te leren, optreden als een strenge rechter die elke seconde van zijn bewegingen observeerde en hem een nauwkeurige score toekende (zoals "7,5 van de 10") voor hoe goed hij uien snijdt. Als de robot het mes liet vallen, moest je precies bepalen wanneer de score daalde en met hoeveel. Dit is ontzettend moeilijk, vooral wanneer de robot faalt, en het betekent dat je de duizenden "mislukte" pogingen die robots in de echte wereld doen, niet kunt gebruiken omdat ze te rommelig zijn om te beoordelen.

ROBOMETER is een nieuw systeem dat de manier waarop we robots leren verandert door een slimmere, meer menselijke aanpak voor beoordeling te gebruiken.

De Kernidee: Vergelijken in plaats van Beoordelen

In plaats van te proberen elke individuele moment een perfecte score te geven, leert ROBOMETER door twee verschillende pogingen voor dezelfde taak te vergelijken.

Denk eraan als een jurylid bij een talentenjacht. In plaats van een contestant een score van 8,2 van de 10 te geven, kijkt de jurylid gewoon naar twee optredens en zegt: "Optreden A was duidelijk beter dan Optreden B."

  • De Oude Manier: Je moet kijken hoe een robot faalt bij het zetten van een kop op een tafel en proberen precies te berekenen hoe "slecht" die mislukking was.
  • De ROBOMETER Manier: Je toont de robot een video van een mens die het perfect doet en een video van de robot die de kop laat vallen. Het systeem leert: "De menselijke video is beter." Het hoeft niet te weten waarom of een specifiek getal te geven; het leert gewoon de volgorde van "goed" versus "slecht".

De "Grote Bibliotheek" van Fouten (RBM-1M)

Om dit systeem te leren, bouwden de onderzoekers een enorme bibliotheek genaamd RBM-1M.

  • Het Oude Probleem: De meeste robottrainingsbibliotheken bevatten alleen "perfecte" video's. Als een robot een kop laat vallen, wordt die video in de prullenbak gegooid omdat het moeilijk is om het te beoordelen.
  • De Nieuwe Oplossing: Deze bibliotheek bevat 1 miljoen video's van 21 verschillende soorten robots (van enkele armen tot mensachtige handen). Cruciaal is dat het vol zit met fouten, mislukkingen en onhandige pogingen. Omdat ROBOMETER leert door te vergelijken (bijvoorbeeld: "Deze mislukte poging is slechter dan die succesvolle"), kan het daadwerkelijk leren van de prullenbak van mislukte video's. Het behandelt mislukkingen als waardevolle lessen over wat je niet moet doen.

Hoe Het Werkt (De Twee-Stappen Dans)

ROBOMETER leert met twee specifieke trucs tegelijkertijd:

  1. De "Vooruitgang" Check: Het bekijkt een enkele video en probeert te raden: "Hoe ver is deze taak gevorderd?" (0% tot 100%). Dit verankert het begrip van de robot voor tijd en vooruitgang.
  2. De "Voorkeur" Check: Het bekijkt twee video's naast elkaar en beslist: "Welke heeft de taak beter uitgevoerd?" Dit leert de robot de kwaliteit van de actie te begrijpen, zelfs als het een totale mislukking is.

Door deze te combineren, leert de robot een "gevoel" voor succes dat werkt, zelfs wanneer het naar een robot kijkt die het nog nooit heeft gezien, in een kamer waar het nog nooit is geweest.

Wat Het Eigenlijk Doet (Bewezen Resultaten)

Het artikel toont aan dat dit systeem beter werkt dan eerdere methoden in vier specifieke, real-world scenario's:

  1. Automatisch Online Leren: Wanneer een robot een taak in real-time leert (zoals een kom op een tafel zetten), fungeert ROBOMETER als een coach die de robot direct vertelt: "Je doet het verkeerd," en het begeleidt om de fout te herstellen. Het hielp een robot om het slagingspercentage te verbeteren van 20% naar 85% in een rommelige keuken, terwijl oudere methoden vastzaten op 55%.
  2. Leren van Rommelige Data (Offline RL): Als je een mix hebt van perfecte video's en rommelige, mislukte video's, kan ROBOMETER ze sorteren om een nieuwe robot te leren. Het verbeterde slagingspercentages met 2,4 keer in vergelijking met de beste eerdere hulpmiddelen.
  3. Het Goede Spotten (Data Filtering): Stel je een enorme stapel videoclips voor en je moet de 10 beste vinden om een robot te leren hoe je "een pot roert". ROBOMETER is veel beter in het vinden van de relevante, succesvolle clips en het negeren van mislukkingen dan andere zoektools. Dit leidde tot een 4,5 keer verbetering in het vermogen van de robot om de taak te leren.
  4. Mislukkingen Opmerken: Als een robot vastzit, oscilleert (waggelt heen en weer zonder te bewegen) of een object laat vallen, kan ROBOMETER deze mislukking direct detecteren zonder dat er verteld moet worden hoe een mislukking eruit ziet. Het identificeerde correct mislukkingen in 81% van de gevallen, en sloeg andere systemen.

De Conclusie

ROBOMETER is een "universeel beloningmodel" dat robots voorkomt dat ze een mens nodig hebben om elke seconde van hun werk te beoordelen. Door te leren "beter" versus "slechter" te vergelijken met behulp van een enorme bibliotheek van zowel successen als mislukkingen, helpt het robots sneller te leren, fouten beter te hanteren en zich aan te passen aan nieuwe taken en nieuwe robotlichamen zonder dat ze vanaf nul opnieuw getraind hoeven te worden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →