← Nieuwste papers
💻 computer science

Video-Based Optimal Transport for Feedback-Efficient Offline Preference-Based Reinforcement Learning

Het artikel introduceert VOTP, een semi-gesuperviseerd framework dat Video Foundation Models en optimale transport gebruikt om hoogwaardige pseudo-labels te genereren met minimale menselijke feedback, wat efficiënt en robuust beloningsleren voor offline preference-based reinforcement learning mogelijk maakt.

Oorspronkelijke auteurs: Tung M. Luu, Hwanhee Kim, Younghwan Lee, Chang D. Yoo

Gepubliceerd 2026-06-16
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Tung M. Luu, Hwanhee Kim, Younghwan Lee, Chang D. Yoo

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot probeert te leren hoe hij een complexe taak moet uitvoeren, zoals het openen van een lade of lopen zonder te struikelen. In de wereld van robotica heeft de robot een "beloningssysteem" nodig om te weten wat hij goed doet. Meestal moeten menselijke ingenieurs nauwgezet code schrijven om de robot te vertellen: "Goed gedaan, je hebt je arm omhoog bewogen," of "Fout gedaan, je hebt het object laten vallen." Dit is alsof je probeert een recept te schrijven voor een gerecht dat je nog nooit hebt gekookt; het is moeilijk, en je kunt de instructies verkeerd krijgen.

Om dit op te lossen, gebruiken wetenschappers Preference-Based Reinforcement Learning (PbRL). In plaats van code te schrijven, laten ze de robot twee video's zien van hem terwijl hij de taak uitvoert en vragen ze aan een mens: "Welke ziet er beter uit?" De robot leert van deze keuzes.

Het Probleem:
Een mens vragen om video's te bekijken en te kiezen welke "beter" is, is traag en duur. Om een robot goed te leren, moet je misschien duizenden van deze vergelijkingen maken. Het is alsof je een kind probeert te leren fietsen door ze na elke wankeling te stoppen om te vragen: "Was dat goed?" Dat duurt eeuwen.

De Oplossing: VOTP
Het artikel introduceert een nieuwe methode genaamd VOTP (Video-based Optimal Transport Preference). Denk aan VOTP als een slimme assistent die helpt om de robot te leren met heel weinig menselijke vragen.

Zo werkt het, met behulp van een eenvoudige analogie:

1. Het "Slimme Oog" (Video Foundation Models)

Eerst gebruikt VOTP een vooraf getraind "Slim Oog" (een Video Foundation Model). Stel je voor dat dit oog miljoenen uren aan menselijke video's heeft bekeken—mensen die dansen, koken, rennen en spelen. Omdat het zoveel heeft gezien, begrijpt het wat "goede beweging" is, zelfs als het nog nooit een robot heeft gezien. Het kan een video van een bewegende robot omzetten in een wiskundige "vingerafdruk" die de essentie van de actie vastlegt.

2. De "Matchmaker" (Optimal Transport)

Dit is het magische deel.

  • De Opstelling: Je geeft het systeem een klein handjevol voorbeelden (bijvoorbeeld 10 video-paren) waarbij een mens al heeft gezegd: "Video A is beter dan Video B."
  • De Berg Data: Je hebt ook een enorme berg ongelabelde video's (duizenden paren) waarover nog geen mens iets heeft gezegd.
  • De Matchmaking: VOTP gebruikt een wiskundig hulpmiddel genaamd Optimal Transport. Stel je voor dat je een stapel "Goede" vingerafdrukken en een stapel "Slechte" vingerafdrukken hebt van je 10 menselijke voorbeelden. Nu heb je een enorme stapel "Onbekende" vingerafdrukken van de ongelabelde video's.
  • De Verbinding: Optimal Transport werkt als een super-efficiënte matchmaker. Het kijkt naar een "Onbekende" video en vraagt: "Waar lijkt deze video het meest op van de 10 door mensen goedgekeurde video's?" Het raadt niet alleen; het berekent de beste manier om de onbekende video's te verbinden met de bekende video's op basis van hoe vergelijkbaar hun "vingerafdrukken" zijn.

3. De "Inference" (Pseudo-labels)

Zodra de matchmaker een onbekende video verbindt met een bekende "Goede" video, zegt VOTP: "Als deze onbekende video op de video lijkt die de mens leuk vond, dan moet deze onbekende video ook goed zijn!" Het wijst automatisch een label (een "pseudo-label") toe aan de duizenden video's die je geen tijd had om te bekijken.

4. Het Resultaat

Nu, in plaats van de robot te leren met slechts 10 menselijke voorbeelden, leert de robot van 10 menselijke voorbeelden plus duizenden automatisch gelabelde voorbeelden. De robot leert veel sneller en beter, ook al heb je de mens maar een heel klein beetje geholpen.

Wat het artikel vond

De auteurs testten dit op robots die moesten lopen (locomotie) en op robots die objecten moesten verplaatsen (manipulatie). Ze testten het ook op een echte robotarm in een laboratorium.

  • Minder Menselijk Werk: VOTP behaalde topresultaten met slechts een handjevol menselijke labels (soms zo weinig als 10).
  • Beter dan de Rest: Het versloeg andere methoden die hetzelfde probeerden te doen, en had vaak honderden of duizenden labels nodig om vergelijkbare resultaten te behalen.
  • Robuustheid: Zelfs als de belichting veranderde of er afleidende zaken op de achtergrond waren (zoals een video die speelde op een tv achter de robot), wist VOTP nog steeds wat goed en wat slecht was.
  • De Werkelijkheid: Toen ze het op een echte robotarm testten die een banaan optilde of een lade opende, hielp VOTP de robot veel vaker te slagen dan methoden die alleen vertrouwden op de weinige menselijke labels.

Kortom: VOTP is een manier om robots te leren door ze een paar voorbeelden te laten zien van wat mensen leuk vinden, en vervolgens een "slim oog" en een "wiskundige matchmaker" te gebruiken om zelf uit te vogelen wat de robot voor de rest van de video's moet doen. Het bespaart mensen het saaie, repetitieve werk van het labelen van duizenden video's.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →