← Nieuwste papers
💻 computer science

BEACON: Cross-Domain Co-Training of Generative Robot Policies via Best-Effort Adaptation

BEACON is een theoriegedreven raamwerk dat de robuustheid en data-efficiëntie van generatieve robotbeleid in cross-domein settings verbetert door co-training te benaderen als een discrepantiebewust belangshervetingsprobleem, dat gezamenlijk een op diffusie gebaseerd visuo-motorisch beleid en per-stuk brongewichten optimaliseert om de generalisatiefout in het doeldomein te minimaliseren.

Oorspronkelijke auteurs: Antong Zhang, Han Qi, Heng Yang

Gepubliceerd 2026-05-13
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Antong Zhang, Han Qi, Heng Yang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je probeert een robotarm te leren blokken te stapelen. Je hebt twee soorten trainingsdata:

  1. De "Bron"-data: Een enorme bibliotheek met video's die robots tonen die de taak uitvoeren in een perfecte, computergegenereerde wereld (simulatie). Er zijn duizenden van deze video's, maar de belichting, texturen en fysica zijn iets anders dan in de echte wereld.
  2. De "Doel"-data: Een klein, kostbaar handjevol video's die een echte robot tonen die de taak uitvoert in je daadwerkelijke keuken. Deze zijn duur en moeilijk te verkrijgen, maar ze zijn de enige die echt tellen voor de uiteindelijke taak.

Het Probleem:
Als je gewoon alle computervideo's mengt met de paar echte video's en de robot gelijkwaardig leert van allemaal, raakt de robot in de war. De computerwereld is te verschillend van de echte wereld (verschillende wrijving, belichting, camerahoeken). De robot zou dan misschien perfect blokken kunnen stapelen in de simulatie, maar volledig falen in de echte keuken.

Als je alleen de paar echte video's gebruikt, leert de robot niet genoeg en faalt hij in het generaliseren.

De Oplossing: BEACON
Het artikel introduceert een nieuwe methode genaamd BEACON (Best-Effort Adaptation for Cross-Domain Co-Training). Denk aan BEACON niet als een leraar, maar als een slimme redacteur of een curator.

In plaats van elke trainingsvideo gelijk te behandelen, wijst BEACON een "relevantiescore" (een gewicht) toe aan elke afzonderlijke video in de enorme bibliotheek.

  • Het "Best-Effort"-idee: Het systeem vraagt: "Welke van deze duizenden nepvideo's lijken en voelen er eigenlijk uit als de paar echte video's die ik heb?"
  • Het redactieproces:
    • Als een computervideo een robot toont die zich op een manier beweegt die zeer lijkt op de echte robot, geeft BEACON deze een hoge score. Het zegt: "Gebruik deze! Hij is nuttig!"
    • Als een computervideo iets vreemds of onrealistisch toont (zoals een blok dat over ijs glijdt terwijl echte blokken over hout glijden), geeft BEACON deze een lage score (of nul). Het zegt: "Negeer deze. Het zal de robot in de war brengen."

Hoe het werkt (De magische truc):
Meestal proberen mensen de computerwereld en de echte wereld gelijk te maken door de kleuren of texturen te veranderen (zoals het plaatsen van een filter op een foto). BEACON doet iets anders.

Het probeert niet de werelden gelijk te laten lijken. In plaats daarvan selecteert het de specifieke momenten in de computerwereld die al nuttig zijn voor de echte wereld.

  • Analogie: Stel je voor dat je een specifiek gerecht leert koken. Je hebt één recept van je oma (de echte data) en duizend recepten van een beroemde tv-chef die andere ingrediënten gebruikt (de brondata).
    • Oude manier: Je probeert de ingrediënten van de tv-chef te laten overeenkomen met die van je oma, of je mengt ze allemaal gewoon door elkaar.
    • BEACON-methode: Je leest de duizend recepten van de tv-chef en pakt alleen de stappen eruit die overeenkomen met de techniek van je oma. Je negeert de rest. Je leert van de paar stappen van je oma, maar je vult de gaten aan met de beste overeenkomstige stappen van de tv-chef.

Het verrassende resultaat:
Het artikel vond dat door deze "slimme selectie" te doen, het brein van de robot (zijn neurale netwerk) van nature begon de echte wereld beter te begrijpen. Hoewel het systeem niet expliciet werd verteld om "kenmerken af te stemmen" of "patronen te matchen", zorgde de daad van het selecteren van de juiste data ervoor dat de robot automatisch de juiste patronen leerde. Het is als een student die alleen de meest relevante oefenvragen bestudeert en daardoor van nature de onderliggende logica van het vak begint te zien, zonder dat er een aparte les over "logica" nodig is.

Wat ze testten:
Ze testten dit op een robotarm die drie taken uitvoerde: blokken stapelen, mokken opruimen en een naald inslaan. Ze vergeleken BEACON met:

  1. Het gebruik van alleen de paar echte video's.
  2. Het gelijkmatig mengen van alle video's.
  3. Het gebruik van andere methoden die proberen de computer- en echte werelden gelijk te laten lijken.

De uitkomst:
BEACON won consequent. De robot leerde sneller, gebruikte minder data uit de echte wereld en was veel robuuster wanneer de omgeving veranderde (zoals het verplaatsen van de camera of het veranderen van de textuur van de tafel). Het bewees dat het zijn als een slimme curator van data krachtiger is dan proberen de data gelijk te laten lijken.

Kortom:
BEACON is een raamwerk dat robots leert door te zeggen: "We hebben veel nepdata en een beetje echte data. Laten we de nepdingen die niet passen negeren, en ons intensief richten op de nepdingen die wel passen, zodat we de echte taak efficiënt kunnen leren."

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →