← Nieuwste papers
🤖 machine learning

WorldBagel: Uncovering the Power of Unified Multimodal Models for Vision-Language-Action-World Modeling

Dit artikel introduceert WorldBagel, een verenigd Vision-Language-Action-World modelleringsframework gebouwd op de BAGEL-architectuur, dat aantoont dat het verenigen van multimodale generatie en wereldmodellering leidt tot superieure prestaties en meer gestructureerde actierepresentaties over diverse robotische manipulatietaken heen in vergelijking met taakspecifieke alternatieven.

Oorspronkelijke auteurs: Zelin Zhao, Min Shi, Bo Yuan, Haotian Xue, Jialuo Li, Lama Moukheiber, Humphrey Shi, Yongxin Chen

Gepubliceerd 2026-07-07
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Zelin Zhao, Min Shi, Bo Yuan, Haotian Xue, Jialuo Li, Lama Moukheiber, Humphrey Shi, Yongxin Chen

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot leert om een maaltijd te koken. De meeste huidige robots zijn als chefs die alleen naar het recept (taal) en de ingrediënten (visie) kijken om te beslissen wat ze nu moeten doen. Ze zijn geweldig in het opvolgen van instructies, maar ze "begrijpen" niet echt hoe de keuken werkt. Ze weten niet intuïtief dat als je te hard tegen een pan duwt, deze van het aanrecht zal glijden, of dat er stoom opstijgt uit een kokende pan.

WorldBagel is een nieuw soort robotbrein dat dit verandert. In plaats van alleen een chef te zijn die bevelen opvolgt, fungeert het als een simulator in het hoofd van de robot. Het beslist niet alleen wat het moet doen; het stelt zich constant voor hoe de wereld eruit zal zien nadat het iets heeft gedaan.

Hier is een eenvoudige uitsplitsing van hoe het werkt, gebruikmakend van de eigen claims uit het paper:

1. De "Two-Tower" Brein

Denk aan het brein van de robot als twee gespecialiseerde experts die in hetzelfde kantoor werken:

  • De "Begrijpende" Expert (UND): Deze expert is erg goed in het bekijken van een afbeelding en het lezen van een zin om te bepalen wat de robot nu moet doen. Het is de "doener".
  • De "Genererende" Expert (GEN): Deze expert is een dromer. Hij kijkt naar de huidige scène en de beoogde actie van de robot, en vraagt zich dan af: "Als ik dit doe, hoe ziet de keuken er dan over één seconde uitzien?" Hij voorspelt de toekomst.

WorldBagel dwingt deze twee experts om hetzelfde notitieblok te delen. Ze werken niet alleen naast elkaar; ze leren van elkaar. Door te proberen de toekomst te voorspellen, wordt de robot beter in het begrijpen van het heden.

2. Het Geheime Sausje: "Fourier" Acties

Robots bewegen op een vloeiende, continue manier (zoals een hand die door de lucht glijdt), maar computers denken meestal in stappen of blokken. Het paper introduceert een slimme truc genaamd Fourier Feature Tokenization.

Stel je voor dat je een vloeiende golf probeert te beschrijven. Je zou het kunnen proberen met grillige Lego-blokjes (discretisatie), maar dat zou er hobbelig en onnauwkeurig uitzien. Of je kunt de golf beschrijven met een specifieke set muzikale noten (frequenties) die, wanneer ze samen worden gespeeld, de vloeiende golf perfect recreëren.

WorldBagel gebruikt deze "muzikale noot"-aanpak voor de bewegingen van de robot. Het vertaalt de vloeiende fysieke acties van de robot naar een gestructureerde taal van frequenties. Hierdoor kan de robot:

  • Zijn eigen bewegingen met veel hogere precisie voorspellen.
  • De "vorm" van een taak beter begrijpen dan andere methoden.

3. De "Sequence Plan" (De Verhalenverteller)

Om deze robot te leren, hebben de onderzoekers de data niet zomaar gevoerd. Ze hebben de leerervaring georganiseerd als een stripverhaal met een specifieke structuur genaamd een Sequence Plan.

Stel je een stripstrip voor waarvan de panelen door elkaar staan. Soms ziet de robot eerst de afbeelding, dan de instructie, dan de actie, en dan het resultaat. Op andere momenten ziet hij eerst het resultaat om te leren wat de oorzaak ervan was. WorldBagel husselt deze "panelen" (beelden, woorden, acties en toekomstvoorspellingen) in verschillende volgordes tijdens de training. Dit helpt de robot te leren dat:

  • Acties veranderingen in de wereld veroorzaken.
  • Taal die acties stuurt.
  • De toekomst een logisch gevolg is van het verleden.

4. Wat hebben ze gevonden?

De onderzoekers hebben WorldBagel getest op drie verschillende "keukens" (robotomgevingen):

  1. LIBIO: Een complexe simulatie met veel verschillende taken.
  2. Language Table: Een echte tafel waar een robot blokken duwt op basis van gesproken commando's.
  3. Franka: Een fysica-zware simulatie met een specifieke robotarm.

De Resultaten:

  • Beter in alles: WorldBagel was beter in het voltooien van taken dan robots die zich alleen concentreerden op de actie of zich alleen concentreerden op het voorspellen van de toekomst. Het was de "alleskunner" die ze allemaal beheerste.
  • Scherpere voorspellingen: Wanneer gevraagd werd om te raden hoe het volgende videoframe eruit zou zien, was WorldBagel veel nauwkeuriger dan zijn concurrenten.
  • Robuuster: Toen de onderzoekers "ruis" toevoegden (zoals het schudden van de hand van de robot of het veranderen van de snelheid van de bewegingen), raakte WorldBagel niet in de war. Het bleef de toekomst correct voorspellen omdat het de fysica van de beweging begreep, en niet alleen het visuele patroon.

De Kernboodschap

Het paper betoogt dat door Visie (zien), Taal (lezen), Actie (doen) en Wereldmodellering (zich de toekomst voorstellen) te combineren in één enkel, verenigd systeem, robots sneller leren en betrouwbaarder worden.

WorldBagel bewijst dat als je een robot leert om de gevolgen van zijn acties te visualiseren, het een veel slimmer en capabeler werker wordt. De code en het model zullen worden vrijgegeven zodat anderen voort kunnen bouwen op deze "verenigde" aanpak.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →