← Nieuwste papers
💻 computer science

Robots Need More than VLA and World Models

Dit position paper betoogt dat het bereiken van algemene robotintelligentie vereist dat men verder gaat dan eenvoudige beleidsschaalbaarheid om de kritieke flessenhals aan te pakken van het omzetten van ongestructureerde gedragsdata naar gegronde robot-supervisie via vier sleutelinterfaces: autolabelling, bewegingsretargeting, natuurkundig gegronde redenering en beloningsinferentie.

Oorspronkelijke auteurs: Elis Karcini, Faisal Mehrban, Quang Nguyen, Mac Schwager, Arash Ajoudani, Cesar Cadena, Jan Peters, Marco Hutter, Haitham Bou-Ammar

Gepubliceerd 2026-06-08
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Elis Karcini, Faisal Mehrban, Quang Nguyen, Mac Schwager, Arash Ajoudani, Cesar Cadena, Jan Peters, Marco Hutter, Haitham Bou-Ammar

Oorspronkelijk artikel vrijgegeven aan het publieke domein onder CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Probleem: Robots Zitten Vast in een "Textbook" Wereld

Stel je voor dat je een kind probeert te leren hoe je moet koken. Momenteel is de beste manier om dit te doen door een meesterkok naast het kind te laten staan, die precies laat zien hoe je een ui snijdt, waarna het kind de handbewegingen kopieert. In de robotica wordt dit Robot-Native Supervision genoemd. We verzamelen data waarbij een robot de taak daadwerkelijk uitvoert, en we leren de AI om die specifieke bewegingen te kopiëren.

Het artikel betoogt dat hoewel deze methode robots slimmer heeft gemaakt, we tegen een muur zijn gelopen. We kunnen niet simpelweg blijven meer "chef-demonstraties" van robots verzamelen omdat:

  1. Het ongelooflijk duur en traag is om robots alles te laten doen.
  2. De echte wereld vol staat met andere manieren om te leren. Er zijn miljarden video's van mensen die koken, fabrieken die draaien en mensen die dingen repareren op het internet.

De Analogie: Stel je voor dat je een nieuwe taal probeert te leren.

  • Huidige Aanpak (Robot-Native): Je leert alleen van een leraar die alleen tot jou spreekt in een klaslokaal, met gebruik van een specifieke tekstbundel. Je hoort de taal nooit gesproken op straat, in films of door vrienden.
  • Het Argument van het Artikel: De wereld zit vol met mensen die die taal spreken (video's, menselijke bewegingen, simulaties). Maar op dit moment kunnen robots deze "straatgesprekken" niet begrijpen omdat ze de woordenlijst en de grammatica regels missen die ruis vertalen naar iets wat een robot kan gebruiken.

De auteurs zeggen: "We hebben niet alleen grotere hersenen nodig (grotere AI-modellen); we hebben betere vertalers nodig om de rommelige echte wereld om te zetten in een taal waar een robot van kan leren."


De Ontbrekende "Vertaalset"

Het artikel stelt voor dat om de volgende generatie robots te ontsluiten, we vier specifieke instrumenten (of "interfaces") nodig hebben om de echte wereld te vertalen naar robotinstructies. Beschouw dit als de ontbrekende onderdelen van een vertaalset.

1. De "Autolabelling Engine" (De Detective)

Het Problem: Als je een video bekijkt van een mens die een pot opent, laat de video pixels bewegen. De video vertelt de robot niet: "De hand raakte de deksel aan," "De kracht was 5 Newton," of "De taak is nu 'draaien/schroeven'."
De Oplossing: We hebben een systeem nodig dat werkt als een superdetective. Het bekijkt rommelige video's, menselijke bewegingssensoren of robotfouten en schrijft automatisch de belangrijke aantekeningen op.

  • Wat het doet: Het zet een wazige video van een persoon die een beker laat vallen om in een gestructureerd rapport: "Gebeurtenis: Contact verloren. Object: Beker. Status: Gebroken. Fase Taak: Mislukking."
  • Waarom het belangrijk is: Het verandert ruwe, ongeorganiseerde beelden in een "tekstboek" waar de robot daadwerkelijk van kan studeren.

2. De "Retargeting Interface" (De Vertaler)

Het Problem: Mensen hebben twee armen en vijf vingers. Een robot heeft misschien één klauw of een ander aantal gewrichten. Als je een robot simpelweg vertelt om "de hoek van de menselijke arm te kopiëren", kan hij zijn eigen arm breken of de opdracht niet uitvoend maken.
De Oplossing: We hebben een vertaler nodig die niet bewegingen kopieert, maar resultaten kopieert.

  • De Analogie: Stel je voor dat je een deur wilt openen. Je geeft niet om het feit of de mens de deur met de elleboog of met de hand opent; je wilt dat de deur opengaat.
  • Wat het doet: Het kijkt naar wat de mens heeft bereikt (de deur is open) en bedenkt hoe deze specifieke robot datzelfde resultaat kan bereiken met zijn eigen unieke lichaam. Het behoudt het "doel" maar verandert de "hoe".

3. De "Physics-Grounded World Model" (De Simulator)

Het Probleem: Sommige AI-modellen zijn goed in het maken van mooie video's van de toekomst (bijv. "De beker zal vallen"). Maar ze kunnen de natuurkunde negeren. Ze kunnen laten zien dat de beker door de tafel valt of in de lucht zweeft. Een robot moet weten of de beker echt kapot gaat of dat hij zal glijden.
De Oplossing: We hebben een "glazen bol" nodig die niet alleen raadt hoe het plaatje eruit zal zien, maar die de natuurkunde voorspelt.

  • Wat het doet: Het beantwoordt vragen als: "Als ik deze blok hier tegenaan duw, kantelt hij dan om? Raakt hij de muur? Is de wrijving genoeg om hem te stoppen?"
  • Waarom het belangrijk is: Het stelt de robot in staat om verschillende uitkomsten te "verbeelden" en te leren van fouten zonder daadwerkelijk iets in de echte wereld kapot te maken.

4. De "Reward Grounding Loop" (De Coach)

Het Problem: Wanneer een robot faalt, ziet hij alleen een video van een rommel. Hij weet niet waarom hij faalde. Was hij te traag? Duwde hij te hard? Begreep hij het doel niet?
De Oplossing: We hebben een systeem nodig dat werkt als een sportcoach. Het bekijkt de poging van de robot en geeft specifieke feedback op basis van het doel.

  • De Analogie: Als een basketballer een schot mist, zegt een algemene waarnemer alleen "Gemist". Een coach zegt: "Je liet de bal te vroeg los, en je elleboog zat te ver naar buiten."
  • Wat het doet: Het kijkt naar de uitkomst en zegt: "Je faalde omdat je niet genoeg kracht op de hendel uitoefende," of "Je slaagde omdat je de beker correct uitlijnde." Dit verandert een mislukking in een specifieke les voor de volgende poging.

De Belangrijkste Conclusie

Het artikel concludeert dat de toekomst van robotica niet alleen gaat over het bouwen van grotere, slimmere AI-modellen (VLAs) die kunnen praten en zien. Het gaat over het bouwen van de infrastructuur die die modellen verbindt met de rommelige, fysieke realiteit.

De Eindmetafoor:
Beschouw de huidige staat van robotica als een briljante student die in een bibliotheek zit met slechts één zeer specifieke, oude tekstbundel (robotdemonstraties). De student is slim, maar wordt beperkt door het boek.

Het artikel stelt dat de echte wereld een enorme, lawaaierige, chaotische bibliotheek is met miljarden boeken, video's en ervaringen. Om de student te laten leren van deze enorme bibliotheek, hebben we niet alleen een grotere student nodig. We hebben nodig:

  1. Librari (Bibliothecarissen) om de rommelige boeken te ordenen (Autolabelling).
  2. Vertalers om uit te leggen hoe je ze leest (Retargeting).
  3. Mentale Kaarten om de verhalen erin te begrijpen (World Models).
  4. Tutors (Bijlesdocenten) om het huiswerk van de student te nakijken en de fouten uit te leggen (Reward Grounding).

Zonder deze vier instrumenten zal de robot vast blijven zitten in zijn kleine, dure bibliotheek, onbekwaam om te leren van de enorme, wonderlijke en chaotische wereld om hem heen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →