← Nieuwste papers
🤖 AI

Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics

Dit artikel toont aan dat hoewel verenigde visie-taalmodellen moeite hebben met het voorspellen van voorwaartse dynamiek, ze effectief kunnen worden gebootstrapt om state-of-the-art prestaties te behalen in actie-gecentreerde beeldbewerking door gebruik te maken van de aanzienlijk eenvoudigere taak van inverse dynamiekvoorspelling om synthetische trainingsgegevens te genereren en zoektochten tijdens de inferentie te sturen.

Oorspronkelijke auteurs: Yifu Qiu, Yftah Ziser, Anna Korhonen, Shay B. Cohen, Edoardo M. Ponti

Gepubliceerd 2026-06-04
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yifu Qiu, Yftah Ziser, Anna Korhonen, Shay B. Cohen, Edoardo M. Ponti

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer slimme, goed onderlegde robot hebt die plaatjes kan bekijken en tekst kan lezen. Je stelt de robot een simpele vraag: "Als ik een man zie die een boek vasthoudt, en ik zeg daarna tegen hem: leg het boek neer, hoe ziet de foto er dan hierna uit?"

Dit artikel vraagt: Kunnen onze huidige slimme robots daadwerkelijk de toekomst voorspellen?

De auteurs ontdekten dat hoewel deze robots geweldig zijn in het lezen en kijken, ze verschrikkelijk zijn in het raden wat er hierna gebeurt in een fysieke wereld. Als je hen vraagt om de volgende scène te voorspellen, gokken ze vaak willekeurig of kopiëren ze de oude afbeelding zonder iets te veranderen. Ze hebben de "physics" (natuurkunde) van hoe acties de wereld veranderen niet echt geleerd.

De onderzoekers ontdekten echter een slimme truc. Ze ontdekten dat het veel makkelijker is om de robot het tegenovergestelde te leren: "Hier is een foto van een man die een boek vasthoudt, en hier is een foto van hem terwijl hij het neerlegt. Welke actie vond daartussen plaats?"

De robot is verrassend goed in het raden van de actie (het verhaal) wanneer hem de voor en na foto's worden getoond. Het voorspellen van de toekomstige afbeelding op basis van de actie is Forward Dynamics (vooruit werken), en dat is het moeilijke deel. Het voorspellen van de actie op basis van de voor en na foto's is Inverse Dynamics (achteruit werken).

De Oplossing: Het "Omgekeerde" gebruiken om het "Voorwaartse" te leren

Omdat de robot goed is in achteruit werken maar slecht in vooruit werken, gebruikten de auteurs de "achterwaartse" vaardigheid van de robot om hem te leren hoe hij "vooruit moet bewegen". Ze gebruikten twee hoofdstrategieën, die ze bootstrapping noemen (een kleine stap gebruiken om jezelf naar een grotere stap te trekken).

Strategie 1: De "Ghost Writer" (Zwakke Supervisie)

Stel je een enorme bibliotheek voor met videoclips, maar niemand heeft opgeschreven wat er in die clips gebeurt.

  1. De Ghost Writer: Ze namen hun "achterwaarts geschoolde" robot en vroegen hem om deze ongelabelde video's te bekijken. De robot keek naar het begin en het einde van een clip en schreef een zin die de actie beschreef (bijv. "De man trapt de bal").
  2. De Student: Nu hadden ze een enorme hoeveelheid nieuwe data: Beginfoto + Zin van de Robot = Eindfoto.
  3. De Les: Ze gebruikten deze nieuwe, zelfgemaakte data om de robot te trainen om de toekomst te voorspellen. Het is alsof je een ghost writer inhuurt om een tekstboek voor een student te schrijven, zodat de student kan leren de toekomst te voorspellen zonder dat er voor elk voorbeeld een mens nodig is om het te schrijven.

Om ervoor te zorgen dat de robot niet gewoon de oude foto kopieert, voegden ze een speciale regel toe: "Let extra goed op de delen van de foto die daadwerkelijk veranderd zijn." Als een bal beweegt, focus dan op de bal, niet op de statische achtergrond.

Strategie 2: De "Judge" (Inference-Time Verificatie)

Stel je voor dat je een toets maakt en dat je drie verschillende antwoorden voor de toekomstige foto mag opschrijven.

  1. De Generator: De robot probeert drie verschillende "toekomstige" foto's te maken op basis van de instructie.
  2. De Judge: Voordat je het definitieve antwoord kiest, vraag je aan de "achterwaarts geschoolde" robot (de Judge) om naar de drie opties te kijken. De Judge vraagt: "Als ik de beginfoto en deze toekomstige foto zie, is de actie 'pak het boek op' dan logisch?"
  3. De Selectie: De robot kiest de toekomstige foto die de Judge het meest logisch vindt. Het is alsof je een docent vraagt om je huiswerk te controleren voordat je het inlevert, om zo het beste antwoord te kiezen.

De Resultaten

De auteurs testten dit op een "World Model" benchmark (een reeks uitdagingen om te zien of een robot begrijpt hoe de wereld werkt).

  • Vóór: De robots waren slecht in het voorspellen van de toekomst en lieten vaak de afbeelding helemaal ongewijzigd.
  • Ná: Door deze twee trucs te gebruiken, werden hun robots beter in het voorspellen van toekomstige beelden dan zelfs de meest geavanceerde, gespecialiseerde beeldbewerkingsprogramma's die momenteel beschikbaar zijn.
  • Het Bewijs: Wanneer mensen naar de resultaten keken, gaven zij de voorkeur aan de voorspellingen van de robot boven die van de gespecialiseerde tools. De robot was beter in het opvolgen van instructies zoals "beweeg het boek" of "laat de hond springen" zonder de rest van de foto te verpesten.

De Kernboodschap

Dit artikel laat zien dat we geen gloednieuwe, supercomplexe robot vanaf nul hoeven te bouwen om de wereld te begrijpen. We kunnen een algemene robot die al goed is in het begrijpen van verhalen (acties) nemen en die kracht gebruiken om hem te leren hoe hij de toekomst kan voorspellen.

Belangrijke Opmerking: De auteurs benadrukken dat dit momenteel beperkt is tot enkele stappen (het voorspellen van de direct volgende foto na één actie). Ze beweren niet dat deze robot al een hele dag kan plannen of een robotarm in een fabriek kan besturen. Ze hebben slechts de eerste stap gezet naar het bouwen van een robot die echt kan simuleren hoe de wereld verandert.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →