← Nieuwste papers
💻 computer science

What-If World: A Causal Benchmark for General World Models in Embodied Scenarios

Dit artikel introduceert "What-If World", een nieuwe benchmark bestaande uit 319 promptparen die videogeneratiemodellen evalueren op hun vermogen om fysiek consistente, causaal divergente uitkomsten te produceren als reactie op veranderingen in één variabele, en onthult dat huidige state-of-the-art-modellen grotendeels falen in het betrouwbaar simuleren van belichaamde scenario's voor planning en besturing.

Oorspronkelijke auteurs: Kunlin Cai, Rui Song, Jinghuai Zhang, Kaiyuan Zhang, Pranav Bodapati, Alicia Yu, Fnu Suya, Mohammad Rostami, Jiaqi Ma, Yuan Tian

Gepubliceerd 2026-05-28
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Kunlin Cai, Rui Song, Jinghuai Zhang, Kaiyuan Zhang, Pranav Bodapati, Alicia Yu, Fnu Suya, Mohammad Rostami, Jiaqi Ma, Yuan Tian

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een zeer getalenteerde kunstenaar voor die ongelooflijk realistische scènes kan schilderen. Als je hen vraagt "een auto die zachtjes remt" te schilderen, doen ze een uitstekend werk. Als je hen vraagt "een auto die hard remt" te schilderen, doen ze ook een uitstekend werk. Beide schilderijen zien er op zichzelf perfect uit.

Maar hier zit de adder onder het gras: What-If World stelt een andere vraag. Het vraagt: "Als je de instructie verandert van 'zachtjes' naar 'hard', verandert het resultaat dan daadwerkelijk op de manier die de natuurkunde voorspelt?"

In de echte wereld stopt een harde rem een auto veel sneller dan een zachte. Maar in de wereld van huidige AI-videogeneratoren kan de kunstenaar twee bijna identieke remafstanden schilderen, zelfs als de instructies totaal verschillend waren. De AI is goed in het schilderen van de uitstraling van een auto, maar slecht in het begrijpen van de logica van hoe de auto beweegt.

Het Probleem: De "Valkuil van de Gelijkenis"

Huidige tests voor AI-videomodellen lijken op het nakijken van het huiswerk van een leerling door elke pagina afzonderlijk te bekijken.

  • Pagina 1: "Teken een auto die zachtjes remt." (De tekening ziet er goed uit. Geslaagd.)
  • Pagina 2: "Teken een auto die hard remt." (De tekening ziet er goed uit. Geslaagd.)

De leraar vergelijkt de twee pagina's nooit naast elkaar. Dus krijgt de AI een A, zelfs als beide tekeningen tonen dat de auto op precies dezelfde plek stopt, waarbij het verschil in instructies volledig wordt genegeerd. Dit wordt het Contrastieve Knelpunt genoemd. De AI kan dingen er echt laten uitzien, maar kan ze niet anders laten handelen wanneer je de regels verandert.

De Oplossing: What-If World

De onderzoekers bouwden een nieuwe test genaamd What-If World. In plaats van één video per keer te nakijken, dwingen ze de AI om paren van video's te genereren op basis van dezelfde startscène, maar dan met één kleine verandering in de instructies.

Stel je het voor als een "Zoek het Verschil"-spel, maar dan moet de AI de verschillen zelf creëren op basis van de natuurkunde.

De Opzet:

  1. Het Anker: Ze nemen een echte foto van een auto of een robotarm net voordat deze beweegt. Dit is het "bevroren moment" waarin alles voor beide video's hetzelfde is.
  2. De Twist: Ze geven de AI twee prompts die identiek zijn, behalve één fysiek detail.
    • Prompt A: "De robotarm duwt het blok zachtjes."
    • Prompt B: "De robotarm duwt het blok hard."
  3. De Test: De AI moet twee video's genereren. De onderzoekers (met behulp van een super-slimme AI-jury) controleren:
    • Heeft de robot daadwerkelijk geduwd? (Naleving)
    • Bewoog het blok op een fysiek mogelijke manier? (Natuurkunde)
    • Bleef de achtergrond hetzelfde? (Omgeving)
    • Cruciaal: Toonde de video met de "harde duw" het blok verder of sneller bewegen dan de video met de "zachte duw"? (Uitkomst)

De Zes Regels van het Spel

Om de test eerlijk en wetenschappelijk te maken, hebben de onderzoekers de veranderingen georganiseerd in zes specifieke "regels" van de natuurkunde, verdeeld in twee categorieën:

1. De Omgeving (Het Toneel):

  • Oppervlaktewrijving: Is de weg glad of droog? (Glijdt de auto?)
  • Materiaal/Medium: Is het object een spons of een baksteen? (Vervormt het of blijft het hard?)
  • Obstakels: Staat er een kegel in de weg? (Rijdt de auto er tegenaan of eromheen?)

2. De Actie (De Acteur):

  • Kracht/Grado: Hoe hard is de duw of de rem?
  • Ruimtelijke Uitlijning: Waar grijpt de robot precies?
  • Temporele Sequencing: Grijpt de robot voor of na het bewegen?

De Resultaten: De AI is Nog Steeds een Novice

De onderzoekers testten 9 van de slimste video-AI-modellen ter wereld (zowel open-source als dure gesloten bron-modellen). De resultaten waren nuchter:

  • Het Plafond: Zelfs het beste model slaagde slechts voor ongeveer 52% van de tests. Dat betekent dat het bijna de helft van de tijd faalde.
  • De Kloof: De open-source modellen waren nog slechter, met een clustering rond de 28%.
  • De Illusie: De meeste modellen scoorden hoog op "single video"-tests (de video's zagen er geweldig uit), maar crashten op de "gepaarde" tests (de video's verschilden niet genoeg). Ze nepden de natuurkunde voor.
  • Visuele Bias: De AI deed het beter wanneer de verandering voor het oog duidelijk was (zoals een auto die snel versus langzaam voorbij schiet), maar faalde jammerlijk wanneer de verandering subtiel of onzichtbaar was (zoals hoe glad de weg is).

De Grote Conclusie

Het paper concludeert dat hoewel deze AI-modellen geweldig zijn in het renderen (mooie plaatjes maken), ze nog niet betrouwbaar simulatoren zijn (het begrijpen van hoe de wereld werkt).

Als je een AI wilt gebruiken om de bewegingen van een robot te plannen of een zelfrijdende auto te simuleren, moet je dat het begrijpt dat "harde rem" betekent "kortere stop". Op dit moment gokt de AI alleen hoe een harde rem er uitziet, niet wat het doet. Totdat ze de What-If World-test kunnen doorstaan, kunnen we ze niet volledig vertrouwen om beslissingen te nemen in de echte wereld.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →