← Nieuwste papers
💻 computer science

WBench: A Comprehensive Multi-turn Benchmark for Interactive Video World Model Evaluation

Dit artikel introduceert WBench, een uitgebreide benchmark voor meerdere beurten die is ontworpen om interactieve video-wereldmodellen systematisch te evalueren op vijf kernaspecten—videokwaliteit, adherentie aan de setting, adherentie aan interacties, consistentie en naleving van de natuurkunde—met behulp van 289 testcases en gevalideerde automatische metrieken, waaruit blijkt dat geen enkel huidig state-of-the-art-model op alle gebieden uitblinkt.

Oorspronkelijke auteurs: Kaining Ying, Hengrui Hu, Siyu Ren, Jiamu Li, Fengjiao Chen, Ziwen Wang, Xuezhi Cao, Xunliang Cai, Henghui Ding

Gepubliceerd 2026-05-26
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Kaining Ying, Hengrui Hu, Siyu Ren, Jiamu Li, Fengjiao Chen, Ziwen Wang, Xuezhi Cao, Xunliang Cai, Henghui Ding

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een videogame-engine bouwt, maar in plaats van de regels te coderen, leer je een AI om een wereld te "dromen" die tot leven komt. Je geeft het een startbeeld en zegt: "Loop nu vooruit, spring over die rots, en plotseling verschijnt er een helikopter." De AI genereert vervolgens de volgende paar seconden video op basis van je opdracht.

Het probleem is: Hoe weten we of de AI hier echt goed in is?

Op dit moment zijn er veel verschillende manieren om deze AI-wereldmodellen te testen, maar het is alsof je een auto probeert te beoordelen door alleen zijn remmen te testen, of alleen zijn snelheid, of alleen zijn lakwerk. Er is geen enkele, geünificeerde test die alles tegelijk controleert.

Maak kennis met WBENCH. Denk aan WBENCH als het ultieme "Rijexamen" voor deze interactieve video-AI's.

Het Grote Idee: De "Wereldsimulator"-test

De auteurs hebben een uitgebreide testsuite ontwikkeld genaamd WBENCH. In plaats van de AI alleen te vragen om een mooi video te maken, plaatsen ze het in een virtuele rijschool waar het een meertrapsgesprek met een gebruiker moet voeren.

Zo werkt de test, opgesplitst in vijf eenvoudige categorieën:

  1. Het Uiterlijk (Video Kwaliteit): Ziet de video er soepel en mooi uit, of flikkert en wazigt het? Dit is alsof je controleert of de lak van de auto glanst en de banden rond zijn.
  2. Het Geheugen (Bijhouden van de Instelling): Als je de AI vertelde: "Het is een besneeuwde berg met een rode robot", houdt het dan de sneeuw en de rode robot vast gedurende de hele video? Of verandert de robot plotseling in blauw en smelt de sneeuw weg? Dit test of de AI de regels van de wereld die het heeft gecreëerd, onthoudt.
  3. De Gehoorzaamheid (Bijhouden van Interactie): Als je zegt "Sla linksaf", draait de camera dan echt naar links? Als je zegt "De robot springt", springt hij dan? Dit is de "stuurwiel"-test. Het paper vond dat sommige AI's geweldig zijn in het maken van mooie plaatjes, maar vreselijk in het luisteren naar je commando's.
  4. De Stabiliteit (Consistentie): Als de camera een cirkel draait en terugkeert naar het startpunt, ziet de wereld er dan exact hetzelfde uit als daarvoor? Of zijn de gebouwen verschoven, of is de robot verdwenen? Dit test of de AI een stabiel "geheugen" heeft van de indeling van de wereld.
  5. De Fysica (Fysieke Conformiteit): Als een bal valt, valt hij dan naar beneden? Als een auto crasht, kreukt hij dan? Of zweeft de bal omhoog naar de lucht en rijdt de auto als een geest door de muur? Dit test of de AI begrijpt hoe de echte wereld (of de fantasiewereld) werkt.

De Proefrit: Wat Ze Dedden

De onderzoekers bouwden een dataset van 289 verschillende "scenario's" (zoals een besneeuwde berg, een drukke stad of een fantasiekasteel). Voor elk scenario creëerden ze een reeks van 1.058 instructies (beurten).

Ze testten 20 verschillende AI-modellen (inclusief grote namen zoals Kling, Wan, Genie 3 en anderen). Ze vroegen deze modellen om instructies te volgen zoals:

  • "Loop vooruit."
  • "Spring."
  • "Schakel het perspectief om van achter de persoon naar de ogen van de persoon zelf."
  • "Laat het regenen."

De Resultaten: Geen Perfecte Bestuurder

Na het uitvoeren van de tests, vond het paper enkele verrassende dingen:

  • Er bestaat nog geen "Super AI": Net zoals er geen enkele auto is die tegelijkertijd de snelste, veiligste en meest brandstofefficiënte is, haalde geen enkel AI-model alle onderdelen van de test. Sommigen waren geweldig in het maken van mooie video's, maar vreselijk in het volgen van aanwijzingen. Anderen waren geweldig in het navigeren, maar vergaten hoe de wereld eruitzag na een paar seconden.
  • Navigatie is lastig: Het bewegen van de camera (lopen of draaien) is eigenlijk een aparte vaardigheid van het mooi maken van de video. Een AI kan een prachtige film maken, maar faalt om de camera te bewegen wanneer daarom wordt gevraagd.
  • Het "Lange Spel" is moeilijk: Hoe langer het gesprek doorgaat (hoe meer beurten je neemt), hoe meer de AI fouten begint te maken. Het is alsof een mens probeert een complex verhaal te onthouden; na een tijdje beginnen ze details door elkaar te halen.
  • Open Source haalt in: Sommige modellen die gratis voor iedereen beschikbaar zijn, presteerden net zo goed als, of zelfs beter dan, de dure, gesloten bron-modellen op specifieke taken.

De Conclusie

WBENCH is een nieuwe, gestandaardiseerde liniaal voor het meten van interactieve video-AI's. Het bewijst dat hoewel deze modellen beter worden in het maken van films, ze nog steeds moeite hebben om betrouwbare "wereldsimulatoren" te zijn die consistent instructies kunnen volgen, het verleden kunnen onthouden en de wetten van de fysica kunnen gehoorzamen over een lange periode.

Het paper zegt niet dat deze modellen klaar zijn om menselijke game-ontwerpers te vervangen of zelfrijdende auto's te besturen. In plaats daarvan zegt het: "Hier is precies waar ze falen, zodat ontwikkelaars weten wat ze als volgende moeten oplossen." Het is een diagnosehulpmiddel om de volgende generatie AI echt interactief te maken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →