← Nieuwste papers
💻 computer science

WorldMark: A Unified Benchmark Suite for Interactive Video World Models

Dit paper introduceert WorldMark, het eerste gestandaardiseerde benchmarkpakket dat een gemeenschappelijke testomgeving biedt voor het eerlijk vergelijken van interactieve video-wereldmodellen via een uniforme besturing, een uitgebreide evaluatiesuite en een online platform.

Oorspronkelijke auteurs: Xiaojie Xu, Zhengyuan Lin, Kang He, Yukang Feng, Xiaofeng Mao, Yuanyang Yin, Kaipeng Zhang, Yongtao Ge

Gepubliceerd 2026-04-24
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Xiaojie Xu, Zhengyuan Lin, Kang He, Yukang Feng, Xiaofeng Mao, Yuanyang Yin, Kaipeng Zhang, Yongtao Ge

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een grote wedstrijd organiseert om te zien wie de beste virtuele wereldbouwer is. Je hebt zes verschillende architecten (de AI-modellen zoals Genie, YUME, etc.). Elk van hen bouwt een virtuele wereld waar je als speler doorheen kunt lopen, draaien en kijken.

Het probleem tot nu toe was als volgt:
Elke architect had zijn eigen eigen testbaan.

  • Architect A liet je door een bos lopen met een toetsenbord.
  • Architect B liet je door een stad vliegen met een gamepad.
  • Architect C liet je door een droomlandschap zwemmen met stemcommando's.

Je kon ze niet vergelijken! Het was alsof je een Formule 1-auto, een fiets en een skateboard tegen elkaar liet racen op drie verschillende banen. Wie won? Je wist het niet, want de regels waren voor iedereen anders.

WorldMark is de oplossing. Het is als het olympisch stadion voor deze virtuele wereldbouwers. Hier is hoe het werkt, in simpele taal:

1. De Universele Vertaler (De "WASD"-Bril)

Elke architect spreekt een andere taal. De ene wil tekst, de andere wil cijfers, de derde wil knoppen.
WorldMark heeft een vertaler gebouwd. Jij geeft één simpele opdracht: "Ga naar voren (W), draai naar rechts (R)".
De vertaler zorgt ervoor dat:

  • De tekst-architect de tekst krijgt.
  • De cijfer-architect de getallen krijgt.
  • De knop-architect de knopdruk krijgt.
    Resultaat: Alle zes bouwen exact dezelfde wereld, met exact dezelfde bewegingen, op exact hetzelfde moment. Eerlijk spel!

2. De Testbaan (500 Uitdagingen)

Ze hebben een enorme verzameling van 500 testcases gemaakt.

  • Verschillende werelden: Soms een echte foto van een stad, soms een schilderij, soms van binnen, soms van buiten.
  • Verschillende moeilijkheidsgraden:
    • Gemakkelijk: Gewoon 20 seconden rechtdoor lopen.
    • Moeilijk: 60 seconden lang een ingewikkeld patroon lopen, draaien en weer terug, zonder dat de wereld "instort".
  • Twee perspectieven: Je kunt kijken alsof je zelf in de wereld loopt (eerste persoon) of alsof je een filmcamera achter de speler hebt (derde persoon).

3. De Drie Juries (Hoe meten ze wie er wint?)

Niet alleen kijken ze of het beeldje mooi is. Er zijn drie soorten jury's die naar de resultaten kijken:

  • De Kunstcriticus (Visuele Kwaliteit): Is het beeldje mooi? Ziet het eruit als een foto of een schilderij? Is het niet te wazig of te donker?
  • De Navigatie-expert (Besturings-Alignement): Luistert de AI naar jou? Als jij "draai naar rechts" zegt, draait de camera dan echt naar rechts? Of loopt hij gewoon rechtdoor terwijl hij zegt dat hij draait?
  • De Realiteits-checker (Wereld-consistentie): Dit is de belangrijkste. Als je een ronde loopt en terugkijkt, is de boom nog steeds daar? Is de muur niet verdwenen? Verandert de stijl van het schilderij ineens in een cartoon? Een goede wereldbouwer houdt de wereld stabiel, zelfs als je lang rondloopt.

Wat hebben ze ontdekt? (De verrassende resultaten)

Toen ze alle zes modellen op deze ene, eerlijke baan zetten, kwamen ze tot verrassende conclusies:

  1. Mooi is niet altijd waar: De model dat de allerprachtigste, meest fotorealistische beelden maakt (YUME), was vaak een slechte wereldbouwer. De wereld "smolt" weg als je te lang rondliep.
  2. Stabiel is niet altijd mooi: Het model dat de wereld het meest stabiel hield (Genie 3), zag er soms wat minder "glamoureus" uit, maar de wereld klopte wel logisch.
  3. De "Derde Persoon" is een nachtmerrie: Alle modellen waren goed als je vanuit de ogen van de speler keek. Maar zodra je een camera achter de speler zette (derde persoon), vielen veel modellen volledig uit elkaar. De camera draaide dan ineens 360 graden terwijl je alleen een beetje wilde lopen.
  4. Specifieke training werkt niet overal: Een model dat getraind was op Minecraft (Open-Oasis), faalde volledig in de echte wereld. Het kon de regels van de echte wereld niet begrijpen.

Waarom is dit belangrijk?

Voorheen was het een "wie-houdt-het-langst-uit"-wedstrijd met eigen regels. Nu hebben we een standaard. Onderzoekers kunnen nu echt zien welke technologie echt vooruitgaat.

Ze hebben ook een online arena (warena.ai) gemaakt waar iedereen live kan kijken hoe deze modellen tegen elkaar vechten, net als in een sportwedstrijd.

Kortom: WorldMark is de eerlijke scheidsrechter die eindelijk zegt wie de echte meesterbouwer is, en wie alleen maar mooie plaatjes maakt die na een minuut in elkaar storten.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →