← Nieuwste papers
🤖 AI

WorldRoamBench: An Open-World Benchmark for Long-Horizon Stability of Interactive World Models

Dit artikel introduceert WorldRoamBench, een nieuwe open-world benchmark die is ontworpen om de langetermijnstabiliteit van interactieve wereldmodellen op vier kritieke dimensies — actie, visie, fysica en geheugen — rigoureus te evalueren, waarbij wordt onthuld dat de huidige state-of-the-art modellen nog steeds moeite hebben om een betrouwbare, fysiek gegronde en geheugenvetrouwe prestatie te leveren in continue interactieve omgevingen.

Oorspronkelijke auteurs: Ting-Bing Xu, Jiacheng Sui, Zhe Gao, Kewei Shi, Wenjin Yang, Zhicheng Liu, Zhaoxu Sun, Mingchao Sun, Hongyu Pan, Fan Jiang, Mu Xu, Qi Fan, Yong Li, Baoquan Chen

Gepubliceerd 2026-07-01
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Ting-Bing Xu, Jiacheng Sui, Zhe Gao, Kewei Shi, Wenjin Yang, Zhicheng Liu, Zhaoxu Sun, Mingchao Sun, Hongyu Pan, Fan Jiang, Mu Xu, Qi Fan, Yong Li, Baoquan Chen

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een videogame speelt waarin je toetsen op je toetsenbord kunt indrukken (W, A, S, D) om te lopen, te draaien en rond te kijken in een wereld die nog niet bestaat. In plaats van een vooraf gemaakte kaart, genereert een AI de omgeving in realtime terwijl je beweegt. Dit wordt een Interactief Wereldmodel genoemd.

Het artikel introduceert een nieuwe "rapportcijferlijst" genaamd WorldRoamBench om te testen hoe goed deze AI-werelden echt zijn wanneer je er lang op speelt (10 tot 60 seconden), in plaats van slechts een paar seconden.

Hier is hoe de benchmark de tests onderverdeelt, met behulp van eenvoudige analogieën:

1. Het Probleen: De "Korte Clip"-valstrik

Eerdere tests keken slechts enkele seconden naar de AI. Het is alsof je een marathonloper beoordeelt door te kijken hoe hij zijn veters strikt. De AI kan er na 5 seconden perfect uitzien, maar dan begint hij te glitchen, vergeet hij waar hij was, of loopt hij door muren heen. WorldRoamBench dwingt de AI om de hele marathon te rennen om te zien of hij uit elkaar valt.

2. De Vier Tests (De "Rapportcijferlijst")

De benchmark controleert de AI op vier specifieke vaardigheden:

A. Actie-opvolging: "Het Gehoorzame Huisdier"

  • De Test: Je drukt op "Vooruit". Beweegt de AI dan ook daadwerkelijk vooruit?
  • De Oude Manier: Eerdere tests keken naar het algemene pad. Als je "Vooruit" drukte maar de AI wild zig zagde voordat hij op de juiste plek eindigde, kreeg hij een goede score.
  • De Nieuwe Manier: WorldRoamBench controleert elke enkele stap. Het is alsof je controleert of een hond elke keer gaat zitten als je "Zit" zegt, en niet alleen of hij uiteindelijk in de hoek terechtkomt. Dit onthult of de AI je toetsen negeert of in de war raakt op het moment dat je van richting verandert.

B. Visuele Kwaliteit: "De Vervagende Foto"

  • De Test: Blijft de wereld helder en mooi, of verandert het in een wazige bende?
  • De Oude Manier: Ze gebruikten een gemiddelde voor de kwaliteit. Als het begin mooi was en het einde lelijk, kon het gemiddelde er nog steeds oké uitzien.
  • De Nieuwe Manier: Ze zoeken naar de "Mid-Sequence Collapse" (instorting halverwege de sequentie). Stel je een foto voor die scherp begint, in het midden wazig wordt en aan het einde op de een of andere manier weer scherp wordt. De oude tests zouden de wazige middensequentie missen. Deze test vangt die "glitchy dip" op waarbij de AI even de controle verliest.

C. Interactie-fysica: "De Realiteitscheck"

  • De Test: Houdt de wereld zich aan de wetten van de fysica?
  • De Oude Manier: Ze negeerden dit grotendeels of controleerden het heel losjes.
  • De Nieuwe Manier: Ze testen drie specifieke zaken:
    • Mechanica: Als je tegen een muur loopt, stop je dan? Of loop je er doorheen als een geest? Als je een kopje laat vallen, valt het dan?
    • Optica: Veranderen schaduwen correct terwijl je draait? Zien reflecties in een spiegel er juist uit?
    • 3D-Consistentie: Als je door een lange gang loopt, blijven de muren dan recht, of vervormen en draaien ze als in een spiegeltuin?

D. Geheugen: "De Tijdreiziger"

  • De Test: Als je wegloopt van een boom en dan weer terugloopt, is het dan dezelfde boom?
  • De Oude Manier: Ze vergeleken het eerste frame met het laatste frame. Maar als de AI iets uit koers liep, kwamen de frames niet overeen en gaven ze de AI de schuld van een slecht geheugen, zelfs als de AI gewoon in een iets andere cirkel had gelopen.
  • De Nieuwe Manier: Ze gebruiken een "3D Point Cloud" (een digitale kaart van de kamer). Ze controleren of de vorm van de kamer behouden blijft, ongeacht waar de camera precies staat.
    • Scènegeheugen: Is het gebouw dat ik eerder zag nog steeds aanwezig?
    • Onderwerpgeheugen (voor 3e persoon): Als ik naar een personage kijk, ziet dat personage er dan nog steeds hetzelfde uit, of verandert het in een vlek of een ander dier?

3. De Resultaten: "Geen Perfecte Speler"

De auteurs hebben meer dan 10 verschillende AI-modellen getest (sommige open-source, sommige van grote techbedrijven zoals Google en Alibaba).

  • De Belangrijkste Bevinding: Geen enkel model is perfect in alles.
  • Sommige modellen zijn geweldig in het opvolgen van je commando's, maar slecht in fysica (ze lopen door muren heen).
  • Sommige zijn prachtig om naar te kijken, maar vergeten wat ze 10 seconden geleden hebben gegenereerd.
  • Sommige zijn erg goed in fysica, maar raken in de war als je ze vraagt om snel te draaien.

4. Waarom Dit Ertoe Doet

Het artikel betoogt dat om een echt meeslepende, oneindige wereld te bouwen (zoals de "Metaverse" of geavanceerde videogames), we niet alleen mooie plaatjes nodig hebben. De wereld moet stabiel zijn (niet glitchen), fysiek (de zwaartekracht respecteren) en memorabel (onthouden wat je hebt gezien).

WorldRoamBench is de eerste tool die al deze zaken tegelijkertijd rigoureus controleert, en laat ons precies zien waar de huidige AI tekortschiet, zodat ontwikkelaars weten wat ze het volgende moeten oplossen. Het gaat er niet om de AI op een algemene manier "slimmer" te maken, maar om het maken van een betrouwbaardere, consistente en fysiek gewortelde virtuele wereld.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →