← Nieuwste papers
💻 computer science

WorldRover: A Scalable Synthetic Video Data Engine for World Exploration with Rich Annotations

Dit artikel introduceert WorldRover, een schaalbare data-engine gebouwd op Unreal Engine die lange-afstands, rijk geannoteerde synthetische videosequenties van door kunstenaars gebouwde omgevingen genereert, waarbij gesynchroniseerde RGB, metrische diepte, cameratrajecten en diverse viewpoint-data biedt om modellen te trainen voor coherente wereldverkenning en reconstructie.

Oorspronkelijke auteurs: Xiaojie Xu, Zhengyuan Lin, Runyi Li, Yihao Liu, Kaipeng Zhang, Yongtao Ge

Gepubliceerd 2026-08-18
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Xiaojie Xu, Zhengyuan Lin, Runyi Li, Yihao Liu, Kaipeng Zhang, Yongtao Ge

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Om te begrijpen hoe een machine kan leren om door een wereld te navigeren, moeten we eerst begrijpen wat het betekent om die wereld te zien. Voor een computer om door een ruimte te bewegen, is meer nodig dan alleen een plaatje van wat er voor zich staat. Het moet weten hoe ver objecten verwijderd zijn, hoe de camera zelf beweegt, en hoe de vormen van dingen veranderen terwijl ze achter elkaar langs bewegen. In de echte wereld is het ongelooflijk moeilijk om al deze informatie tegelijkertijd vast te leggen. Een camera kan een video opnemen, maar kan je niet automatisch vertellen wat de exacte afstand tot een boom is of het precieze pad dat de persoon die de camera vasthield heeft afgelegd. Wetenschappers moeten deze details vaak achteraf raden, en die gissingen kunnen fout zijn, vooral wanneer objecten het zicht op elkaar blokkeren. Zonder perfecte kennis van de geometrie en de beweging is het moeilijk om een computer te leren een stabiele, samenhangende mentale kaart van een plek op te bouwen die hij kan verkennen en naar kan terugkeren.

Dit is de uitdaging waar een team onderzoekers van Alaya Lab, de Universiteit van Tokio en het Shanghai Innovation Institute mee aan de slag is gegaan met een nieuw systeem genaamd WorldRover. In plaats van te proberen perfecte data te extraheren uit rommelige video's uit de echte wereld, hebben zij een machine gebouwd die de data vanaf nul genereert. Ze creëerden een pijplijn die kunstmatig gebouwde virtuele omgevingen neemt en een camera op lange, minutenlange reizen door deze omgevingen stuurt. De kerninnovatie is dat dit systeem niet alleen de video opneemt; het legt de volledige geschiedenis van de reis gelijktijdig vast. Terwijl de camera beweegt, legt het systeem het exacte pad vast dat het heeft afgelegd, de precieze afstand tot elk punt in de scène, en hoe elk pixel in het beeld zich verhoudt tot de vorige. Omdat de wereld synthetisch is, kennen de onderzoekers de waarheid van elk frame: ze weten precies waar de camera was, hoe het licht op de muren viel, en waar elk object zich in de driedimensionale ruimte bevindt.

Het resultaat van deze inspanning is een enorme collectie data genaamd WorldRover-10M. Het bevat meer dan zes duizend verschillende videosequenties afkomstig van tweeëndertig verschillende virtuele omgevingen, variërend van stadswegen en metrostations tot bossen en kathedralen. In totaal bevat de dataset meer dan tweeëntwintig miljoen videoframes, wat neerkomt op meer dan tweehonderd uur aan filmmateriaal. Wat deze collectie uniek maakt, is dat het dezelfde reis biedt vanuit drie verschillende perspectieven: een eerste-persoonsperspectief alsof men door de wereld loopt, een derde-persoonsperspectief dat een personage van achteren volgt, en een 360-graden panoramisch perspectief dat alles rondom de waarnemer vastlegt. Voor elk afzonderlijk frame levert het systeem een bijbehorende set labels. Deze omvatten een kaart van de exacte diepte van de scène, een verslag van hoe de camera bewoog, en een dichte tracking van hoe punten in het beeld van het ene moment naar het volgende verschuiven.

De onderzoekers ontwierpen deze engine om een specifiek probleem op te lossen: de behoefte aan data waarbij de oorzaak van visuele verandering nooit verward wordt. In een normale video is het moeilijk te zeggen of een pixel bewoog omdat het object bewoog of omdat de camera draaide. In WorldRover kunnen de onderzoekers exact hetzelfde traject herafspelen onder verschillende omstandigheden. Ze kunnen dezelfde wandeling door een stad tonen in helder daglicht, en daarna in zware mist, of zelfs als een neutraal wit model waarbij alle texturen zijn verwijderd maar de vormen intact blijven. Omdat het pad en de geometrie identiek blijven terwijl alleen het uiterlijk verandert, kan een computer die van deze data leert, leren om de structuur van de wereld te scheiden van de manier waarop het eruitziet. Deze scheiding is essentieel voor het trainen van modellen die de wereld diep genoeg moeten begrijpen om erdoorheen te navigeren of hem in drie dimensies te reconstrueren.

Om dit te bouwen, gebruikten de onderzoekers een krachtige game engine, een hulpmiddel dat normaal gesproken wordt gebruikt om videogames te maken, maar dat zij hebben aangepast voor wetenschappelijke datageneratie. Ze bereidden tweeëndertig verschillende omgevingen voor die door kunstenaars zijn gemaakt, waarbij ze ervoor zorgden dat deze rijk waren aan details en rommel, net als echte plaatsen. Vervolgens programmeerden ze drie verschillende manieren om door deze ruimtes te bewegen. Eén methode gebruikte een vooraf berekende kaart van begaanbare paden om efficiënte routes te plannen. Een andere methode gebruikte een reactieve agent die obstakels detecteerde terwijl hij bewoog, waarbij hij soms dwaalde of vastliep, vergelijkbaar met een persoon die een nieuwe kamer verkent. De derde methode stelde een mens in staat om handmatig een pad op te nemen. Deze routes werden vervolgens offline gerenderd, wat betekent dat de computer de tijd nam om elke lichtstraal en schaduw met hoge precisie te berekenen, in plaats van te haasten om een real-time beeld te produceren. Dit proces stelde hen in staat om data te genereren die fysiek accuraat is, met verlichting die correct verandert naarmate de tijd van de dag verschuift of het weer omslaat.

De dataset bevat specifieke subsets die zijn afgestemd op verschillende taken. De derde-persoonssequenties zijn bijzonder waardevol omdat ze een personage laten zien dat onafhankelijk van de camera beweegt. Dit stelt onderzoekers in staat om te bestuderen hoe een machine het onderscheid kan maken tussen de beweging van een waarnemer en de beweging van een object in de wereld. Het systeem houdt ook punten op het personage en de achtergrond bij over lange perioden, zelfs wanneer die punten verborgen zijn achter muren of andere objecten. De data vertelt de computer niet alleen waar een punt is wanneer het zichtbaar is, maar ook waar het zou zijn als het nog steeds zichtbaar zou zijn, een concept dat bekend staat als amodale tracking. Dit is cruciaal voor het begrijpen dat een auto achter een gebouw nog steeds bestaat en een specifieke locatie heeft, zelfs wanneer deze niet te zien is.

WorldRover-10M is niet alleen een collectie video's; het is een gestructureerde bibliotheek waar elk stuk informatie gekoppeld is aan het exacte moment waarop het werd vastgelegd. De dieptekaarten worden gemeten in meters, de optical flow-gegevens leggen de beweging van pixels vast in precieze eenheden, en de camerapaden zijn opgenomen met hoge getrouwheid. Het team heeft deze data beschikbaar gesteld in een formaat waarmee onderzoekers gemakkelijk toegang hebben tot de ruwe informatie zonder dat ze hoeven te gissen of te schatten. Ze hebben de data publiekelijk beschikbaar gemaakt, waardoor een fundament is gelegd voor anderen om modellen te bouwen die werelden kunnen begrijpen, navigeren en reconstrueren. Door het probleem van wereldverkenning te transformeren naar een schaalbare datageneratie-taak, hebben de onderzoekers een nieuw instrument aan het vakgebied van kunstmatige intelligentie gegeven, dat een niveau van helderheid en controle biedt dat met alleen opnames uit de echte wereld onmogelijk te bereiken is.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →