← Nieuwste papers
🤖 AI

FactorJEPA: Factorizing Monolithic Futures into Layout-Agent-Interaction Channels for Crowded and Chaotic Global South Urban Worlds

Dit artikel introduceert FactorJEPA, een nieuwe architectuur die toekomstige voorspellingen deelt in afzonderlijke kanalen voor lay-out, agent en interactie om de chaotische, drukke dynamiek van stedelijke omgevingen in het Globale Zuiden beter te modelleren, ondersteund door de release van de grootschalige DENSEWORLD-dataset en het demonstreren van superieure robuustheid en nauwkeurigheid ten opzichte van bestaande monolithische wereldmodellen.

Oorspronkelijke auteurs: Kapil Wanaskar, Gaytri Jena, Aman Chadha, Vinija Jain, Vasu Sharma, Amitava Das

Gepubliceerd 2026-08-04
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Kapil Wanaskar, Gaytri Jena, Aman Chadha, Vinija Jain, Vasu Sharma, Amitava Das

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot probeert te leren de wereld te begrijpen. Je wilt niet alleen dat hij een kat of een auto herkent; je wilt dat hij voorspelt wat er hierna gebeurt. Als een bal naar een muur rolt, moet de robot weten dat hij zal stuiteren. Als een menigte mensen loopt, moet de robot kunnen raden hoe ze om elkaar heen zullen manoeuvreren zonder tegen elkaar aan te botsen. Dit wetenschappelijke veld wordt "world modeling" genoemd. Het is alsof je een AI een kristallen bol geeft, maar in plaats van magie gebruikt het wiskunde en video om de toekomst te raden.

Lange tijd hebben wetenschappers deze robots getest in zeer nette, geordende werelden. Denk aan een snelweg met duidelijke witte lijnen, waar auto's in hun banen blijven en iedereen zich perfect aan de regels houdt. Het is alsof je een videogame speelt op de "Easy Mode". Maar de echte wereld is niet zo. In veel bruisende steden over de hele wereld is het verkeer een chaotische dans. Er zijn geen strikte rijstroken, mensen lopen waar ze willen, riksja's wurmen zich langs bussen en dieren dwalen door de straten. Het is "Hard Mode". De grote vraag die wetenschappers zich hebben gesteld is: kunnen onze huidige AI-modellen omgaan met deze rommelige, drukke realiteit, of werken ze alleen wanneer alles netjes is?

Dit artikel, getiteld FactorJEPA, pakt precies dat probleem aan. De onderzoekers realiseerden zich dat standaard AI-modellen in de war raakten door de chaos van drukke steden, dus bouwden ze een gloednieuwe dataset genaamd DENSEWORLD. Ze verzamelden 1.000 uur aan videomateriaal uit 22 verschillende steden, waarbij alles werd vastgelegd: van drukke markten en smalle steegjes tot viaducten en stranden. Ze ontdekten dat bestaande AI-modellen, die meestal goed werken op ordelijke snelwegen, moeite hadden met het voorspellen van wat er zou gebeiden in deze drukke scènes. De modellen begrepen wel het algemene idee, maar misten de specifieke details van hoe mensen en voertuigen met elkaar interageren.

Om dit op te lossen, heeft het team een nieuwe methode uitgevonden genaamd FactorJEPA. In plaats van te proberen de hele toekomst in één grote, rommelige brok data te raden, leerden ze de AI om de voorspelling op te splitsen in drie afzonderlijke "kanalen", zoals een chef die ingrediënten scheidt voordat hij een complex gerecht bereidt:

  1. Layout: De statische zaken die niet veel bewegen, zoals gebouwen, wegen en muren.
  2. Agents: De bewegende dingen, zoals mensen, auto's en riksja's.
  3. Interactions: Hoe die bewegende dingen zich tot elkaar verhouden, zoals een voetganger die opzij stapt voor een bus of twee fietsen die elkaar passeren.

Door deze drie zaken te scheiden, kon de AI veel beter leren. Het is alsof je een druk feestje probeert te begrijpen. Als je probeert de hele kamer in één keer te onthouden, raak je overweldigd. Maar als je je eerst concentreert op de vorm van de kamer, dan op de mensen, en tot slot op hoe zij met elkaar praten, wordt het veel gemakkelijker om te raden wie er als volgende zal bewegen.

De resultaten waren indrukwekkend. Bij tests op hun nieuwe chaotische stadsvideo's was deze nieuwe "gescheiden" AI veel beter in het voorspellen van de toekomst dan de oude "alles-in-één"-modellen. Het maakte minder fouten over waar dingen zich zouden bevinden, het begreep beter wat er zou gebeuren als een auto plotseling zou uitwijken (een test genaamd "intervention"), en het bleef accuraat, zelfs wanneer delen van de video verborgen of wazig waren. Het artikel laat zien dat door de manier waarop de AI over de wereld denkt te organiseren — door het op te splitsen in layout, agents en interacties — we eindelijk robots kunnen bouwen die de rommelige, drukke en wonderbaarlijke realiteit van menselijke steden begrijpen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →