← Nieuwste papers
💻 computer science

OmniNWM: Omniscient Driving Navigation World Models

OmniNWM introduceert een verenigd probabilistisch wereldmodel dat simultaan de dimensies van staat, actie en beloning aanpakt door uitgelijnde panoramische multimodale video's te genereren, wat nauwkeurige zero-shot trajectcontrole mogelijk maakt door middel van geometrische actiecodering, en intrinsieke dichte beloningen afleidt uit 3D-bezetting voor robuuste closed-loop planningevaluatie.

Oorspronkelijke auteurs: Bohan Li, Zhuang Ma, Dalong Du, Baorui Peng, Zhujin Liang, Zhenqiang Liu, Xianda Guo, Zheng Zhu, Chao Ma, Yueming Jin, Xin Jin, Hao Zhao, Wenjun Zeng

Gepubliceerd 2026-06-23
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Bohan Li, Zhuang Ma, Dalong Du, Baorui Peng, Zhujin Liang, Zhenqiang Liu, Xianda Guo, Zheng Zhu, Chao Ma, Yueming Jin, Xin Jin, Hao Zhao, Wenjun Zeng

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot probeert te leren autorijden. Om dit veilig te doen, kun je het niet volstaan met het laten zien van een paar video's; je moet een virtuele wereld bouwen binnen een computer waar de robot kan oefenen, fouten kan maken en daarvan kan leren zonder een echte auto te crashen.

Dit artikel introduceert OmniNWM, een nieuw type "virtuele rijsimulator" dat veel slimmer is dan eerdere versies. De auteurs noemen het een "Omniscient" (alwetende) wereldmodel omdat het niet alleen raadt hoe de weg eruitziet; het begrijpt de weg, de beweging van de auto en de gevolgen van de acties allemaal tegelijkertijd.

Hier is hoe het werkt, onderverdeeld in drie eenvoudige delen met behulp van alledaagse analogieën:

1. Het "Alziende Oog" (Toestand/State)

Het Probleem: Oude simulators waren als een persoon met een blinddoek die slechts één ding tegelijk ziet. Ze genereerden misschien een video van de weg, maar als ze probeerden te raden hoe ver een boom weg was of wat de kleur van een bord was, kwamen die gissingen vaak niet overeen met de video. Het was also slapend naar een film kijken waarbij de achtergrond willekeurig verandert.

De OmniNWM Oplossing: OmniNWM werkt als een meesterverfschilder die gelijktijdig vier verschillende versies van dezelfde scène schildert op één enkel canvas:

  1. De Foto (RGB): Wat de camera ziet.
  2. De Kaart (Semantiek): Wat dingen zijn (bijv. "dat is een auto", "dat is een weg").
  3. De Liniaal (Diepte): Hoe ver dingen weg zijn.
  4. Het 3D-Blok (Occupancy): Een solide 3D-model van de ruimte (is er lucht, of is er een muur?).

Omdat het al deze vier tegelijkertijd schildert, sluiten ze perfect op elkaar aan. Als de robot denkt dat een auto 10 meter verwijderd is in de "diepte"-versie, zal de "foto"-versie ook de auto op de juiste grootte weergeven. Dit zorgt ervoor dat de virtuele wereld fysiek consistent is.

2. De "Universele Afstandsbediening" (Actie/Action)

Het Probleem: In oude simulators was het de robot leren om links af te slaan alsof je hem probeerde te leren rijden met een afstandsbediening die alleen werkte op één specifک merk tv. Als je de camera-opstelling veranderde (de "tv"), stopte de afstandsbediening met werken. De robot raakte in de war omdat hij de vorm van de camera leerde, niet het idee van afslaan.

De OmniNWM Oplossing: De auteurs hebben een "Universele Afstandsbediening" uitgevonden genaamd de Genormaliseerde Panoramische Straalkaart (Normalized Panoramic Ray-map).

  • Stel je hebt een kaart van een stad. Of je nu de kaart van het Noorden, het Zuiden of ondersteboven bekijkt, de lay-out van de stad verandert niet.
  • OmniNLM vertaalt elke rijinstructie (zoals "linksaf slaan" of "rechtdoor gaan") naar deze universele kaarttaal.
  • Dit betekent dat de robot kan leren rijden in één stad (met één specifieke set camera's) en vervolgens direct kan rijden in een compleet andere stad met andere camera's, zonder dat hij opnieuw hoeft te leren. Hij begrijpt de geometrie van de bocht, niet alleen de camerahoek.

3. Het "Natuurlijke Geweten" (Beloning/Reward)

Het Probleem: Normaal gesproken heb je om een robot te leren een menselijke leraar nodig die na elke beweging zegt: "Goed gedaan!" of "Slecht gedaan!". In een computersimulatie is deze leraar vaak een apart, "black-box" programma dat fouten kan maken of inconsistent kan zijn.

De OmniNWM Oplossing: OmniNWM geeft de robot een ingebouwd geweten.

  • Omdat de simulator een perfect 3D-model van de wereld creëert (de "Occupancy" die eerder werd genoemd), kan de robot direct controleren: "Ben ik tegen een muur gereden?" of "Rijd ik op de stoep?".
  • De computer berekent automatisch een "score" (beloning) op basis van natuurkunde. Als de robot in een virtuele boom rijdt, krijgt hij een straf. Als hij in de rijstrook blijft, krijgt hij een bonus.
  • Dit creëert een gesloten lus: De robot rijdt, de wereld controleert of het veilig was, geeft een score, en de robot gebruikt die score om de volgende zet te plannen. Het is als het spelen van een videogame waarbij de game engine zelf vertelt of je wint of verliest, zonder dat je een menselijke scheidsrechter nodig hebt.

Waarom is dit een grote zaak?

Het artikel beweert dat omdat OmniNWM deze drie zaken combineert (alles duidelijk zien, beweging universeel begrijpen en veiligheid automatisch beoordelen), het kan:

  • Veel langer rijden: Het raakt niet in de war of "drijft" niet van de weg af na een paar seconden zoals oudere modellen.
  • Nieuwe situaties aan: Het kan rijden in steden die het nog nooit heeft gezien (zoals de nuPlan-dataset) omdat het de universele regels van het rijden begrijpt, niet alleen de specifieke data waarop het is getraind.
  • Interacties simuleren: Als de robot probeert in te halen voor een vrachtwagen, laat de simulator de vrachtwagen van nature "afremmen" of "voorrang geven", omdat het heeft geleerd hoe echte bestuurders reageren, en niet omdat iemand een script heeft geprogrammeerd om dat te doen.

Kortom, OmniNWM is een zelfstandige, hoogwaardige rijschool waar de robot urenlang kan oefenen, kan leren van zijn eigen fouten en een veilige bestuurder kan worden, zonder dat er een mens aan zijn hand hoeft te zitten of een specifieke camera-opstelling nodig is om te werken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →