← Nieuwste papers
💻 computer science

NavWAM: A Navigation World Action Model for Goal-Conditioned Visual Navigation

NavWAM is een diffusion-transformer-beleid dat toekomstige visuele voorspelling, schatting van de doelvoortgangswaarde en actiegeneratie verenigt in een gedeelde latente sequentie, waardoor een robot direct closed-loop navigatie kan uitvoeren zonder afhankelijk te zijn van externe planners of actiezoekopdrachten.

Oorspronkelijke auteurs: Daichi Azuma, Taiki Miyanishi, Koya Sakamoto, Shuhei Kurita, Yaonan Zhu, Petr Khrapchenkov, Motoaki Kawanabe, Yusuke Iwasawa, Yutaka Matsuo

Gepubliceerd 2026-06-12
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Daichi Azuma, Taiki Miyanishi, Koya Sakamoto, Shuhei Kurita, Yaonan Zhu, Petr Khrapchenkov, Motoaki Kawanabe, Yusuke Iwasawa, Yutaka Matsuo

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot leert om een specifieke kamer in een huis te vinden, maar de robot kan alleen zien wat recht voor zijn "ogen" (een camera) staat. Hij heeft geen kaart en kan niet om de hoek kijken. Dit is de uitdaging van goal-conditioned visual navigation (doelgestuurde visuele navigatie).

Hier is het verhaal over hoe de auteurs, Daichi Azuma en zijn team, dit probleem hebben opgelost met een nieuw systeem genaamd NavWAM.

Het Probleem: De "Glazen Bol" versus de "Chauffeur"

In het verleden probeerden onderzoekers robots te leren navigeren met behulp van twee afzonderlijke instrumenten:

  1. De Glazen Bol (World Model): Dit instrument is erg goed in het raden wat de robot zal zien als hij vooruit beweegt. "Als ik naar links draai, zie ik een keuken." "Als ik rechtdoor ga, bots ik tegen een muur."
  2. De Chauffeur (Planner): Dit instrument kijkt naar de voorspellingen van de Glazen Bol en besluit: "Oké, de keuken ziet er goed uit, dus ik draai naar links."

De Fout: Het artikel stelt dat het apart houden van deze twee instrumenten inefficiënt is. Het is also kind van een passagier die instructies schreeuwt ("Sla linksaf!") terwijl de chauffeur moet stoppen, nadenken en dan pas draait. Dit creëert een bottleneck. De "Glazen Bol" voorspelt de toekomst, maar weet niet hoe hij de auto moet besturen om daar te komen.

De Oplossing: NavWAM (De "Chauffeur-Voorspeller")

De auteurs creëerden NavWAM (Navigation World Action Model). Denk aan NavWAM als een superchauffeur die ook in de toekomst kan kijken.

In plaats van een aparte "Glazen Bol" en een "Chauffeur" te hebben, combineert NavWAM deze tot één brein. Het raadt niet alleen wat het zal zien; het raadt tegelijkertijd wat het zal zien, hoe dicht het bij het doel is, en precies welke stuurcommando's het moet geven — allemaal tegelijkertijd.

De Creatieve Analogie: Het "Gedeelde Canvas"

Om te begrijpen hoe NavWAM werkt, stel je een schilder voor die werkt op een enkel canvas met negen verschillende panelen:

  • De Onderste Panelen (Wat we weten): Deze tonen het huidige beeld van de robot, waar hij nu is, en het plaatje van het doel (bijv. een foto van een specifieke stoel).
  • De Bovenste Panelen (Wat we voorspellen): De robot schildert deze panelen om te laten zien:
    1. Wat de robot in de toekomst zal zien.
    2. Hoe dicht hij bij het doel zal zijn.
    3. Het belangrijkste deel: De eigenlijke stuurcommando's (de "action chunk") die nodig zijn om daar te komen.

De robot leert door dit canvas te "denoisen" (ruis te verwijderen). Het begint met een rommelige, wazige versie van de toekomst en maakt deze schoon totdat het een helder beeld heeft van het pad, de bestemming en de stappen die nodig zijn. Omdat de "stuurcommando's" op hetzelfde canvas worden geschilderd als het "toekomstige beeld", leert de robot dat hij deze specifieke acties moet uitvoeren om het doel te zien.

Hoe het de Concurrentie Verslaat

Het artikel testte NavWAM tegen twee andere soorten robots:

  1. De Oude Manier (NWM): De robot voorspelt de toekomst en gebruikt vervolgens een complexe, trage wiskundige zoekopdracht (genoemd CEM) om te bepalen welke actie hij moet nemen. Het is als een schaker die 100 zetten berekent voordat hij er één doet.
  2. De Directe Manier (OmniVLA): De robot kijkt simpelweg naar het doel en raadt de volgende beweging zonder aan de toekomst te denken. Het is als een chauffeur die gewoon reageert op de weg zonder vooruit te kijken.

De Resultaten:

  • NavWAM vs. De Oude Manier: NavWAM was veel sneller en nauwkeuriger omdat het niet hoefde te stoppen om een complexe zoekopdracht te berekenen. Het "wist" de zet gewoon. Het bereikte het doel in 79% van de echte tests, terwijl de Oude Manier slechts in 16% van de gevallen slaagde.
  • NavWAM vs. De Directe Manier: NavWAM presteerde net zo goed als de Directe Manier (die een veel groter, krachtiger computerbrein gebruikt), maar NavWAM had de extra superkracht om daadwerkelijk de toekomst te voorspellen.

De Test in de Praktijk

Het team heeft NavWAM niet alleen in een computersimulatie getest. Ze plaatsten NavWAM op een echte robot genaamd Diablo en stuurden hem in vier verschillende binnenomgevingen (een kantoor, een opslagruimte, een vergaderruimte en een gang).

  • Het Doel: Een specifieke afbeelding vinden die in die kamer is vastgelegd.
  • De Uitkomst: NavWAM navigeerde succesvol naar het doel in 19 van de 24 pogingen.
  • De "Foresight" Controle: Hoewel NavWAM de toekomstvoorspellingen niet nodig had om te bewegen (het gebruikte alleen de stuurcommando's), laat het artikel zien dat de voorspellingen verrassend accuraat waren. Wanneer de robot voorspelde "Ik zie over 4 seconden een deur", zag hij ook echt over 4 seconden een deur.

De Belangrijkste Conclusie

Het artikel concludeert dat voor een robot om goed te kunnen navigeren, hij niet alleen een "voorspeller" of alleen een "chauffeur" moet zijn. Hij moet beide tegelijkertijd zijn. Door te leren de toekomst te voorspellen én de acties die nodig zijn om die toekomst te creëren in één enkele stap, wordt de robot veel beter in het vinden van zijn weg, zelfs op plekken waar hij nog nooit eerder is geweest.

Kortom: NavWAM leert de robot om "te rijden terwijl hij vooruit kijkt", in plaats van "vooruit kijken, stoppen, berekenen en dan rijden".

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →