← Nieuwste papers
💻 computer science

From Seeing to Experiencing: Scaling Navigation Foundation Models with Reinforcement Learning

Dit artikel introduceert het Seeing-to-Experiencing (S2E) framework, dat navigatie-fundamentmodellen verbetert door offline pretraining op web-schaal video's te combineren met reinforcement learning in simulatie om interactief redeneren en veiligheid te verbeteren, ondersteund door een nieuwe evaluatiebenchmark genaamd NavBench-GS.

Oorspronkelijke auteurs: Honglin He, Yukai Ma, Brad Squicciarini, Wayne Wu, Bolei Zhou

Gepubliceerd 2026-06-12
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Honglin He, Yukai Ma, Brad Squicciarini, Wayne Wu, Bolei Zhou

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Probleem: De "Toerist" versus de "Local"

Stel je voor dat je een robot wilt leren hoe hij door een drukke stad moet lopen.

De Oude Manier (Alleen "Zien"):
Momenteel worden de meeste navigatierobots getraind als een toerist die duizenden uren aan YouTube-video's heeft bekeken over wandelen in steden. Ze hebben elk type straat, menigte en obstakel op een scherm gezien. Dit wordt Offline Pre-training genoemd.

  • De Fout: Een video bekijken van iemand die een skateboarder ontwijkt, is heel anders dan daadwerkelijk een skateboarder ontwijken. De robot weet hoe een botsing eruit ziet, maar begrijpt niet de fysica van vallen of de fractie van een seconde timing die nodig is om te stoppen. Als de robot in de echte wereld probeert te lopen, kan hij bevriezen of crashen omdat hij nooit de gevolgen heeft "gevoeld" van een verkeerde afslag. Het mist causaliteit (oorzaak en gevolg).

De Nieuwe Manier (Het "S2E"-framework):
De auteurs stellen een nieuwe methode voor genaamd Seeing-to-Experiencing (S2E). Zie dit als het nemen van die toerist en hem naar een zeer realistische, veilige videogame-simulator sturen waar hij daadwerkelijk kan lopen, struikelen en leren van zijn fouten zonder gewond te raken.

Het doel is om de brede kennis van de video-kijkende toerist te combineren met de straatwijsheid van iemand die daadwerkelijk in de echte wereld heeft geoefend.


Hoe het werkt: Het Tweestaps-recept

Het S2E-framework gebruikt twee belangrijke "trucs" om dit efficiënt te laten werken.

1. Het "Anker"-systeem (Tijdens de video-fase)

De Uitdaging: Wanneer een robot een video bekijkt, ziet hij dat mensen soms rechtuit lopen, soms naar links afbuigen om een hond te ontwijken, en soms stoppen voor een rood licht. Al deze acties zijn geldig voor dezelfde situatie. Als de robot probeert slechts één gemiddeld pad te raden, zal hij falen.

De Oplossing: De auteurs gebruiken iets dat Anchor-Guided Distribution Matching wordt genoemd.

  • De Analogie: Stel je voor dat de robot een chefkok is die een recept probeert te raden. In plaats van één smaak te raden, plaatst hij verschillende "Ankers" (zoals specifieke smaakprofielen: "Pittig", "Zoet", "Hartig") op tafel.
  • Hoe het helpt: De robot leert dat voor een specifieke situatie het antwoord "Pittig" (rechtdoor gaan) OF "Hartig" (naar links afbuigen) kan zijn. Door deze ankers te gebruiken, leert de robot om een menu van mogelijke goede acties te voorspellen in plaats van slechts één gemiddelde gok. Dit maakt de robot veel flexibeler en klaar voor verschillende scenario's.

2. Het "Residuele" Brein (Tijdens de oefenfase)

De Uitdaging: Zodra de robot begint te oefenen in de simulator, willen we dat hij nieuwe trucjes leert (zoals het ontwijken van een bewegende voetganger). Maar als we de robot alles vanaf nul laten opnieuw leren, kan hij vergeten hoe hij rechtuit loopt of een stoep herkent. Dit wordt "catastrofale vergetelheid" genoemd. Ook ziet de simulator er net even anders uit dan de echte wereld (andere belichting, texturen), wat de robot in de war kan brengen.

De Oplossing: Ze gebruiken een Residual-Attention Module.

  • De Analogie: Stel je voor dat de robot een "Basisbrein" heeft (het deel dat getraind is op video's) dat uitstekend is in het herkennen van straten. Wanneer hij de simulator binnengaat, vervangen we het Basisbrein niet. In plaats daarvan bevestigen we een klein, lichtgewicht "Add-on Brein" (de Residuele Module) bovenop het.
  • Hoe het helpt: Het Basisbrein blijft bevroren en houdt zijn algemene kennis veilig. Het Add-on Brein is het enige deel dat leert. Het focust zich alleen op de nieuwe, interactieve zaken: "O, die persoon beweegt, ik moet vertragen."
  • Het Voordeel: Dit is als het toevoegen van een nieuwe app aan je telefoon zonder je contacten te verwijderen. De robot krijgt nieuwe reactieve vaardigheden (ontwijken, stoppen) zonder zijn oude algemene kennis (het herkennen van een weg) te verliezen.

De Proefrit: NavBench-GS

Om te bewijzen dat dit werkt, bouwden de auteurs een nieuwe testomgeving genaamd NavBench-GS.

  • Wat is het? In plaats van te testen op platte 2D-beelden (zoals kijken naar een foto van een straat), bouwden ze een 3D-wereld die precies lijkt op de echte wereld, maar met echte fysica. Je kunt een bal tegen de robot gooien, en hij zal reageren.
  • De Resultaten:
    • Robots die alleen op video's zijn getraind (de "Touristen"), botsten vaak wanneer ze geconfronteerd werden met bewegende mensen of obstakels.
    • Robots die getraind zijn met de S2E-methode (de "Locals") waren veel beter. Ze bereikten hun bestemming vaker en botsten veel minder vaak.
    • De Efficiëntie-verrassing: De S2E-robot leerde sneller met minder data. Een robot getraind op slechts 100 uur aan data + simulator-oefening presteerde beter dan andere robots die getraind waren op meer dan 2.000 uur aan video-data. Dit bewijst dat interactieve oefening waardevoller is dan alleen het kijken naar meer video's.

Bewijs uit de Praktijk

Het team stopte niet bij simulaties alleen. Ze plaatsten hun robot op twee echte machines:

  1. Een wielrobot (zoals een bezorgbot).
  2. Een quadruped robot (een hondachtige robot).

Ze testten deze robots in echte straten met echte obstakels en mensen. De S2E-robots navigeerden succesvol door deze complexe omgevingen zonder voorafgaande specifieke training op die exacte straten (Zero-Shot Generalization). Ze konden op de stoep blijven en voetgangers ontwijken, wat bewees dat de vaardigheden die in de simulator zijn geleerd, perfect overkwamen naar de echte wereld.

Samenvatting

Het paper betoogt dat om robots echt slimme navigatoren te maken, we ze niet alleen meer video's kunnen voeren. We moeten ze laten oefenen. Door een stabiele "video-gebaseerde" fundering te combineren met een "oefen-gebaseerde" leermodule die de oorspronkelijke kennis niet overschrijft, kunnen robots veilig en efficiënt door de chaotische, echte wereld navigeren.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →