LocalNav: Distilling Frontier VLMs and Embodied RL for On-Device Object Goal Navigation
Dit artikel presenteert "LocalNav", een framework dat complexe ruimtelijk-semantische redenering destilleert van geavanceerde Vision Language Models naar een lichtgewicht model met 4 miljard parameters en dit optimaliseert met E-RLVR en kwantisatie, waardoor hoogwaardige, lage-latentie objectdoelnavigatie op middelenbeperkte edge-apparaten mogelijk wordt zonder afhankelijk te zijn van cloud-executie.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een heel slimme, maar ook heel zware, robot hersenen hebt. Dit brein is als een gigantische bibliotheek vol kennis die complexe instructies kan begrijpen zoals: "Zoek de laden onder de magnetron." Het probleem is dat dit brein zo groot en zwaar is dat het niet in een kleine robot past; het moet in een enorme cloud-computer ver weg wonen. Elke keer als de robot een beslissing moet nemen, moet hij een bericht naar de cloud sturen, wachten op een antwoord, en dan bewegen. Dit is traag, duur en werkt niet als de robot op een plek is zonder internet.
Het artikel introduceert LocalNav, een nieuwe manier om dat gigantische brein te verkleinen zodat het in een kleine robot past (zoals een met een Jetson Orin-chip) en volledig zelfstandig kan werken, zonder de cloud nodig te hebben.
Zo hebben ze het gedaan, met drie eenvoudige stappen:
1. De "Schaduwstudent" (Distillatie)
Beschouw het gigantische cloud-brein (zoals Claude of GPT) als een Meesterkok. De Meesterkok kan een perfect, complex gerecht bereiden, maar dat kost veel tijd en gebruikt een enorme keuken. De onderzoekers wilden een Studentkok (een veel kleiner model met 4 miljard parameters genaamd Qwen3.5-4B) leren hoe hij dezelfde gerechten moet maken.
In plaats van de student te dwingen om miljoenen kookboeken te lezen, lieten ze de student ongeveer 500 voorbeelden zien van de Meesterkok die navigatiepuzzels oplost. Ze zeiden: "Kijk hoe de Meesterkok denkt: 'Ik zie een magnetron, dus de laden moeten eronder zitten.'" Door deze specifieke voorbeelden te kopiëren, leerde de Studentkok net zo goed te navigeren als de Meesterkok, maar met een brein dat klein genoeg is om in een rugzak te passen.
- Het resultaat: Het kleine robotbrein bereikte een succespercentage van 34,5%, wat erg dicht bij de 39,7% van het gigantische cloud-brein ligt.
2. De "Beknoptheidscoach" (E-RLVR)
Er was één addertje onder het gras: de Studentkok was een beetje te praatgraag. Wanneer hem gevraagd werd om de laden te zoeken, zou de Meesterkok kunnen zeggen: "Ik zie een zilveren apparaat dat op een magnetron lijkt, en ik herinner me dat laden meestal onder magnetrons zitten, dus ik ga daarheen." Dat zijn veel woorden om te typen! Voor een robot met beperkte batterij en rekenkracht kost het typen van al die woorden te veel tijd.
Om dit op te lossen, gebruikten de onderzoekers een techniek genaamd E-RLVR (Embodied Reinforcement Learning from Verifiable Rewards). Stel je een strenge coach voor die de student-robot in de gaten houdt.
- Als de robot te lang doet over het antwoorden of te veel woorden gebruikt, geeft de coach een "onvoldoende".
- Als de robot het object snel vindt en zegt: "Laden gevonden. Klaar!" in slechts een paar woorden, geeft de coach een "gouden ster".
De robot leerde om te "doen" in plaats van te "praten". Hij ontdekte hoe hij de klus kon klaren met zo min mogelijk woorden. Dit verminderde de tijd die nodig was om na te denken en te spreken met 71,8%.
3. Het "Compacte Pak" (Quantisatie)
Om de robot zelfs nog sneller te maken, stopten ze het brein in een "compact pak". Dit is een technische truc die quantisatie wordt genoemd, wat vergelijkbaar is met het comprimeren van een foto met een hoge resolutie naar een kleiner bestand zonder de belangrijke details te verliezen. Dit zorgde ervoor dat het brein van de robot nog sneller draaide op zijn kleine hardware.
De Einduitslag
Door deze drie trucs te combineren:
- Leren van een Meester (Distillatie),
- Leren om beknopt te zijn (E-RLVR), en
- Het brein comprimeren (Quantisatie),
creëerden de onderzoekers een robot die complexe instructies kan begrijpen zoals "Zoek de persoon die aan de tafel zit" en zelfstandig door een echt appartement kan navigeren, zonder dat hij internet nodig heeft.
In hun real-world test stuurden ze een handbediende robot een appartement binnen met vier verschillende missies: vind een bank, een piano, een badkuip en een persoon. De robot slaagde erin een mentale kaart van de kamers op te bouwen, de objecten te vinden en precies te stoppen waar hij moest stoppen, waarmee bewezen werd dat een klein, lokaal brein het werk van een gigantisch cloud-brein kan doen.
Kortom: Ze namen een superintelligent maar traag cloud-brein, leerden een klein lokaal brein om zoals dat te denken, leerden het kleine brein om niet zo veel te praten, en persten het in een pieklein pakketje. Nu kan de robot snel denken en bewegen, direct op het apparaat zelf.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.