Qwen-RobotNav Technical Report: A Scalable Navigation Model Designed for an Agentic Navigation System
Qwen-RobotNav is een schaalbaar, geparametriseerd navigatiemodel dat is getraind op 15,6 miljoen samples en dat agentische systemen in staat stelt om observatiestrategieën en taakmodi tijdens de inferentie dynamisch te herconfigureren zonder architecturale wijzigingen, waarbij het state-of-the-art prestaties en sterke zero-shot generalisatie bereikt over diverse benchmarks en real-world robots.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een superintelligente robot hond of een zelfrijdende auto hebt. Je wilt dat het veel verschillende dingen doet: een gesproken instructie opvolgen zoals "ga naar de keuken", een bewegend persoon achtervolgen, een verloren set sleutels vinden, of veilig door het verkeer rijden.
Normaal gesproken is het bouwen van een robot die al deze dingen kan doen, als het proberen in te huren van één persoon die tegelijkertijd een meesterkok, een racewagenchauffeur en een detective is. Dat is ongelooflijk moeilijk, omdat elke baan een andere manier vereist om naar de wereld te kijken. Een detective moet zich herinneren wat er uren geleden gebeurde, terwijl een racewagenchauffeur alleen geeft om wat er op dit exacte moment recht voor hem gebeurt.
Qwen-RobotNav is een nieuw "brein" voor robots dat dit probleem oplost. In plaats van een apart brein te bouwen voor elke taak, hebben de onderzoekers één flexibel brein gebouwd dat van "bril" kan veranderen afhankelijk van wat het doet.
Hier is hoe het werkt, met behulp van eenvoudige analogieën:
1. Het "Zwitserse Zakmes"-brein
Denk aan Qwen-RobotNav als een Zwitsers zakmes. De meeste navigatierobots zijn als een enkele schroevendraaier; ze zijn erg goed in één ding, maar nutteloos voor andere zaken. Qwen-RobotNav is het hele gereedschap.
- De Schakelaar: Het heeft een "modus-schakelaar". Als je zegt "volg die persoon", schakelt het over naar Tracking Mode (Volgmodus). In deze modus zet het een "snelle bril" op die alleen naar de laatste paar seconden video kijkt en de oude geschiedenis negeert, zodat het direct kan reageren.
- Het Geheugen: Als je zegt "zoek de rode bank", schakelt het over naar Search Mode (Zoekmodus). Hier zet het een "groothoekbril" op die alles onthoudt wat het de afgelopen 10 minuten heeft gezien, zodat het niet in cirkels loopt.
- De Magie: Het beste deel is dat je de robot niet opnieuw hoeft te trainen om van deze brillen te veranderen. Je vertelt hem gewoon wat hij moet doen, en hij past direct aan hoe hij zijn aandacht op de wereld richt.
2. Een "Slim Budget" voor de ogen
Robots hebben een limiet aan hoeveel visuele informatie ze tegelijkertijd kunnen verwerken (zoals een computer die zonder RAM komt te zitten).
- Het Probleen: Als een robot 100 frames van video bekijkt, kan hij overweldigd raken. Als hij slechts 1 frame bekijkt, mist hij misschien een cruciaal detail.
- De Oplossing: Qwen-RobotNav gebruikt een Slim Budget. Stel je voor dat je $100 hebt om uit te geven aan foto's van een kamer.
- Als je aan het rijden bent, geef je het grootste deel van je geld uit aan de foto van de weg op dit moment (het vooraanzicht) en heel weinig aan het achterzicht.
- Als je op zoek bent naar een verloren item, verspreid je je geld om foto's van de hele kamer over de afgelopen paar minuten te kopen.
- De robot leert deze berekening automatisch te doen. Hij beslist precies hoeveel "pixels" (visuele details) hij voor elke camera en elk moment in de tijd moet bewaren, gebaseerd op de taak.
3. Leren van een "Mega-Mix" van ervaringen
Om deze robot te leren, hebben de onderzoekers hem niet alleen één type video laten zien. Ze voerden hem een enorme "smoothie" van 15,6 miljoen verschillende ervaringen:
- Instructies opvolgen: "Draai links bij de blauwe stoel."
- Puntnavigatie: "Ga naar coördinaat (5, 2)."
- Object zoeken: "Zoek de tv-afstandsbediening."
- Volgen: "Volg de man met de zwarte hoed."
- Rijden: "Rij veilig door een kruispunt."
Ze voegden ook algemene "wereldkennis" toe (zoals het lezen van borden of het herkennen van objecten), zodat de robot niet vergeet hoe hij taal begrijpt terwijl hij leert bewegen. Dit voorkomt dat de robot een "hersendloze reflexmachine" wordt die alleen maar beweegt zonder na te denken.
4. Het "Manager en Werker" Systeem
Voor zeer lange en ingewikkelde taken (zoals "Vind de groene paraplu bij het koffietentje en vertel me of hij er is"), werkt de robot in een team:
- De Manager (Upper Planner): Dit is een hoogwaardige AI die het grote doel opdeelt in kleine stappen. Deze beslist: "Ga eerst naar de gang. Kijk dan naar het koffietentje."
- De Werker (Qwen-RobotNav): Dit is het navigatiemodel. De Manager vertelt de Werker: "Ga naar het koffietentje, maar gebruik je 'Search Mode' met een groot geheugengebruik."
- De Loop: De Werker gaat, vindt de winkel en rapporteert terug: "Ik ben hier, maar de paraplu is er niet." De Manager werkt zijn geheugen bij en zegt: "Oké, controleer de tafel als volgende." Dit gebeurt steeds opnieuw totdat de taak voltooid is.
5. Resultaten in de echte wereld
Het artikel laat zien dat deze robot niet slechts een simulatietruc is.
- Het wint wedstrijden: Het versloeg andere toprobots in tests voor het opvolgen van instructies, het vinden van objecten en het volgen van bewegende doelen.
- Het rijdt: Het leerde auto's veilig door complexe verkeerssimulaties te besturen.
- Het werkt op echte robots: Het team testte het op een echte robot hond in een echt gebouw dat het nog nooit eerder had gezien. Ze gaven het gesproken instructies zoals "Loop naar de medische kamer, draai je dan om en loop achteruit." De robot navigeerde succesvol door het vreemde gebouw, gebruikte herkenningspunten om de weg te vinden en liep zelfs precies zoals gevraagd achteruit.
Samenvattend: Qwen-RobotNav is een universeel navigatiebrein dat leert om zijn eigen aandacht te "tunen". Het weet wanneer het zich op het huidige moment moet concentreren en wanneer het het verleden moet onthouden, waardoor één enkele robot tegelijkertijd een chauffeur, een volger en een zoeker kan zijn.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.