Robostral Navigate
Robostral Navigate is een 8B vision-language model dat state-of-the-art monoculaire navigatie bereikt over diverse robotbelichamingen door gebruik te maken van een schaalbaar trainingsrecept met 2,4 miljoen gesimuleerde trajecten, prefix-caching efficiëntie en waypoint-voorspelling in de beeldruimte om de noodzaak voor dieptesensoren of vooraf gebouwde kaarten te elimineren.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een robot leert om een gids te zijn. In de wereld van de robotica wordt dit "embodied navigation" genoemd — het vermogen van een machine om een gesproken commando zoals "ga naar de keuken" te begrijpen en er ook daadwerkelijk naartoe te lopen zonder tegen muren aan te botsen. Lange tijd waren de beste gidsen als hoogwaardige astronauten: ze hadden dure, zware uitrusting nodig om hun werk te doen. Ze droegen speciale 3D-brillen (dieptesensoren), voerden meerdere camera's met zich mee als een beveiligingsteam, of vertrouwden op vooraf getekende kaarten van het hele gebouw. Hoewel deze robots goed waren, waren ze ook duur, kwetsbaar en moeilijk te integreren in een eenvoudige bezorgdrone of een klein wiel in een magazijn. De grote vraag die wetenschappers zich hebben gesteld is: Kunnen we een robot bouwerken die net zo slim is, maar gebruikmaakt van het eenvoudigste, meest voorkomende hulpmiddel dat beschikbaar is? Het antwoord ligt in een enkele, standaard camera — het soort dat in bijna elke telefoon en robot van vandaag te vinden is — en een brein dat krachtig genoeg is om de rest uit te vogelen.
Dit artikel introduceert Robostral Navigate, een nieuw soort robotbrein dat is ontworpen om het navigatiepuzzel op te lossen met alleen die enkele, standaard camera. Denk aan een robot die geen 3D-kaart of een laserscanner nodig heeft; in plaats daarvan leert hij om "te wijzen" naar de volgende stap op een reis door simpelweg naar een afbeelding te kijken. De onderzoekers bouwden een "vision-language model" met 8 miljard parameters (een superintelligent AI die kan lezen en zien) en leerden het te navigeren door het miljoenen voorbeelden te tonen in een video game-achtige simulatie. In plaats van complexe wiskunde te berekenen over hoe ver het in meters moet bewegen, wijst het model simpelweg naar waar het als volgende naartoe wil op het scherm. Als de bestemming om een hoek verborgen is, schakelt het over naar een back-upplan waarbij het een specifieke afstand vooruit beweegt.
Het team kwam tot de conclusie dat deze eenvoudige aanpak ongelooflijk krachtig is. Door het model te trainen op 2,4 miljoen gesimuleerde reizen verspreid over 350.000 verschillende scènes, creëerden ze een systeem dat niet alleen goedkoper en gemakkelijker te bouwen is, maar ook slimmer dan veel robots met luxe sensoren. Bij standaardtests behaalde Robostral Navigate een succespercentage van 77,4% in het vinden van de weg, waarmee het de beste eerdere single-camera robots met een ruime marge versloeg en zelfs sommige robots die dieptesensoren of meerdere camera's gebruikten, overtrof. Het geheime ingrediënt was niet alleen het wijzen; het was een nieuwe trainingsmethode die het leerproces 22 keer sneller maakte en een reinforcement learning-fase die de robot leerde hoe hij moest herstellen wanneer hij verdwaald was. Het resultaat is een robot die kan overstappen van een karretje op wielen naar een lopende machine of een vliegende drone zonder opnieuw te hoeven worden onderwezen, wat bewijst dat je geen miljoenen kostende sensor suite nodig hebt om een echt algemeen bruikbare robot te bouwen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.