PGN: Design and Implementation of a Vision-Language Navigation System Based on Pangu Multimodal Foundation Model
Dit artikel presenteert PGN, een offline Vision-Language Navigation-systeem gebouwd op het OpenPangu-7B basismodel dat een tweestaps trainingsstrategie gebruikt om visuele en talige modaliteiten uit te lijnen en zich aan te passen aan expert-trajecten, waarbij een Normalized Action Match van 62,29% wordt bereikt op gehouden data terwijl gebruik wordt gemaakt van mixed-precision berekening en DeepSpeed op Ascend 910B hardware.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je een wereld voor waarin robots niet alleen rigide, vooraf geprogrammeerde lijsten met commando's volgen, maar je ook echt kunnen begrijpen zoals een menselijke vriend dat kan. Dit is de droom van "embodied AI" — een machine een lichaam geven (of een camera en wielen) en een brein dat de kamer kan zien, je stem kan horen en kan uitzoeken hoe het zich moet verplaatsen. De grote uitdaging is het verbinden van twee zeer verschillende talen: de visuele wereld van pixels en kleuren, en de taalkundige wereld van zinnen en instructies. Denk eraan als het proberen te leren aan een hond om door een huis te navigeren met behulp van alleen een kaart die in poëzie is geschreven. Je hebt een manier nodig om "loop langs de keuken" te vertalen naar een reeks fysieke draaiingen en stappen. Dit is de kernpuzzel van Vision-Language Navigation (VLN). Het gaat niet alleen om het herkennen van objecten; het gaat om het begrijpen van het verhaal van een kamer in de loop van de tijd, het onthouden waar je bent geweest, en beslissen wat je nu gaat doen op basis van een eenvoudige zin.
Maak kennis met PGN, een nieuw systeem gebouwd door onderzoekers van de University of Electronic Science and Technology of China, ontworpen om dit puzzelstukje op te lossen met een krachtig "brein" genaamd OpenPangu-7B. Je kunt OpenPangu zien als een superintelligent, vooraf getraind taalmodel dat al weet hoe het moet spreken en schrijven, maar het weet nog niet hoe het moet zien of bewegen. Het doel van de onderzoekers was om deze taalreus te leren hoe hij door een virtueel huis kan navigeren door hem foto's en instructies te tonen. Ze hebben de robot niet zomaar in het diepe gegooid; ze bouwden een trainingskamp met twee stappen. Eerst leerden ze de robot hoe hij kon "zien" door zijn taalbrein te verbinden met een gespecialiseerd camera-oog (een vision encoder) via een vertaalmodule genaamd een Q-Former. Dit stelde de robot in staat om te begrijpen dat een foto van een vaas gerelateerd is aan het woord "vaas".
Zodra de robot de verbinding tussen afbeeldingen en woorden kon begrijpen, begon de tweede fase: leren bewegen. Het team voedde het systeem met duizenden voorbeelden van perfecte navigatiepaden die zijn afgelegd door een "expert" (een computerprogramma dat nooit fouten maakt). De robot leerde om naar een opeenvolging van vijf recente opnames van de kamer te kijken, de instructie te lezen en vervolgens — cruciaal — na te denken voordat hij handelde. In plaats van simpelweg "draai links" te roepen, werd het model getraind om eerst een klein stukje redeneertekst te genereren, zoals een mens die zegt: "Oké, ik zie de keuken aan mijn linkerkant, dus ik moet naar links draaien," voordat het de actie uitvoert. Ze testten dit systeem op 500 verborgen testpaden waarbij de robot de juiste geschiedenis kreeg van wat het had gezien, en werd gevraagd de volgende beweging te voorspellen. De resultaten waren veelbelovend: in de nieuwste versie (V9) kwam de actie van de robot in 62,29% van de gevallen overeen met die van de expert en gaf hij bijna altijd een niet-leeg antwoord (100% van de tijd). De auteurs merken echter zeer zorgvuldig op dat dit een "teacher-forced" test is. Het is als een student die een meerkeuzetoets maakt waarbij de leraar bij elke stap het juiste antwoord laat zien. De robot is nog niet echt getest op de vraag of hij kan herstellen als hij een fout maakt of of hij succesvol een doel kan bereiken in een echte, rommelige omgeving zonder hulp. Hoewel het systeem aantoont dat een groot taalmodel kan worden aangepast om navigatie-instructies te begrijpen en afgestemd te worden op expert-acties, concludeert het artikel dat de echte test om te zien of deze robot daadwerkelijk zelfstandig door een huis kan navigeren, nog een taak is voor de toekomst.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.