Joint On-and-Off Policy Learning for Vision-and-Language Navigation
Dit artikel introduceert JOP-VLN, een nieuw framework dat off-policy imitatie-leren synergetisch integreert met on-policy exploratie via een driestaps trainingspipeline om de staat van de kunst te bereiken op Vision-and-Language Navigation benchmarks.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een robot leert om jouw persoonlijke gids te zijn. Je wilt dat hij naar jouw stemcommando's luistert zoals, "Loop naar de keuken, sla linksaf bij de blauwe vaas en stop voor de koelkast," en dat hij dit vervolgens ook echt doet zonder tegen muren op te botsen of de weg kwijt te raken. Dit is de wereld van Vision-and-Language Navigation (VLN). Het is een tak van de robotica waarbij een "embodied agent" (een robot met een lichaam en ogen) moet leren navigeren door de chaotische, echte wereld via een camera en menselijke spraak moet begrijpen om rond te bewegen.
De grote uitdaging hier is dat robots vreselijk zijn in het leren van hun eigen fouten. Als je een robot leert door hem perfecte video's te laten zien van hoe hij moet lopen, leert hij die video's te kopiëren. Maar op het moment dat hij een nieuwe kamer binnenstapt of een stoel op een andere plek ziet, raakt hij in paniek omdat hij nooit heeft geleerd hoe hij moet herstellen wanneer er iets misgaat. Dit is als een student die de antwoorden op een oefentoets uit het hoofd leert, maar bevriest wanneer de leraar de cijfers verandert. Om dit op te lossen, proberen wetenschappers meestal twee verschillende dingen: of ze laten de robot meer voorbeelden van perfecte paden zien (Imitation Learning), of ze laten de robot ronddwalen en geven hem een "traktatie" (beloning) wanneer hij dichter bij het doel komt (Reinforcement Learning). Lange tijd waren deze twee methoden als twee aparte scholen die nooit met elkaar praatten.
Hier komt JOP-VLN kijken, een nieuw framework dat besluit om een gezamenlijk feestje te geven aan deze twee scholen. De onderzoekers hebben een systeem gebouwd dat de robot in drie duidelijke stadia leert, waarbij de veiligheid van het kopiëren van experts wordt vermengd met de dapperheid van het zelfstandig verkennen. Denk aan een trainingskamp waar de robot eerst de basis leert van een meestercoach, dan oefent op een versie van de wereld met "zijwieltjes" waarbij een vangnet hem opvangt als hij valt, en ten slotte de wildernis in gaat om te verkennen, maar met een speciale regel: hij betaalt alleen aandacht aan de momenten waarop hij in de war was of een fout maakte, en gebruikt die momenten om slimmer te worden.
Het paper introduceert deze driestaps pijplijn om het probleem op te lossen waarbij robots vastlopen wanneer ze met iets nieuws te maken krijgen. In de eerste fase leert de robot basis navigatievaardigheden en hoe hij wat hij ziet kan samenvatten, net zoals een student die het alfabet leert en leert een zin te schrijven. In de tweede fase probeert de robot te navigeren, en telkens wanneer hij uit koers raakt, grijpt een "god-mode" veiligheidssysteem (de oracle) in om zijn pad te corrigeren. De robot leert vervolgens van deze gecorrigeerde paden, waardoor hij effectief oefent in het herstellen van fouten. Dit is het "off-policy" gedeelte, waarbij hij leert van data verzameld door een mix van zijn eigen pogingen en de correcties van het veiligheidsnet.
De magie gebeurt in de derde fase, waar het paper alles combineert. De onderzoekers realiseerden zich dat als ze de robot willekeurig zouden laten verkennen, hij misschien alleen maar in cirkels zou dwalen of te zelfverzekerd zou worden over slechte gewoontes. Daarom voegden ze een slim filter toe: ze laten de robot alleen leren van de momenten waarop hij echt onzeker was of "high-entropy" (een chique manier om te zeggen dat hij wild aan het gokken was). Dit voorkomt dat de robot tijd verspilt aan gemakkelijke taken die hij al kent en dwingt hem om zich te concentreren op de moeilijke zaken. Bovendien hebben ze de trainingsdata gesorteerd zodat de robot de meeste tijd besteedt aan het oefenen van de specifieke paden waar hij eerder faalde, wat ervoor zorgt dat hij leert hoe hij zijn eigen fouten kan herstellen.
De resultaten van deze aanpak zijn indrukwekkend. Wanneer getest op standaard navigatiebenchmarks, behaalde JOP-VLN een succespercentage van 69,9% op de R2R-dataset en 68,0% op de RxR-dataset. Deze cijfers vertegenwoordigen een nieuwe state-of-the-art, wat betekent dat het eerdere methoden die vertrouwden op slechts één type leren, heeft overtroffen. De onderzoekers hebben de robot ook getest in de echte wereld, met behulp van een viervoetige robot hond in zowel binnenkant kantoren als buiten tuinen. Zelfs met de rommelige realiteit van echte lichtinval en texturen, kon de robot complexe instructies volgen, wat bewijst dat deze "gezamenlijke" leerstijl het beter kan generaliseren dan voorheen. Het paper suggereert dat door expertbegeleiding zorgvuldig te mengen met slimme, op fouten gerichte exploratie, we robots kunnen boueren die niet alleen goed zijn in het volgen van regels, maar ook veerkrachtig genoeg zijn om de onverwachte wendingen van de echte wereld aan te kunnen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.