Reinforcement Learning for Real-Time Vision-Language-Action Policies
Dit artikel introduceert Real-Time EXPO-FT, een reinforcement learning-framework dat de trage, expressieve actiegeneratie ontkoppelt van snelle, reactieve actie-editing om een efficiënte aanpassing van grote Vision-Language-Action-modellen aan de werkelijke dynamiek mogelijk te maken, ondanks inferentielatentie.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Robots worstelen al lang met het bewegen met de vloeiendheid van levende wezens. Hoewel ze geprogrammeerd kunnen worden om een rigide reeks instructies in een fabriek te volgen, is de echte wereld rommelig, onvoorspelbaar en beweegt deze snel. Om dit te navigeren, hebben onderzoekers zich gericht op een type kunstmatige intelligentie dat bekend staat als een vision-language-action model. Dit zijn enorme computerprogramma's die getraind zijn op enorme hoeveelheden data, waardoor ze kunnen begrijpen wat ze zien via een camera, een tekstuele instructie kunnen lezen en kunnen beslissen hoe ze een robotarm moeten bewegen. Ze zijn krachtig omdat ze zo veel voorbeelden hebben gezien van hoe de wereld werkt, wat fungeert als een enorme bibliotheek aan ervaring. Er zit echter een aanzienlijke adder onder het gras: omdat deze modellen zo groot en complex zijn, hebben ze een merkbare tijd nodig om na te denken. In de fractie van een seconde die de computer nodig heeft om een afbeelding te verwerken en een beweging te beslissen, is de fysieke wereld al veranderd. Als een robot probeert een bal te vangen of een object in evenwicht te houden, is de informatie die het gebruikte om een beslissing te nemen al verouderd op het moment dat de actie daadwerkelijk wordt uitgevoerd, wat vaak leidt tot het falen van de actie.
Een team van onderzoekers aan de Stanford University heeft een nieuwe manier ontwikkeld om deze grote modellen te leren hoe ze in realtime moeten handelen, zelfs wanneer ze traag zijn in hun denken. Hun aanpak, genaamd Real-Time EXPO-FT, lost het probleem van vertraging op door de besluitvorming van de robot te splitsen in twee afzonderlijke delen. In plaats van het enorme, trage model elke kleine, snelle aanpassing te laten maken, laten ze het de zware taken uitvoeren van het plannen van een algemeen pad, terwijl een veel kleiner, sneller computerprogramma de onmiddellijke correcties afhandelt. Stel je een dirigent voor die een orkest leidt; de dirigent bepaalt het algemene tempo en de melodie, maar de individuele muzikanten moeten hun spel direct aanpassen om in de pas te blijven. In dit systeem fungeert het grote model als de dirigent, die een reeks bewegingen voorstelt op basis van wat het een moment geleden zag. Vervolgens kijkt een lichtgewicht assistent naar de huidige staat van de wereld en maakt razendsnelle, kleine aanpassingen aan die voorgestelde bewegingen om ervoor te zorgen dat ze nog steeds correct zijn voor het exacte moment waarop de robot moet handelen. Dit stelt de robot in staat om de diepe kennis van het grote model te gebruiken zonder dat het wordt tegengehouden door de trage denksnelheid ervan.
De onderzoekers testten deze methode in twee zeer verschillende omgevingen: een gesimuleerde wereld van fysica en de werkelijke fysieke wereld. In de simulatie daagden ze de robot uit met tien verschillende dynamische taken, zoals het balanceren van een bal op een plaat, het trappen tegen een voetbal terwijl een verdediger wordt vermeden, en het vangen van een bewegend object. Ze vergeleken hun nieuwe methode met verschillende bestaande technieken die probeerden om te gaan met vertragingen. De resultaten waren duidelijk: de nieuwe aanpak stelde de robot in staat om bijna elke enkele poging te voltooien, waarbij het alle andere methoden overtrof, inclus\tijf de methoden die helemaal geen last hadden van vertragingen. Dit was een belangrijke bevinding, omdat het aantoonde dat door het systeem expliciet te leren rekening te houden met zijn eigen traagheid, de robot betrouwbaarder kon worden dan systemen die theoretisch sneller waren maar minder aanpasbaar.
Om te bewijzen dat dit ook in de echte wereld werkte, verplaatste het team de robot naar een laboratoriumsetting en gaf het vier uitdagende taken die constante, snelle reacties vereisten. Deze omvatten het in evenwicht houden van een pingpongbal op een roterende plaat, het oppakken van een blok van een draaiend oppervlak, het vangen van een object dat door een andere robotarm wordt doorgegeven, en het trappen van een bal in een doel terwijl een verdediger rond beweegt. De onderzoekers beperkten de trainingstijd tot slechts tien minuten waarin de robot met de omgeving interacteerde, om ervoor te zorgen dat het systeem snel kon leren zonder eindeloze uren oefening nodig te hebben. Voordat ze hun methode toepasten, was het succespercentage van de robot bij deze taken vrij laag, gemiddeld rond de 42 procent. Na het toepassen van het nieuwe real-time trainingsframework sprong het succespercentage naar 97 procent. De robot leerde zich aan te passen aan de chaotische bewegingen van de objecten en de tijdsbeperkingen van de taken zonder menselijke tussenkomst tijdens het trainingsproces.
De studie onderzocht ook hoe goed het systeem standhield onder verschillende omstandigheden. Wanneer de onderzoekers de vertraging in het denkproces van de robot kunstmatig vergrootten, behield de nieuwe methode haar hoge prestatieniveau, terwijl andere methoden faalden naarmate de vertraging langer werd. Op dezelfde manier, wanneer de snelheid van de bewegende objecten toenam, bleef de robot die het nieuwe framework gebruikte succesvol, terwijl andere benaderingen moeite hadden om het bij te houden. Dit demonstreert dat het systeem niet alleen werkt voor een specifieke snelheid of vertraging, maar robuust genoeg is om de onvoorspelbare aard van een dynamische omgeving aan te kunnen. De onderzoekers merkten op dat hoewel hun systeem zeer effectief is, het nog steeds afhankelijk is van een mens om de robot na een taak te resetten, en dat het een specifieke manier vereist om succes voor elke taak te definiëren. De kernprestatie is echter een demonstratie dat grote, krachtige AI-modellen realtime werkend kunnen worden gemaakt, waarmee de kloof wordt overbrugd tussen het trage, bedachte plannen van kunstmatige intelligentie en de snelle, reactieve eisen van de fysieke wereld.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.