Stay Seated: Learning Omnidirectional Humanoid Locomotion on a Passive Mobile Chair with Casters
Dit artikel presenteert een reinforcement learning-framework dat een humanoïde robot in staat stelt om robuuste, zero-shot sim-to-real omnidirectionele zittende voortbeweging op een passieve mobiele stoel te bereiken door standaard velocity-tracking omgevingen uit te breiden met gespecialiseerde beloningen en contactinstellingen, terwijl wordt aangetoond dat het combineren van voet-slip regularisatie met symmetrie of curriculum learning effectief de balans vindt tussen energie-efficiëntie en tracking-prestaties.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je een robot voor die kan gaan zitten en aan een bureau kan werken, net als een mens. Jarenlang hebben ingenieurs robots geleerd om op twee benen te lopen, maar stilstaan vereist constante energie; de motoren van de robot moeten hard werken om alleen al het evenwicht te bewaren tegen de zwaartekracht, wat warmte genereert en vermogen verbruikt. Mensen hebben echter een eenvoudigere oplossing voor langdurige taken: wij zitten. Door ons gewicht op een stoel te laten rusten, bevrijden we onze spieren en kunnen we door de kantoorruimte bewegen zonder ooit op te staan. Deze eenvoudige observatie vormde de basis voor een nieuwe vraag voor onderzoekers in de robotica: kan een humanoïde robot leren om rond te bewegen terwijl hij zit, gebruikmakend van een wieltjesstoel en zijn eigen voeten om zichzelf naar voren, achteruit en opzij te duwen?
Een team van onderzoekers zette zich in om dit te beantwoorden door een robot te leren navigeren terwijl hij op een passieve, mobiele stoel zit. In tegen tegenstelling tot een zelfrijdende rolstoel die uit zichzelf beweegt, heeft deze stoel geen motor; het is een eenvoudige stoel op wieltjes. Om te bewegen, moet de robot zijn voeten gebruiken om tegen de vloer af te zetten, waardoor hij zowel zichzelf als de stoel in elke gewenste richting voortstuwt. De uitdaging is complex omdat de robot zijn lichaam niet simpelweg aan de stoel kan vergrendelen. Hij moet een delicaat, verschuivend evenwicht bewaren, waarbij zijn heupen in contact blijven met de stoel terwijl zijn voeten grip vinden op de grond om beweging te genereren. Als de robot het contact met de stoel verliest of te veel slipt, mislukt de taak.
Om dit op te lossen, gebruikten de onderzoekers een methode genaamd deep reinforcement learning, een proces waarbij een computerprogramma leert door middel van trial-and-error in een virtuele wereld. Ze begonnen met een standaard trainingsomgeving die ontworpen is voor staande robots en pasten deze aan om de zittende scenario's te bevatten. Ze lieten de robot geen video's zien van bewegende mensen en gaven hem ook geen vooraf geschreven reeks instructies over hoe hij moest lopen. In plaats daarvan vertelden ze de robot simpelweg welke snelheid en richting hij moest aanhouden, en lieten ze hem de rest zelf uitzoeken. Het "brein" van de robot ontving alleen basisinformatie over zijn eigen lichaamspositie en het commando dat hem werd gegeven, zonder speciale sensoren om de stoel of de vloer te voelen.
De onderzoekers testten verschillende manieren om het leerproces te begeleiden. Ze wilden zien of het toevoegen van specifieke regels over hoe de robot zijn voeten moest bewegen of hoe hij de linker- en rechterbenen moest behandelen, zou helpen. Eén regel bestrafte de robot als zijn voeten over de vloer slipten, in de hoop dit een vloeiendere beweging te laten stimuleren. Een andere regel moedigde de robot aan om de linker- en rechterbenen gelijkmatig te gebruiken, terwijl een derde regel de robot begon met gemakkelijke, langzame commando's voordat de moeilijkheid geleidelijk werd verhoogd.
De resultaten onthulden een verrassende waarheid over hoe de robot leerde. Wanneer de onderzoekers alleen de regel tegen het slippen van de voeten gebruikten, faalde de robot vaak op een vreemde manier. In plaats van te leren zichzelf naar voren te duwen, gaven sommige versies van de robot simpelweg op en bleven ze perfect stilstaan, waarbij ze de opdrachten om diagonaal te bewegen negeerden. De robot had een "lokaal arrest" gevonden, een oplossing die technisch gezien slipslippen voorkwam maar de werkelijke taak niet volbracht. Echter, wanneer de onderzoekers de no-slip regel combineerden met ofwel de symmetrieregel of de regel voor geleidelijke moeilijkheidsgraad, leerde de robot het succesvol. De robot ontdekte hoe hij zichzelf in alle richtingen kon voortstuwen zonder vast te komen zitten.
De meest effectieve aanpak combineerde een geleidelijke toename van de snelheid met een regel die een gebalanceerde beenbeweging aanmoedigde. Deze combinatie stelde de robot in staat om commando's met hoge precisie op te volgen, waarbij hij vaak beter presteerde dan een vergelijkbare robot die getraind was om te staan en te lopen. De onderzoekers analyseerden exact hoe de robot bewoog en ontdekten dat de richting van de verplaatsing de manier waarop de robot zijn benen gebruikte, beïnvloedde. Bij het bewegen naar achteren of opzij, plantte de robot één voet stevig en strekte hij zijn knie om de stoel weg te duwen. Bij het bewegen naar voren deed hij het tegenovergestelde: hij raakte de grond eerst met zijn hiel en boog vervolgens zijn knie om zichzelf en de stoel naar die voet toe te treken.
Dit verschil in beweging had een directe impact op de energie-efficiëntie. De robot was het meest efficiënt bij het bewegen naar achteren, gevolgd door het bewegen opzij. Voorwaartse beweging was de meest energie-intensieve taak, waarbij ongeveer twee keer zoveel inspanning nodig was als bij zijwaartse beweging op hoge snelheden. Dit kwam waarschijnlijk doordat de voorwaartse beweging vertrouwde op het buigen van de knie nadat de voet de grond raakte, een beweging die meer wrijving genereerde en meer kracht vereiste om de snelheid te behouden.
De studie concludeerde met een succesvolle test in de echte wereld. De onderzoekers namen het computerprogramma dat ze in de simulatie hadden getraind en installeerden dit direct op een fysieke robot zonder verdere aanpassingen. De robot, zittend op een echte stoel met wieltjes, begon onmiddellijk naar voren, achteruit en opzij te bewegen, en draaide zelfs rond, precies zoals hij in de virtuele training had gedaan. Het lukte de robot om zittend te blijven en commando's op te volgen met behulp van alleen zijn interne sensoren, wat bewees dat een robot kan leren te navigeren in een complexe, zittende omgeving zonder de stoel te hoeven zien of de vloer te hoeven voelen. Dit werk suggereert dat robots binnenkort bij ons aan het bureau kunnen aanschuiven, om rond te bewegen om gereedschap te pakken of zichzelf te herpositioneren terwijl ze blijven zitten, wat energie bespaart en een zeer menselijke manier van werken nabootst.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.