Closing the Loop on the Poppy Humanoid: Bipedal Locomotion with Linear-Quadratic Control and Learned Cost Functions
Dit artikel presenteert een closed-loop loopcontroller voor de Poppy Humanoid robot die gebruikmaakt van een Linear-Quadratic Regulator (LQR) raamwerk met een geleerde kostenfunctie om betrouwbare, onondersteunde bipedale voortbeweging te bereiken, waarbij statistisch significante prestatieverbeteringen ten opzichte van open-loop trajectafspelen worden aangetoond.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Lopen is een prestatie van constante, onzichtbare berekening. Voor een mens is het een naadloze stroom van evenwicht, waarbij de hersenen en het lichaam elke seconde duizenden micro-aanpassingen maken om ons rechtop te houden. Voor een robot is dezezelfde taak een wankele koorddans. De uitdaging is niet alleen het bewegen van de benen, maar dit doen zonder om te vallen, vooral wanneer de machine is gebouwd van lichtgewicht, goedkope onderdelen die niet beschikken over de perfecte sensoren of krachtige motoren van een hoogwaardige industriële robot. Dit is de specifieke puzzel waar onderzoekers die werken met de Poppy Humanoid voor staan, een kleine, open-source robot ontworpen voor educatie en studie. Hoewel de Poppy een toegankelijk platform is om te leren over kunstmatige intelligentie, heeft het historisch gezien moeite gehad om zelfstandig te lopen. Zonder constante menselijke hulp om het te stabiliseren, zou de robot snel zijn evenwicht verliezen en vallen, wat de bruikbaarheid beperkt tot een demonstratie in een klaslokaal in plaats van een echte autonome machine.
De kern van de moeilijkheid ligt in de hardware van de robot. Het is gemaakt van 3D-geprinte plastic ledematen en vertrouwt op motoren die alleen kunnen worden verteld waar ze naartoe moeten wijzen, niet hoeveel kracht ze moeten uitoefenen. Bovendien mist de robot de hogesnelheidssensoren die in duurdere machines te vinden zijn, wat betekent dat hij niet de weg kan "voelen" tijdens een stap in realtime. Eerdere pogingen om de Poppy te laten lopen involveerden het afspelen van een vooraf opgenomen sequentie van bewegingen, zoals een tapeopname. Deze open-loop benadering werkte alleen als de vloer perfect was en de robot in een perfecte positie begon. Op het moment dat er een kleine fout optrad — een lichte wankeling of een slipje — had de robot geen manier om zichzelf te corrigeren, en de fout zou zich opstapelen totdat de robot viel. De vraag waarmee onderzoekers werden geconfronteerd was of het mogelijk was om deze fragiele, goedkope machine te leren om te gaan met haar eigen fouten en betrouwbaar te lopen zonder menselijke tussenkomst.
Een team van onderzoekers aan de Syracuse University zette zich af om dit op te lossen door de Poppy een eenvoudige vorm van zelfcorrectie te geven. In plaats van alleen een vast script af te spelen, bouwden zij een systeem dat de gewrichten van de robot in realtime observeert en kleine, onmiddellijke aanpassingen maakt om op koers te blijven. Ze begonnen met het opnemen van honderden looppogingen, sommige succesvol en vele die eindigden in een val. Door het verschil te analyseren tussen de bewegingen die wel werkten en de bewegingen die faalden, leerden ze een computerprogramma om de vroege tekenen van een struikeling te herkennen. Het programma leerde een set regels die een "kostprijs" toekende aan elke mogbare beweging, waarbij een hoge kostprijs een hoog risico op vallen betekende. Het gebruikte deze regels vervolgens om de best mogelijke kleine correctie op elk moment te berekenen, waardoor effectief een vangnet werd gecreëerd dat de robot kon gebruiken om rechtop te blijven staan.
De resultaten van deze aanpak waren opmerkelijk. Wanneer de onderzoekers de robot testten in een standaard kantooromgeving, liet de oude methode van het afspelen van een vast script de robot een gemiddelde van net iets meer dan vier stappen voltooien voordat hij viel. Met het nieuwe, zelfcorrigerende systeem slaagde de robot erin aanzienlijk verder te lopen, met een gemiddelde van meer dan vijf stappen vóór een val, en voltooide hij de volledige zes-stappensequentie in bijna 80 procent van de proeven. De verbetering was nog opmerkelijker toen de robot werd getest in een andere kamer met een gladde vloer, een oppervlak dat hij nog nooit eerder had gezien. In deze nieuwe omgeving daalde het succespercentage voor de oude methode naar 30 procent, maar het nieuwe systeem slaagde nog steeds in 42,5 procent van de gevallen. Dit bewees dat de robot niet alleen een specifiek pad aan het memoriseren was, maar een algemeen vermogen had geleerd om zichzelf te balanceren tegen verschillende omstandigheden.
De sleutel tot dit succes was niet een complexe nieuwe hersenstructuur, maar een verfijnde manier van het gebruik van de data die de robot al genereerde. De onderzoekers hoefden geen nieuwe sensoren te bouwen of het fysieke ontwerp van de robot te veranderen. In plaats daarvan gebruikten ze een wiskundig kader dat bekend staat als een lineair-kwadratische regulator, een methode voor het vinden van het meest efficiënte pad naar een doel terwijl fouten worden geminimaliseerd. Door het systeem data te voeden van de eigen mislukte pogingen van de robot, waren ze in staat de robot te leren welke afwijkingen van het geplande pad gevaarlijk waren. Het systeem leerde bewegingen te bestraffen die eruit zagen alsof ze tot een val zouden leiden, waardoor de robot terug naar een stabiel middelpunt werd gestuurd. Dit stelde de robot in staat om kleine schokken en wankelingen op te vangen die voorheen tot een instorting zouden hebben geleid, waardoor een rigide, breekbare machine werd getransformeerd in een machine die zich aan de echte wereld kon aanpassen.
Dit werk vormt een belangrijke stap voorwaarts voor betaalbare robotica. Het bewijst dat zelfs een robot die is gebouwd van goedkope, kant-en-klare onderdelen met beperkte sensoren, betrouwbare, autonome beweging kan bereiken als deze is uitgerust met het juiste soort leren. De onderzoekers lieten zien dat door een eenvoudige besturingsstrategie te combineren met datagestuurd leren, zij de kloof konden dichten tussen een robot die een mens nodig heeft om zijn hand vast te houden en een robot die uit zichzelf kan lopen. Hoewel de robot nog steeds langzaam beweegt en nog geen complexe taken heeft beheerst zoals draaien of lopen op snelheid, is het vermogen om te lopen zonder te vallen een fundamentele vereiste voor elke toekomstige toepassing. De studie bevestigt dat met de juiste software de beperkingen van goedkope hardware kunnen worden overwonnen, wat de deur opent naar meer toegankelijke en capabele robots voor onderzoek en educatie.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.