Weave: Learning Whole-Body Dexterous Loco-Manipulation from Human-Object Interactions
Weave is een verenigd framework dat hele lichaamsbrede, behendige loco-manipulatie voor humanoïde robots leert van menselijke demonstraties door deze om te zetten in uitvoerbare referenties via contactbewuste retargeting en door een geometrie-bewust beleid toe te passen om hoge succespercentages te bereiken in zowel getrainde als onbekende interactiescenario's.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Om een robot te bouwen die door een menselijke wereld kan bewegen, worden ingenieurs geconfronteerd met een coördinatieprobleem dat veel complexer is dan simpelweg een machine leren lopen of dingen op te pakken. Een robot moet beide tegelijkertijd kunnen doen, vaak terwijl hij een object vasthoudt dat zijn gewicht verschuift en verandert hoe hij zijn evenwicht bewaart. Dit staat bekend als loco-manipulatie, een term die de moeilijke taak beschrijft van het bewegen van het lichaam terwijl men tegelijkertijd een object met de handen manipuleert. Voor een robot om te slagen, kan hij lopen en grijpen niet als aparte taken behandelen; als hij naar een stoel reikt zonder zijn voeten aan te passen, zal hij omvallen. Als hij naar een tafel loopt zonder te plannen hoe zijn vingers het oppervlak zullen raken, zal hij falen om deze op te tillen. De uitdaging ligt in het leren aan een machine dat zijn hele lichaam, van zijn voeten tot zijn vingertoppen, als een enkele, gebalanceerde eenheid moet werken om met de fysieke wereld te interageren.
Onderzoekers proberen robots al lang te leren door hen menselijke bewegingen te tonen, een proces dat imitatie-leren wordt genoemd. Het direct kopiëren van een mens faalt echter vaak omdat robots en mensen verschillende lichaamsvormen en verschillende manieren hebben om hun gewrichten te bewegen. Een mens kan zijn pols draaien op een manier die een robot niet kan, of de vingers van een robot kunnen te stijf zijn om een menselijke zachte aanraking na te bootsen. Bovendien richtten de meeste eerdere pogingen om robots te leren objecten te hanteren zich op ofwel op de grote bewegingen van het lichaam, ofwel op de fijne bewegingen van de handen, maar zelden beide samen in een enkel, verenigd systeem. Deze kloof betekende dat hoewel robots konden leren lopen of leren een kopje vast te houden, ze moeite hadden met de complexe, alledaagse taak van naar een zwaar object lopen, het stevig vastpakken en het ergens naartoe dragen zonder het te laten vallen of om te vallen.
Een team van onderzoekers heeft een nieuw systeem genaamd WE_AVE geïntroduceerd om dit specifieke probleem op te lossen. Hun aanpak begint met het opnemen van echte mensen die interageren met alledaagse objecten zoals stoelen, dozen en tafels. Deze opnames leggen de volledige beweging vast van de persoon terwijl deze het voorwerp nadert, grijpt en verplaatst. De onderzoekers nemen vervolgens deze menselijke bewegingen en vertalen deze naar een formaat dat een robot kan begrijpen en uitvoeren. Deze vertaling is geen eenvoudige kopieer-en-plakactie; het is een zorgvuldige reconstructie die rekening houdt met de fysieke grenzen van de robot. Het systeem vult eerst de ontbrekende delen van de beweging aan, zoals de stappen die de robot moet zetten om dicht bij het object te komen, die niet aanwezig waren in de oorspronkelijke menselijke opname. Vervolgens past het de handbewegingen van de mens aan om te passen bij de specifieke vingers van de robot, zodat de greep van de robot fysiek mogelijk en sterk genoeg is om het object vast te houden. Cruciaal is dat het systeem nauwlettend let op precies waar de vingers het object raken, waarbij de contactpunten die de greep stabiel maken, behouden blijven.
Zodra deze referentiebewegingen zijn gemaakt, trainen de onderzoekers één enkel computerprogramma, of beleid (policy), om hiervan te leren. Dit programma is ontworig om elk gewricht in het lichaam van de robot te besturen, inclusief de vierentwintig gewrichten in zijn romp en benen en de twaalf gewrichten in zijn twee handen. In plaats van een apart programma te trainen voor elk type object, trainden de onderzoekers dit ene programma op een grote verscheidenheid aan voorwerpen en interactiestijlen tegelijkertijd. De robot leert in een gesimuleerde omgeving, een digitale wereld waarin hij duizenden keren kan oefenen zonder iets kapot te maken. Hij leert de referentiebeweging te observeren en probeert deze te matchen, waarbij hij zijn evenwicht en vingerdruk in realtime aanpast om het object veilig vast te houden. De training is intensief en omvat willekeurige veranderingen in de wrijving en het gewicht van de robot om ervoor te zorgen dat hij onverwachte omstandigheden kan aanpakken.
De resultaten van deze training zijn indrukwekkend. Wanneer getest op de specifieke objecten en bewegingen die hij tijdens de training heeft gezien, slaagde de robot erin de taak in 92,5% van de gevallen te voltooien. Belangrijker nog, het systeem toonde een sterk vermogen tot generalisatie. Wanneer de onderzoekers de robot testten op sequenties van bewegingen die hij nog nooit eerder had gezien, waarbij dezelfde objecten werden gebruikt maar vanuit verschillende hoeken of met verschillende bewegingen werden benaderd, slaagde hij nog steeds in 65,0% van de gevallen zonder extra training. Dit suggereert dat de robot een algemene strategie heeft geleerd voor het interageren met objecten, in plaats van alleen specifieke bewegingen te onthouden. De onderzoekers hebben ook een grote dataset van deze succesvolle bewegingen vrijgegeven, in totaal ongeveer 23 uur aan opgenomen robotactiviteit, om andere wetenschappers te helpen bestuderen hoe robots kunnen leren interageren met de fysieke wereld.
De studie benadrukt dat het leren om objecten te hanteren het meest effectief is wanneer de robot tegelijkertijd zijn hele lichaam leert coördineren. Door te trainen op veel verschillende objecten tegelijk, ontdekte de robot gemeenschappelijke patronen, zoals hoe hij zijn gewicht balanceert bij het tillen van een zware doos of hoe hij zijn voeten positioneert bij het reiken naar een hoge lamp. Deze verenigde aanpak bleek succesvoller dan het trainen van aparte specialisten voor elk object. De onderzoekers ontdekten dat hoewel een specialist misschien iets beter is in het exact nabootsen van de houding voor één specifiek item, de algemene (generalist) robot veel beter was in het daadwerkelijk voltooien van de taak in een breed scala aan situaties. Dit geeft aan dat het vermogen om zich aan te passen aan nieuwe vormen en situaties waardevoller is dan de perfecte imitatie van een enkele beweging.
Ondanks deze successen zijn de onderzoekers zich duidelijk bewust van de beperkingen van hun werk. De gehele studie werd uitgevoerd in een computersimulatie, wat betekent dat de robot nooit fysiek de echte wereld heeft aangeraakt. Het systeem vertrouwde op perfecte kennis van waar de robot en het object zich bevonden, wat niet altijd beschikbaar is in de echte wereld waar sensoren ruis kunnen bevatten. Daarnaast gebruikt de robot in de simulatie handen die niet volledig flexibel zijn, wat de complexiteit van de grijpbewegingen die hij kan uitvoeren, beperkt. De onderzoekers merken ook op dat hun systeem een vooraf geplande sequentie van acties vereist om te volgen; het heeft nog niet het vermogen om zelf te beslissen wat het oppakt of waar het het naartoe brengt. Dit zijn de volgende stappen voor het vakgebied, waarbij toekomstige systemen deze fysieke vaardigheid moeten combineren met het vermogen om complexe instructies te begrijpen en te navigeren door de onvoorspelbare aard van de echte wereld.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.