UniReflex: Plug-and-Play Force Control for Pretrained Generative Policies via Fast-Slow Reflex
UniReflex is een universeel, plug-and-play framework dat voorgetrainde generatieve policies verbetert met closed-loop variabele impedantiecontrole via een fast-slow reflexmechanisme, wat robuuste contactregulatie en naadloze overgangen tussen positie- en krachtuitvoering mogelijk maakt zonder dat netwerktraining vereist is.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Robots zijn opmerkelijk goed geworden in het observeren en kopiëren van menselijke bewegingen. Door duizenden videodemonstraties te bestuderen, kunnen moderne kunstmatige intelligentiesystemen leren om objecten op te pakken, blokken te stapelen of gereedschap over een tafel te verplaatsen met indrukwekkende precisie. Deze systemen, vaak generatieve beleidssystemen (generative policies) genoemd, fungeren als een trage, bedachtzame planner die beslist waar de hand van een robot als volgende naartoe moet gaan. Er bestaat echter een aanzienlijke kloof tussen het bewegen door de lege lucht en het interageren met de fysieke wereld. Wanneer een robot een oppervlak moet afnemen, een knop moet indrukken of iets moet indraaien, moet hij de krachten beheren die hij uitoefent. Als de robot te hard duwt, kan hij het object breken of uitschieten; als hij te zacht duwt, slaagt hij er niet in de taak te voltooien. Huidige robots worstelen hier vaak mee omdat ze zijn ontworpen om een visueel pad perfect te volgen, waarbij ze de wereld behandelen alsof deze gemaakt is van glas dat nooit buigt of weerstand biedt. Ze missen het vermogen om weerstand te voelen en hun grip of druk in realtime aan te passen, een vaardigheid die bij mensen vanzelfsprekend is, maar moeilijk aan te leren is aan machines die alleen zien.
Onderzoekers van de Tsinghua Universiteit en de Nanyang Technological University hebben een nieuwe aanpak ontwikkend genaamd UniReflex om deze kloof te overbruggen zonder het volledige robotbrein te hoeven herbouwen. In plaats van te proberen de enorme, complexe AI-modellen die al weten hoe ze moeten bewegen te hertrainen, hebben ze een lichtgewicht, snel reagerende laag bovenop deze modellen toegevoegd. Denk aan de hoofd-AI als een bestuurder die de route en de bestemming kent, terwijl deze nieuwe toevoeging fungeert als een reflex die het stuur direct bijstuurt wanneer de auto een hobbel raakt. Het systeem werkt door te luisteren naar de interne gedachten van de robot over waar hij naartoe wil gaan, terwijl het tegelijkertijd de krachten in de pols van de robot in de gaten houdt. Als de robot onverwachte weerstand ondervindt, neemt deze snelle laag het voor een fractie van een seconde over om de aanraking te verzachten of de hoek te veranderen, zodat het contact stabiel blijft. Cruciaal is dat deze nieuwe laag niet vereist dat de oorspronkelijke AI wordt hertraind of aangepast, waardoor deze direct in verschillende bestaande robotbreinen kan worden ingeplugd.
Het team testte deze methode op een verscheidenheid aan moeilijke taken die constante fysieke aanraking vereisen, zoals het afnemen van een gebogen oppervlak, het eraf peuteren van een sticker van een briefje of het insteken van een oplader in een poort. In deze experimenten gebruikten ze drie verschillende soorten vooraf getrainde robotbreinen, variërend van kleinere modellen tot enorme modellen met miljarden parameters. Wanneer de robots werden achtergelaten om enkel met hun oorspronkelijke planningsvaardigheden te werken, faalden ze vaak zodra ze een object aanraakten, door uit te glijden of te veel druk uit te oefenen. Echter, wanneer de UniReflex-laag werd geactiveerd, steeg het succespercentage voor deze contactintensieve taken drastisch. Bijvoorbeeld, bij een taak waarbij een sticker moest worden verwijderd, verbeterde het succespercentage van een lage baseline naar bijna negentig procent. Het systeem was bijzonder effectief in het handhaven van de juiste hoeveelheid druk, waardoor de hand van de robot stabiel bleef, zelfs wanneer het object bewoog of het oppervlak ongelijk was.
Een belangrijke bevinding van het onderzoek is dat deze verbetering komt zonder het oorspronkelijke vermogen van de robot om nauwkeurig naar een doel te bewegen op te offeren. De nieuwe laag fungeert als een schakelaar die weet wanneer hij de hoofdplanner het werk moet laten doen en wanneer hij de controle moet overnemen voor fijne aanpassingen. Voordat de robot iets aanraakt, beweegt hij precies zoals de oorspronkelijke AI bedoeld heeft, waardoor de hoogwaardige planningsvaardigheden behouden blijven. Op het moment dat contact wordt gedetecteerd, grijpt de snelle reflexlaag in om de krachten te beheren, wat ervoor zorgt dat de robot niet tegen het object botst of zijn grip verliest. Deze scheiding van taken zorgt ervoor dat de robot zowel precies in zijn bewegingen als voorzichtig in zijn interacties kan zijn. De onderzoekers ontdekten ook dat deze aanpak uiterst efficiënt is. Omdat ze alleen de kleine, snelle reflexlaag trainden en de enorme hoofd-AI bevroren lieten, werd de tijd die nodig is om het systeem te trainen met een factor vijfentwintig tot zesenzestig verminderd vergeleken met methoden die proberen het volledige robotbrein vanaf nul te hertrainen.
De studie onderzocht ook hoe goed het systeem omgaat met onverwachte verstoringen, zoals een oppervlak dat verschuift terwijl de robot het afneemt of een onderdeel dat iets uit positie ligt. In dergelijke scenario's verloren de standaard robotmodellen vaak het contact en faalden ze in de taak volledig. De door UniReflex verbeterde robots waren echter in staat om snel te herstellen en binnen een seconde of minder het juiste contactkrachtniveau te herstellen. Deze veerkracht suggereert dat het systeem beter kan aanpassen aan de onvoorspelbaarheid van de echte wereld dan eerdere methoden. De onderzoekers merkten op dat hoewel de methode uitstekend werkt voor aanhoudende taken zoals afnemen of drukken, het meer uitdagingen kent bij zeer korte, snelle handelingen zoals het in een krappe opening klikken van een stekker, waarbij het venster voor aanpassing extreem klein is. Desalniettemin laten de resultaten een krachtige nieuwe manier zien om robots het gevoel van tastzin te geven die ze tot nu toe hebben gemist, waardoor ze veiliger en effectiever met de fysieke wereld kunnen interageren zonder dat ze volledig opnieuw ontworpen hoeven te worden.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.