GE-Act 2.0: Pretraining and Scaling a World-Action Model for Robotic Manipulation
GE-Act 2.0 is een nieuw wereld-actiemodel dat vanaf nul is getraind op manipulatiegegevens en een controle-georiënteerde autoencoder, een single-step visuele planner en een invers dynamica-model met kennis-gealigneerde selectieve optimalisatie integreert, waarmee het door middel van uitgebreide schaling en cross-embodiment transfer een aanzienlijk zero-shot succes bereikt over diverse taken en belichamingen heen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Robots zijn al lang meesters op de fabrieksvloer, waarbij ze dezelfde nauwkeurige beweging duizenden keren zonder fouten herhalen. Maar breng ze in een keuken, een woonkamer of een rommelige werkplaats, en ze bevriezen vaak. De uitdaging is niet alleen het bewegen van een hand; het is begrijpen hoe de wereld verandert wanneer die hand iets aanraakt. Om dit te navigeren, leert een nieuwe generatie kunstmatige intelligentie zich de toekomst voor te stellen. In plaats van simpelweg te reageren op wat het nu ziet, proberen deze systemen te voorspellen wat er hierna zal gebeuren als ze een specifieke actie ondernemen. Deze benadering, bekend als een wereld-actie-model, stelt een robot in staat om een sequentie van gebeurtenissen in zijn geest te simuleren voordat hij een spier beweegt, om te controleren of de uitkomst overeenkomt met het doel. Jarenlang hebben onderzoekers geprobeerd deze systemen te bouwen door bestaande videogeneratoren — programma's die getraind zijn om nepfilms te maken — te dwingen om robotbewegingen te begrijpen. Deze methode laat de robot echter vaak achter met een vage kennis van de fysica, omdat de videogenerator nooit echt ontworpen was om een fysiek lichaam te besturen.
Een team van AgiBot heeft nu een andere aanpak geïntroduceerd, een die de verbeelding van de robot vanaf de grond opbouwt met behulp van alleen echte interactiedata uit de echte wereld. Ze creëerden een systeem genaamd GE-Act 2.0, dat leert om de toekomst te voorspellen en acties te beslissen tegelijkertijd, maar met een cruciale twist: elk onderdeel van het systeem is vanaf nul getraind op data verzameld van robots en mensen die objecten manipuleren. De onderzoekers vertrouwden niet op vooraf gemaakte videomodellen. In plaats daarvan leerden ze het systeem een gecomprimeerde taal van beweging, een manier om de wereld te zien die onnodige details weglaat om zich te concentreren op wat belangrijk is voor controle. Dit stelde de robot in staat om te leren van een enorme en gevarieerde bibliotheek aan data, inclus inclusief uren aan succesvolle demonstraties, mislukte pogingen en zelfs video's van mensen die werken zonder enige opgenomen instructies. Door deze verschillende soorten leren te combineren, leerde het systeem te generaliseren, wat betekent dat het wat het leerde in één situatie kon toepassen op een volledig nieuwe situatie die het nog nooit eerder had gezien.
De kern van deze prestatie ligt in de manier waarop de onderzoekers omgingen met de rommelige realiteit van de fysieke wereld. Wanneer een robot probeert te leren, wordt hij vaak geconfronteerd met een verwarrend probleem: dezelfde instructie kan op veel verschillende manieren worden voltooid. Een robot kan de opdracht krijgen om "de rode beker op te pakken", en hij zou er van links, rechts of door het handvat of de rand naar kunnen grijpen. Als de trainingsdata slechts één manier laat zien, maar de verbeelding van de robot een andere voorspelt, kunnen de twee delen van het systeem uit de pas lopen. De onderzoekers identificeerden deze mismatch als een "validiteitskloof", waarbij de voorspelling van de robot over de toekomst niet overeenkomt met de actie die hij moet uitvoeren. Om dit op te lossen, ontwikkelden ze een selectieproces dat werkt als een filter. Voordat de robot leert van een voorspelde toekomst, controleert hij of die toekomst compatibel is met de actie die hij moet uitvoeren. Hij genereert verschillende mogelijke toekomsten, test ze tegen de vereiste actie, en leert alleen van de toekomsten die logisch bij elkaar passen. Dit zorgt ervoor dat de robot zijn begrip van hoe verschillende acties tot verschillende uitkomsten leiden, niet vertroebelt.
De resultaten van deze training zijn opmerkelijk, vooral wanneer ze worden getest op taken die de robot nooit heeft geoefend. De onderzoekers evalueerden het systeem op honderd verschillende manipulatietaken, variërend van het stapelen van blokken en het schenken van vloeistoffen tot het vouwen van handdoeken en het insteken van stekkers. Deze tests werden uitgevoerd op echte robots in omgevingen met andere belichting, achtergronden en objectopstellingen dan tijdens de training. Wanneer het systeem werd getraind op een kleine dataset van 300 uur, slaagde het in slechts 17,1% van de taken op één robotmodel. Echter, naarmate de onderzoekers de trainingsdata opschaalden naar 30.000 uur, steeg het succespercentage gestaag naar 44,1%. Deze verbetering vond plaats zonder specifieke verfijning voor de individuele taken; de robot paste simpelweg de algemene vaardigheden toe die hij had geleerd op de nieuwe uitdagingen. Nog verrassender was dat het systeem sterke vermogens toonde op een tweede, ander robotmodel dat minder dan 2% van de trainingsdata uitmaakte, wat suggereert dat de vaardigheden die uit de grotere dataset werden geleerd, effectief werden overgedragen naar een nieuwe fysieke vorm.
Het vermogen van het systeem om instructies op te volgen, werd ook getest onder moeilijke omstandigheden. In veel proeven werd de robot gevraagd een actie uit te voeren die botste met wat hij op basis van de scène of een eerdere gewoonte zou verwachten. Bijvoorbeeld, als een robot midden in een beweging was, kon hij nog steeds stoppen en een nieuwe, expliciete opdracht volgen om van pad te veranderen. In meer dan 90% van deze proeven identificeerde de robot correct het specifieke object, de kleur, vorm of positie die in de instructie werd genoemd, zelfs wanneer die details subtiel waren of de context verwarrend was. De onderzoekers vonden een sterke link tussen de variëteit van de vaardigheden die de robot tijdens de training leerde en zijn vermogen om te slagen bij nieuwe taken. Hoe diverser de trainingsdata, hoe groter de kans dat de robot een nieuwe situatie aankan. Dit suggereert dat de weg naar meer capabele robots niet alleen ligt in betere algoritmen, maar in de pure omvang en variëteit van de data die ze consumeren.
Dit werk markeert een belangrijke stap naar robots die kunnen leren van dezelfde rijke, ongestructureerde data die mensen gebruiken om de wereld te begrijpen. Door een systeem te bouwen dat de toekomst voorspelt en acties plant op een verenigde manier, en door het te leren de juiste voorspellingen uit vele mogelijkheden te selecteren, hebben de onderzoekers een model gecreëerd dat robuust en aanpasbaar is. De bevindingen suggereren dat een robot met genoeg diverse ervaring een diep, intuïtief begrip kan ontwikkelen van hoe objecten zich gedragen en hoe hij ermee kan omgaan, waarbij hij verder gaat dan rigide programmering richting een flexibelere vorm van intelligentie. Het succes van deze aanpak op echte hardware, zonder dat er opnieuw getraind hoeft te worden voor elke nieuwe taak, wijst op een toekomst waarin robots kunnen worden ingezet in dynamische, onvoorspelbare omgevingen en daar kunnen floreren.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.