Tok: Multi-head Multi-codebook Discrete Action Tokenization for Vision-Language-Action Models
Het artikel stelt Tok voor, een nieuwe multi-head multi-codebook actie-tokenizer die de reconstructiefout aanzienlijk vermindert en de prestaties van Vision-Language-Action modellen verbetert door latente kenmerken te ontbinden in gespecialiseerde heads met onafhankelijke codebooks om fijne actiedynamiek beter te vangen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Robots worstelen al lange tijd met het bewegen met de vloeiende gratie van een menselijke hand. Hoewel moderne kunstmatige intelligentie nu poëzie kan schrijven, ziekten kan diagnosticeren en verbluffende afbeeldingen kan genereren, blijft het geven van een machine het vermogen om de fysieke wereld te manipuleren een hardnekkige uitdaging. De kern van het probleem ligt in hoe computers beweging begrijpen. In tegenstelling tot tekst, dat bestaat uit afzonderlijke letters, of afbeeldingen, die bestaan uit pixels, zijn de fysieke acties van een robotarm continue stromen van gegevens. Een robotarm springt niet simpelweg van de ene naar de andere positie; hij stroomt door een oneindig aantal kleine posities daartussenin. Om een robot te onderwijzen met de krachtige taalmodellen die de huidige AI aansturen, moeten ingenieurs eerst deze vloeiende, continue beweging vertalen naar een reeks discrete stappen, vergelijkbaar met het veranderen van een stromende rivier in een snoer van individuele kralen. Dit vertalingsproces staat bekend als tokenisatie. Als de vertaling te grof is, verliest de robot de fijne details van zijn beweging, wat resulteert in schokkerige, onnauwkeurige acties die falen bij delicate taken. Als de vertaling te complex is, kan de computer het niet snel genoeg verwerken om in realtime te reageren.
Jarenlang hebben onderzoekers geprobeerd dit vertaalprobleem op te lossen, maar bestaande methoden dwingen vaak een vierkante pen in een rond gat. Sommige benaderingen behandelen elke beweging als een eenvoudige lijst van vaste categorieën, wat de subtiele timing en relaties tussen stappen negeert. Andere proberen de gegevens te comprimeren door bewegingen samen te voegen, maar ze verliezen vaak de specifieke details die nodig zijn voor nauwkeurige controle, zoals de exacte hoek van een pols of de zachte knijpkracht van een grijper. Dit verlies van detail creëert een flessenhals, waardoor robots niet in staat zijn complexe vaardigheden te leren zoals het stapelen van breekbare objecten of het assembleren van ingewikkelde onderdelen. Het resultaat is een robot die brede, eenvoudige taken kan uitvoeren, maar struikelt wanneer hij wordt geconfronteerd met de genuanceerde eisen van de echte wereld.
Een team van onderzoekers heeft nu een nieuwe manier voorgesteld om deze vertaling aan te pakken, een methode die de rijkdom van beweging behoudt terwijl de gegevens compact genoeg blijven voor moderne AI om te verwerken. Ze noemen hun systeem M2Tok, een hulpmiddel dat ontworpen is om de continue stroom van robotacties af te breken in een formaat dat taalmodellen kunnen begrijpen zonder de fijnmazige dynamiek te verliezen die nodig is voor succes. In plaats van het hele lichaam van de robot als één enkel, monolithisch blok gegevens te behandelen, splitst hun aanpak de beweging op in aparte, gespecialiseerde kanalen. Stel je een robotarm voor die tegelijkertijd zijn schouder, elleboog, pols en grijper moet bewegen. Oudere methoden zouden proberen al deze verschillende bewegingen in één enkele code te comprimeren, waarbij het systeem vaak moet kiezen tussen nauwkeurigheid voor de arm en nauwkeurigheid voor de grijper. De nieuwe methode scheidt deze bewegingen echter in afzonderlijke groepen, waardoor de AI zich op de specifieke nuances van elk onderdeel onafhankelijk kan richten.
De onderzoekers bereikten dit door de bewegingsgegevens van de robot te verdelen in meerdere koppen (heads), waarbij elke kop verantwoordelijk is voor een ander aspect van de beweging. Eén kop kan bijvoorbeeld de positie van de arm volgen, terwijl een andere het openen en sluiten van de grijper volgt. Cruciaal is dat elke van deze koppen zijn eigen onafhankelijke woordenboek van bewegingscodes gebruikt. Door meerdere woordenboeken parallel te laten werken, creëert het systeem een enorm aantal mogelijke combinaties, veel meer dan een enkel woordenboek ooit zou kunnen bieden. Deze combinatorische kracht stelt het systeem in staat om een veel grotere variëteit aan bewegingen met hoge precisie weer te geven. Het is vergelijkbaar met hoe een muzikant een oneindig aantal melodieën kan creëren door een beperkte set noten te combineren over verschillende instrumenten; het nieuwe systeem combineert beperkte sets bewegingscodes over verschillende "instrumenten" van het lichaam van de robot om complexe acties met opmerkelijke getrouwheid te reproduceren.
Om dit idee te testen, trainden de onderzoekers hun systeem op een grote collectie gesimuleerde robottaken, variërend van het slaan met een hamer op een blok tot het oppakken van diverse flessen en het plaatsen van containers op borden. Ze vergeleken hun nieuwe methode met verschillende bestaande technieken die in het vakgebied zijn gebruikt. De resultaten toonden een duidelijk voordeel voor de nieuwe aanpak. In een reeks van twaalf verschillende simulatietaken slaagde de robot met de nieuwe methode in 51 procent van zijn pogingen, wat aanzienlijk beter was dan de op één na beste methode, die slechts in 45 procent van de gevallen slaagde. De verbetering was nog dramatischer bij moeilijke taken die een hoge precisie vereisten. Bijvoorbeeld, in een taak waarbij een blikje naar een pot werd verplaatst, slaagde de nieuwe methode bijna twee keer zo vaak als de vorige beste aanpak. In een andere taak waarbij een doosje met een burger en frietjes op een dienblad werd geplaatst, behaalde de nieuwe methode een succespercentage van 64 procent, terwijl de vorige beste methode slechts 52 procent behaalde.
De onderzoekers testten het systeem ook op een andere set gesimuleerde omgevingen om te zien of de vaardigheden konden worden overgedragen naar nieuwe situaties. Hier bewees de nieuwe methode opnieuw superieur te zijn, met een succespercentage van 28 procent vergeleken met 21 procent voor de leidende alternatieve methode. Het meest opvallende verschil deed zich voor bij een taak waarbij de robot een aubergine moest oppakken en in een mandje moest plaatsen. De aubergine is een onregelmatig gevormd object dat moeilijk vast te pakken is, en vorige methoden faalden volledig bij deze taak. De nieuwe methode slaagde echter 33 procent van de tijd, wat suggereert dat het vermogen om fijne details vast te leggen de complexe geometrie van het object kon hanteren waar anderen dat niet konden.
Om er zeker van te zijn dat deze resultaten niet alleen een product waren van de simulatie, namen het team hun getrainde modellen en testten ze op echte robots. Ze gebruikten een mobiel platform uitgerust met vier robotarmen en een camera, en vroegen de robots om drie verschillende taken uit te voeren: een bel luiden, een container op een bord plaatsen en verschillende flessen oppakken. Dit waren zero-shot tests, wat betekent dat de robots deze specifieke real-world objecten of omgevingen nooit eerder hadden gezien; ze moesten volledig vertrouwen op wat ze in de simulatie hadden geleerd. De nieuwe methode presteerde opnieuw beter dan de anderen, met een gemiddeld succespercentage van 33 procent over de drie taken, vergeleken met een maximum van 28 procent voor het beste alternatief. Het visuele bewijs van deze tests liet zien dat de robots succesvol de posities van objecten identificeerden en nauwkeurige grijpoperaties uitvoerden, wat bevestigde dat de hoogwaardige vertaling van bewegingsgegevens standhield wanneer de robots de computer verlieten en de fysieke wereld betraden.
Naast nauwkeurigheid keken de onderzoekers ook naar hoe snel het systeem kon draaien. Voor een robot om nuttig te zijn, moet hij beslissingen snel genoeg kunnen nemen om te reageren op zijn omgeving. De nieuwe methode stelde de robot in staat om te opereren op een frequentie van meer dan 8 hertz, wat betekent dat hij meer dan acht beslissingen per seconde kan nemen. Dit is een aanzienlijke verbetering ten opzichte van oudere methoden die werkten op slechts 2 hertz. Bovendien, toen de onderzoekers het systeem optimaliseerden voor snelheid met behulp van een gespecialiseerde verwerkingstechniek, kon de robot een frequentie van 56 hertz bereiken, wat de snelheid die nodig is voor de meeste real-time manipulatietaken ruim overtreft. Deze combinatie van hoge precisie en hoge snelheid suggereert dat de nieuwe methode een praktische oplossing kan zijn voor het inzetten van geavanceerde robots in dynamische omgevingen.
Het succes van dit werk berust op een fundamentele verschuiving in de manier waarop bewegingsgegevens worden verwerkt. Door het idee te verwerpen dat alle beweging in een enkele, uniforme code moet worden gecomprimeerd, stelden de onderzoekers het systeem in staat om de unieke aard van verschillende delen van het lichaam van de robot te respecteren. De scheiding van beweging in onafhankelijke kanalen, gecombineerd met het gebruik van meerdere gespecialiseerde woordenboeken, creëerde een systeem dat de subtiele, hoogfrequente details van beweging kon vastleggen die eerdere methoden misten. Deze aanpak vereiste geen wijziging van de onderliggende architectuur van de taalmodellen die de robots aansturen; in plaats daarvan bood het een betere manier om de gegevens erin te voeden. Het resultaat is een robot die complexe fysieke taken kan begrijpen en uitvoeren met een niveau van behendigheid dat voorheen onbereikbaar was, waardoor de kloof tussen de digitale intelligentie van taalmodellen en de fysieke realiteit van de wereld die ze moeten navigeren, wordt overbrugd.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.