GaussVLA: Geometry-Aware Spatial Reasoning for Vision-Language-Action Model
GaussVLA is een parameterefficiënt, op Mamba gebaseerd Vision-Language-Action-model dat ruimtelijk redeneren verbetert door een Gaussian Spatial Tokenizer te introduceren om 2D-kenmerken om te zetten in compacte 3D Gaussian-tokens en een Depth-Aware Chain-of-Thought-module voor gestructureerd geometrisch redeneren, waarmee het de state-of-the-art prestaties bereikt op de LIBERO-benchmark met slechts 200 miljoen parameters.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Robots die kunnen leren objecten te manipuleren door naar mensen te kijken, zijn een centraal doel geworden in de moderne kunstmatige intelligentie. Jarenlang hebben onderzoekers vertrouwd op modellen die het beeld van een camera op de wereld behandelen als een plat rooster van gekleurde vierkantjes, vergelijkbaar met een digitale foto. Deze modellen zijn uitstekend in het herkennen van welke objecten aanwezig zijn en het begrijpen van taalcommando's, maar ze worstelen met het begrijpen van de fysieke vorm en positie van die objecten in een driedimensionale ruimte. Ze zien een kopje als een patroon van pixels, en niet als een solide object dat op een tafel staat met een specifieke hoogte en oriëntatie. Deze beperking maakt het voor robots moeilijk om taken uit te voeren die nauwkeurige hantering vereisen, zoals het oppakken van een breekbaar item of het navigeren door een rommelige werkruimte, omdat de robot een echt gevoel voor geometrie mist.
Om deze kloof te overbruggen, heeft een team van onderzoekers een nieuw systeem ontwikkeld genaamd GaussVLA, ontworpen om robots een intuïtiever begrip van de fysieke wereld te geven. In plaats van te vertrouwen op platte afbeeldingen, zet dit systeem visuele gegevens om in een verzameling piepkleine, driedimensionale vormen die in de ruimte zweven, waarbij elk stuk informatie draagt over waar een object zich bevindt, hoe groot het is en hoe zeker de robot is over die informatie. Door dit geometrische begrip te combineren met een nieuwe manier van "denken" over ruimtelijke problemen voordat er wordt bewogen, creëerden de onderzoekers een robotcontroller die zowel zeer nauwkeurig als verrassend klein is. In tests presteerde dit systeem beter dan veel grotere, complexere modellen, wat suggereelt dat het geven van een beter ruimtelijk gevoel aan een robot belangrijker is dan simpelweg het brein van de robot groter maken.
De kern van het probleem ligt in de manier waarop robots momenteel "zien". Traditionele systemen breken een camera-afbeelding af in een lange lijst van platte segmenten, waarbij elk deel van de afbeelding als even belangrijk wordt behandeld, ongeacht of het een muur ver weg is of een gereedschap direct voor de robot. Hoewel dit werkt voor eenvoudige taken, faalt het wanneer de robot afstanden of de hoek van een oppervlak moet beoordelen. Andere pogingen om dit op te lossen omvatten het toevoegen van dieptekaarten, wat in feite enkele getallen zijn die de robot vertellen hoe ver elk pixel verwijderd is. Deze dieptekaarten missen echter vaak informatie over de oriëntatie van het oppervlak of hoe betrouwbaar die afstandmeting is, waardoor de robot moet gokken wanneer de omgeving verandert.
De onderzoekers pakten dit aan door een nieuwe manier te introduceren om visuele gegevens te verwerken, genaamd de Gaussian Spatial Tokenizer. Stel je voor dat je de platte afbeelding neemt en elk segment ervan de lucht in tilt, waardoor het verandert in een kleine, wazige 3D-wolk. Elke van deze wolken heeft een middelpunt, een grootte en een vorm die de lokale geometrie van het object dat het vertegenwoordigt, beschrijft. Cruciaal is dat het systeem ook een betrouwbaarheidsscore toekent aan elke wolk, die de robot vertelt hoe zeker hij is over dat deel van de 3D-wereld. Dit stelt de robot in staat om zich te concentreren op de meest betrouwbare delen van de scène, zoals de rand van een tafel of het handvat van een kopje, terwijl onzekere gebieden worden genegeerd. Deze transformatie verandert een plat plaatje in een gestructureerde, driedimensionale kaart waar de robot over kan redeneren.
Zodra de robot deze 3D-kaart heeft, moet hij nog steeds beslissen wat hij gaat doen. Vorige systemen probeerden vaak een plan te maken door een lange lijst van tekstgebaseerde gedachten te genereren voordat ze bewogen, een proces dat traag is en vaak losstaat van de werkelijke fysieke actie. Het nieuwe systeem gebruikt een andere aanpak genaamd Depth-Aware Chain-of-Thought. In plaats van een lang verhaal uit te schrijven, gebruikt de robot een kleine set gerichte vragen om snel zijn 3D-kaart te scannen en de belangrijkste ruimtelijke relaties te extraheren die nodig zijn voor de taak. Hij vraagt zichzelf bijvoorbeeld: waar bevindt het doelobject zich ten opzichte van de hand van de robot, en gebruikt dat antwoord om zijn beweging direct te sturen. Dit is geen langzaam, stapsgewijs tekstgeneratieproces, maar een snel, gestructureerd redeneerproces dat synchroon loopt met de beslissing van de robot om te bewegen.
Het hele systeem is gebouwd op een backbone-architectuur bekend als Mamba, die is ontworpen om informatie veel sneller en efficiënter te verwerken dan de standaardmodellen die vandaag de dag in de meeste kunstmatige intelligentie worden gebruikt. Deze efficiëntie is essentieel omdat het de robot in staat stelt om beslissingen in realtime te nemen zonder dat er een enorme computer nodig is. De onderzoekers testten hun systeem op een verscheidenheid aan gesimuleerde taken, waaronder het verplaatsen van objecten, het stapelen van blokken en het volgen van complexe instructies. In deze tests behaalde het nieuwe systeem een succespercentage van 93,5 procent op een standaard benchmark, waarmee het leidende modellen die aanzienlijk groter zijn, overtrof. Op een specifieke set taken die ontworpen zijn om ruimtelijk redeneren te testen, behaalde het een perfecte score van 100 procent.
Wat deze resultaten bijzonder opvallend maakt, is de omvang van het systeem. Terwijl veel van de concurrerende modellen miljarden parameters nodig hebben om te functioneren, werkt dit nieuwe systeem met slechts 200 miljoen parameters. Dit betekent dat het ongeveer 97 procent kleiner is dan sommige van de grootste modellen die momenteel in gebruik zijn, en toch presteert het beter op taken die het begrijpen van de fysieke ruimte vereisen. De onderzoekers testten het systeem ook op een echte robotarm in een fysiek laboratorium. Zelfs wanneer geconfronteerd werd met echte werelduitdagingen zoals cameraruis en licht verschillende plaatsingen van objecten, behield het systeem een hoog niveau van succes, wat bewees dat het in simulatie geleerde 3D-geometrische begrip kon worden overgedragen naar de echte wereld.
De studie onderzocht ook wat er gebeurt als het systeem wordt uitgedaagd met onverwachte veranderingen, zoals verschillende verlichting of objectkleuren. Hoewel het systeem een sterke robuustheid vertoonde, merkten de onderzoekers op dat het nog steeds problemen ondervindt wanneer de omgeving drastisch verandert, wat aangeeft dat er nog werk te verrichten is om robots aanpasbaar te maken aan elk mogelijk scenario in de echte wereld. De resultaten laten echter duidelijk zien dat de sleutel tot betere robotmanipulatie niet alleen het hebben van meer data of een groter model is, maar het geven van een gestructureerd, driedimensionaal begrip van de ruimte die de robot inneemt. Door platte afbeeldingen om te zetten in 3D-wolken en gerichte redenering te gebruiken om door deze te navigeren, hebben de onderzoekers een duidelijk pad getoond naar robots die de fysieke wereld met meer vaardigheid en betrouwbaarheid kunnen hanteren.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.