← Nieuwste papers
💻 computer science

GPA-RAM: Grasp-Pretraining Augmented Robotic Attention Mamba for Spatial Task Learning

Het artikel stelt GPA-RAM voor, een nieuw framework dat Grasp-Pretraining Augmentation integreert om manipulatiesuccesratio's te verbeteren en een Robotic Attention Mamba-architectuur gebruikt voor efficiënte, real-time actiegeneratie, waarmee het state-of-the-art prestaties bereikt over meerdere robotplatforms.

Oorspronkelijke auteurs: Juyi Sheng, Yangjun Liu, Sheng Xu, Zhixin Yang, Tiantian Xu, Mengyuan Liu

Gepubliceerd 2026-08-03
📖 3 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Juyi Sheng, Yangjun Liu, Sheng Xu, Zhixin Yang, Tiantian Xu, Mengyuan Liu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot probeert te leren om jouw huishoudelijke taken te doen. Je wilt niet een miljoen regels code schrijven die de robot precies vertellen hoe hij zijn vingers moet bewegen voor elk enkel object in je huis. In plaats daarvan wil je hem laten zien wat hij moet doen, zoals een ouder die een kind leert hoe het blokjes moet stapelen of een lepel in een beker moet doen. Dit is de wereld van robot imitatie-leren. Het is een tak van de wetenschap waarbij robots leren door te kijken en menselijke demonstraties na te bootsen. De grote uitdaging? Robots zijn geweldig in het bewegen van hun armen, maar ze zijn vaak erg slecht in de allereerste stap: het juiste ding op de juiste manier vastpakken. Als een robot een beker bij de rand pakt in plaats van bij het handvat, of een pennetje met een millimeter mist, kan de hele taak mislukken en weet de robot misschien niet hoe hij het moet oplossen. Wetenschappers proberen constant "hersenen" voor robots te bouwen die een rommelige kamer kunnen zien, kunnen uitzoeken wat de beste manier is om een object vast te houden, en het vervolgens perfect kunnen verplaatsen zonder tegen alles aan te botsen.

Maak kennis met GPA-RAM, een nieuw robotbrein dat ontworpen is om precies dat "pak-en-ga"-probleem op te lossen. De onderzoekers achter dit project realiseerden zich dat veel robots falen omdat ze niet genoeg aandacht besteden aan hoe ze een object vasthouden voordat ze überhaupt beginnen met bewegen. Ze bouwden een systeem dat twee slimme trucjes combineert. Ten eerste gaven ze de robot een "pre-training" over hoe hij dingen moet pakken, gebruikmakend van dezelfde video's die hij gebruikt om de rest van de taak te leren. Het is alsof je een student een korte quiz geeft over hoe je een potlood vasthoudt voordat je hem vraagt een essay te schrijven; de robot leert de grip voordat hij de puzzel probeert op te lossen. Ten tweede vervingen ze de trage, zware denk-motor van de robot door een nieuwe, razendsnelle motor genaamd RAM (Robotic Attention Mamba). Denk aan RAM als een super-efficiënte bibliothecaris die een enorme bibliotheek aan visuele informatie kan scannen en in een fractie van een seconde het juiste boek kan vinden, terwijl oudere systemen overweldigd zouden raken en traag zouden worden.

Het team testte dit nieuwe brein op vier verschillende robot-opstellingen, inclusief echte fysieke robots en gesimuleerde robots. Ze ontdekten dat door het toevoegen van de "vastpak-pre-training", de robot veel beter werd in lastige taken zoals het stapelen van bekers, het invoeren van pennen in gaatjes en het verplaatsen van objecten tussen twee armen. Op een standaardtest genaamd RLBench slaagde het nieuwe systeem 87,5% van de tijd, waarmee het de vorige beste methoden versloeg. Nog indrukwekkender nog: bij een taak met een dual-arm robot waarbij een kubus wordt verplaatst, slaagde het systeem 98% van de tijd, en bij een moeilijke taak met twee handen waarbij iets moet worden ingevoegd, sprong de slaagkans van 16% naar 56%. Het beste deel? Het deed dit allemaal terwijl het draaide op ongeveer 71 frames per seconde, wat betekent dat het snel genoeg denkt om in realtime te reageren zonder vast te lopen. De onderzoekers suggereren dat deze aanpak van het leren aan robots om eerst te "grijpen, en dan te handelen" robots veel betrouwbaardere helpers in de echte wereld kan maken, die delicate taken kunnen afhandelen die voorheen tot falen leidden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →