← Nieuwste papers
💻 computer science

PrimitiveVLA: Learning Reusable Motion Primitives for Efficient and Generalizable Robotic Manipulation

PrimitiveVLA pakt de data-inefficiëntie en de slechte generalisatie van Vision-Language-Action-modellen aan door een primitief-centraal raamwerk te introduceren dat demonstraties ontleedt in herbruikbare bewegingsprimitieven via een gedeelde multimodale representatie en deze tijdens inferentie weer samenvoegt, waardoor meer efficiënt leren en robuuste zero-shot generalisatie over complexe taken mogelijk wordt gemaakt.

Oorspronkelijke auteurs: Yutai Li, Shaohui Peng, Jiaming Guo, Di Huang, Zihao Zhang, Yuxuan Guo, Yunkai Gao, Siming Lan, Ling Li, Xing Hu, Yunji Chen

Gepubliceerd 2026-07-21
📖 3 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Yutai Li, Shaohui Peng, Jiaming Guo, Di Huang, Zihao Zhang, Yuxuan Guo, Yunkai Gao, Siming Lan, Ling Li, Xing Hu, Yunji Chen

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een wereld voor waarin robots niet alleen onhandige, vooraf geprogrammeerde machines zijn die alleen precies kunnen doen wat gisteren aan hen werd verteld, maar eerder slimme helpers die kunnen uitzoeken hoe ze een nieuw soort pot openen of een vreemd gevormd blokje kunnen stapelen zonder voor elk object een handleiding nodig te hebben. Dit is de droom van "Embodied AI" — het geven van een brein aan robots dat combineert wat ze zien, wat ze horen en hoe ze bewegen. Op dit moment proberen wetenschappers deze breinen te bouwen met behulp van iets dat Vision-Language-Action (VLA) modellen wordt genoemd. Denk aan deze modellen als het "brein" van een robot dat naar een plaatje kijkt, een zin leest zoals "zet de beker op de tafel", en dan besluit welke spieren er moeten samentrekken om het te laten gebeuren. Het grote probleem is dat deze robots momenteel heel slecht zijn in het snel leren van nieuwe dingen. Ze zijn als studenten die het exacte antwoordmodel voor een specifieke toets uit het hoofd leren, maar volledig falen als de leraar de getallen in de vragen verandert. Ze proberen het hele, rommelige pad van een taak in één keer uit het hoofd te leren, wat hen traag maakt in het leren en gemakkelijk in de war brengt wanneer de wereld verandert.

Dit is waar een nieuw artikel genaamd "PrimitiveVLA" komt om de dag te redden. De onderzoekers beargumenteren dat de reden dat robots zo slecht zijn in het generaliseren is, dat ze proberen hele, enorme taken te leren als één groot, onbreekbaar blok. In plaats daarvan stellen ze een slimmere manier voor: de robot leren werken met "primitieven". Stel je voor dat je leert koken. In plaats van het exacte recept voor "Spaghetti Carbonara" als één grote, verwarrende lijst met stappen uit het hoofd te leren, leer je de basisbewegingen: hakken, koken, roeren en bakken. Zodra je die herbruikbare bewegingen beheerst, kun je ze combineren en afwisselen om bijna elk gerecht te maken, zelfs gerechten die je nog nooit hebt gezien. De auteurs suggereren dat robots hetzelfde zouden moeten doen. Ze bouwden een systeem dat complexe robottaken afbreekt in deze kleine, herbruikbare "bewegingsprimitieven" (zoals grijpen, duwen of tillen) tijdens de training. Wanneer de robot vervolgens voor een nieuwe, lastige taak staat, probeert hij niet het hele ding te onthouden; hij assembleert simpelweg de juiste opeenvolging van deze basisbewegingen om het probleem op te lossen.

Het artikel laat zien dat deze "uit elkaar halen en assembleren"-aanpak ongelooflijk goed werkt. In hun tests leerden robots die met deze methode getraind waren veel sneller; ze hadden slechts de helft van de hoeveelheid oefendata nodig om even goed te presteren als robots die getraind waren op volledige datasets. Maar de echte magie gebeurde toen ze de robots testten op zaken die ze nog nooit eerder hadden gezien. Bijvoorbeeld, bij een reeks lange, ingewikkelde taken slaagde het standaard topmodel voor robots slechts ongeveer 30% van de tijd. Echter, de robot die gebruikmaakte van PrimitiveVLA sprong naar een succespercentage van 80%. Nog indrukwekkender was dat, wanneer geconfronteerd met volledig nieuwe taken die de robot nog nooit was tegengekomen, de nieuwe methode het succespercentage zes keer verbeterde vergeleken met de oude manier. De onderzoekers testten dit zowel in computer-simulaties als op een echte fysieke robotarm, waarmee ze bewezen dat het leren van de basis eerst, in plaats van het uit het hoofd leren van het hele plaatje, de sleutel is tot het maken van echt slimme en aanpasbare helpers.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →