← Nieuwste papers
💻 computer science

Beyond Data Scaling: Representation-Centric Continued Pre-training for Vision-Language-Action Models

Het artikel introduceert VLAct, een representatie-gecentreerde voortgezette pre-training aanpak voor Vision-Language-Action modellen die heterogene multi-embodiment data benut om superieure transfereerbaarheid en prestaties te bereiken over diverse taken en onbekende robots, zelfs onder bescheiden compute-budgetten en beperkte downstream data.

Oorspronkelijke auteurs: Senqiao Yang, Chengyao Wang, Yuxin Chen, Zixuan Wang, Longxiang Tang, Haokun Gui, Jinhui Ye, Changsheng Lu, Xiaoyang Wu, Mingkang Zhu, Pengguang Chen, Shu Liu, Zhuotao Tian, Hengshuang Zhao, Bei Yu, J
Gepubliceerd 2026-08-31
📖 8 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Senqiao Yang, Chengyao Wang, Yuxin Chen, Zixuan Wang, Longxiang Tang, Haokun Gui, Jinhui Ye, Changsheng Lu, Xiaoyang Wu, Mingkang Zhu, Pengguang Chen, Shu Liu, Zhuotao Tian, Hengshuang Zhao, Bei Yu, Jiaya Jia

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Robots worstelen al lang met het leren van ervaringen op de manier waarop mensen dat doen. Terwijl een kind kan kijken naar een ouder die een glas water inschenkt en de beweging begrijpt, heeft een robot doorgaans duizenden specifieke, handmatig gecodeerde instructies nodig om dezelfde taak uit te voeren. Jarenlang hebben wetenschappers geprobeerd dit op te lossen door robots enorme hoeveelheden data te voeren, in de hoop dat louter volume hen zou leren hoe ze moeten bewegen. Deze aanpak steunt op Vision-Language-Action-modellen, computergestuurde systemen die een afbeelding kunnen zien, een zin kunnen begrijpen en een fysieke beweging kunnen beslissen. De heersende overtuiging was dat als je simpelweg genoeg robotbewegingen verzamelt, het systeem vanzelf slim genoeg zal worden om elke situatie aan te kunnen. Het verzamelen van robotdata is echter ongelooflijk moeilijk en duur; in tegen tegenstelling tot foto's of tekst op het internet, moeten robotbewegingen in de echte fysieke wereld worden opgenomen, vaak door mensen die de machines begeleiden. Deze schaarste betekent dat zelfs de grootste robotdatasets minuscuul en ijl zijn in vergelijking met de uitgestrektheid van de fysieke wereld.

Een team van onderzoekers heeft nu een ander pad vooruit voorgesteld, waarbij zij suggereren dat de kwaliteit van wat een robot leert belangrijker is dan de hoeveelheid data die hij ziet. Zij stellen dat een robot, in plaats van alleen specifieke bewegingen te memoriseren, een diep, flexibel begrip moet ontwikkelen van hoe objecten en acties met elkaar samenhangen. Door te focussen op deze "representatie"—de interne kaart die de robot van de wereld bouwt—hebben zij een nieuwe trainingsmethode ontwikkeld die ervoor zorgt dat robots veel beter kunnen generaliseren. Hun werk demonstreert dat met een slimmere manier om de kernhersenen van de robot te onderwijzen, een systeem complexe taken kan uitvoeren op robots die het nog nooit eerder heeft gezien, met slechts een fractie van de data die voorheen nodig werd geacht.

De onderzoekers, werkend onder de naam VLAct, begonnen met een fundamentele vraag: waarom falen robots in het generaliseren? Wanneer een robot wordt getraind op een specifieke set bewegingen, wordt hij vaak te gespecialiseerd; hij leert de exacte patronen die hij zag te imiteren, in plaats van het onderliggende fysica van de taak te begrijpen. Om dit te onderzoeken, keken de onderzoekers naar hoe verschillende manieren van een robot onderwijzen zijn interne begrip beïnvloedden. Ze ontdekten dat als een robot wordt getraind om acties te voorspellen met behulp van slechts één specifieke methode, hij "vast komt te zitten" in die methode. Het is als een student die leert wiskundige problemen op te lossen met slechts één specifieke formule; als de toets de vorm van de vraag verandert, faalt de student omdat hij nooit het concept zelf heeft geleerd. De onderzoekers ontdekten dat dit "vastzitten" gebeurt wanneer de hersenen van de robot worden gedwongen zijn kennis in een enkele, rigide structuur te passen tijdens de training.

Om dit op te lossen, ontwikkelde het team een nieuw trainingsrecept dat de hersenen van de robot flexibel houdt. Ze begonnen met een krachtig vision-language model, een type kunstmatige intelligentie dat al getraind is op enorme hoeveelheden internetafbeeldingen en tekst, wat het een brede kennis van de wereld geeft. In plaats van de robottraining de brede kennis te laten overschrijven, beschermden ze de lagere lagen van de hersenen die de basis visuele herkenning afhandelen. Vervolgens introduceerden ze een unieke techniek waarbij de robot werd gevraagd om dezelfde fysieke bewegingen te voorspellen met behulp van drie verschillende wiskundige methoden tegelijkertijd. Door de robot te dwingen om aan alle drie de methoden tegelijk te voldoen, voorkwamen de onderzoekers dat hij zich in slechts één methode specialiseerde. Deze aanpak zorgde ervoor dat de robot een universeel begrip van actie leerde, in plaats van een smalle vaardigheid die verbonden is aan één specifieke manier van beweging berekenen.

Verder pakte het team het probleem van verschillende robotlichamen aan. Een robot met twee armen beweegt anders dan een robot met één arm, en een robot met een grijper beweegt anders dan een robot met een hand. Eerdere methoden behandelden deze verschillen vaak als aparte problemen, waarbij een uniek brein voor elk type robot werd getraind. Het VLAct-team creëerde in plaats daarvan een gedeelde taal voor beweging. Ze leerden de robot dat het openen van een grijper op de ene machine hetzelfde concept is als het openen van een grijper op een andere, zelfs als de fysieke mechanica verschillen. Ze bereikten dit door de delen van de actie die fysiek vergelijkbaar zijn, zoals het openen en sluiten van een hand, af te stemmen, terwijl de unieke delen van het lichaam van elke robot apart werden gelaten. Dit stelde de robot in staat om wat hij leerde over het ene type machine over te dragen naar een totaal ander type machine dat hij nog nooit eerder had ontmoet.

De resultaten van deze aanpak waren opmerkelijk. Wanneer getest op een breed scala aan taken, presteerde het nieuwe systeem consistent beter dan bestaande modellen, inclus_ief de modellen die getraind zijn op veel grotere datasets. In een simulatie-benchmark genaamd LIBERO-Plus, die test hoe goed een robot omgaat met veranderingen in verlichting, camerastandpunten en plaatsing van objecten, behaalde het nieuwe systeem een succespercentage van 82,6 procent. Dit was aanzienlijk hoger dan andere leidende systemen, wat bewees dat de robot een robuust begrip van de taak had geleerd in plaats van slechts een specifiek scenario te memoriseren. Op een andere benchmark genaamd RoboTwin 2.0, die twee robotarmen betreft die samenwerken, bereikte het systeem een succespercentage van 92,5 procent, waarmee het grootschalige industriële systemen overtrof die vertrouwen op propriëtaire data en enorme rekenkracht.

Misschien wel het meest overtuigende bewijs van de kracht van deze methode kwam uit een test met een humanoïde robot die volledig nieuw was voor de trainingsdata. De onderzoekers trainden hun systeem op data van standaard robotarmen en vroegen het vervolgens om een humanoïde robot te besturen met benen en een torso, een machine die ze nog nooit eerder hadden gezien. Met slechts 20 procent van de data die normaal gesproken nodig is om een robot voor dit specifieke lichaam te trainen, presteerde het systeem beter dan een baseline-model dat getraind is met 100 procent van de data. Dit suggereert dat de robot een fundamenteel concept van "hoe te bewegen" heeft geleerd dat kan worden toegepast op elk lichaam, in plaats van alleen de specifieke bewegingen van de armen te hebben gememoriseerd waarop hij getraind was.

De onderzoekers testten hun systeem ook in de echte wereld, waarbij ze fysieke robotarmen gebruikten om taken uit te voeren zoals het stapelen van blokken, het schoonmaken van tafels en het vouwen van kleding. In deze experimenten in de echte wereld bleef het systeem de baseline overtreffen, waarbij het een grotere stabiliteit en precisie vertoonde. Het ging succesvol om met nieuwe objecten die het nog nooit eerder had gezien, zoals het oppakken van een peper in plaats van een wortel, en beheerde complexe, meerstaps-taken zoals het scheppen van bonen en het in een kom gieten zonder stappen over te slaan. Het systeem blonk ook uit in het coördineren van twee armen om samen te werken, zoals het vasthouden van een stopcontact terwijl een stekker wordt getrokken, wat een niveau van synchronisatie demonstreerde waar eerdere modellen moeite mee hadden.

Wat dit werk bijzonder significant maakt, is dat het werd bereikt met alleen open-source data en een bescheiden hoeveelheid rekenkracht, specifiek een opstelling met 16 graphics processing units. Dit staat in schril contrast met veel van de best presterende systemen in het veld, die vertrouwen op propriëtaire datasets en enorme industriële rekenbronnen. De onderzoekers toonden aan dat door te focussen op hoe de robot de wereld intern representeert, in plaats van simpelweg de hoeveelheid data op te schalen, het mogelijk is om meer capabele en aanpasbare robots te bouwen. Hun bevindingen suggereren dat de toekomst van robotleren niet ligt in het verzamelen van eindeloze stromen data, maar in het ontwerpen van trainingsmethoden die de robot helpen een dieper, flexibeler begrip van de fysieke wereld op te bouwen.

De studie concludeert dat de manier waarop een robot wordt onderwezen net zo belangrijk is als wat hij wordt onderwezen. Door de brede kennis van een vooraf getraind brein te behouden en de robot aan te moedigen acties te leren op een manier die niet gebonden is aan een enkele methode of lichaamstype, kunnen onderzoekers systemen creëren die veel beter in staat zijn om met de onvoorspelbare aard van de echte wereld om te gaan. Deze aanpak biedt een veelbelovend pad naar algemene robots die nieuwe taken snel kunnen leren en zich aan nieuwe omgevingen kunnen aanpassen zonder dat er enorme hoeveelheden nieuwe data nodig zijn. Het werk is publiekelijk beschikbaar gesteld, zodat andere wetenschappers voort kunnen bouwen op deze bevindingen en verder kunnen onderzoeken hoe we machines kunnen leren bewegen met dezelfde flexibiliteit en het begrip van levende wezens.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →