← Nieuwste papers
💻 computer science

DriftingVLA: Native One-Step Vision-Language-Action Generation via Per-Dimension Temporal Drifting

DriftingVLA is een natief one-step vision-language-action model dat gebruikmaakt van een distribution-drifting objectief met Per-Dimension Temporal Drifting om volledige actiechunks te genereren in een enkele forward pass, waarbij het state-of-the-art prestaties bereikt op benchmarktaken terwijl het een 3,36-voudige versnelling levert ten opzichte van conventionele multi-step flow-gebaseerde methoden.

Oorspronkelijke auteurs: Yuxuan Gao, Shiqi Zhang, Yedong Shen, Yifan Duan, Wenhao Yu, Xin Zhang, Siyuan Cao, Jiajun Deng, Yanyong Zhang

Gepubliceerd 2026-09-01
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yuxuan Gao, Shiqi Zhang, Yedong Shen, Yifan Duan, Wenhao Yu, Xin Zhang, Siyuan Cao, Jiajun Deng, Yanyong Zhang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Robots die kunnen zien, taal begrijpen en met menselijke vloeiendheid kunnen bewegen, zijn al lang de droom van kunstmatige intelligentie. Jarenlang hebben onderzoekers systemen gebouwd die krachtig visueel en taalkundig begrip combineren met het vermogen om robotarmen aan te sturen. Deze systemen, bekend als vision-language-action modellen, fungeren als het brein van de robot; ze nemen waar wat de camera ziet en de woorden die een mens spreekt, en beslissen vervolgens hoe de gewrichten van de robot moeten bewegen om een taak te voltooien. Echter, een significante flessenhals heeft deze machines tegengehouden in hun streven naar echte realtime responsiviteit. Om een vloeiende sequentie van bewegingen te genereren, vertrouwen deze modellen traditioneel op een complex, meerstaps proces. Stel je voor dat je probeert een perfecte cirkel te tekenen door bij elk enkel punt langs de lijn kleine, aarzelende correcties aan te brengen; de robot moet een pad berekenen, een stap zetten, zijn werk controleren, en dan weer een volgende stap zetten, waarbij deze cyclus vele malen wordt herhaald voor elke enkele beweging die hij maakt. Hoewel deze methode hoogwaardige resultaten oplevert, is het traag, wat een vertraging introduceert waardoor de robot traag en ongevoelig aanvoelt in een dynamische wereld.

Een team van onderzoekers heeft nu een nieuwe aanpak geïntroduceerd die fundamenteel verandert hoe deze robots hun bewegingen plannen, waardoor ze in één enkel instant een volledige sequentie van acties kunnen genereren. Hun werk, gecentreerd rond een systeem dat ze DriftingVLA noemen, vervangt het trage, iteratieve correctieproces door een methode die leert om de gehele toekomstige beweging in één keer te voorspellen. In plaats van tijdens de eigenlijke taak stap voor stap een pad te berekenen, leert het systeem een directe verbinding tussen een willekeurig startpunt en de uiteindelijke gewenste beweging tijdens de trainingsfase. Deze verschuiving stelt de robot in staat om de repetitieve berekeningen volledig over te slaan tijdens de inzet, door direct naar de juiste actie te springen. In tests met complexe manipulatietaken evenaarde deze nieuwe methode niet alleen de precisie van de oudere, tragere systemen, maar maakte de robot ook meer dan drie keer sneller, waardoor de tijd die nodig is om een beweging te beslissen werd teruggebracht van over tweehonderd milliseconden naar onder de zeventig.

De kern van deze doorbraak ligt in de manier waarop de onderzoekers de robot leerden de relatie tussen zijn verschillende bewegende onderdelen te begrijpen. Een robotarm beweegt niet slechts in één lijn; hij heeft meerdere gewrichten en vrijheidsgraden die samen moeten werken, zoals vooruit bewegen, roteren en een grijper openen. Eerdere pogingen om deze systemen te versnellen, behandelden de volledige beweging vaak als één groot blok of deelden deze op in minuscule, losstaande momenten in de tijd. De nieuwe aanpak erkende echter dat elke specifieke richting van beweging — zoals de verticale lift van een grijper of de rotatie van een pols — zijn eigen unieke ritme en statistisch patroon heeft. De onderzoekers ontwikkelden een techniek genaamd Per-Dimension Temporal Drifting, die de volledige geschiedenis van elke individuele bewegingsrichting behandelt als een aparte eenheid om te leren. Dit stelt het systeem in staat om de specifieke nuances te begrijpen van hoe een grijper moet openen of hoe een pols moet draaien, zonder deze verschillende bewegingen te dwingen zich te conformeren aan één enkele, rigide wiskundige regel.

Cruciaal is dat deze methode het vermogen van de robot niet opoffert om zijn ledematen te coördineren. Zelfs als het systeem de patronen van elke bewegingsrichting afzonderlijk leert, genereert het nog steeds het volledige actieplan als een verenigd geheel. Het brein van de robot, dat taal en visie begrijpt, blijft intact en blijft de actie-expert aansturen die de bewegingen produceert. Door het systeem te trainen om zijn voorspellingen te verfijnen over vele verschillende "wat-als"-scenario's tegelijkertijd, hebben de onderzoekers ervoor gezorgd dat de uiteindelijke, eenstapsbeslissing net zo accuraat is als het resultaat van een trage, meerstapsberekening. Dit betekent dat de robot nog steeds delicate taken kan uitvoeren, zoals het schenken van vloeistof uit één container naar een andere of het stapelen van blokken met twee armen die synchroon werken, zonder de aarzeling die eerdere modellen te kwelde.

De onderzoekers testten dit nieuwe systeem zowel in gesimuleerde omgevingen als in de echte wereld om te zien of de snelheid ten koste ging van de betrouwbaarheid. In een reeks uitdagende simulaties met taken zoals het oppakken van objecten en het verplaatsen ervan, behaalde het nieuwe systeem een succespercentage van bijna 98,3 procent, waarmee het de beste bestaande meerstapsmodellen licht overtrof. Wanneer het werd verplaatst naar een echte setting met fysieke robotarmen, behield het systeem zijn voorsprong met een succespercentage van 77,67 procent in zes verschillende taken, inclusen zowel single-arm als dual-arm coördinatie uitdagingen. Deze prestatie was opmerkelijk hoger dan die van andere eenstapsmethoden die probeerden de oude systemen te versnellen door simpelweg hun berekeningsproces in te korten, wat vaak resulteerde in een aanzienlijke daling van de nauwkeurigheid. De nieuwe methode bewees dat door te veranderen in hoe het systeem leert, in plaats van alleen hoe het berekent, het mogelijk is om zowel snelheid als precisie te bereiken.

Buiten de ruwe cijfers benadrukte de studie de efficiëntiewinst die voortkomt uit het verwijderen van de repetitieve berekeningslus. In de echte wereld, waar elke fractie van een seconde telt, verminderde het nieuwe systeem de tijd die nodig is om een bewegingsblok te genereren van 227,61 milliseconden naar 67,67 milliseconden. Dit vertegenwoordigt een versnelling van meer dan drie keer, waardoor de vertraging die robots een gevoel van onthechting van hun omgeving geeft, effectief wordt geëlimineerd. Hoewel het trainingsproces iets meer computerkracht vereiste om de vele "wat-als"-scenario's tijdens de leerfase te verwerken, is deze kostenpost een eenmalige investering. Eenmaal getraind, opereert de robot met een slanke, eenstaps-efficiëntie die geen extra middelen vereist. Het werk demonstreert dat de toekomst van responsieve robotica wellicht niet ligt in het bouwen van snellere computers om tragere algoritmen uit te voeren, maar in het herontwerpen van de algoritmen zelf om inherent direct en onmiddellijk te zijn.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →