← Nieuwste papers
💻 computer science

StructRL: Structured Action-Space Exploration for Flow-Based VLAs

Het artikel introduceert StructRL, een reinforcement learning-framework voor flow-gebaseerde Vision-Language-Action-modellen dat het probleem van "Structured Noise Dilution" van bestaande methoden overwint door gestructureerde stochastiek direct naar de actieruimte te verplaatsen via een deterministische ODE-decoder en last-step replay, waardoor de exploratie-efficiëntie en out-of-distribution prestaties in robotische manipulatietaken aanzienlijk worden verbeterd.

Oorspronkelijke auteurs: Jiarui Yang, Bin Zhu, Jingjing Chen, Na Zou, Yanwei Fu, Jianggang Zhu, Yu-Gang Jiang

Gepubliceerd 2026-08-18
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Jiarui Yang, Bin Zhu, Jingjing Chen, Na Zou, Yanwei Fu, Jianggang Zhu, Yu-Gang Jiang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Robots die menselijke taal kunnen begrijpen en complexe instructies kunnen opvolgen, zijn niet langer alleen een droom uit sciencefiction; ze worden een realiteit in laboratoria over de hele wereld. Deze systemen, bekend als Vision-Language-Action-modellen, fungeren als het brein van een robot, waarbij ze verwerken wat de robot ziet en wat een mens zegt, om vervolgens te beslissen hoe de armen en handen precies moeten bewegen om een taak te voltooien. Om deze bewegingen vloeiend en nauwkeurig te maken, gebruiken onderzoekers vaak een techniek die werkt als een beeldhouwer die een blok klei verfijnt. De computer begint met een ruwe, ruisende gok van wat de robot moet doen en maakt deze stap voor stap steeds schoner, totdat een perfecte, vloeiende beweging ontstaat. Dit proces is ongelooflijk krachtig, maar het loopt tegen een muur wanneer de robot probeert nieuwe taken zelfstandig te leren. Om te leren, moet een robot verkennen door verschillende acties uit te proberen om te zien wat wel en wat niet werkt. Echter, als de robot probeert te leren door willekeurige trillingen toe te voegen aan zijn bewegingen tijdens dit reiningsproces, kan het proces van het opschonen van die bewegingen de trillingen per ongeluk wegpoetsen voordat de robot ze ooit echt heeft geprobeerd. De robot eindigt met een vorm van exploratie die óf te willekeurig is om nuttig te zijn, óf te chaotisch om veilig te zijn.

Een team van onderzoekers heeft een betere manier ontdekt om deze robots te leren van hun eigen fouten. Ze ontdekten dat het probleem niet het idee van het toevoegen van ruis om exploratie aan te moedigen was, maar eerder waar die ruis werd toegevoegd. Bij eerdere methoden werden de willekeurige variaties vroeg in het reiningsproces geïnjecteerd, om vervolgens slechts gedeeltelijk te worden uitgewist door de daaropvolgende stappen die de beweging verfijnden. De onderzoekers noemen dit fenomeen "gestructureerde ruisdilutie" (structured noise dilution), waarbij de specifieke, nuttige patronen van exploratie worden weggespoeld voordat ze de werkelijke gedragingen van de robot kunnen beïnvloeden. Om dit op te lossen, ontwikkelden ze een nieuwe aanpak genaamd StructRL. In plaats van ruis toe te voegen terwijl de computer nog bezig is met het uitwerken van de beweging, laten ze de computer eerst zijn werk afmaken, wat resulteert in een schoon, perfect bewegingsplan. Pas nadat dat plan voltooid is, voegen ze de noodzakelijke variaties direct toe aan de uiteindelijke beweging. Dit zorgt ervoor dat de robot daadwerkelijk de nieuwe, licht afwijkende acties uitprobeert, in plaats van dat deze worden gladgestreken door de interne berekeningen van de computer.

De sleutel tot het laten slagen hiervan was het besef dat robotbewegingen een specifieke structuur hebben die willekeurige ruis vaak negeert. Een robotarm beweegt op drie verschillende manieren: het verandert van positie in de ruimte, het roteert de oriëntatie, en het opent of sluit de grijper. Deze drie soorten beweging verschillen van elkaar; een kleine verschuiving in positie kan veilig zijn, terwijl een vergelijkbare rotatie gevaarlijk zou kunnen zijn, en de grijper heeft een volledig ander soort controle nodig. De onderzoekers ontwierpen hun nieuwe methode om rekening te houden met deze verschillen. Ze voegden ruis toe die vloeiend was over de tijd, zodat de robot niet heen en weer trilde, en ze schaalden de ruis verschillend voor elk deel van de beweging. Dit betekende dat de robot nieuwe posities kon verkennen met een ruim bereik aan beweging, terwijl hij zijn rotaties en grijperacties veel voorzichtiger en gecontroleerder hield. Door het interne reiningsproces van de computer deterministisch en voorspelbaar te houden, en de noodzakelijke willekeur pas aan het einde te introduceren, zorgden de onderzoekers ervoor dat de exploratie van de robot zowel veilig als effectief was.

Het team testte deze nieuwe methode op een verscheidenheid aan gesimuleerde taken en op een echte robotarm in een laboratorium. In de simulaties kregen de robots de opdracht om complexe manipulatietaken uit te voeren, zoals het oppakken van objecten, het verplaatsen ervan naar specifieke locaties en het assembleren van onderdelen. De resultaten toonden een duidelijk voordeel voor de nieuwe aanpak. Bij een reeks uitdagende taken met een lange horizon (long-horizon tasks) behaalden de robots die de nieuwe methode gebruikten een succespercentage van bijna 99 procent, wat aanzienlijk beter was dan de oudere methoden die ruis toevoegden tijdens het reiningsproces. De verbetering was zelfs nog merkbaarder wanneer de robots te maken kregen met situaties die ze nog nooit hadden gezien, zoals objecten die op nieuwe locaties stonden of onder andere lichtomstandigheden. De robots die getraind waren met de nieuwe methode waren in staat om veel sneller te adapteren; ze leerden omgaan met deze onverwachte veranderingen met minder pogingen. Dit suggereert dat het behoud van de structuur van de exploratie cruciaal is om de vaardigheden van robots te laten generaliseren naar de rommelige, onvoorspelbare echte wereld.

Om te bewijzen dat dit ook buiten de computer werkte, installeerden de onderzoekers hun best presterende model op een fysieke robotarm in een echt laboratorium. Ze gaven de robot twee specifieke uitdagingen: het oppakken van een banaan en het in een stopcontact steken van een oplader. Aanvankelijk had de robot slechts enkele demonstraties van deze taken gezien en faalde hij volledig toen hij werd gevraagd deze zelfstandig uit te voeren. Vervolgens lieten de onderzoekers de robot leren door middel van trial-and-error, gebruikmakend van de nieuwe gestructureerde exploratiemethode. Voor de banaan-taak leerde de robot de vrucht 84 procent van de tijd succesvol op te pakken na slechts één uur online leren, terwijl een robot die de oudere, minder gestructureerde methode gebruikte, slechts in 56 procent van de gevallen slaagde. Voor de oplader-taak, die fijne motoriek vereiste om de stekker uit te lijnen met het stopcontact, zorgde de nieuwe methode ervoor dat de robot ongeveer vijf minuten sneller een stabiele, succesvolle staat bereikte dan de oudere methode. Deze resultaten uit de echte wereld bevestigden dat de theoretische verbeteringen zich direct vertaalden in sneller en betrouwbaarder leren voor fysieke machines.

Het succes van dit werk benadrukt een fundamentele verschuiving in hoe we robots kunnen leren. Het laat zien dat de manier waarop een robot zijn omgeving verkent net zo belangrijk is als de intelligentie die hij gebruikt om beslissingen te nemen. Door te begrijpen dat het interne "denkproces" van de robot stabiel en voorspelbaar moet blijven, terwijl het "actieproces" juist de plek is waar het experimenteren plaatsvindt, kunnen onderzoekers systemen creëren die efficiënter en veiliger leren. De bevindingen suggereren dat voor robots om de complexe, continue bewegingen die nodig zijn voor taken in de echte wereld echt te beheersen, we moeten stoppen met het behandelen van hun acties als een reeks willekeurige gokken en ze moeten gaan behandelen als gestructureerde, doelgerichte experimenten. Deze aanpak maakt robots niet alleen beter in het opvolgen van instructies; het geeft hen het vermogen om zelf nieuwe instructies te ontdekken, een cruciale stap richting machines die ons echt in ons dagelijks leven kunnen bijstaan.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →