← Nieuwste papers
💻 computer science

Drift-Based Policy Optimization: Native One-Step Policy Learning for Online Robot Control

Dit artikel introduceert Drift-Based Policy Optimization (DBPO), een tweestaps raamwerk dat native one-step generatieve beleidsregels voor robotbesturing mogelijk maakt door iteratieve verfijning te internaliseren in de training en online reinforcement learning te ondersteunen, waardoor een hoogfrequente, lage-latentie prestatie wordt bereikt die bestaande multi-step diffusie en single-step baselines overtreft.

Oorspronkelijke auteurs: Yuxuan Gao, Yedong Shen, Shiqi Zhang, Wenhao Yu, Yifan Duan, Jia pan, Jiajia Wu, Jiajun Deng, Yanyong Zhang

Gepubliceerd 2026-09-01
📖 7 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yuxuan Gao, Yedong Shen, Shiqi Zhang, Wenhao Yu, Yifan Duan, Jia pan, Jiajia Wu, Jiajun Deng, Yanyong Zhang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Robotarmen worden steeds gebruikelijker in fabrieken en laboratoria, belast met delicate taken zoals het assembleren van elektronica of het sorteren van objecten. Om deze machines goed te laten werken, hebben ze een "brein" nodig dat precies kan beslissen hoe de gewrichten moeten bewegen op basis van wat hun camera's zien. Dit besluitvormingsproces vindt in een fractie van een seconde plaats, keer op keer, terwijl de robot reageert op een veranderende wereld. De uitdaging is dat de echte wereld rommelig en onvoorspelbaar is. Een enkel beeld van een blok op een tafel kan verschillende geldige manieren bieden om het te grijpen, afhankelijk van de vorige bewegingen van de robot of lichte verschuivingen in de verlichting. Om deze onzekerheid aan te pakken, hebben onderzoekers systemen ontwikkeld die niet slechts één enkel antwoord kiezen, maar in plaats daarvan een reeks mogelijke goede acties leren. De meest succesvolle systemen tot nu toe gebruiken een methie die werkt als een trage, zorgvuldige beeldhouwer: ze beginnen met een willekeurige gok en verfijnen deze stapsgewijs, stap voor stap, totdat de actie er perfect uitziet. Hoewel deze aanpak hoogwaardige bewegingen produceert, is het traag. De robot moet zijn computerbrein vele keren laten draaien voor elke enkele beweging die hij maakt, wat een vertraging creëert waardoor hij te traag is voor snelle taken in real-time of voor het leren van nieuwe vaardigheden door middel van vallen en opstaan.

Een team van onderzoekers heeft nu een manier gevonden om deze slimme robotbreinen net zo capabel maar vele malen sneller te maken. Ze ontwikkelden een nieuw systeem dat dezelfde hoogwaardige, multi-optie actieplannen in één enkel ogenblik produceert, in plaats van tientallen stappen te nemen om ze te verfijnen. In hun werk lieten ze zien dat door de manier waarop de robot tijdens de training leert te veranderen, ze de robot konden leren het trage verfijningsproces volledig over te slaan. In plaats van te leren om fouten te herstellen nadat ze zijn gemaakt, leert de robot om de eerste keer het juiste antwoord te geven. Bij tests op een reeks van twaalf verschillende robottaken behaalde deze nieuwe methode een hoger gemiddeld succespercentage dan de oudere, tragere systemen, terwijl de tijd die nodig was om een beslissing te nemen werd teruggebracht van honderd computerberekeningen naar slechts één. Deze versnelling is niet alleen een theoretische verbetering; op een fysieke dual-arm robot in een echt lab voltooide het nieuwe systeem 82 procent van zijn taken, vergeleken met 59 procent voor de vorige beste één-stap-methode, terwijl het snel genoeg reageerde om de robot in real-time aan te sturen.

De kern van deze doorbraak ligt in hoe de robot leert van voorbeelden. Traditionele methoden die hoogwaardige acties produceren, vertrouwen vaak op een proces dat iteratieve denoising wordt genoemd. Stel je voor dat een robot probeert een beker op te pakken. De oude systemen zouden kunnen beginnen met een volledig willekeurige handpositie en de hand dan langzaam dichter bij de beker duwen, het werk controleren, weer een duwtje geven, en dit proces herhalen totdat de hand op de perfecte plek is. Dit zorgt ervoor dat de robot een goede oplossing vindt, maar het kost tijd. De nieuwe aanpak, die de onderzoekers een drift-gebaseerd beleid noemen, draait deze logica om. In plaats van het antwoord te verfijnen tijdens het eigenlijke moment van actie, leert de robot het volledige correctieproces te internaliseren terwijl hij wordt getraind. Tijdens de training wordt het systeem getoond aan veel voorbeelden van succesvolle bewegingen en wordt het geleerd hoe een willekeurige gok zou driften naar een correcte actie. Het leert deze correcties te absorberen in zijn eigen interne instellingen, zodat het bij de uiteindelijke inzet niet meer die trage, incrementele stappen hoeft te zetten. Het geeft simpelweg direct de uiteindelijke, gecorrigeerde actie uit.

Om te bewijzen dat dit idee werkt, testten de onderzoekers hun systeem op een verscheidenheid aan uitdagingen. Ze begonnen met een standaardset van twaalf simulatietaken waarbij blokken duwen, objecten tillen en gereedschap manipuleren betrokken waren. De oudere, multi-stappen systemen vereisten dat de computer honderd keer het netwerk draaide om een enkele beweging te beslissen. Het nieuwe systeem deed hetzelfde werk met slechts één run. Het resultaat was een systeem dat niet alleen honderd keer sneller was, maar ook iets succesvoller was in totaal, met een gemiddeld succespercentage van 83 procent tegenover 79 procent voor de tragere methoden. Dit toonde aan dat de snelheid niet ten koste ging van de kwaliteit; de robot was even goed in de taak, maar veel efficiënter.

De onderzoekers gingen vervolgens verder met het systeem om te zien of het complexe, driedimensionale omgevingen kon aan kunnen waar de robot de wereld ziet als een puntenwolk in plaats van een plat beeld. Ze testten het op zevenendertig verschillende taken, variërend van eenvoudige objectmanipulatie tot moeilijke behendige taken zoals het gebruiken van een hamer of het draaien van een deurknop. In deze tests presteerde het nieuwe systeem opnieuw beter dan de leidende bestaande methoden die ontworpen zijn voor één-stap snelheid. Het behaalde een gemiddeld succespercentage van 88,4 procent, waarmee het de op één na beste één-stap-systeem met een aanzienlijke marge versloeg. Dit toonde aan dat de methode robuust genoeg was om de complexiteit van 3D-visie in de echte wereld aan te kunnen zonder de trage, multi-stappen verfijning die voorheen als noodzakelijk werd beschouwd voor dergelijke moeilijke taken.

Echter, een robot die goed is in het kopiëren van menselijke demonstraties, is niet altijd goed in het oplossen van nieuwe problemen of het herstellen van fouten. Om dit aan te pakken, voegden de onderzoekers een tweede fase toe aan hun framework, waardoor de robot kan leren via online reinforcement learning. Dit is een proces waarbij de robot zijn prestaties verbetert door interactie met de omgeving en feedback te ontvangen over zijn succes, in plaats van alleen maar oude video's te kopiëren. De uitdaging hierbij was dat standaard leeralgoritmen meestal vereisen dat het systeem de waarschijnlijkheid van elke mogelijke actie berekent, wat moeilijk is voor deze snelle, één-stap generatoren. Het team loste dit op door een speciale interface te creëren die de robot in staat stelde om te leren van zijn ervaringen terwijl de snelle, één-stap natuur intact bleef. Ze vonden dat deze aanpak de robot in staat stelde om zijn vaardigheden effectief te verfijnen, waardoor de prestaties verbeterden op taken waarbij hij aanvankelijk alleen op menselijke demonstraties was getraind.

De laatste test bracht het systeem uit de computer simulatie en op een fysieke robot in een echt laboratorium. Ze monteerden het systeem op een dual-arm robot met twee armen, vergelijkbaar met een mens, en vroegen het om taken uit te voeren zoals het tillen van een blok, het dragen van een blikje en het verplaatsen van objecten tussen de twee armen. De robot moest in real-time reageren op visuele informatie van camera's, zonder menselijke tussenkomst. Het systeem werkte met een gemiddelde vertraging van slechts 9,5 milliseconden van het zien van de wereld tot het bewegen van de arm, een snelheid die snel genoeg is voor hoogfrequente controle. In een reeks proeven voltooide de robot 123 van de 150 pogingen succesvol, een succespercentage van 82 procent. Ter vergelijking: het vorige beste één-stap systeem slaagde in slechts 89 van de 150 pogingen, oftewel 59 procent. De fouten die optraden waren voornamelijk te wijten aan fysieke problemen zoals het wegglijden van het object of het botsen van de twee armen, in plaats van een falen van het besluitvormingssysteem zelf.

Dit werk suggereert dat de afruil tussen snelheid en intelligentie in robotbesturing niet zo vaststaand is als men voorheen dacht. Door de last van verfijning te verplaatsen van het moment van actie naar de tijd van het leren, is het mogelijk om robotcontrollers te creëren die zowel zeer capabel als ongelooflijk snel zijn. De onderzoekers hebben aangetoond dat een robot niet de tijd hoeft te nemen om zijn opties stap voor stap door te denken om een goede beslissing te nemen; het kan leren om direct de juiste beslissing te nemen. Dit opent de deur naar robots die kunnen opereren op de snelheid van menselijke reflexen, en in real-time kunnen leren en zich kunnen aanpassen aan de complexe, onvoorspelbare omgevingen van onze wereld. De code voor dit nieuwe systeem is beschikbaar gesteld aan andere onderzoekers, zodat de gemeenschap kan voortbouwen op dit fundament van snelle, generatieve controle.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →