Dynin-Robotics: Omnimodal Unified Diffusion Vision-Language-Action Model
Dynin-Robotics introduceert een omnimodaal verenigd diffusiemodel dat taal, visie en acties behandelt als discrete tokens om gezamenlijk doelvoorspelling, dynamische modellering en actiegeneratie te leren, waarbij competitieve prestaties op meerdere benchmarks worden bereikt door gedeelde trajectmodellering en schaling tijdens de testtijd.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Robots worstelen al lang met het begrijpen van de wereld zoals mensen dat doen. Hoewel een machine geprogrammeerd kan worden om een arm naar een specifieke coördinaat te bewegen, faalt het vaak wanneer de taak een vage instructie vereist zoals "geef me iets om de verpakking mee door te snijden." Om dit op te lossen, bouwen onderzoekers systemen die taal, visie en fysieke beweging verbinden tot één enkel brein. Deze systemen, bekend als vision-language-action modellen, proberen niet alleen te leren wat een object is, maar ook hoe het zich gedraagt en hoe men het ermee kan manipuleren. De uitdaging is geweest dat de meeste huidige benaderingen deze vaardigheden apart behandelen: één deel van het systeem begrijpt misschien de woorden, een ander herkent de afbeelding, en een derde berekent de motorische commando's. Deze scheiding zorgt er vaak voor dat de robot in de war raakt wanneer de echte wereld verandert of wanneer de instructies op onverwachte manieren worden geformuleerd.
Een team van onderzoekers aan de Seoul National University heeft een nieuwe aanpak geïntroduceerd genaamd Dynin-Robotics, die deze afzonderlijke vaardigheden verenigt in één samenhangend model. In plaats van een robotbrein te bouwen met verschillende modules voor verschillende taken, hebben zij een enkel systeem gecreëerd dat leert de toekomst op meerdere manieren tegelijkertijd te voorspellen. Stel je een robot voor die, wanneer hij een taak krijgt, niet alleen de volgende zet berekent, maar ook voorstelt hoe de scène er na die zet uit zal zien, wat de uiteindelijke doeltoestand moet zijn en hoe de taak in woorden kan worden beschreven. Door één enkel model te trainen om al deze voorspellingen gelijktijdig af te handelen, ontdekten de onderzoekers dat de robot veel beter wordt in het opvolgen van instructies, zelfs wanneer die instructies anders zijn geformuleerd dan waarop hij getraind is.
De kern van dit systeem is een methode genaamd masked diffusion. In eenvoudige termen is dit een leerproces waarbij het model een sequentie van informatie wordt getoond — zoals een video van een taak, een geschreven instructie en de bewegingen van de robot — maar waarbij sommige delen van die sequentie verborgen of "gemaskeerd" zijn. De taak van het model is om naar de zichtbare delen te kijken en te raden wat de verborgen delen zouden moeten zijn. Het ziet bijvoorbeeld een foto van een kopje en de woorden "pak de kop op", maar de bewegingsgegevens zijn verborgen, dus moet het de juiste beweging voorspellen. In een ander scenario ziet het de beweging en de instructie, maar de uiteindelijke afbeelding van de kop in de hand is verborgen, dus moet het de uitkomst voorspellen. Door deze verschillende soorten raadspelletjes te oefenen op een enorme dataset van meer dan 1,3 miljoen robottrajecten, leert het model een diep begrip van hoe taal, visie en actie met elkaar verbonden zijn.
Wat deze aanpak uniek maakt, is dat hetzelfde model onmiddellijk tussen deze verschillende rollen kan schakelen. Het kan fungeren als een policy (beleid), waarbij het beslist welke actie het nu moet ondernemen; als een world model (wereldmodel), dat voorspelt wat de camera zal zien na een actie; als een goal predictor (doelvoorspeller), die de uiteindelijke succesvolle toestand visualiseert; of als een leraar, die de oorspronkelijke instructie reconstrueert vanuit een video van de werkende robot. Deze flexibiliteit stelt het systeem in staat om zijn eigen voorspellingen te gebruiken om zijn prestaties te verbeteren. Bijvoorbeeld, voordat de robot besluit hoe hij zijn arm moet bewegen, kan hij eerst voorspellen hoe de doeltoestand eruit ziet. Vervolgens gebruikt hij die voorspelde doeltoestand als gids om zijn actieplan te verfijnen. Dit proces van vooruitkijken en het plan in realtime aanpassen helpt de robot complexe taken aan te kunnen die een nauwkeurige afstemming vereisen, zoals het in een vaas steken van een bloem of het stapelen van blokken in een specifieke volgorde.
De onderzoekers testten dit systeem op een verscheidenheid aan benchmarks om te zien hoe goed het presteerde in vergelijking met andere toonaangevende robotmodellen. Op standaard simulatietaken behaalde het model een succespercentage van 98,1%, waarmee het tot de beste presteerders in het veld behoort. Belangrijker nog, toen het werd getest op taken waarbij de instructies indirecter of abstracter werden gemaakt, toonde het systeem een aanzienlijk vermogen tot aanpassing. In een reeks experimenten werd het model getest op een taak waarbij het een fruitsoort moest selecteren op basis van een beschrijving als "iets dat van nature zoet en sappig is" in plaats van een directe opdracht zoals "pak de appel". Terwijl andere modellen moeite hadden met deze verschuivingen in taal, behield Dynin-Robotics een hoog succespercentage, wat aantoont dat het de onderliggende concept van de taak heeft geleerd in plaats van alleen specifieke zinnen te hebben uit het hoofd geleerd.
Het systeem bleek ook effectief in de echte wereld. De onderzoekers zetten het model in op een fysieke robotarm, de Franka Research 3. In een reeks praktijktests waarbij fruit werd opgepakt, gekleurde kubussen werden gesorteerd en ze in een specifieke volgorde werden gestapeld, behaalde de robot een gemiddeld succespercentage van 78,4% over vier verschillende manipulatiecondities. Deze prestatie was bijzonder sterk in taken die het volgen van een reeks stappen vereisten, zoals het stapelen van kubussen in een door de gebruiker opgegeven kleurvolgorde. Het vermogen om de doeltoestand en de tussenliggende stappen te visualiseren, stelde de robot in staat om zijn koers te corrigeren als hij een fout maakte, een capaciteit die vaak ontbreekt in eenvoudigere systemen.
Naast zijn vermogen om een robot aan te sturen, toonde het model een verrassend vermogen tot het begrijpen en genereren van beschrijvingen. Wanneer het een video te zien kreeg van een robot die een taak uitvoert, kon het systeem accuraat beschrijven wat er gebeurde, waarbij werkwoorden als "pakken", "plaatsen" en "vouwen" gebruikte en objecten identificeerde aan de hand van hun kleur en locatie. Omgekeerd kon het, wanneer het een taakbeschrijving kreeg, een visuele voorspelling genereren van hoe de uiteindelijke scène eruit zou zien. Deze capaciteiten suggereren dat het model een rijke, interne representatie van de fysieke wereld heeft opgebouwd die verder gaat dan eenvoudige motorische controle.
Om dit systeem snel genoeg te maken voor real-time gebruik, hebben de onderzoekers ook een gespecialiseerde methode ontwikkeld om het model uit te voeren. Omdat het model werkt door iteratief voorspellingen te verfijnen, kan het traag zijn als het elke stap één voor één moet verwerken. Het team heeft een techniek ontwikkeld waarmee het model meerdere stappen van beweging tegelijkertijd kan voorspellen en vastleggen. Deze optimalisatie versnelde het besluitvormingsproces van de robot met bijna 30 keer vergeleken met de standaardmethode, waardoor het haalbaar werd om het complexe model te draaien op hardware die het tempo van een fysieke robot kan bijhouden.
De bevindingen van dit werk suggereren dat het behandelen van robotleren als een verenigd voorspellingsprobleem een krachtige strategie is. Door het vermogen om taal te begrijpen, visuele veranderingen te voorspellen en acties te genereren te combineren in één enkel kader, hebben de onderzoekers een systeem gecreëerd dat robuuster en aanpasbaarder is dan vorige modellen. Het succes van Dynin-Robotics geeft aan dat wanneer een robot de toekomst kan voorstellen en de context van een taak kan begrijpen, hij veel beter in staat is om de onvoorspelbare aard van de echte wereld aan te kunnen. Hoewel er nog werk te verrichten is, met name het uitbreiden van deze capaciteiten naar langere en complexere reeksen acties, biedt deze aanpak een veelbelovend pad naar robots die de omgeving echt kunnen begrijpen en ermee kunnen interageren.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.