Dynin-Robotics: Omnimodal Unified Diffusion Vision-Language-Action Model
Dynin-Robotics introduce un modello di diffusione unificato omnimodale che tratta linguaggio, visione e azioni come token discreti per apprendere congiuntamente la predizione degli obiettivi, la modellazione della dinamica e la generazione delle azioni, raggiungendo prestazioni competitive su molteplici benchmark attraverso la modellazione condivisa delle traiettorie e lo scaling al tempo di test.
Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo
I robot hanno lottato a lungo per comprendere il mondo come fanno gli esseri umani. Sebbene una macchina possa essere programmata per muovere il proprio braccio verso una coordinata specifica, spesso fallisce quando il compito richiede di comprendere un'istruzione vaga come "passami qualcosa per tagliare il pacco". Per risolvere questo problema, i ricercatori stanno costruendo sistemi che collegano linguaggio, visione e movimento fisico in un unico cervello. Questi sistemi, noti come modelli visione-linguaggio-azione, cercano di imparare non solo cos'è un oggetto, ma anche come si comporta e come manipolarlo. La sfida è stata che la maggior parte degli approcci attuali tratta queste abilità separatamente: una parte del sistema potrebbe comprendere le parole, un'altra potrebbe riconoscere l'immagine e una terza potrebbe calcolare i comandi motori. Questa separazione lascia spesso il robot confuso quando il mondo reale cambia o quando le istruzioni sono formulate in modi inaspettati.
Un team di ricercatori della Seoul National University ha introdotto un nuovo approccio chiamato Dynin-Robotics che unifica queste abilità separate in un unico modello coeso. Invece di costruire un cervello robotico con moduli diversi per compiti diversi, hanno creato un singolo sistema che impara a prevedere il futuro in più modi contemporaneamente. Immaginate un robot che, quando riceve un compito, non si limita a calcolare la mossa successiva, ma immagina anche come apparirà la scena dopo quella mossa, quale dovrebbe essere lo stato finale dell'obiettivo e come descrivere il compito a parole. Addestrando un singolo modello per gestire tutte queste previsioni simultaneamente, i ricercatori hanno scoperto che il robot diventa molto più bravo a seguire le istruzioni, anche quando queste sono formulate diversamente rispetto a come è stato addestrato.
Il cuore di questo sistema è un metodo chiamato diffusione mascherata (masked diffusion). In termini semplici, questo è un processo di apprendimento in cui al modello viene mostrata una sequenza di informazioni — come un video di un compito, un'istrazione scritta e i movimenti del robot — ma alcune parti di tale sequenza sono nascoste o "mascherate". Il compito del modello è guardare le parti visibili e indovinare quali debbano essere le parti nascoste. Ad esempio, potrebbe vedere l'immagine di una tazza e le parole "prendi la tazza", ma i dati del movimento sono nascosti, quindi deve prevedere il movimento corretto. In un altro scenario, potrebbe vedere il movimento e l'istruzione, ma l'immagine finale della tazza in mano è nascosta, quindi deve prevedere l'esito. Praticando questi diversi tipi di giochi di indovinelli su un enorme dataset di oltre 1,3 milioni di traiettorie robotiche, il modello apprende una comprensione profonda di come il linguaggio, la visione e l'azione siano connessi.
Ciò che rende unico questo approccio è che lo stesso modello può passare tra questi diversi ruoli istantaneamente. Può agire come una policy, decidendo quale azione intraprendere successivamente; come un modello del mondo, prevedendo cosa vedrà la telecamera dopo un'azione; come un predittore di obiettivi, visualizzando lo stato finale di successo di un compito; o come un insegnante, ricostruendo l'istruzione originale da un video del robot al lavoro. Questa flessibilità permette al sistema di usare le proprie previsioni per migliorare le proprie prestazioni. Ad esempio, prima di decidere come muovere il braccio, il robot può prima prevedere quale sarà lo stato dell'obiettivo. Successivamente, usa quella previsione dell'obiettivo come guida per perfezionare il suo piano d'azione. Questo processo di guardare avanti e regolare il piano in tempo reale aiuta il robot a gestire compiti complessi che richiedono un allineamento preciso, come inserire un fiore in un vaso o impilare blocchi in un ordine specifico.
I ricercatori hanno testato questo sistema su una varietà di benchmark per vedere come si sia comportato rispetto ad altri modelli robotici leader. Nei compiti di simulazione standard, il modello ha raggiunto un tasso di successo del 98,1%, posizionandosi tra i migliori esponenti del settore. Più importante ancora, quando testato su compiti in cui le istruzioni sono state cambiate per essere più indirette o astratte, il sistema ha mostrato una significativa capacità di adattamento. In un set di esperimenti, il modello è stato testato su un compito in cui doveva selezionare un frutto basandosi su una descrizione come "qualcosa di naturalmente dolce e succoso" anziché un comando diretto come "prendi la mela". Mentre altri modelli faticavano con questi cambiamenti nel linguaggio, Dynin-Robotics ha mantenuto un alto tasso di successo, dimostrando di aver appreso il concetto sottostante del compito piuttosto che aver semplicemente memorizzato frasi specifiche.
Il sistema si è dimostrato efficace anche nel mondo reale. I ricercatori hanno implementato il modello su un braccio robotico fisico noto come Franka Research 3. In una serie di test nel mondo reale che coinvolgevano il prelievo di frutta, la smistazione di cubi colorati e l'impilamento degli stessi in ordini specifici, il robot ha raggiunto un tasso di successo medio del 78,4% attraverso quattro diverse condizioni di manipolazione. Questa prestazione è stata particolarmente forte in compiti che richiedevano di seguire una sequenza di passaggi, come impilare cubi in un ordine di colori specificato dall'utente. La capacità di visualizzare l'obiettivo e i passaggi intermedi ha permesso al robot di correggere la rotta se commetteva un errore, una capacità che spesso manca nei sistemi più semplici.
Oltre alla sua capacità di controllare un robot, il modello ha dimostrato una sorprendente capacità di comprendere e generare descrizioni. Mostrandogli un video di un robot che svolge un compito, il sistema poteva descrivere accuratamente ciò che stava accadendo, usando verbi come "prendere", "posare" e "piegare", identificando gli oggetti per colore e posizione. Viceversa, data una descrizione del compito, poteva generare una previsione visiva di come sarebbe apparuta la scena finale. Queste capacità suggeriscono che il modello ha costruito una ricca rappresentazione interna del mondo fisico che va oltre il semplice controllo motorio.
Per rendere questo sistema abbastanza veloce per l'uso in tempo reale, i ricercatori hanno anche sviluppato un metodo specializzato per eseguire il modello. Poiché il modello lavora raffinando iterativamente le proprie ipotesi, può essere lento se deve elaborare ogni singolo passaggio uno alla volta. Il team ha creato una tecnica che consente al modello di prevedere e impegnarsi in più passi di movimento contemporaneamente. Questa ottimizzazione ha velocizzato il processo decisionale del robot di quasi 30 volte rispetto al metodo standard, rendendo fattibile l'esecuzione del complesso modello su un hardware capace di stare al passo con la velocità di un robot fisico.
I risultati di questo lavoro suggeriscono che trattare l'apprendimento robotico come un problema di previsione unificato è una strategia potente. Combinando la capacità di comprendere il linguaggio, prevedere i cambiamenti visivi e generare azioni in un unico framework, i ricercatori hanno creato un sistema che è più robusto e adattabile rispetto ai modelli precedenti. Il successo di Dynin-Robotics indica che quando un robot può immaginare il futuro e comprendere il contesto di un compito, diventa molto più capace di gestire la natura imprevedibile del mondo reale. Sebbene ci sia ancora del lavoro da fare, in particolare nell'estendere queste capacità a sequenze di azioni più lunghe e complesse, questo approccio offre una strada promettente verso robot che possano veramente comprendere e interagire con il proprio ambiente.
Sommerso dagli articoli nel tuo campo?
Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.