WholeBodyWAM: Learning Whole-Body World Action Models with Scalable Motion Priors
Il documento introduce WholeBodyWAM, un modello mondo-azione umanoide che sfrutta un corpus di movimento eterogeneo su larga scala (UniMotion-4K) per preaddestrare un prior di movimento trasferibile, il quale migliora significativamente l'efficienza dei dati e le prestazioni di manipolazione a valle quando integrato con esperti di video e azione tramite un'attenzione Mixture-of-Transformers asimmetrica.
Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo
Per far muovere un robot come un essere umano, gli ingegneri devono affrontare un problema fondamentale: insegnare a una macchina a coordinare l'intero corpo è incredibilmente difficile. Un essere umano non pensa a muovere ogni singolo muscolo quando allunga la mano per prendere una tazza o cammina attraverso una stanza; il corpo si muove come un'unica unità fluida. Per i robot, invece, ogni giunto e arto deve essere comandato separatamente, e raccogliere le milioni di ore di dati di pratica necessari per insegnare a un robot specifico questa abilità è lento, costoso e spesso impossibile. Sebbene gli scienziati abbiano costruito modelli potenti in grado di comprendere il linguaggio e vedere il mondo, questi sistemi spesso faticano a prevedere come il corpo di un robot si muoverà in futuro, affidandosi invece a una reazione rispetto a ciò che sta accadendo proprio in quel momento. Questa limitazione rende difficile per i robot eseguire compiti complessi che richiedono di pianificare in anticipo, come trasportare una scatola pesante navigando su un terreno irregolare o inginchiarsi per raccogliere un oggetto senza perdere l'equilibrio.
Un team di ricercatori ha affrontato questa sfida insegnando a un robot a imparare dalla vasta e gratuita libreria di movimenti umani disponibile su internet, piuttosto che fare affidamento esclusivamente su costose dimostrazioni del robot stesso. Hanno creato un nuovo sistema chiamato WHOLEBODYWAM, che funge da motore predittivo per il corpo del robot. Inve di limitarsi a guardare un video e indovinare cosa fare dopo, questo sistema impara la fisica sottostante del modo in cui i corpi si muovono nel tempo. È stato addestrato su una massiccia collezione di dati di movimento chiamata UniMotion-4K, che include oltre 4.100 ore di movimento registrate da video umani, dataset specializzati di motion capture 3D e altri robot umanoidi. Convertendo tutte queste diverse fonti in un unico linguaggio comune del movimento, il sistema ha appreso un'"intuizione" generale su come un corpo debba passare da una posa a un'altra. Questa intuizione è stata poi trasferita a un vero robot umanoide, permettendogli di anticipare i propri movimenti futuri ed eseguire compiti complari di tutto il corpo con una capacità e un'efficienza molto superiori rispetto ai metodi precedenti.
Il cuore di questo lavoro risiede in un processo di addestramento a due fasi che separa l'apprendimento delle regole generali del movimento dall'apprendimento di come applicarle a una specifica macchina. Nella prima fase, il sistema ha studiato l'enorme dataset di movimento umano e robotico senza aver mai visto un singolo esempio dei comandi effettivi del robot target. Ha imparato a prevedere cosa farebbe un corpo successivamente basandosi su una semplice descrizione testuale di un compito, come "prendi il giocattolo" o "inginocchiati". Ciò ha creato una base potente, un "prior" predittivo che comprendeva la danza coordinata di arti ed equilibrio necessaria per un movimento simile a quello umano. Nella seconda fase, questa conoscenza pre-addestrata è stata combinata con un modulo di comprensione video e un generatore di azioni. Al sistema è stato poi mostrato un piccolo numero di dimostrazioni del robot specifico, il TianGong 3.0, per imparare come tradurre la sua comprensione generale del movimento nei comandi motori specifici che i giunti di quel robot devono eseguire. Fondamentalmente, il sistema non si limita a reagire alla scena attuale; utilizza la sua conoscenza appresa per immaginare lo stato futuro del proprio corpo, usando questa previsione per guidare le proprie azioni in tempo reale.
Quando testato su sei compiti difficili nel mondo reale, i risultati sono stati sorprendenti. Al robot è stato chiesto di eseguire azioni come raccogliere giocattoli, caricare il bucato in una lavatrice, trasferire un cuscino su un divano e trasportare una scatola verso un tavolo. Questi compiti richiedevano al robot di piegarsi, camminare, inginocchiarsi e manipolare oggetti contemporaneamente. Il nuovo sistema ha superato i migliori metodi esistenti, raggiungendo un tasso di successo significativamente più alto in tutti i compiti. Ad esempio, nel compito di trasferimento della scatola, in cui il robot doveva sollevare una scatola, camminare verso un tavolino laterale e posarla, il nuovo sistema ha avuto successo nel 73,3% dei casi, rispetto a tassi molto più bassi per altri approcci. I ricercatori hanno scoperto che più dati di movimento venivano utilizzati per addestrare l'iniziale "esperto di movimento", migliori erano le prestazioni del robot, suggerendo che il sistema abbia realmente appreso una competenza scalabile piuttosto che limitarsi a memorizzare esempi specifici. Ancora più importante, il sistema si è dimostrato altamente efficiente con i dati; quando i ricercatori hanno ridotto della metà la quantità di dimostrazioni del robot specifico disponibili per l'addestramento, il robot che era stato pre-addestrato sul massiccio dataset di movimento continuava a performare meglio di altri robot addestrati sull'intero set di dimostrazioni.
Questo approccio ha anche dimostrato una straordinaria capacità di gestire i cambiamenti nell'ambiente. Quando i ricercatori hanno spostato leggermente il cesto target o hanno cambiato il colore e la forma dei giocattoli che il robot doveva raccogliere, il sistema si è adattato rapidamente, mantenendo alte prestazioni laddove altri modelli incontravano difficoltà. Il sistema ha ottenuto questo risultato senza dover generare un video del futuro, il che sarebbe stato computazionalmente costoso e lento. Invece, ha previsto direttamente le posizioni future dei propri giunti, permettendogli di prendere decisioni in circa 363 millisecondi, una velocità sufficiente per il controllo in tempo reale. Lo studio conferma che, sebbene un robot non possa semplicemente copiare i movimenti umani perché il suo corpo è diverso, può imparare dalle vaste strutture del movimento umano per sviluppare una comprensione predittiva e robusta di come muovere il proprio corpo. Sfruttando l'abbondanza di dati sul movimento umano disponibili nel mondo, questo metodo offre una nuova strada verso la creazione di robot umanoidi che non siano solo capaci di compiti complessi, ma che possano anche impararli con molte meno dimostrazioni di quanto precedentemente ritenuto possibile.
Sommerso dagli articoli nel tuo campo?
Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.