← Ultimi articoli
💻 computer science

AnyWorld: Factorized Egocentric World Models for Cross-Embodiment Generalization

Il documento introduce AnyWorld, un framework di modellazione del mondo fattorizzato che sintetizza diverse esperienze robotiche cross-embodiment da singoli video egocentrici umani, disaccoppiando i fattori di azione, telecamera ed embodiment, abilitando così una generazione di dati controllabile che migliora significativamente le policy di manipolazione sia su robot umanoidi simulati che reali.

Autori originali: Cheng Chen, Jerry Bai, Jiacheng Wei, Boyu Chen, Xiaoji Zheng, Fan Wu, Minghao Yang, Tianrun Chen, Ruibo Li, Xiaoyu Yue, Xiaoyang Guo, Yixiao Ge, Guosheng Lin, Fayao Liu

Pubblicato 2026-09-02
📖 6 min di lettura🧠 Approfondimento

Autori originali: Cheng Chen, Jerry Bai, Jiacheng Wei, Boyu Chen, Xiaoji Zheng, Fan Wu, Minghao Yang, Tianrun Chen, Ruibo Li, Xiaoyu Yue, Xiaoyang Guo, Yixiao Ge, Guosheng Lin, Fayao Liu

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

I robot stanno imparando a fare molto più che limitarsi a muoversi in linea retta; stanno imparando a manipolare il mondo che li circonda, raccogliendo oggetti, aprendo porte e assemblando parti. Per apprendere queste abilità, un robot ha bisogno di esperienza. Deve vedere migliaia di esempi di come una mano raggiunga una tazza, di come una pinza stringa una spugna e di come uno strumento scivoli su un tavolo. Per molto tempo, l'unico modo per ottenere questa esperienza è stato far eseguire il compito al robot stesso, ripetutamente. Questo è un processo lento, costoso e limitato dal numero di robot che un laboratorio può permettersi di costruire e da quante ore possono operare senza rompersi.

Un'alternativa promettente è emersa da una fonte inaspettata: i video umani. Ogni giorno, le persone registrano se stesse mentre cucinano, puliscono e costruiscono cose. Questi video sono ricchi di interazioni fisiche profonde da cui i robot potrebbero imparare. Tuttavia, c'è un problema fondamentale. Un video di un essere umano che cucina mostra una mano umana, un corpo umano e un punto di vista umano. Un robot non ha un corpo umano e non vede il mondo dalla testa di un essere umano. Se un robot cercasse di copiare direttamente un video umano, potrebbe fallire perché il braccio dell'uomo è più lungo, la telecamera del robot si trova in una posizione diversa o la sua pinza funziona diversamente. La sfida per gli scienziati è capire come prendere la "storia" utile di ciò che accade in un video umano e raccontarla in un modo che abbia senso per un robot.

Un team di ricercatori ha sviluppato un nuovo sistema chiamato AnyWorld per risolvere questo problema. Invece di cercare di copiare esattamente un video umano, il sistema scompone il video in tre ingredienti separati: l'azione che viene eseguita, il modo in cui si muove la telecamera e il corpo e la scena che compiono l'azione. Pensate all'azione come alla sceneggiatura di ciò che accade, al movimento della telecamera come alla direzione della ripresa e al corpo e alla scena come agli attori e alla scenografia. Separando questi elementi, i ricercatori possono prendere un singolo video di un essere umano che compie un compito e ricombinare questi ingredienti per creare un video completamente nuovo. In questo nuovo video, l' "attore" è un robot, la "scenografia" è l'ambiente di un robot e la "telecamera" è l'occhio di un robot, ma la "sceneggiatura" dell'azione rimane la stessa.

I ricercatori hanno addestrato il loro sistema utilizzando una vasta collezione di video umani in cui le persone interagivano con oggetti. Hanno insegnato al modello a comprendere la differenza tra il movimento del compito e il corpo specifico che lo esegue. Una volta che il modello ha appreso questo, lo hanno testato fornendogli un video umano e chiedendogli di generare una versione dello stesso compito eseguito da un robot. Non avevano bisogno di alcun video che mostrasse un essere umano e un robot che eseguivano lo stesso compito fianco a fianco. Il sistema ha semplicemente preso i movimenti dell'umano e il percorso della telecamera, e poi ha sostituito il corpo umano e la scena con un corpo robotico e una scena robotica. Il risultato è stato un video che mostrava un robot che eseguiva il compito, completo della corretta prospettiva e dei vincoli fisici di quella specifica macchina.

Il team ha testato questa capacità di cambiare il corpo, l'angolo della telecamera e la scena. Hanno dimostrato che il sistema poteva prendere un video umano e generare una versione in cui un robot chiamato RoboCasa GR1 eseguiva il compito, e un'altra versione in cui un robot diverso chiamato IRON lo eseguiva. Hanno anche dimostrato di poter mantenere lo stesso robot e lo stesso compito cambiando l'angolo della telecamera, creando una visuale da una prospettiva diversa. Fondamentalmente, il sistema preservava la logica dell'interazione. Se un essere umano nel video originale prendeva una tazza e la spostava su uno scaffale, il video del robot generato mostrava il robot che eseguiva esattamente la stessa sequenza di movimenti, solo adattata alla sua forma corporea e alla sua posizione della telecamera.

Per dimostrare che questi video generati fossero effettivamente utili, i ricercatori li hanno utilizzati per addestrare veri robot. Hanno preso un sistema standard di apprendimento robotico e gli hanno fornito un addestramento extra utilizzando i video creati da AnyWorld. Hanno testato questo approccio su una simulazione di un braccio robotico e su un vero robot umanoide fisico. Nella simulazione, il tasso di successo del robot nel raccogliere e posizionare oggetti è migliorato significamente dopo l'addestramento sui dati generati. Sul robot reale, il miglioramento è stato ancora più drammatico. Un robot che era in grado di afferrare una banana con successo solo nel 20 percento dei tentativi è passato a un tasso di successo del 55 percento dopo essere stato addestrato sui video dall'uomo al robot. Ciò ha dimostrato che il sistema non stava solo creando immagini carine; stava creando dati di addestramento validi che aiutavano il robot a imparare meglio.

I ricercatori hanno anche indagato esattamente perché questo funzionasse. Volevano sapere se bastasse dire al robot quale azione intraprendere o se fosse necessaria anche la visione della scena. Hanno eseguito un test in cui fornivano al robot i comandi d'azione corretti ma mantenevano i dati di addestramento visivi del video robotico originale non modificato. Questo approccio non è riuscito a insegnare al robot come seguire istruzioni specifiche, come scegliere la banana di sinistra invece di quella di destra. Tuttavia, quando hanno utilizzato il sistema completo per generare sia la nuova scena visiva che l'azione corretta, il robot ha imparato a seguire le istruzioni in modo affidabile. Ciò ha dimostrato che la ricomposizione visiva era essenziale. Il robot aveva bisogno di vedere il mondo dalla propria prospettiva per capire come applicare l'azione.

Lo studio suggerisce che questo metodo di scomporre le interazioni in fattori separati permette a una singola esperienza umana di essere riutilizzata molte volte. Un video umano che un tempo era limitato a un corpo umano e a una telecamera umana può diventare una fonte di dati di addestramento per molti tipi diversi di robot, in molti ambienti diversi. I ricercatori hanno osservato che, sebbene il sistema sia potente, presenta dei limiti. Non è ancora in grado di catturare la sensazione del tatto o la forza esatta necessaria per schiacciare un oggetto morbido, poiché ciò richiede sensori fisici che la generazione video non fornisce. Inoltre, il sistema dipende dalla capacità di tracciare chiaramente i movimenti umani; se il video è troppo tremolante o se la persona è nascosta dietro un oggetto, il sistema incontra difficoltà.

Nonostante questi limiti, questo lavoro offre una nuova strada per l'apprendimento dei robot. Suggerisce che la vasta libreria di video umani presenti su internet, che è stata difficile da utilizzare per i robot a causa delle differenze nei corpi e nei punti di vista, può ora essere sfruttata. Utilizzando un modello che comprende come separare l'azione dall'attore, gli scienziati possono trasformare le esperienze umane in esperienze robotiche senza dover registrare ogni singolo compito con ogni singolo robot. Ciò potrebbe consentire ai robot di apprendere abilità complesse molto più velocemente, usando l'abbondante dato della vita quotidiana umana come fondamento per le proprie capacità.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →