CLAP: Cross-Embodiment Video World Models are Zero-Shot Physical Simulators
CLAP è un framework innovativo che consente la simulazione fisica zero-shot attraverso diverse incarnazioni di robot e umani addestrandosi su video eterogenei su scala internet, riconciliando spazi di azione disparati attraverso una ricetta di apprendimento basata su un curriculum per raggiungere prestazioni allo stato dell'arte nell'adattamento few-shot e nella comprensione generalizzabile della fisica.
Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo
I robot hanno lottato a lungo per comprendere il mondo fisico nel modo in cui lo fanno gli esseri umani. Mentre un bambino impara che una tazza cadrà se spinta via da un tavolo o che un asciugamano può essere piegato tirandone gli angoli, i robot spesso richiedono migliaia di esempi specifici per apprendere anche le regole più semplici. Questa difficoltà deriva dal fatto che la maggior parte dei sistemi di apprendimento robotico viene addestrata su dati provenienti da un singolo tipo di macchina. Un robot con un braccio lungo e sottile impara la fisica in modo diverso rispetto a un robot con una pinza o una mano umana, creando una barriera dove la conoscenza acquisita da uno non può essere facilmente condivisa con un altro. Per superare questo ostacolo, gli scienziati hanno iniziato a guardare ai modelli di generazione video, ovvero programmi informatici capaci di immaginare cosa accadrà dopo in una scena. Se un robot potesse guardare un video e prevedere il movimento futuro degli oggetti, potrebbe pianificare le proprie azioni senza doverle provare fisicamente prima. Tuttavia, questi modelli predittivi sono stati storicamente limitati a singoli tipi di robot, impedendo loro di apprendere dalla vasta e diversificata libreria di video umani e robotici disponibili su internet.
Un team di ricercatori dell'Università di Princeton ha sviluppato un nuovo framework chiamato CLAP per colmare questa lacuna. Il loro lavoro dimostra che un singolo modello video può apprendere le leggi universali della fisica addestrandosi su un enorme mix di video che presentano sia esseri umani che molti tipi diversi di robot. L'idea centrale è che, sebbene una mano umana, un braccio robotico e una pinza siano tutti diversi, tutti obbediscono alle stesse regole fisiche quando muovono oggetti. Insegnando a un computer a prevedere il futuro di una scena indipendentemente da chi o cosa stia compiendo l'azione, i ricercatori hanno creato un sistema che comprende la meccanica sottostante del mondo piuttosto che solo i movimenti specifici di una singola macchina. Questo approccio consente al modello di apprendere da video non etichettati presenti su internet, dove non vengono fornite istruzioni, così come da dati robotici dettagliati, creando una comprensione molto più ricca di come le cose si muovano e interagiscano.
I ricercatori hanno affrontato un ostacolo significativo perché i dati che volevano utilizzare erano disordinati e incoerenti. I video degli esseri umani non arrivano con istruzioni su come si siano mossi i loro movimenti, e diversi robot utilizzano modi differenti per descrivere i propri movimenti. Per risolvere questo problema, il team ha creato un metodo per tradurre tutte queste diverse lingue del movimento in un formato comune. Hanno utilizzato tre strumenti principali: la posizione precisa della mano di un robot, semplici descrizioni testuali del movimento e una rappresentazione nascosta e appresa dell'azione che il computer capisce da solo. La strategia più efficace ha comportato un processo di apprendimento a tappe. Prima, il modello ha imparato le regole base della fisica guardando video non etichettati utilizzando le rappresentazioni dell'azione nascoste. Una volta compresi i principi dinamici fondamentali, i ricercatori hanno perfezionato la sua conoscenza utilizzando dati precisi da robot con movimenti etichettati. Questo approccio in due fasi ha permesso al sistema di scalare utilizzando la vasta quantità di video presenti su internet, pur rimanendo abbastanza accurato da controllare robot reali.
I risultati di questo lavoro mostrano che il nuovo sistema è performante quanto, e spesso meglio di, i migliori modelli esistenti che sono stati addestrati solo su un singolo tipo di robot. In ambienti di test impegnativi, il modello è stato in grado di prevedere i fotogrammi futuri di un video con alta precisione, simulando correttamente come gli oggetti cadrebbero, scivolerebbero o verrebbero manipolati. Fondamentalmente, il sistema è stato in grado di generalizzare questa conoscenza a compiti del mondo reale senza la necessità di essere riaddestrato per ogni nuovo robot. Quando testato su un robot a braccio singolo, il sistema ha aiutato con successo un robot a pianificare le sue azioni per raccogliere vari oggetti, come nastro adesivo, pesce o aragosta, superando le normali policy robotiche. Ancora più impressionante, il sistema è stato applicato a un robot a due braccia e a un robot umanoide con una struttura corporea diversa, nonostante non fosse mai stato addestrato su dati relativi a quelle specifiche macchine. Semplicemente regolando l'ultimo strato del modello per adattarlo ai movimenti del nuovo robot, il sistema ha mantenuto la sua profonda comprensità della fisica e ha continuato a fare previsioni accurate.
Questa ricerca suggerisce che la strada verso robot più capaci non richiede la costruzione di un cervello unico per ogni nuova macchina. Invece, addestrando un modello su un mix diversificato di dati, un singolo modello può apprendere un insieme generale di principi fisici che si applicano a quasi ogni agente. I ricercatori hanno scoperto che, mentre i movimenti relativi, che descrivono il cambiamento piuttosto che la posizione, funzionavano bene per le istruzioni basate sul testo, le posizioni assolute erano necessarie per il controllo preciso dei bracci robotici. Hanno anche scoperto che, sebbene i video umani fossero eccellenti per insegnare al modello le basi della fisica, i dati provenienti da robot reali erano essenziali per tradurre tale conoscenza in azioni di successo nel mondo reale. Il lavoro stabilisce un nuovo modo per addestrare i robot, passando da sistemi isolati e a scopo singolo verso un approccio più unificato in cui l'apprendimento da un'embodiment può beneficiare direttamente di un'altra. Sebbene il sistema non sia perfetto e possa talvolta commettere errori nelle sue previsioni, rappresenta un passo avanti significativo nell'insegnare alle macchine a comprendere il mondo fisico attraverso l'osservazione e l'immaginazione.
Sommerso dagli articoli nel tuo campo?
Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.