Riemann-1.0: An Embodied World Action Model for Physical AI
Riemann-1.0 è un modello di azione del mondo causale autoregressivo unificato che integra osservazioni multi-vista, stati del robot e azioni in un unico framework, sfruttando una strategia di pre-addestramento progressivo su oltre 200.000 ore di dati embodiment diversificati per raggiungere prestazioni allo stato dell'arte sia in simulazione che in compiti di manipolazione a lungo raggio nel mondo reale.
Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo
L'intelligenza artificiale è da tempo maestra del regno digitale, capace di leggere testi, riconoscere immagini e risolvere enigmi entro i confini di uno schermo di un computer. Ma affinché le macchine possano unirsi davvero a noi nel mondo fisico, devono fare molto più che comprendere ciò che vedono; devono imparare ad agire al suo interno. Questa è la sfida dell'intelligenza incarnata (embodied intelligence): insegnare ai robot a percepire l'ambiente circostante, a ragionare su causa ed effetto e a eseguire movimenti fisici con la stessa fluidità che un essere umano usa per prendere una tazza o piegare una camicia. Affinché una macchina abbia successo, ha bisogno di un modello del mondo che comprenda non solo l'aspetto degli oggetti, ma anche come si muovono e cambiano quando vengono toccati. Deve imparare che spingere un blocco lo fa scivolare e che sollevare un coperchio rivela ciò che contiene. Fino ad ora, creare un singolo sistema capace sia di pianificare queste azioni fisiche che di prevedere le conseguenze visive di tali azioni è stato un difficile ostacolo, richiedendo spesso sistemi separati per il pensiero e per il movimento.
Un team di ricercatori ha introdotto un nuovo sistema chiamato Riemann-1.0, progettato per colmare questo divario trattando le azioni di un robot e i cambiamenti risultanti nel mondo come una singola, continua storia. Invece di costruire strumenti separati per decidere cosa fare e strumenti per immaginare cosa accadrà dopo, questo modello impara a fare entrambe le cose contemporaneamente. Opera su un principio semplice ma potente: nel mondo reale, un'azione avviene sempre prima che il risultato venga visto. Se un robot allunga la mano verso un cucchiaio, il movimento avviene per primo, e il cambiamento visivo — il movimento del cucchiaio — segue. Riemann-1.0 è costruito per rispettare questo ordine, imparando da una vasta collezione di dati video e di movimento per prevedere esattamente cosa dovrebbe fare un robot dopo e come apparirà il mondo dopo che lo avrà fatto.
Per insegnare questo sistema, i ricercatori hanno raccolto una vasta libreria di esperienze, per un totale di oltre 200.000 ore di interazione. Questa collezione non era solo un mucchio di video di robot; era un mix accuratamente curato di tre diversi tipi di materiale di apprendimento. In primo luogo, hanno incluso migliaia di ore di video registrati dal punto di vista di un essere umano, che mostrano persone mentre svolgono compiti quotidiani come cucinare o pulire. Questi video hanno fornito una comprensione ampia di come gli oggetti interagiscono e di come i compiti si sviluppano nel tempo, anche se mancavano dei dati meccanici specifici di un robot. In secondo luogo, hanno aggiunto dimostrazioni da pinze robotiche manuali e dispositivi indossabili, che servono da ponte, mostrando come i movimenti della mano umana si traducano in controlli simili a quelli di una macchina. Infine, hanno incluso registrazioni precise di veri movimenti robotici, che hanno fornito le istruzioni eseguibili esatte necessarie per insegnare alla macchina come muovere le proprie membra. Combinando queste fonti, i ricercatori hanno creato un dataset unificato che ha permesso al modello di imparare dalla vasta saggezza dell'esperienza umana, radicando al contempo tale conoscenza nella precisa meccanica del controllo robotico.
Il processo di addestramento per Riemann-1.0 è stato strutturato come un curriculum scolastico, passando dall'osservazione generale all'esecuzione specifica. Nella prima fase, il modello ha studiato la vasta libreria di video umani. Poiché questi video non contenevano dati di movimento robotico, il sistema ha utilizzato uno strumento ausiliario per stimare le "azioni" invisibili che devono aver causato i cambiamenti visivi osservati sullo schermo. Ciò ha permesso al modello di apprendere la dinamica di base di come il mondo si muove senza la necessità di dati robotici perfetti. Nella seconda fase, il modello è stato introdotto ai dati misti di mani umane e pinze robotiche, imparando ad allineare la sua comprensione del movimento con i controlli fisici reali. Infine, nella terza fase, il modello si è concentrato esclusivamente su registrazioni di alta qualità di robot che eseguono compiti. Questa fase finale ha affinato la sua capacità di generare comandi precisi ed eseguibili, assicurando che le azioni che pianificava fossero non solo visivamente plausibili, ma fisicamente possibili per una vera macchina.
I risultati di questo approccio sono stati sorprendenti. Quando testato su una vasta gamma di compiti, sia in simulazioni informatiche che su robot reali, Riemann-1.0 ha superato i metodi precedenti con un margine significativo. In una simulazione progettata per testare compiti lunghi e complessi che coinvolgono molti passaggi, il modello ha avuto successo nel 62,6% dei casi, un miglioramento notevole rispetto ai migliori sistemi esistenti. In un'altra simulazione focalizzata su robot a due braccia, ha raggiunto un tasso di successo del 94,3%. Forse più impressionante è stato il fatto che, quando implementato su robot nel mondo reale per eseguire compiti come impilare blocchi colorati, piegare vestiti, organizzare una scrivania disordinata o sistemare oggetti da cucina, il sistema ha completato i compiti con successo l'85% delle volte. Ha inoltre mostrato una straordinaria capacità di adattarsi a nuove situazioni mai viste prima, come inserire un Cubo di Rubik in una scatola o mettere un asciugamano in un bacile, ottenendo successo nell'85% di queste prove inedite.
Oltre a fungere semplicemente da controllore per robot, Riemann-1.0 può anche funzionare come un simulatore. Poiché comprende il legame causale tra un'azione e il risultato visivo, i ricercatori possono chiedergli di immaginare cosa accadrebbe se un robot eseguisse un movimento specifico. Il modello può generare un video del futuro, mostrando esattamente come si muoverebbero gli oggetti e dove finirebbero, basandosi sull'azione fornita. Questa doppia capacità significa che il sistema può servire sia come il cervello che decide cosa fare, sia come l'immaginazione che verifica se il piano funzionerà prima che il robot si muova effettivamente. Questa capacità di prevedere il futuro del mondo fisico, radicata nella realtà di come le azioni causano cambiamenti, rappresenta un passo avanti significativo nel rendere l'intelligenza artificiale un partner affidabile nel mondo fisico. Il lavoro suggerisce che, unificando l'apprendimento di come agire con l'apprendimento di come il mondo risponde, le macchine possono sviluppare una comprensione più robusta e generalizzabile dei compiti che svolgiamo ogni giorno.
Sommerso dagli articoli nel tuo campo?
Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.