← Ultimi articoli
🤖 machine learning

Motus2: A Self-Evolving General World Model for Dexterous Manipulation

Motus2 è un modello di mondo generale auto-evolutivo per la manipolazione destra che unifica policy, simulazione e valutazione in un ciclo chiuso di decisione e apprendimento, sfruttando architetture di modelli scalabili e dataset multi-modali progressivamente espansi per consentire un miglioramento continuo attraverso sia dimostrazioni esperte che dati di interazione auto-generati.

Autori originali: Hongzhe Bi, Zihao Zhou, Yihang Tang, Jingrui Pang, Shuhe Huang, Haitian Liu, Runqing Wang, Shuai Huang, Yichen Wang, Yiming Cheng, Ruowen Zhao, Zhenghua Li, Hengkai Tan, Xiaolong Liu, Jinhui Wan, Jiab
Pubblicato 2026-09-01
📖 7 min di lettura🧠 Approfondimento

Autori originali: Hongzhe Bi, Zihao Zhou, Yihang Tang, Jingrui Pang, Shuhe Huang, Haitian Liu, Runqing Wang, Shuai Huang, Yichen Wang, Yiming Cheng, Ruowen Zhao, Zhenghua Li, Hengkai Tan, Xiaolong Liu, Jinhui Wan, Jiabao Liu, Min Zhao, Fan Bao, Jun Zhu

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Per costruire un robot che possa davvero gestire il mondo disordinato e imprevedibile dei compiti umani, gli scienziati cercano da tempo un sistema che faccia molto di più che limitarsi a seguire una lista di istruzioni. L'obiettivo è creare una macchina capace di percepire l'ambiente circostante, immaginare cosa potrebbe accadere dopo, compiere un'azione e poi imparare dal risultato per fare meglio la volta successiva. Questo concetto, noto come "modello del mondo" (world model), funge da simulatore interno per il robot. Invece di reagire semplicemente a ciò che vede in quel momento, il robot esegue simulazioni mentali per ipotizzare l'esito dei suoi movimenti prima ancora di compierli effettivamente. Sebbene le versioni precedenti di questi sistemi potessero prevedere il futuro o suggerire una mossa, spesso operavano in linea retta: vede, ipotizza, agisce e si ferma. Mancavano di un modo per guardare indietro alle proprie previsioni, giudicare se fossero buone o cattive e usare quel giudizio per migliorare le proprie capacità decisionali senza dover dipendere da un essere umano che mostri loro la strada giusta ogni singola volta.

Un team di ricercatori ha presentato un sistema chiamato Motus2, un cervello robotico auto-evolutivo progettato specificamente per compiti delicati e complessi, come l'uso di strumenti o la manipolazione di oggetti con mani simili a quelle umane. Questo sistema rappresenta un passo avanti significativo perché chiude il cerchio tra pensiero e apprendimento. Piuttosto che essere un semplice osservatore passivo o un semplice esecutore, Motus2 agisce come il proprio insegnante. Esso propone una serie di possibili movimenti, simula come apparirebbero tali movimenti nel futuro e poi valuta se quegli esiti immaginati porterebbero al successo. Se la simulazione mostra un fallimento, il robot impara da quell'errore. Se mostra un successo, rinforza quel percorso. Questo ciclo permette al robot di migliorare la propria "policy", ovvero il proprio insieme di regole per agire, testando e perfezionando costantemente le proprie idee, anche quando non ha un essere umano che lo guidi in ogni singolo passaggio.

La base di questo sistema si fonda su una quantità massiccia di dati raccolti dalle mani umane. I ricercatori hanno iniziato insegnando al robot come gli esseri umani interagiscono con il mondo utilizzando video registrati da una prospettiva in prima persona, come se la telecamera fosse montata sulla testa della persona. Hanno iniziato con semplici video a lente singola che mostravano una grande varietà di compiti, dalla cucina all'organizzazione, per poi passare a video stereoscopici sincronizzati più avanzati che forniscono un senso di profondità, simile alla visione binoculare umana. Ciò ha permesso al robot di apprendere la sottile fisica di come le mani afferrano, sollevano e manipolano gli oggetti. Tuttavia, osservare gli esseri umani non è sufficiente per un robot con un corpo diverso. I ricercatori hanno quindi guidato il sistema attraverso una fase intermedia di addestramento in cui ha imparato a tradurre quei movimenti umani nelle specifiche meccaniche delle proprie braccia e mani robotiche. Questo processo ha comportato la presentazione al robot di migliaia di ore di dati umani, seguite da esempi specifici di come umani e robot possano lavorare insieme, colmando efficacementmente il divario tra l'intuizione umana e l'esecuzione robotica.

Ciò che rende unico Motus2 è il modo in cui utilizza questa conoscenza. Il sistema è costruito attorno a un unico modello unificato che indossa tre cappelli diversi simultaneamente. Primo, agisce come una policy, suggerendo quale azione intraprendere successivamente. Secondo, agisce come un simulatore, prevedendo come sarà il mondo dopo che tale azione è stata compiuta. Terzo, agisce come un valutatore, giudicando se quel futuro previsto sia buono o cattivo. Nei sistemi tradizionali, queste funzioni sono spesso separate o scollegate, ma qui sono strettamente intrecciate. Quando il robot considera una mossa, esegue istantaneamente una simulazione mentale per vedere le conseguenze. Poi si chiede se quella conseguenza sia desiderabile. Se la risposta è no, scarta quel percorso e ne prova un altro. Se la risposta è sì, si impegna nell'azione. Questo dialogo interno avviene così rapidamente che il robot può pianificare diversi passi avanti, scegliendo il percorso migliore prima ancora di muovere un muscolo.

I ricercatori hanno testato questo sistema su una piattaforma completamente robotica dotata di due braccia, due mani destre e sensori in grado di percepire il tatto, simili ai polpastrelli umani. Hanno sfidato il robot con una serie di compiti difficili, come posizionare una pallina in un punto specifico, avvitare una lampadina in un attore o attaccare una gomma a una penna. In questi test, la capacità del robot di imparare dalle proprie simulazioni si è rivelata cruciale. Quando il sistema è stato autorizzato a usare il proprio valutatore interno per selezionare le migliori opzioni durante un compito, il suo tasso di successo è migliorato significativamente. Ancora più impressionante è stato il fatto che, quando il sistema è stato autorizzato a usare le proprie previsioni per aggiornare le proprie regole di apprendimento, è diventato ancora più bravo nel compito. Il robot non ha avuto solo fortuna; ha realmente imparato ad evitare gli errori che aveva simulato e a ripetere le azioni che aveva simulato come di successo.

Una parte fondamentale di questo successo è stata la capacità del robot di ricordare ciò che era accaduto precedentemente in un compito, anche se tali informazioni erano temporaneamente nascoste alla vista. In molti lavori complessi, una mano potrebbe bloccare la visuale di un oggetto, o un passaggio critico potrebbe avvenire molto prima che il risultato finale venga visto. Per gestire questo, i ricercatori hanno dotato il robot di una forma di memoria di lavoro capace di conservare dettagli visivi importanti del passato. Hanno testato diversi modi per gestire questa memoria, dal mantenere una finestra scorrevole e breve degli eventi recenti al mantenere una cronologia più lunga e dettagliata. I risultati hanno mostrato che avere accesso a questa cronologia più lunga ha permesso al robot di risolvere compiti che richiedevano di ricordare una sequenza di eventi su un periodo più lungo, provando che la capacità di ricordare il passato è importante quanto la capacità di prevedere il futuro.

Il sistema ha inoltre incorporato un modulo specializzato per il tatto. Sebbene la vista sia potente, non può sempre dire se una presa stia scivolando o se una superficie sia troppo morbida. Il robot è stato dotato di un sistema esperto leggero dedicato all'elaborazione del feedback tattile. Ciò ha permesso di affinare i movimenti in tempo reale, regolando la presa nel momento stesso in cui si avvertiva uno scivolamento o un cambiamento di pressione. Questa combinazione di vedere, sentire, pensare e imparare ha creato un sistema robusto capace di gestire l'incertezza del mondo reale.

Le scoperte suggeriscono che la strada verso robot veramente capaci non risiede solo nella raccolta di più dati, ma nella costruzione di sistemi che possano usare quei dati per mettere in discussione se stessi e migliorare. Combinando i dati sull'interazione umana su larga scala con un ciclo di auto-correzione basato su previsione e valutazione, Motus2 ha dimostrato che i robot possono imparare a manipolare il mondo fisico con un livello di adattabilità precedentemente fuori portata. I ricercatori hanno scoperto che, aumentando la quantità di dati video stereoscopici utilizzati per l'addestramento, la capacità del robot di prevedere le azioni umane migliorava in modo costante e prevedibile. Questa scalabilità suggerisce che, con ancora più dati, questi sistemi potrebbero diventare ancora più proficienti. In definitiva, il lavoro dimostra che un robot non ha bisogno di essere programmato con ogni possibile soluzione per ogni possibile problema. Al contrario, se riesce a simulare il futuro, giudicare l'esito e imparare dalla differenza, può evolvere le proprie abilità per affrontare le sfide di un mondo complesso e destre.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →