← Ultimi articoli
💻 computer science

GE-Act 2.0: Pretraining and Scaling a World-Action Model for Robotic Manipulation

GE-Act 2.0 è un nuovo modello di azione-mondo addestrato da zero su dati di manipolazione che integra un autoencoder orientato al controllo, un pianificatore visivo a singolo step e un modello di dinamica inversa con ottimizzazione selettiva allineata alla conoscenza, raggiungendo un successo significativo zero-shot attraverso una vasta gamma di compiti e incarnazioni grazie a un esteso scaling e al trasferimento cross-embodiment.

Autori originali: AgiBot Research Team, Renhang Liu, Wenzhi Zhao, Zhuo Yang, Liliang Chen, Pengfei Zhou, Shengcong Chen, Guanghui Ren, Youlun Peng, Rongjun Jin, Nan Wang, Sukai Wang, Xindong He, Jinyuan Feng, Ziyu Xion
Pubblicato 2026-09-09
📖 6 min di lettura🧠 Approfondimento

Autori originali: AgiBot Research Team, Renhang Liu, Wenzhi Zhao, Zhuo Yang, Liliang Chen, Pengfei Zhou, Shengcong Chen, Guanghui Ren, Youlun Peng, Rongjun Jin, Nan Wang, Sukai Wang, Xindong He, Jinyuan Feng, Ziyu Xiong, Linqing Zhong, Yifei Wei, Feng Han, Long Zhang, Da Huang, Nanshu Zhao, Chenghao Yin, Mo Wu, Zhaodong Yan, Kongtao Hu, Yuxiang Yan, Aogelijiang Niyazi, Yu Fang, Jia Zeng, Lizhu Meng, Daizhen Lv, Haoyu Cao, Zhiwen Hou, Lianjin Ye, Yuehan Niu, Zhikai Cai, Xuan Hu, Hui Min, Xiongfeng Cai, Yue Liao, Jing Wu, Soujanya Poria, Ye Li, Sanping Zhou, Maoqing Yao

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

I robot sono stati a lungo i maestri della fabbrica, ripetendo lo stesso movimento preciso migliaia di volte senza errori. Ma se li si inserisce in una cucina, in un soggiorno o in un laboratorio disordinato, spesso si bloccano. La sfida non è solo muovere una mano; è capire come il mondo cambi quando quella mano tocca qualcosa. Per navigare in questo scenario, una nuova generazione di intelligenza artificiale sta imparando a immaginare il futuro. Invece di limitarsi a reagire a ciò che vede in questo momento, questi sistemi cercano di prevedere cosa accadrà dopo se compiono una specifica azione. Questo approccio, noto come modello mondo-azione, permette a un robot di simulare una sequenza di eventi nella sua mente prima di muovere un muscolo, verificando se l'esito corrisponde al suo obiettivo. Per anni, i ricercatori hanno cercato di costruire questi sistemi prendendo gli esistenti generatori di video — programmi addestrati per creare film finti — e costringendoli a comprendere i movimenti robotici. Tuttavia, questo metodo lascia spesso il robot con una comprensione vaga della fisica, poiché il generatore di video non è mai stato progettato per controllare un corpo fisico.

Un team di AgiBot ha introdotto un approccio diverso, uno che costruisce l'immaginazione del robot partendo da zero utilizzando solo dati di interazione dal mondo reale. Hanno creato un sistema chiamato GE-Act 2.0, che impara a prevedere il futuro e a decidere le azioni simultaneamente, ma con un tocco cruciale: ogni parte del sistema è addestrata da zero su dati raccolti da robot e umani che manipolano oggetti. I ricercatori non si sono affidati a modelli video preesistenti. Al contrario, hanno insegnato al sistema un linguaggio compresso del movimento, un modo di vedere il mondo che elimina i dettagli superflui per concentrarsi su ciò che è importante per il controllo. Ciò ha permesso al robot di imparare da una libreria vasta e varia di dati, inclusi ore di dimostrazioni di successo, tentativi falliti e persino video di esseri umani che lavorano senza alcuna istruzione registrata. Combinando questi diversi tipi di apprendimento, il sistema ha imparato a generalizzare, il che significa che poteva applicare ciò che aveva imparato in una situazione a una completamente nuova che non aveva mai visto prima.

Il nucleo di questo traguardo risiede nel modo in cui i ricercatori hanno gestito la realtà disordinata del mondo fisico. Quando un robot cerca di imparare, spesso affronta un problema confuso: la stessa istruzione può essere completata in molti modi diversi. Un robot potrebbe ricevere l'ordine di "prendere la tazza rossa", e potrebbe avvicinarsi da sinistra, da destra, o afferrarla per il manico o per il bordo. Se i dati di addestramento mostrano solo un modo, ma l'immaginazione del robot ne prevede un altro, le due parti del sistema possono perdere la sincronia. I ricercatori hanno identificato questo disallineamento come un "gap di validità", dove la previsione del futuro del robot non si allinea con l'azione che dovrebbe compiere. Per risolvere il problema, hanno sviluppato un processo di selezione che agisce come un filtro. Prima che il robot impari da un futuro previsto, controlla se quel futuro è compatibile con l'azione che deve eseguire. Genera diverse possibili realtà future, le testa rispetto all'azione richiesta e impara solo da quelle che hanno senso insieme. Ciò assicura che il robot non offuschi la sua comprensione di come diverse azioni conducano a diversi esiti.

I risultati di questo addestramento sono sorprendenti, in particolare quando testati su compiti che il robot non ha mai praticato. I ricercatori hanno valutato il sistema su cento compiti di manipolazione distinti, che vanno dallo impilare blocchi e versare liquidi, al piegare asciugamani e inserire spine. Questi test sono stati condotti su robot reali in ambienti con diverse illuminazioni, sfondi e disposizioni di oggetti rispetto a quelli utilizzati durante l'addestramento. Quando il sistema è stato addestrato su un piccolo dataset di 300 ore, ha avuto successo solo nel 17,1% dei compiti su un modello di robot. Tuttavia, man mano che i ricercatori aumentavano il dataset di addestramento a 30.000 ore, il tasso di successo è salito costantemente al 44,1%. Questo miglioramento è avvenuto senza alcun fine-tuning specifico per i singoli compiti; il robot ha semplicemente applicato le abilità generali apprese alle nuove sfide. Ancora più sorprendente, il sistema ha mostrato forti capacità su un secondo modello di robot differente, che costituiva meno del 2% dell'addestramento, suggerendo che le abilità apprese dal dataset più ampio si siano trasferite efficacemente a una nuova forma fisica.

Anche la capacità del sistema di seguire le istruzioni è stata testata in condizioni difficili. In molti casi, al robot è stato chiesto di compiere un'azione che contrastava con ciò che avrebbe potuto aspettarsi in base alla scena o a un'abitudine precedente. Ad esempio, se un robot era nel mezzo di un movimento, poteva comunque fermarsi e seguire un nuovo comando esplicito per cambiare percorso. In oltre il 90% di questi tentativi, il robot ha identificato correttamente l'oggetto specifico, il colore, la forma o la posizione menzionati nell'istruzione, anche quando tali dettagli erano sottili o il contesto era confuso. I ricercatori hanno trovato un forte legame tra la varietà delle abilità apprese dal robot durante l'addestramento e la sua capacità di avere successo in nuovi compiti. Più diversificati erano i dati di addestramento, più probabile era che il robot gestisse una situazione inedita. Ciò suggerisce che la strada verso robot più capaci non risiede solo in algoritmi migliori, ma nel volume e nella varietà dei dati che consumano.

Questo lavoro segna un passo significativo verso robot che possono imparare dagli stessi dati ricchi e non strutturati che gli esseri umani usano per comprendere il mondo. Costruendo un sistema che prevede il futuro e pianifica le azioni in modo unificato, e insegnando al sistema a selezionare le previsioni corrette tra molte possibilità, i ricercatori hanno creato un modello che è robusto e adattabile. I risultati suggeriscono che, con abbastanza esperienza diversificata, un robot può sviluppare una comprensione profonda e intuitiva di come gli oggetti si comportano e di come interagire con essi, passando da una programmazione rigida verso una forma di intelligenza più flessibile. Il successo di questo approccio su hardware reale, senza la necessità di riaddestrare per ogni nuovo lavoro, punta verso un futuro in cui i robot possano essere impiegati in ambienti dinamici e imprevedibili e imparare a prosperare in essi.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →