← Ultimi articoli
💻 computer science

OpenWAM: An Open, Modular Exploration Towards Systematic World-Action Model Pretraining

Questo articolo introduce OpenWAM, uno stack di ricerca aperto e modulare che investiga sistematicamente il pretraining di World-Action Model attraverso esperimenti controllati per derivare principi di progettazione chiave, culminando nel rilascio dell'efficiente modello OpenWAM-α\alpha addestrato su 6.400 ore di dati embodiment diversificati.

Autori originali: Yuran Wang, Siqiao Huang, Mingleyang Li, Chenhao Zhang, Jiaqi Liang, Weiyang Jin, Yue Chen, Xuemin Chi, Donghao Zhou, Qize Yu, Yu-Kai Wang, Yuhan Rui, Shenzhe Yao, Zhen Yuan, Zhenhao Shen, Kefei Zhu
Pubblicato 2026-09-09
📖 6 min di lettura🧠 Approfondimento

Autori originali: Yuran Wang, Siqiao Huang, Mingleyang Li, Chenhao Zhang, Jiaqi Liang, Weiyang Jin, Yue Chen, Xuemin Chi, Donghao Zhou, Qize Yu, Yu-Kai Wang, Yuhan Rui, Shenzhe Yao, Zhen Yuan, Zhenhao Shen, Kefei Zhu, Zijie Zhu, Ning Gao, Xiaowei Chi, Guanqi He, Shanghang Zhang, Hao Dong, Lin Shao, Hang Zhao

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

L'intelligenza non consiste solo nel vedere il mondo; consiste nel sapere come cambiarlo. Per decenni, gli scienziati hanno costruito sistemi informatici capaci di riconoscere oggetti in una fotografia o di descrivere una scena in una frase. Più recentemente, hanno creato modelli in grado di immaginare come una scena possa evolversi nel tempo, prevedendo il fotogramma successivo di un video basandosi su quello precedente. Questi sistemi apprendono la fisica del mondo — come una tazza cade, come una porta oscilla — osservando enormi quantità di video. Tuttavia, esiste un divario tra l'osservare il mondo e l'agire all'interno di esso. Un robot ha bisogno di qualcosa di più di una semplice previsione di ciò che accadrà; ha bisogno di sapere quali movimenti specifici renderanno concreta quella previsione. Questa è la sfida dell'apprendimento incarnato (embodied learning): colmare il divario tra la comprensione di un futuro visivo e la generazione delle azioni fisiche per raggiungerlo.

Un team di ricercatori ha introdotto un nuovo approolo chiamato OpenWAM per risolvere questo problema. Invece di costruire un cervello robotico singolo e rigido, difficile da modificare o comprendere, hanno creato un sistema aperto e modulare che tratta la progettazione di un controllore robotico come un insieme di parti intercambiabili. Hanno scomposto il complesso compito di insegnare a un robot come agire in tre domande distinte: quali conoscenze il robot dovrebbe ereditare dall'osservazione dei video, come dovrebbero lavorare insieme la comprensione del mondo del robot e la sua capacità di muoversi, e come può questo apprendimento essere scalato su diversi tipi di robot e ambienti. Rispondendo a queste domande attraverso esperimenti controllati, hanno distillato un insieme di principi che hanno portato alla creazione di OpenWAM-α, un nuovo modello potente capace di apprendere la manipolazione di oggetti sia in ambienti simulati che nel mondo reale.

I ricercatori hanno iniziato chiedendosi quale tipo di "conoscenza del mondo" un robot dovrebbe avere inizialmente. Hanno testato se il robot dovesse apprendere da un enorme generatore di video che ha visto milioni di ore di filmati, o se dovesse fare affidamento su un encoder visivo più semplice. Hanno scoperto che i risultati migliori derivavano dall'uso di un grande generatore di video pre-addestrato come base. Questo modello comprende già come gli oggetti si muovono e interagiscono, fornendo un punto di partenza ricco. Tuttavia, non era sufficiente collegare semplicemente un braccio robotico a questo modello video. I ricercatori hanno scoperto che il robot aveva anche bisogno di un modo compatto ed efficiente per rappresentare ciò che vede. Hanno testato vari metodi per comprimere l'informazione visiva in una forma più piccola e gestibile, scoprendo che un tipo specifico di compressione, che manteneva i dettagli essenziali del mondo scartando il rumore, funzionava meglio. Ciò ha permesso al robot di concentrarsi sulle parti importanti di una scena senza lasciarsi sopraffare dai dati.

Successivamente, il team ha indagato su come la "mente" del robot dovesse essere strutturata per connettere la sua comprensione del mondo con la sua capacità di muoversi. Hanno confrontato diverse architetture, che spaziavano da modelli in cui la parte video e quella dell'azione erano completamente separate a quelli in cui erano profondamente intrecciate. I loro esperimenti hanno dimostrato che il design più efficace era un approccio a doppio sistema. In questa configurazione, una parte del modello si concentra sulla previsione dello stato visivo futuro del mondo, mentre una parte dedicata si concentra sulla generazione della sequenza di movimenti. Fondamentalmente, queste due parti potevano dialogare costantemente tra loro. Il generatore di azioni poteva osservare il futuro previsto per decidere cosa fare, e il predittore del mondo poteva usare le azioni pianificate per affinare la propria visione di ciò che sarebbe accaduto dopo. Questa costante conversazione bidirezionale ha permesso al modello di apprendere una vera sinergia tra vedere e agire, piuttosto che limitarsi ad apprenderli l'uno accanto all'altro.

I ricercatori hanno anche esplorato come addestrare questi modelli utilizzando diversi tipi di dati. Avevano accesso a due fonti principali: video di esseri umani che svolgono compiti da una prospettiva in prima persona, che offrivano una vasta gamma di scene visive ma nessun dato sull'azione robotica, e registrazioni di robot reali che svolgono compiti, che fornivano istruzioni di movimento precise ma coprivano meno tipi di scene. Hanno testato se fosse meglio addestrare solo sui dati dei robot, solo sui dati umani, o su una combinazione di entrambi. Hanno scoperto che combinare le due fonti in una singola sessione di addestramento era la strategia più potente. I video umani insegnavano al modello la vasta diversità del mondo, mentre i dati dei robot radicavano tale conoscenza nella realtà fisica. Questa combinazione ha permesso al modello di generalizzare molto meglio verso nuove situazioni non viste rispetto a un addestramento basato su un solo tipo di dato.

Utilizzando questi principi, il team ha costruito OpenWAM-α, un modello addestrato su oltre 500 milioni di fotogrammi di video e dati robotici. Hanno testato questo modello attraverso otto diversi benchmark di simulazione e su robot reali con bracci singoli, doppi bracci e persino mani destre. I risultati sono stati costanti e impressionanti. Nelle simulazioni, il modello ha operato ai massimi livelli in una vasta gamma di compiti, dalla sovrapposzione di blocchi alla manipolazione di oggetti complessi. Quando trasferito nel mondo reale, ha mantenuto questa alta prestazione, completando con successo compiti su robot fisici che non aveva mai visto prima. Il modello ha mostrato una particolare forza nell'adattarsi a nuovi ambienti, suggerendo che la combinazione della conoscenza del mondo basata sul video e dell'ancoraggio basato sull'azione abbia creato una base robusta per l'intelligenza generale.

Una delle scoperte più significative è stata il confronto di questo approccio con altri metodi popolari. Alcuni sistemi si affidano fortemente alla comprensione linguistica e visiva ma non modellano esplicitamente il futuro, mentre altri si concentrano puramente sulla meccanica del movimento. I ricercatori hanno scoperto che il loro approccio basato sul video eccelleva nell'adattarsi ai dati di addestramento e nel performare bene in contesti familiari, mentre altri metodi a volte generalizzavano meglio in ambienti completamente nuovi e caotici. Tuttavia, hanno concluso che nessuno dei due approcci fosse perfetto da solo. La chiave per il progresso futuro risiede nel combinare i punti di forza di entrambi: utilizzare i ricchi "prior" visivi e fisici della generazione video per guidare l'azione, assicurando al contempo che il sistema sia addestrato su dati diversificati e di alta qualità che coprano l'intero spettro delle sfide del mondo reale.

Il progetto OpenWAM fa molto di più del semplice presentare un nuovo controllore robotico; fornisce un toolkit completo per la comunità scientifica. Rilasciando l'infrastruttura, i dati di addestramento e i protocolli di valutazione, i ricercatori hanno trasformato lo sviluppo di modelli mondo-azione in una scienza trasparente e riproducibile. Ciò consente ad altri scienziati di testare idee specifiche, sostituire componenti e comprendere esattamente perché determinati design funzionano meglio di altri. Il lavoro suggerisce che la strada verso robot più capaci non passa attraverso la costruzione di sistemi più grandi e opachi, ma attraverso la comprensione attenta di come le diverse parti della conoscenza e dell'apprendimento interagiscano. Trattando la mente del robot come una collezione di parti composibili, i ricercatori hanno aperto la porta a una nuova era di esplorazione sistematica nell'intelligenza artificiale, dove ogni scelta di design può essere testata, misurata e migliorata.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →